Skip to main content
Personal Agent Benchmark Pack to niewielki, oparty na repozytorium pakiet scenariuszy QA dla lokalnych przepływów pracy osobistego asystenta. Nie jest to ogólny benchmark modelu i nie wymaga nowego mechanizmu uruchamiającego: ponownie wykorzystuje prywatny stos QA (omówienie QA), syntetyczny kanał QA oraz istniejący katalog YAML qa/scenarios.

Scenariusze

Dziesięć scenariuszy zdefiniowanych w qa/scenarios/personal/*.yaml: Metadane pakietu w formacie czytelnym maszynowo (lista identyfikatorów, tytuł, opis) znajdują się w extensions/qa-lab/src/scenario-packs.ts jako QA_PERSONAL_AGENT_SCENARIO_IDS. Uruchom pakiet za pomocą --pack personal-agent:
--pack działa addytywnie z powtarzanymi flagami --scenario. Jawnie wskazane scenariusze są uruchamiane najpierw, a następnie scenariusze pakietu w kolejności określonej przez QA_PERSONAL_AGENT_SCENARIO_IDS, po usunięciu duplikatów. Pakiet jest przeznaczony dla qa-channel z mock-openai lub inną lokalną ścieżką dostawcy QA. Nie kieruj go do usług czatu działających na żywo ani do prawdziwych kont osobistych.

Model prywatności

Scenariusze używają wyłącznie fikcyjnych użytkowników, fikcyjnych preferencji, fikcyjnych sekretów oraz tymczasowego obszaru roboczego Gateway QA utworzonego przez zestaw. Nie mogą odczytywać ani zapisywać rzeczywistej pamięci użytkownika OpenClaw, sesji, danych uwierzytelniających, agentów uruchamiania, globalnych konfiguracji ani stanu działającego Gateway. Artefakty pozostają w istniejącym katalogu artefaktów zestawu QA i są traktowane jak wyniki testów. Kontrole redakcji używają fikcyjnych znaczników, dzięki czemu awarie można bezpiecznie analizować i zgłaszać w problemach.

Rozszerzanie pakietu

Dodaj nowe przypadki .yaml w qa/scenarios/personal/, a następnie dodaj identyfikator scenariusza do QA_PERSONAL_AGENT_SCENARIO_IDS. Każdy przypadek powinien być mały, lokalny, deterministyczny w mock-openai i skupiony na jednym zachowaniu osobistego asystenta. Dobrzy kandydaci do dalszego rozwoju: kontrole eksportu trajektorii z redakcją danych, kontrole przepływów pracy Plugin działających wyłącznie lokalnie. Unikaj dodawania nowego mechanizmu uruchamiającego, Plugin, zależności, transportu działającego na żywo lub modelu oceniającego, dopóki katalog scenariuszy nie będzie zawierał wystarczającej liczby stabilnych przypadków uzasadniających taką powierzchnię.