Skip to main content
Het Personal Agent Benchmark Pack is een klein, door een repository ondersteund QA-scenariopakket voor lokale workflows voor persoonlijke assistenten. Het is geen generieke modelbenchmark en heeft geen nieuwe runner nodig: het hergebruikt de privé-QA-stack (QA-overzicht), het synthetische QA-kanaal en de bestaande qa/scenarios YAML-catalogus.

Scenario’s

Tien scenario’s, gedefinieerd in qa/scenarios/personal/*.yaml: De machineleesbare pakketmetadata (lijst met id’s, titel, beschrijving) staat in extensions/qa-lab/src/scenario-packs.ts als QA_PERSONAL_AGENT_SCENARIO_IDS. Voer het pakket uit met --pack personal-agent:
--pack is additief bij herhaalde --scenario-vlaggen. Expliciete scenario’s worden eerst uitgevoerd, waarna de pakketscenario’s in de volgorde van QA_PERSONAL_AGENT_SCENARIO_IDS worden uitgevoerd, waarbij duplicaten worden verwijderd. Het pakket is gericht op qa-channel met mock-openai of een andere lokale QA-providerlane. Richt het niet op livechatdiensten of echte persoonlijke accounts.

Privacymodel

Scenario’s gebruiken uitsluitend fictieve gebruikers, fictieve voorkeuren, fictieve geheimen en de tijdelijke QA Gateway-werkruimte die door de suite wordt aangemaakt. Ze mogen geen echt OpenClaw-gebruikersgeheugen, sessies, inloggegevens, launch agents, globale configuraties of live Gateway-status lezen of schrijven. Artefacten blijven in de bestaande artefactmap van de QA-suite en worden behandeld als testuitvoer. Redactiecontroles gebruiken fictieve markeringen, zodat fouten veilig kunnen worden geïnspecteerd en in issues kunnen worden vastgelegd.

Het pakket uitbreiden

Voeg nieuwe .yaml-gevallen toe onder qa/scenarios/personal/ en voeg vervolgens het scenario-id toe aan QA_PERSONAL_AGENT_SCENARIO_IDS. Houd elk geval klein, lokaal en deterministisch in mock-openai, en richt het op één gedrag van een persoonlijke assistent. Goede kandidaten voor vervolgwerk: controles voor de export van geredigeerde trajecten, controles voor uitsluitend lokale Plugin-workflows. Voeg geen nieuwe runner, Plugin, afhankelijkheid, live transport of modelbeoordelaar toe totdat de scenariocatalogus voldoende stabiele gevallen bevat om dat oppervlak te rechtvaardigen.