Skip to main content
Il Personal Agent Benchmark Pack è un piccolo pacchetto di scenari di QA supportato da un repository per i flussi di lavoro degli assistenti personali locali. Non è un benchmark generico per modelli e non richiede un nuovo esecutore: riutilizza lo stack QA privato (panoramica della QA), il canale QA sintetico e il catalogo YAML qa/scenarios esistente.

Scenari

Dieci scenari, definiti in qa/scenarios/personal/*.yaml: I metadati del pacchetto leggibili dalla macchina (elenco degli ID, titolo e descrizione) si trovano in extensions/qa-lab/src/scenario-packs.ts come QA_PERSONAL_AGENT_SCENARIO_IDS. Esegui il pacchetto con --pack personal-agent:
--pack si combina con flag --scenario ripetuti. Gli scenari espliciti vengono eseguiti per primi, quindi gli scenari del pacchetto vengono eseguiti nell’ordine di QA_PERSONAL_AGENT_SCENARIO_IDS, rimuovendo i duplicati. Il pacchetto è destinato a qa-channel con mock-openai o un’altra corsia locale di provider QA. Non indirizzarlo verso servizi di chat attivi o account personali reali.

Modello di privacy

Gli scenari usano esclusivamente utenti fittizi, preferenze fittizie, segreti fittizi e l’area di lavoro temporanea del Gateway QA creata dalla suite. Non devono leggere né scrivere la memoria, le sessioni, le credenziali, gli agenti di avvio, le configurazioni globali o lo stato attivo del Gateway di utenti OpenClaw reali. Gli artefatti rimangono nella directory degli artefatti della suite QA esistente e vengono trattati come output dei test. Le verifiche di oscuramento usano marcatori fittizi, in modo che gli errori possano essere esaminati e segnalati in modo sicuro nelle issue.

Estensione del pacchetto

Aggiungi nuovi casi .yaml in qa/scenarios/personal/, quindi aggiungi l’ID dello scenario a QA_PERSONAL_AGENT_SCENARIO_IDS. Mantieni ogni caso piccolo, locale, deterministico in mock-openai e incentrato su un singolo comportamento dell’assistente personale. Buoni candidati per sviluppi successivi: verifiche dell’esportazione oscurata delle traiettorie, verifiche dei flussi di lavoro dei Plugin esclusivamente locali. Evita di aggiungere un nuovo esecutore, Plugin, dipendenza, trasporto attivo o valutatore basato su modello finché il catalogo degli scenari non contiene abbastanza casi stabili da giustificare tale superficie.