Skip to main content
Le pack de référence pour agents personnels est un petit ensemble de scénarios d’assurance qualité adossé à un dépôt, destiné aux workflows locaux d’assistant personnel. Il ne s’agit pas d’un benchmark générique de modèles et il ne nécessite aucun nouvel exécuteur : il réutilise la pile d’assurance qualité privée (vue d’ensemble de l’assurance qualité), le canal d’assurance qualité synthétique et le catalogue YAML qa/scenarios existant.

Scénarios

Dix scénarios, définis dans qa/scenarios/personal/*.yaml : Les métadonnées du pack lisibles par machine (liste des identifiants, titre, description) se trouvent dans extensions/qa-lab/src/scenario-packs.ts sous le nom QA_PERSONAL_AGENT_SCENARIO_IDS. Exécutez le pack avec --pack personal-agent :
--pack est cumulatif avec les options --scenario répétées. Les scénarios explicites sont exécutés en premier, puis les scénarios du pack sont exécutés dans l’ordre de QA_PERSONAL_AGENT_SCENARIO_IDS, après suppression des doublons. Le pack cible qa-channel avec mock-openai ou une autre voie de fournisseur d’assurance qualité locale. Ne l’orientez pas vers des services de discussion en direct ni vers de vrais comptes personnels.

Modèle de confidentialité

Les scénarios utilisent uniquement de faux utilisateurs, de fausses préférences, de faux secrets et l’espace de travail temporaire du Gateway d’assurance qualité créé par la suite. Ils ne doivent ni lire ni écrire la mémoire, les sessions, les identifiants d’accès, les agents de lancement, les configurations globales ou l’état en direct du Gateway de véritables utilisateurs d’OpenClaw. Les artefacts restent dans le répertoire d’artefacts existant de la suite d’assurance qualité et sont traités comme des résultats de test. Les vérifications de masquage utilisent de faux marqueurs afin que les échecs puissent être inspectés et consignés en toute sécurité dans des tickets.

Extension du pack

Ajoutez de nouveaux cas .yaml sous qa/scenarios/personal/, puis ajoutez l’identifiant du scénario à QA_PERSONAL_AGENT_SCENARIO_IDS. Chaque cas doit rester petit, local, déterministe dans mock-openai et centré sur un seul comportement d’assistant personnel. Bons candidats pour la suite : vérifications de l’export de trajectoires expurgées, vérifications des workflows locaux uniquement des Plugins. Évitez d’ajouter un nouvel exécuteur, Plugin, dépendance, transport en direct ou modèle juge tant que le catalogue de scénarios ne contient pas suffisamment de cas stables pour justifier cette surface.