Skip to main content
O Pacote de Benchmark de Agente Pessoal é um pequeno pacote de cenários de QA baseado em repositório para fluxos de trabalho locais de assistente pessoal. Ele não é um benchmark genérico de modelos e não precisa de um novo executor: reutiliza a pilha privada de QA (visão geral de QA), o canal de QA sintético e o catálogo YAML qa/scenarios existente.

Cenários

Dez cenários, definidos em qa/scenarios/personal/*.yaml: Os metadados do pacote legíveis por máquina (lista de IDs, título e descrição) ficam em extensions/qa-lab/src/scenario-packs.ts como QA_PERSONAL_AGENT_SCENARIO_IDS. Execute o pacote com --pack personal-agent:
--pack é aditivo com flags --scenario repetidas. Os cenários explícitos são executados primeiro; depois, os cenários do pacote são executados na ordem de QA_PERSONAL_AGENT_SCENARIO_IDS, com as duplicatas removidas. O pacote tem como alvo o qa-channel com mock-openai ou outra modalidade de provedor de QA local. Não o direcione a serviços de chat ativos nem a contas pessoais reais.

Modelo de privacidade

Os cenários usam apenas usuários fictícios, preferências fictícias, segredos fictícios e o espaço de trabalho temporário do Gateway de QA criado pela suíte. Eles não devem ler nem gravar memória de usuários reais do OpenClaw, sessões, credenciais, agentes de inicialização, configurações globais ou o estado ativo do Gateway. Os artefatos permanecem no diretório de artefatos existente da suíte de QA e são tratados como saída de teste. As verificações de ocultação usam marcadores fictícios para que as falhas sejam seguras para inspecionar e registrar em issues.

Como estender o pacote

Adicione novos casos .yaml em qa/scenarios/personal/ e depois adicione o ID do cenário a QA_PERSONAL_AGENT_SCENARIO_IDS. Mantenha cada caso pequeno, local, determinístico em mock-openai e concentrado em um comportamento de assistente pessoal. Bons candidatos para acompanhamento: verificações de exportação de trajetórias com dados ocultados e verificações de fluxos de trabalho de Plugin exclusivamente locais. Evite adicionar um novo executor, Plugin, dependência, transporte ativo ou avaliador de modelo até que o catálogo de cenários tenha casos estáveis suficientes para justificar essa superfície.