Skip to main content
Personal Agent Benchmark Pack 是一个由小型仓库支持的 QA 场景包,用于 本地个人助理工作流。它不是通用模型基准测试,并且 不需要新的运行器:它复用私有 QA 栈(QA overview)、 合成的 QA channel 以及现有的 qa/scenarios YAML 目录。

场景

共十个场景,定义于 qa/scenarios/personal/*.yaml 机器可读的包元数据(ID 列表、标题、描述)位于 extensions/qa-lab/src/scenario-packs.ts,名称为 QA_PERSONAL_AGENT_SCENARIO_IDS。 使用 --pack personal-agent 运行该场景包:
--pack 可与重复的 --scenario 标志叠加使用。显式指定的场景会 先运行,然后场景包中的场景按照 QA_PERSONAL_AGENT_SCENARIO_IDS 顺序运行, 并移除重复项。 该场景包面向使用 mock-openai 或其他本地 QA 提供商 通道的 qa-channel。请勿将其指向实时聊天服务或真实个人账户。

隐私模型

场景仅使用模拟用户、模拟偏好、模拟密钥以及 测试套件创建的临时 QA Gateway 网关工作区。它们不得读取或 写入真实的 OpenClaw 用户记忆、会话、凭据、启动代理、全局 配置或实时 Gateway 网关状态。 工件保留在现有 QA 测试套件的工件目录下,并按 测试输出处理。脱敏检查使用模拟标记,因此可以安全地 检查失败并将其提交到议题中。

扩展场景包

qa/scenarios/personal/ 下添加新的 .yaml 用例,然后将场景 ID 添加到 QA_PERSONAL_AGENT_SCENARIO_IDS。每个用例应保持小型、本地,并在 mock-openai 中具有确定性,且专注于一种个人助理行为。 适合作为后续工作的候选项:经过脱敏的轨迹导出检查、仅限本地的 插件工作流检查。 在场景目录拥有足够多的稳定用例、足以证明新增表面合理之前, 请避免添加新的运行器、插件、依赖项、实时传输或模型评审器。