Skip to main content
Пакет бенчмарков персонального агента — это небольшой пакет сценариев QA на базе репозитория для локальных рабочих процессов персонального помощника. Это не универсальный бенчмарк модели, и ему не требуется новый исполнитель: он повторно использует закрытый стек QA (обзор QA), синтетический канал QA и существующий каталог YAML qa/scenarios.

Сценарии

Десять сценариев, определённых в qa/scenarios/personal/*.yaml: Машиночитаемые метаданные пакета (список идентификаторов, заголовок, описание) находятся в extensions/qa-lab/src/scenario-packs.ts как QA_PERSONAL_AGENT_SCENARIO_IDS. Запустите пакет с помощью --pack personal-agent:
--pack дополняет повторяющиеся флаги --scenario. Сначала выполняются явно указанные сценарии, затем сценарии пакета выполняются в порядке QA_PERSONAL_AGENT_SCENARIO_IDS с удалением дубликатов. Пакет предназначен для qa-channel с mock-openai или другой локальной линией провайдера QA. Не направляйте его на действующие службы чатов или реальные личные учётные записи.

Модель конфиденциальности

Сценарии используют только фиктивных пользователей, фиктивные предпочтения, фиктивные секреты и временное рабочее пространство Gateway для QA, создаваемое набором тестов. Они не должны читать или изменять реальную пользовательскую память OpenClaw, сеансы, учётные данные, агенты запуска, глобальные конфигурации или состояние действующего Gateway. Артефакты остаются в существующем каталоге артефактов набора QA и рассматриваются как результаты тестирования. Проверки редактирования используют фиктивные маркеры, поэтому сбои можно безопасно исследовать и регистрировать в задачах.

Расширение пакета

Добавьте новые случаи .yaml в qa/scenarios/personal/, затем добавьте идентификатор сценария в QA_PERSONAL_AGENT_SCENARIO_IDS. Каждый случай должен быть небольшим, локальным и детерминированным в mock-openai, а также сосредоточенным на одном аспекте поведения персонального помощника. Подходящие кандидаты для дальнейшего развития: проверки экспорта траекторий с редактированием, проверки локальных рабочих процессов плагинов. Не добавляйте новый исполнитель, плагин, зависимость, действующий транспорт или модель-судью, пока каталог сценариев не будет содержать достаточно стабильных случаев, оправдывающих такую поверхность.