Skip to main content
Personal Agent Benchmark Pack은 로컬 개인 비서 워크플로를 위한 저장소 기반의 소규모 QA 시나리오 팩입니다. 범용 모델 벤치마크가 아니며 새 러너도 필요하지 않습니다. 비공개 QA 스택(QA 개요), 합성 QA 채널, 기존 qa/scenarios YAML 카탈로그를 재사용합니다.

시나리오

qa/scenarios/personal/*.yaml에 정의된 10개의 시나리오: 기계 판독 가능한 팩 메타데이터(ID 목록, 제목, 설명)는 extensions/qa-lab/src/scenario-packs.tsQA_PERSONAL_AGENT_SCENARIO_IDS에 있습니다. --pack personal-agent로 팩을 실행합니다.
--pack은 반복되는 --scenario 플래그와 함께 추가로 적용됩니다. 명시적 시나리오가 먼저 실행된 다음, 중복을 제거한 팩 시나리오가 QA_PERSONAL_AGENT_SCENARIO_IDS 순서대로 실행됩니다. 이 팩은 mock-openai 또는 다른 로컬 QA 제공자 실행 경로와 함께 qa-channel을 대상으로 합니다. 라이브 채팅 서비스나 실제 개인 계정을 대상으로 지정하지 마세요.

개인정보 보호 모델

시나리오는 가상 사용자, 가상 기본 설정, 가상 비밀 정보와 제품군이 생성한 임시 QA Gateway 작업 공간만 사용합니다. 실제 OpenClaw 사용자의 메모리, 세션, 자격 증명, 시작 에이전트, 전역 구성 또는 라이브 Gateway 상태를 읽거나 쓰면 안 됩니다. 아티팩트는 기존 QA 제품군 아티팩트 디렉터리 아래에 유지되며 테스트 출력처럼 취급됩니다. 삭제 처리는 가상 마커를 사용하므로 실패 결과를 안전하게 검사하고 이슈에 등록할 수 있습니다.

팩 확장

qa/scenarios/personal/ 아래에 새 .yaml 사례를 추가한 다음 시나리오 ID를 QA_PERSONAL_AGENT_SCENARIO_IDS에 추가합니다. 각 사례는 작고 로컬에서 실행되며 mock-openai에서 결정론적으로 동작하고, 하나의 개인 비서 동작에 집중해야 합니다. 적합한 후속 후보: 삭제 처리된 궤적 내보내기 검사, 로컬 전용 Plugin 워크플로 검사. 시나리오 카탈로그에 해당 표면을 정당화할 만큼 안정적인 사례가 충분히 쌓이기 전까지는 새 러너, Plugin, 종속성, 라이브 전송 수단 또는 모델 판정기를 추가하지 마세요.