Skip to main content
Personal Agent Benchmark Pack は、ローカルのパーソナルアシスタントワークフロー向けの、 リポジトリに基づく小規模な QA シナリオパックです。汎用的なモデルベンチマークではなく、 新しいランナーも必要ありません。プライベート QA スタック(QA の概要)、 合成 QA チャンネル、既存の qa/scenarios YAML カタログを再利用します。

シナリオ

qa/scenarios/personal/*.yaml で定義されている 10 個のシナリオ: 機械可読なパックメタデータ(ID リスト、タイトル、説明)は、 extensions/qa-lab/src/scenario-packs.tsQA_PERSONAL_AGENT_SCENARIO_IDS として格納されています。 --pack personal-agent を使用してパックを実行します:
--pack は、繰り返し指定された --scenario フラグに追加されます。明示的なシナリオが 最初に実行され、その後、パックのシナリオが QA_PERSONAL_AGENT_SCENARIO_IDS の順序で 重複を除いて実行されます。 このパックは、mock-openai または別のローカル QA プロバイダー レーンを使用する qa-channel を対象としています。ライブチャットサービスや実際の個人アカウントに接続しないでください。

プライバシーモデル

シナリオでは、架空のユーザー、架空の設定、架空のシークレット、および スイートによって作成された一時的な QA Gateway ワークスペースのみを使用します。実際の OpenClaw ユーザーのメモリ、セッション、認証情報、起動エージェント、グローバル 設定、ライブ Gateway の状態を読み書きしてはなりません。 アーティファクトは既存の QA スイートのアーティファクトディレクトリ内に保持され、 テスト出力として扱われます。秘匿化チェックでは架空のマーカーを使用するため、失敗時も 安全に調査し、Issue に記録できます。

パックの拡張

qa/scenarios/personal/ の下に新しい .yaml ケースを追加し、その後シナリオ ID を QA_PERSONAL_AGENT_SCENARIO_IDS に追加します。各ケースは小規模かつローカルで、mock-openai において決定的にし、 1 つのパーソナルアシスタント動作に焦点を当ててください。 有望な次の候補:秘匿化された軌跡のエクスポートチェック、ローカル限定の Plugin ワークフローチェック。 シナリオカタログにそのサーフェスを正当化できるだけの安定したケースが蓄積されるまでは、 新しいランナー、Plugin、依存関係、ライブトランスポート、モデル判定機能を追加しないでください。