基本原則
専門レーンによってスループットが向上するのは、実際のボトルネックに対する競合が減る場合に限られます。- セッションロック:特定のセッションを同時に変更する実行は 1 つだけにする必要があります。
- グローバルなモデル容量:ユーザーに表示されるすべてのチャット実行は、引き続きプロバイダーの制限を共有します。
- ツール容量:シェル、ブラウザー、ネットワーク、リポジトリでの作業は、モデルのターン自体よりも遅くなることがあります。
- コンテキスト予算:長いトランスクリプトは、以後のすべてのターンを遅くし、焦点をぼやけさせます。
- 所有権の曖昧さ:複数のエージェントが同じ作業を重複して行うと、容量が無駄になります。
推奨される導入手順
フェーズ 1:レーンの契約と負荷の高いバックグラウンド作業
各レーンのワークスペースとシステムプロンプトに、次の契約を明記します。- 目的:このレーンが担当する作業。
- 対象外:このレーンでは試みず、引き渡すべき作業。
- チャット予算:簡単な回答はチャット内で行います。長いタスクには簡潔に応答してから、バックグラウンドのサブエージェントまたはタスクで実行します。
- 引き渡しルール:別のレーンが作業を担当する場合は、引き渡し先を示し、簡潔な引き渡し要約を提供します。
- ツールリスクのルール:作業を実行できる最小限のツール範囲を優先します。
フェーズ 2:優先度と並行処理の制御
各レーンのビジネス価値に合わせて、キューとモデルの容量を調整します。フェーズ 3:コーディネーター/トラフィックコントローラー
複数のレーンが稼働するようになったら、小規模なコーディネーターパターンを追加します。- 進行中のレーンタスクと担当者を追跡します。
- グループ間で重複するリクエストを検出します。
- レーン間で引き渡し要約をルーティングします。
- ブロッカー、完了した結果、および人間による判断が必要な事項だけを提示します。