基本原则
只有当专门处理通道减少了对 实际瓶颈的争用时,才能提高吞吐量:- 会话锁:同一时间应只有一个运行能够修改给定会话。
- 全局模型容量:所有用户可见的聊天运行仍共享提供商限制。
- 工具容量:Shell、浏览器、网络和仓库操作可能比 模型轮次本身更慢。
- 上下文预算:冗长的对话记录会让之后的每个轮次更慢且更不 聚焦。
- 所有权不明确:重复执行相同工作的智能体会浪费容量。
推荐实施步骤
阶段 1:通道契约 + 后台繁重工作
在每个通道的工作区和系统提示词中为其提供书面契约:- 用途:此通道负责的工作。
- 非目标:此通道应移交而非尝试处理的工作。
- 聊天预算:快速回答留在聊天中;对于耗时任务,先简短确认, 然后在后台子智能体或任务中运行。
- 移交规则:当工作由另一个通道负责时,说明应移交到哪里, 并提供简洁的移交摘要。
- 工具风险规则:优先使用能够完成工作的最小工具集。
阶段 2:优先级和并发控制
根据每个通道的业务价值调整队列和模型容量:阶段 3:协调器/流量控制器
在多个通道启用后,添加一个轻量级协调器模式:- 跟踪活跃的通道任务及其负责人。
- 检测不同群组中的重复请求。
- 在通道之间路由移交摘要。
- 仅呈现阻塞项、已完成结果以及必须由人工做出的决策。