Principios fundamentales
Un carril de especialista solo mejora el rendimiento cuando reduce la contención en los cuellos de botella reales:- Bloqueos de sesión: solo una ejecución debe modificar una sesión determinada a la vez.
- Capacidad global del modelo: todas las ejecuciones de chat visibles siguen compartiendo los límites del proveedor.
- Capacidad de las herramientas: el trabajo con el shell, el navegador, la red y el repositorio puede ser más lento que el propio turno del modelo.
- Presupuesto de contexto: las transcripciones largas hacen que cada turno futuro sea más lento y esté menos enfocado.
- Ambigüedad de responsabilidad: los agentes duplicados que realizan el mismo trabajo desperdician capacidad.
Despliegue recomendado
Fase 1: contratos de carril + trabajo pesado en segundo plano
Proporcione a cada carril un contrato escrito en su espacio de trabajo y en el prompt del sistema:- Propósito: el trabajo del que se encarga este carril.
- Objetivos excluidos: el trabajo que debe transferir en lugar de intentar realizar.
- Presupuesto de chat: las respuestas rápidas permanecen en el chat; las tareas largas se confirman brevemente y después se ejecutan en un subagente o una tarea en segundo plano.
- Regla de transferencia: cuando otro carril se encargue del trabajo, indique adónde debe dirigirse y proporcione un resumen de transferencia conciso.
- Regla de riesgo de herramientas: prefiera la superficie de herramientas más pequeña que pueda realizar el trabajo.
Fase 2: controles de prioridad y concurrencia
Ajuste la capacidad de la cola y del modelo según el valor empresarial de cada carril:Fase 3: coordinador/controlador de tráfico
Añada un patrón de coordinación sencillo cuando haya varios carriles activos:- Realice un seguimiento de las tareas activas de los carriles y sus responsables.
- Detecte solicitudes duplicadas entre grupos.
- Transfiera resúmenes de traspaso entre carriles.
- Muestre únicamente los bloqueos, los resultados completados y las decisiones que debe tomar la persona.