tools.media, el orden de respaldo y la integración con el pipeline de respuesta.
Cómo funciona
1
Recopilar archivos adjuntos
Recopila en orden los datos de los archivos multimedia entrantes (
path, url, contentType y kind).2
Seleccionar por capacidad
Para cada capacidad habilitada (imagen/audio/video), selecciona los archivos adjuntos según la política
attachments (valor predeterminado: solo el primer archivo adjunto).3
Elegir un modelo
Elige la primera entrada de modelo apta (tamaño + capacidad + autenticación disponible).
4
Usar el respaldo en caso de error
Si un modelo genera un error, agota el tiempo de espera o el archivo multimedia supera
maxBytes, prueba la siguiente entrada.5
Aplicar cuando se completa correctamente
Body se convierte en un bloque [Image], [Audio] o [Video]. El audio también establece {{Transcript}}; el análisis de comandos utiliza el texto del pie de contenido cuando está presente y, en caso contrario, la transcripción. Los pies de contenido se conservan como User text: dentro del bloque.Configuración
tools.media contiene una lista de modelos etiquetados por capacidad y pequeños controles para cada capacidad:
image/audio/video):
Los prompts, límites, indicaciones de idioma, reemplazos de solicitudes y opciones de proveedores se pueden establecer como valores predeterminados de la capacidad o reemplazar en entradas
tools.media.models[] individuales. Los valores predeterminados de la capacidad también se aplican a los proveedores detectados automáticamente cuando no se configura ningún modelo explícito.
Entradas de modelos
Cada entradamodels[] es una entrada de proveedor (valor predeterminado) o una entrada de CLI:
- Entrada de proveedor
- Entrada de CLI
Credenciales del proveedor
La comprensión de archivos multimedia mediante proveedores utiliza la misma resolución de autenticación que las llamadas normales a modelos: perfiles de autenticación, variables de entorno y, a continuación,models.providers.<providerId>.apiKey. Las entradas tools.media.models[] no aceptan un campo apiKey en línea.
Reglas y comportamiento
- Los archivos multimedia que superan
maxBytesomiten ese modelo y prueban el siguiente. - Los archivos de audio de menos de 1024 bytes se consideran vacíos o dañados y se omiten antes de la transcripción; en su lugar, el agente recibe una transcripción de marcador de posición determinista.
- Si el modelo de imagen principal activo ya admite visión de forma nativa, OpenClaw omite el bloque de resumen
[Image]y pasa la imagen original directamente al modelo. MiniMax es una excepción:minimax,minimax-cn,minimax-portalyminimax-portal-cnsiempre enrutan la comprensión de imágenes mediante el proveedor de archivos multimediaMiniMax-VL-01controlado por el plugin, aunque los metadatos heredados de chat de MiniMax M2.x indiquen que admite entrada de imágenes (soloMiniMax-M3y versiones posteriores se consideran compatibles con visión de forma nativa). - Si el modelo principal de Gateway/WebChat solo admite texto, los archivos de imagen adjuntos se conservan como referencias
media://inbound/*descargadas, de modo que las herramientas de imagen/PDF o un modelo de imagen configurado puedan inspeccionarlos sin perder el archivo adjunto. - La configuración explícita de
openclaw infer image describe --file <path> --model <provider/model>(alias:openclaw capability image describe) ejecuta directamente ese proveedor/modelo compatible con imágenes, incluidas referencias de Ollama comoollama/qwen2.5vl:7bcuando se configura un modelo compatible con imágenes coincidente enmodels.providers.ollama.models[]. - Si
<capability>.enabledno esfalse, pero no hay modelos configurados, OpenClaw prueba el modelo de respuesta activo cuando su proveedor admite la capacidad.
Detección automática (valor predeterminado)
Cuandotools.media.<capability>.enabled no es false y no hay modelos configurados, OpenClaw prueba las siguientes opciones en orden y se detiene en la primera que funciona:
1
Modelo de imagen configurado (solo imagen)
Referencias principales/de respaldo de
agents.defaults.imageModel, salvo que el modelo de respuesta activo ya admita visión de forma nativa. Se da preferencia a las referencias provider/model; las referencias simples solo se completan a partir de entradas de modelos de proveedores configurados compatibles con imágenes cuando la coincidencia es única.2
Modelo de respuesta activo
El modelo de respuesta activo, cuando su proveedor admite la capacidad.
3
Autenticación del proveedor (solo audio, antes de las CLI locales)
Las entradas
models.providers.* configuradas que admiten audio se prueban antes que las CLI locales. Orden de prioridad de proveedores incluidos (los empates se resuelven alfabéticamente por id. de proveedor): Groq/OpenAI → xAI → Deepgram → OpenRouter → Google/SenseAudio → Deepinfra/ElevenLabs → Mistral.4
CLI locales (solo audio)
Los binarios locales disponibles forman una lista ordenada de respaldo:
whisper-cliprimero solo después de que una invocación anterior de un modelo en el proceso actual haya detectado Metal o CUDAsherpa-onnx-offlinecon CPU de forma predeterminada (requiereSHERPA_ONNX_MODEL_DIRcontokens.txt/encoder.onnx/decoder.onnx/joiner.onnx)whisper-clicuando la aceleración solo es compatible en la compilación o no se ha observadoparakeet-mlxen Apple Silicon (compatible con MLX, uso del dispositivo no observado)whisper(CLI de Python; usa de forma predeterminada el modeloturboy lo descarga automáticamente)
5
Autenticación del proveedor (imagen/video)
Las entradas
models.providers.* configuradas que admiten la capacidad se prueban antes que el orden de respaldo incluido. Los proveedores configurados solo para imágenes con un modelo compatible con imágenes se registran automáticamente para la comprensión de archivos multimedia, aunque no sean un plugin de proveedor incluido.Orden de prioridad de proveedores incluidos (los empates se resuelven alfabéticamente por id. de proveedor):- Imagen: Anthropic/OpenAI → Google → MiniMax → Deepinfra → MiniMax Portal → Z.AI
- Video: Google → Qwen → Moonshot
6
CLI de Antigravity (solo imagen/video)
El primer binario
agy o antigravity instalado (se reemplaza con OPENCLAW_ANTIGRAVITY_CLI), aislado en el directorio del archivo multimedia.La detección de binarios se realiza con el máximo esfuerzo en macOS/Linux/Windows; asegúrate de que la CLI esté en
PATH (~ se expande) o establece una entrada explícita de modelo de CLI con la ruta completa del comando.Compatibilidad con proxy (llamadas de proveedores de audio/video)
La comprensión de audio y video mediante proveedores respeta las variables de entorno estándar del proxy saliente, incluidas las reglas de omisiónNO_PROXY/no_proxy: HTTPS_PROXY, HTTP_PROXY, ALL_PROXY, https_proxy, http_proxy, all_proxy. Las variables en minúsculas tienen prioridad sobre las que están en mayúsculas. Si no se establece ninguna, la comprensión de archivos multimedia utiliza una salida directa; si el valor del proxy tiene un formato incorrecto, OpenClaw registra una advertencia y vuelve a la recuperación directa. La comprensión de imágenes no utiliza esta ruta de proxy.
Capacidades
Establececapabilities en una entrada models[] para restringirla a tipos específicos de archivos multimedia. En las listas compartidas, OpenClaw infiere los valores predeterminados para cada proveedor incluido:
Para las entradas de la CLI, establezca
capabilities explícitamente para evitar coincidencias inesperadas; si se omite, la entrada será apta para todas las listas de capacidades en las que aparezca.
Matriz de compatibilidad de proveedores
Nota sobre MiniMax: la comprensión de imágenes de
minimax, minimax-cn, minimax-portal y minimax-portal-cn siempre procede del proveedor de medios MiniMax-VL-01, propiedad del plugin, aunque los metadatos heredados del chat de MiniMax M2.x indiquen que admite la entrada de imágenes.Orientación para seleccionar modelos
- Cuando la calidad y la seguridad sean importantes, utilice el modelo de la generación actual más potente para cada capacidad multimedia.
- En agentes con herramientas que gestionen entradas no confiables, evite los modelos multimedia antiguos o menos potentes.
- Mantenga al menos una alternativa por capacidad para garantizar la disponibilidad (un modelo de calidad y otro más rápido o económico).
- Las alternativas de la CLI (
whisper-cli,whisper,gemini) resultan útiles cuando las API de los proveedores no están disponibles. - Los modos conocidos de salida a archivo son autoritativos: si el archivo de transcripción inferido está vacío o no existe, no se genera ninguna transcripción en lugar de recurrir a la salida de progreso de la CLI.
parakeet-mlx: utilice--output-format txt(oall) con--output-diry la plantilla de salida predeterminada{filename}. También se respetan las variables de entorno del proyecto de origenPARAKEET_OUTPUT_FORMATyPARAKEET_OUTPUT_TEMPLATE. OpenClaw lee<output-dir>/<media-basename>.txt; el formato predeterminadosrt, los demás formatos y las plantillas de salida personalizadas siguen utilizando stdout.
Política de archivos adjuntos
La opciónattachments de cada capacidad controla qué archivos adjuntos se procesan:
"first" | "all"
predeterminado:"first"
Procesa solo el primer archivo adjunto seleccionado o todos ellos.
number
predeterminado:"1"
Limita el número de archivos procesados.
"first" | "last" | "path" | "url"
Preferencia de selección entre los archivos adjuntos candidatos.
mode: "all", las salidas se etiquetan como [Image 1/2], [Audio 2/2], etc.
Extracción de archivos adjuntos
- El texto extraído de los archivos se delimita como contenido externo no confiable antes de añadirse al prompt multimedia, mediante marcadores de límite como
<<<EXTERNAL_UNTRUSTED_CONTENT id="...">>>/<<<END_EXTERNAL_UNTRUSTED_CONTENT id="...">>>y una línea de metadatosSource: External. - Esta ruta omite intencionadamente el extenso aviso
SECURITY NOTICE:para mantener breve el prompt multimedia; los marcadores de límite y los metadatos siguen aplicándose. - Los archivos sin texto extraíble reciben
[No extractable text]. - Si un PDF recurre a imágenes renderizadas de sus páginas, OpenClaw reenvía esas imágenes a los modelos de respuesta con capacidad de visión y conserva el marcador de posición
[PDF content rendered to images]en el bloque del archivo.
Ejemplos de configuración
- Modelos compartidos y anulaciones
- Solo audio y vídeo
- Solo imagen
- Entrada multimodal única
Salida de estado
Cuando se ejecuta la comprensión multimedia,/status incluye una línea de resumen por capacidad:
openclaw capability audio providers. Las filas locales muestran por separado la alternativa local elegida, la selección global del proveedor, la disponibilidad y los campos independientes de backend capaz/solicitado/observado. La misma selección local está disponible como hallazgo informativo de doctor:
Notas
- La comprensión funciona según el mejor esfuerzo posible. Los errores no bloquean las respuestas.
- Los archivos adjuntos se siguen enviando a los modelos aunque la comprensión esté desactivada.
- Utilice
scopepara limitar dónde se ejecuta la comprensión (por ejemplo, solo en mensajes directos).