openclaw infer es la interfaz canónica sin interfaz gráfica para la inferencia respaldada por proveedores. Expone familias de capacidades (model, image, audio, tts, video, web, embedding), no nombres RPC sin procesar del Gateway ni identificadores de herramientas del agente. openclaw capability ... es un alias para el mismo árbol de comandos.
Motivos para preferirlo frente a un contenedor específico para un proveedor:
- Reutiliza los proveedores y modelos ya configurados en OpenClaw.
- Contenedor
--jsonestable para scripts y automatización controlada por agentes (consulte Salida JSON). - Ejecuta la ruta local normal sin el Gateway para la mayoría de los subcomandos.
- Para las comprobaciones integrales de proveedores, utiliza la CLI distribuida, la carga de configuración, la resolución del agente predeterminado, la activación de plugins incluidos y el entorno de ejecución de capacidades compartido antes de enviar la solicitud al proveedor.
Convertir infer en una skill
Copie y pegue lo siguiente en un agente:openclaw infer ... frente a alternativas de nivel inferior y no vuelve a documentar toda la interfaz de infer en el cuerpo de la skill.
Árbol de comandos
infer list / infer inspect --name <capability> muestran este árbol como datos (identificador de capacidad, transportes y descripción).
Tareas habituales
Comportamiento
- Use
--jsoncuando la salida alimente otro comando o script; en caso contrario, use la salida de texto. - Use
--providero--model provider/modelpara fijar un backend específico. - Use
model run --thinking <level>para una anulación puntual del pensamiento/razonamiento:off,minimal,low,medium,high,adaptive,xhighomax. - Para
image describe,audio transcribeyvideo describe,--modeldebe usar el formato<provider/model>. - Para
image describe,--fileacepta rutas locales y URL HTTP(S); las URL remotas pasan por la política SSRF normal de obtención de contenido multimedia. - Los comandos de ejecución sin estado (
model run,image *,audio *,video *,web *,embedding *) usan la ejecución local de forma predeterminada. Los comandos de estado administrados por el Gateway (tts status) usan el Gateway de forma predeterminada. - La ruta local nunca requiere que el Gateway esté en ejecución.
model runlocal es una finalización puntual y ligera del proveedor: resuelve el modelo y la autenticación configurados del agente, pero no inicia un turno del agente de chat, carga herramientas ni abre servidores MCP incluidos.model run --fileadjunta archivos de imagen (con detección automática del tipo MIME) al prompt; repita--filepara varias imágenes. Los archivos que no sean imágenes se rechazan; useinfer audio transcribeoinfer video describeen su lugar.model run --gatewayutiliza el enrutamiento del Gateway, la autenticación guardada, la selección del proveedor y el entorno de ejecución integrado, pero sigue siendo una prueba de modelo sin procesar: sin transcripción de sesión previa, contexto de arranque/AGENTS, herramientas ni servidores MCP incluidos.model run --gateway --model <provider/model>requiere una credencial de Gateway de operador de confianza, porque solicita al Gateway que ejecute una anulación puntual de proveedor/modelo.
Modelo
Inferencia de texto e inspección de modelos/proveedores.<provider/model> con --local para realizar una prueba de humo de un proveedor sin iniciar el Gateway ni cargar la interfaz de herramientas del agente:
model runlocal es la prueba de humo de CLI más específica para comprobar el estado del proveedor/modelo/autenticación: para proveedores distintos de ChatGPT-Codex, solo envía el prompt proporcionado.model run --model <provider/model>local puede resolver filas exactas del catálogo estático incluido (las mismas filas que muestraopenclaw models list --all) antes de que ese proveedor se escriba en la configuración. La autenticación del proveedor sigue siendo obligatoria; la falta de credenciales produce errores de autenticación, noUnknown model.- Para las pruebas de razonamiento de Mistral Medium 3.5, deje la temperatura sin definir/predeterminada. Mistral rechaza
reasoning_effort="high"contemperature: 0; use la temperatura predeterminada o un valor distinto de cero, como0.7. - Las pruebas locales de OAuth de OpenAI ChatGPT/Codex (API
openai-chatgpt-responses) añaden una instrucción mínima del sistema para que el transporte pueda rellenar su campo obligatorioinstructions; no se incluye el contexto completo del agente, herramientas, memoria ni la transcripción de la sesión. model run --fileadjunta el contenido de la imagen directamente al único mensaje del usuario. Los formatos habituales (PNG, JPEG y WebP) funcionan cuando el tipo MIME se detecta comoimage/*; los archivos no compatibles o no reconocidos fallan antes de llamar al proveedor. Useinfer image describeen su lugar cuando desee el enrutamiento y las alternativas de modelos de imagen de OpenClaw, en vez de una prueba directa de un modelo multimodal.- El modelo seleccionado debe admitir la entrada de imágenes; los modelos que solo admiten texto pueden rechazar la solicitud en la capa del proveedor.
model run --promptdebe contener texto que no sea únicamente espacio en blanco; los prompts vacíos se rechazan antes de cualquier llamada al proveedor o al Gateway.model runlocal termina con un código distinto de cero cuando el proveedor no devuelve ninguna salida de texto, de modo que los proveedores inaccesibles y las finalizaciones vacías no parezcan pruebas satisfactorias.- Use
model run --gatewaypara probar el enrutamiento del Gateway o la configuración del entorno de ejecución del agente mientras mantiene sin procesar la entrada del modelo. Useopenclaw agento una interfaz de chat para disponer del contexto completo del agente, herramientas, memoria y transcripción de la sesión. --thinking adaptivese asigna al nivelmediumdel entorno de ejecución de finalización;--thinking maxse asigna amaxpara los modelos de OpenAI que admiten el esfuerzo máximo nativo y, en caso contrario, axhigh.model auth login,model auth logoutymodel auth statusadministran el estado guardado de autenticación del proveedor.
Imagen
Generación, edición y descripción.-
Use
image edital partir de archivos de entrada existentes;--size,--aspect-ratioo--resolutionañaden indicaciones de geometría en los proveedores/modelos que las admiten. -
--output-format png --background transparentcon--model openai/gpt-image-1.5genera una salida PNG de OpenAI con fondo transparente;--openai-backgroundes un alias específico de OpenAI para la misma indicación. Los proveedores que no declaran compatibilidad con fondos la notifican como una sobrescritura ignorada (consulteignoredOverridesen el contenedor JSON). -
--quality low|medium|high|autofunciona con proveedores que admiten indicaciones de calidad de imagen, incluido OpenAI. OpenAI también acepta--openai-moderation low|auto. -
image providers --jsonenumera qué proveedores de imágenes incluidos se pueden detectar, están configurados o seleccionados, y qué capacidades de generación/edición ofrece cada uno. -
image generate --model <provider/model> --jsones la prueba rápida en vivo más específica para cambios en la generación de imágenes:La respuesta informa deok,provider,model,attemptsy las rutas de salida escritas. Cuando se establece--output, la extensión final puede corresponder al tipo MIME devuelto por el proveedor. -
Para
image describeyimage describe-many, use--promptpara proporcionar una instrucción específica de la tarea (OCR, comparación, inspección de la interfaz de usuario o generación de descripciones breves). -
Use
--timeout-mspara modelos de visión locales lentos o arranques en frío de Ollama. -
Para
image describe, primero se ejecuta un--modelexplícito (debe ser un<provider/model>compatible con imágenes) y, si esa llamada falla, se prueban losagents.defaults.imageModel.fallbacksconfigurados. Los errores de preparación de la entrada (archivo ausente, URL no admitida) provocan un fallo antes de intentar cualquier alternativa, y el modelo debe ser compatible con imágenes en el catálogo de modelos o en la configuración del proveedor. -
Para los modelos de visión locales de Ollama, descargue primero el modelo y establezca
OLLAMA_API_KEYen cualquier valor de marcador de posición, por ejemplo,ollama-local. Consulte Ollama.
Audio
Transcripción de archivos (no gestión de sesiones en tiempo real).--model debe ser <provider/model>.
TTS
Síntesis de voz y estado del proveedor/persona de TTS.tts statussolo admite--gateway(refleja el estado de TTS gestionado por el Gateway).- Use
tts providers,tts voices,tts personas,tts set-providerytts set-personapara inspeccionar y configurar el comportamiento de TTS.
Vídeo
Generación y descripción.video generateacepta--size,--aspect-ratio,--resolution,--duration,--audio,--watermarky--timeout-ms, que se reenvían al entorno de ejecución de generación de vídeo.--modeldebe ser<provider/model>paravideo describe.
Web
Búsqueda y obtención.web providers enumera los proveedores disponibles, configurados y seleccionados para la búsqueda y la obtención.
Incrustación
Creación de vectores e inspección de proveedores de incrustaciones.Salida JSON
Los comandos de inferencia normalizan la salida JSON en un contenedor compartido:okcapabilitytransportprovidermodelattemptsinputs(archivos adjuntos de imagen enviados con la solicitud, cuando corresponda)outputsignoredOverrides(claves de indicaciones que un proveedor no admite, cuando corresponda)error
outputs contiene los archivos escritos por OpenClaw. Para la automatización, use path, mimeType, size y cualquier dimensión específica del contenido multimedia incluida en esa matriz, en lugar de analizar la salida estándar legible para humanos.