image_generate crea y edita imágenes mediante los
proveedores configurados. En las sesiones de chat se ejecuta de forma asíncrona:
OpenClaw registra una tarea en segundo plano, devuelve de inmediato el id. de la
tarea y activa al agente cuando el proveedor finaliza. El agente de finalización
sigue el modo normal de respuesta visible de la sesión: entrega automática de la
respuesta final cuando está configurada, o message(action="send") cuando la sesión
requiere la herramienta de mensajes. Si la sesión solicitante está inactiva o
falla su activación, OpenClaw envía directamente una alternativa idempotente con
las imágenes generadas para que el resultado no se pierda.
La herramienta solo aparece cuando hay al menos un proveedor de generación de
imágenes disponible. Si no aparece
image_generate entre las herramientas del
agente, configure agents.defaults.mediaModels.image, establezca una clave de API de un proveedor
o inicie sesión con OAuth de OpenAI ChatGPT/Codex.Inicio rápido
1
Configurar la autenticación
Establezca una clave de API para al menos un proveedor (por ejemplo,
OPENAI_API_KEY, GEMINI_API_KEY, OPENROUTER_API_KEY) o inicie sesión
con OAuth de OpenAI Codex.2
Elegir un modelo predeterminado (opcional)
openai/gpt-image-2. Cuando se configura un perfil OAuth
openai, OpenClaw dirige las solicitudes de imágenes mediante
ese perfil OAuth en lugar de intentar primero OPENAI_API_KEY.
La configuración explícita de models.providers.openai (clave de API, URL base
personalizada o de Azure) vuelve a habilitar la ruta directa de la API
OpenAI Images.3
Solicitarlo al agente
“Genera una imagen de una mascota robótica amigable.”El agente llama automáticamente a
image_generate. No es necesario
incluirla en una lista de herramientas permitidas: está habilitada de forma
predeterminada cuando hay un proveedor disponible. La herramienta devuelve
el id. de una tarea en segundo plano y, cuando está lista, el agente de
finalización envía la imagen adjunta generada mediante la herramienta
message.Rutas habituales
La misma herramienta gestiona la generación de texto a imagen y la edición con
imágenes de referencia. Use
image para una referencia o
images para varias. En los modelos Krea 2 de fal, esas referencias se
envían como referencias de estilo en lugar de entradas de edición. Las
indicaciones de salida compatibles con el proveedor, como quality,
outputFormat y background, se reenvían cuando están disponibles y
se notifican como ignoradas cuando un proveedor no declara compatibilidad. La
compatibilidad integrada con fondos transparentes es específica de OpenAI;
otros proveedores también pueden conservar el canal alfa de PNG si su backend
lo genera.
Proveedores compatibles
Use
action: "list" para consultar los proveedores y modelos disponibles en
tiempo de ejecución:
action: "status" para consultar la tarea activa de generación de imágenes
de la sesión actual:
Capacidades de los proveedores
Parámetros de la herramienta
string
requerido
Instrucción para la generación de imágenes. Obligatoria para
action: "generate"."generate" | "status" | "list"
predeterminado:"generate"
Use
"status" para consultar la tarea activa de la sesión o
"list" para consultar los proveedores y modelos disponibles en
tiempo de ejecución.string
Reemplazo de proveedor/modelo (p. ej.,
openai/gpt-image-2). Use
openai/gpt-image-1.5 para fondos transparentes de OpenAI.string
Ruta o URL de una única imagen de referencia para el modo de edición.
string[]
Varias imágenes de referencia para el modo de edición o los modelos de
referencia de estilo (hasta 14 mediante la herramienta compartida; siguen
aplicándose los límites específicos de cada proveedor).
string
Indicación de tamaño:
1024x1024, 1536x1024,
1024x1536, 2048x2048, 3840x2160.string
Relación de aspecto:
1:1, 2:1,
20:9, 19.5:9, 2:3,
3:2, 2.35:1, 3:4,
4:3, 4:5, 5:4,
9:16, 9:19.5, 9:20,
16:9, 21:9, 1:2,
4:1, 1:4, 8:1,
1:8. Los proveedores validan el subconjunto específico de
cada modelo."1K" | "2K" | "4K"
Indicación de resolución.
"low" | "medium" | "high" | "auto"
Indicación de calidad cuando el proveedor la admite.
"png" | "jpeg" | "webp"
Indicación del formato de salida cuando el proveedor lo admite.
"transparent" | "opaque" | "auto"
Indicación del fondo cuando el proveedor la admite. Use
transparent con outputFormat: "png" o "webp" para
proveedores compatibles con transparencias.number
Número de imágenes que se generarán (1-4).
number
Tiempo de espera opcional de la solicitud al proveedor, en milisegundos.
Cuando Codex llama a
image_generate mediante herramientas dinámicas,
este valor por llamada sigue reemplazando el valor predeterminado configurado
y está limitado a 600000 ms.string
Indicación del nombre del archivo de salida.
object
Indicaciones exclusivas de OpenAI:
background, moderation,
outputCompression y user."raw" | "low" | "medium" | "high"
Control de creatividad de fal Krea 2. El valor predeterminado es
medium.No todos los proveedores admiten todos los parámetros. Cuando un proveedor
alternativo admite una opción geométrica similar en lugar de la solicitada
exactamente, OpenClaw la reasigna al tamaño, la relación de aspecto o la
resolución compatible más cercana antes de enviar la solicitud. Las
indicaciones de salida no compatibles se descartan en los proveedores que no
declaran compatibilidad y se notifican en el resultado de la herramienta. Los
resultados de la herramienta indican la configuración aplicada;
details.normalization registra cualquier conversión entre lo solicitado y lo
aplicado.Configuración
Selección del modelo
Orden de selección de proveedores
OpenClaw prueba los proveedores en este orden:- Parámetro
modelde la llamada a la herramienta (si el agente especifica uno). imageGenerationModel.primaryde la configuración.imageGenerationModel.fallbacksen orden.- Detección automática: solo valores predeterminados de proveedores respaldados por autenticación:
- primero, el proveedor predeterminado actual;
- después, los demás proveedores de generación de imágenes registrados, ordenados por identificador de proveedor.
Las sustituciones de modelo por llamada son exactas
Las sustituciones de modelo por llamada son exactas
Una sustitución de
model por llamada prueba únicamente ese proveedor/modelo y
no continúa con el proveedor principal, los proveedores alternativos configurados ni los proveedores detectados automáticamente.La detección automática tiene en cuenta la autenticación
La detección automática tiene en cuenta la autenticación
El valor predeterminado de un proveedor solo entra en la lista de candidatos cuando OpenClaw puede
autenticar realmente ese proveedor. La conmutación automática entre proveedores autenticados
siempre está habilitada; un
model por llamada sigue teniendo prioridad.Tiempos de espera
Tiempos de espera
Establezca
agents.defaults.mediaModels.image.timeoutMs para backends de imágenes
lentos. Un parámetro de herramienta timeoutMs por llamada sustituye el valor predeterminado
configurado, y los valores predeterminados configurados sustituyen los valores predeterminados
del proveedor definidos por el plugin. Los proveedores de imágenes alojados de Google y OpenRouter usan valores
predeterminados de 180 segundos; la generación de imágenes de Microsoft Foundry MAI, xAI y Azure OpenAI usa
600 segundos. Las llamadas a herramientas dinámicas de Codex usan un valor predeterminado de puente
image_generate de 120 segundos y, cuando está configurado, respetan el mismo límite de tiempo de espera,
acotado por el máximo de 600000 ms del puente de herramientas dinámicas de OpenClaw.Inspección durante la ejecución
Inspección durante la ejecución
Use
action: "list" para inspeccionar los proveedores registrados actualmente,
sus modelos predeterminados y las indicaciones sobre variables de entorno de autenticación.Edición de imágenes
OpenAI, OpenRouter, Google, DeepInfra, fal, Microsoft Foundry, MiniMax, ComfyUI y xAI permiten editar imágenes de referencia. Los modelos Krea 2 en fal usan los mismos camposimage / images como referencias de estilo en lugar de entradas
de edición. Proporcione la ruta o URL de una imagen de referencia:
images; xAI admite hasta 3. fal admite 1 imagen de referencia para
la conversión de imagen a imagen de Flux, hasta 10 para ediciones de GPT Image 2, hasta 10 referencias de estilo
para Krea 2 y hasta 14 para ediciones de Nano Banana 2. Microsoft Foundry, MiniMax
y ComfyUI admiten 1.
Análisis detallados de proveedores
OpenAI gpt-image-2 (y gpt-image-1.5)
OpenAI gpt-image-2 (y gpt-image-1.5)
La generación de imágenes de OpenAI usa
openai/gpt-image-2 de forma predeterminada. Si se configura
un perfil OAuth openai, OpenClaw reutiliza el mismo
perfil OAuth empleado por los modelos de chat de suscripción de Codex y envía la
solicitud de imagen a través del backend Responses de Codex. Las URL base heredadas de Codex,
como https://chatgpt.com/backend-api, se normalizan como
https://chatgpt.com/backend-api/codex para las solicitudes de imágenes. OpenClaw
no recurre silenciosamente a OPENAI_API_KEY para esa solicitud:
para forzar el enrutamiento directo mediante la API de imágenes de OpenAI, configure
models.providers.openai explícitamente con una clave de API, una URL base personalizada
o un endpoint de Azure.Los modelos openai/gpt-image-1.5, openai/gpt-image-1 y
openai/gpt-image-1-mini aún pueden seleccionarse explícitamente. Use
gpt-image-1.5 para obtener resultados PNG/WebP con fondo transparente; la API
gpt-image-2 actual rechaza background: "transparent".gpt-image-2 admite tanto la generación de texto a imagen como
la edición de imágenes de referencia mediante la misma herramienta image_generate.
OpenClaw reenvía prompt, count, size, quality, outputFormat
y las imágenes de referencia a OpenAI. OpenAI no recibe
aspectRatio ni resolution directamente; cuando es posible, OpenClaw asigna
esos valores a un size compatible; de lo contrario, la herramienta los registra como
sustituciones ignoradas.Las opciones específicas de OpenAI se encuentran en el objeto openai:openai.background acepta transparent, opaque o auto;
los resultados transparentes requieren outputFormat png o webp y un
modelo de imágenes de OpenAI compatible con transparencias. OpenClaw dirige las solicitudes
predeterminadas gpt-image-2 con fondo transparente a gpt-image-1.5.
openai.outputCompression se aplica a los resultados JPEG/WebP y se ignora
para los resultados PNG.La indicación background de nivel superior es independiente del proveedor y actualmente se asigna
al mismo campo de solicitud background de OpenAI cuando se selecciona el proveedor OpenAI.
Los proveedores que no declaran compatibilidad con fondos la devuelven
en ignoredOverrides en lugar de recibir el parámetro no compatible.Para dirigir la generación de imágenes de OpenAI a través de una implementación de Azure OpenAI
en lugar de api.openai.com, consulte
Endpoints de Azure OpenAI.Modelos de imágenes de Microsoft Foundry MAI
Modelos de imágenes de Microsoft Foundry MAI
La generación de imágenes de Microsoft Foundry usa nombres de implementaciones de imágenes MAI
bajo el prefijo de proveedor El proveedor usa la API de MAI de Microsoft Foundry, no la API de imágenes de OpenAI:
microsoft-foundry/. No existe un modelo predeterminado
para todo el proveedor porque la API de MAI espera el nombre de la implementación en el
campo model:- Endpoint de generación:
/mai/v1/images/generations - Endpoint de edición:
/mai/v1/images/edits - Autenticación:
AZURE_OPENAI_API_KEY/ clave de API del proveedor, o Entra ID medianteaz login - Resultado: una imagen PNG
- Tamaño: valor predeterminado
1024x1024; tanto el ancho como la altura deben ser de al menos 768 px, y el total de píxeles no debe superar 1,048,576 - Ediciones: una imagen de referencia PNG o JPEG, compatible únicamente con
implementaciones
MAI-Image-2.5-FlashyMAI-Image-2.5
MAI-Image-2.5-Flash o MAI-Image-2.5.Los modelos de imágenes MAI actuales son MAI-Image-2.5-Flash, MAI-Image-2.5,
MAI-Image-2e y MAI-Image-2. Consulte
Plugin de Microsoft Foundry para obtener información sobre la configuración
y el comportamiento de los modelos de chat.Modelos de imágenes de OpenRouter
Modelos de imágenes de OpenRouter
La generación de imágenes de OpenRouter usa el mismo OpenClaw reenvía
OPENROUTER_API_KEY y
se enruta mediante la API de imágenes de finalizaciones de chat de OpenRouter. Seleccione
los modelos de imágenes de OpenRouter con el prefijo openrouter/:prompt, count, las imágenes de referencia y
las indicaciones aspectRatio / resolution compatibles con Gemini a OpenRouter.
Los accesos directos integrados actuales para modelos de imágenes de OpenRouter incluyen
google/gemini-3.1-flash-image,
google/gemini-3-pro-image y openai/gpt-5.4-image-2. Use
action: "list" para ver qué expone el plugin configurado.fal Krea 2
fal Krea 2
Los modelos Krea 2 en fal usan el esquema Krea nativo de fal en lugar del esquema
genérico Actualmente, Krea 2 devuelve una imagen por solicitud. Se recomienda
image_size utilizado por Flux. OpenClaw envía:aspect_ratiopara las indicaciones de relación de aspectocreativity, conmediumcomo valor predeterminadoimage_style_referencescuando se proporcionanimageoimages
aspectRatio para
Krea; OpenClaw asigna size a la relación de aspecto compatible más cercana de Krea y
rechaza resolution para Krea en lugar de descartarlo. Use fal.creativity
cuando se desee un nivel de creatividad nativo de Krea:Autenticación dual de MiniMax
Autenticación dual de MiniMax
La generación de imágenes de MiniMax está disponible mediante las dos rutas de
autenticación incluidas de MiniMax:
minimax/image-01para configuraciones con clave de APIminimax-portal/image-01para configuraciones con OAuth
xAI grok-imagine-image
xAI grok-imagine-image
El proveedor xAI incluido usa
/v1/images/generations para solicitudes basadas únicamente
en un prompt y /v1/images/edits cuando está presente image o images.- Modelos:
xai/grok-imagine-image,xai/grok-imagine-image-quality - Cantidad: hasta 4
- Referencias: un
imageo hasta tresimages - Relaciones de aspecto:
1:1,16:9,9:16,4:3,3:4,3:2,2:3,2:1,1:2,19.5:9,9:19.5,20:9,9:20 - Resoluciones:
1K,2K - Resultados: se devuelven como archivos adjuntos de imagen administrados por OpenClaw
quality, mask,
user ni la relación de aspecto auto hasta que esos controles existan en el contrato
compartido entre proveedores image_generate.Ejemplos
- Generar (paisaje 4K)
- Generar (PNG transparente)
- Generar (calidad baja de OpenAI)
- Generar (dos cuadradas)
- Editar (una referencia)
- Editar (varias referencias)
- Referencias de estilo de Krea
--output-format, --background, --quality y
--openai-moderation están disponibles en openclaw infer image edit;
--openai-background se mantiene como un alias específico de OpenAI. Actualmente, los proveedores incluidos
distintos de OpenAI no declaran un control explícito del fondo, por lo que
background: "transparent" se indica como ignorado para ellos.
Relacionado
- Descripción general de las herramientas - todas las herramientas disponibles para el agente
- ComfyUI - configuración de flujos de trabajo de ComfyUI local y Comfy Cloud
- fal - configuración del proveedor de imágenes y vídeos fal
- Google (Gemini) - configuración del proveedor de imágenes Gemini
- Plugin de Microsoft Foundry - configuración del chat de Microsoft Foundry y de imágenes MAI
- MiniMax - configuración del proveedor de imágenes MiniMax
- OpenAI - configuración del proveedor OpenAI Images
- Vydra - configuración de imágenes, vídeos y voz de Vydra
- xAI - configuración de imágenes, vídeos, búsqueda, ejecución de código y TTS de Grok
- Referencia de configuración - configuración de
imageGenerationModel - Modelos - configuración de modelos y conmutación por error