image_generate створює та редагує зображення через налаштованих
провайдерів. У сеансах чату він працює асинхронно: OpenClaw реєструє
фонове завдання, негайно повертає ідентифікатор завдання та активує агента,
коли провайдер завершує роботу. Агент завершення дотримується звичайного для
сеансу режиму видимої відповіді: автоматично доставляє остаточну відповідь,
якщо це налаштовано, або використовує message(action="send"), якщо сеанс
вимагає застосування інструмента повідомлень. Якщо сеанс запитувача неактивний
або його активна спроба активації завершується невдало, OpenClaw надсилає
ідемпотентну пряму резервну відповідь зі створеними зображеннями, щоб результат
не було втрачено.
Інструмент відображається лише тоді, коли доступний принаймні один провайдер
генерування зображень. Якщо серед інструментів вашого агента немає
image_generate, налаштуйте agents.defaults.imageGenerationModel, задайте
API-ключ провайдера або ввійдіть через OpenAI ChatGPT/Codex OAuth.Швидкий початок
1
Налаштуйте автентифікацію
Задайте API-ключ принаймні для одного провайдера (наприклад,
OPENAI_API_KEY, GEMINI_API_KEY, OPENROUTER_API_KEY) або ввійдіть через
OpenAI Codex OAuth.2
Виберіть модель за замовчуванням (необов’язково)
openai/gpt-image-2. Коли налаштовано профіль OAuth openai, OpenClaw
спрямовує запити зображень через цей профіль OAuth, а не намагається
спочатку використати OPENAI_API_KEY. Явна конфігурація
models.providers.openai (API-ключ, власна або Azure базова URL-адреса)
знову вмикає прямий маршрут через OpenAI Images API.3
Зверніться до агента
“Створи зображення дружнього робота-талісмана.”Агент автоматично викликає
image_generate. Додавати інструмент до списку
дозволених не потрібно — його ввімкнено за замовчуванням, коли доступний
провайдер. Інструмент повертає ідентифікатор фонового завдання, а після
завершення агент надсилає створений вкладений файл через інструмент
message.Поширені маршрути
Той самий інструмент підтримує генерування зображень із тексту та редагування
за еталонним зображенням. Використовуйте
image для одного еталона або
images для кількох. Для моделей Krea 2 у fal ці еталони надсилаються як
стильові референси, а не як вхідні дані для редагування. Підтримувані
провайдером підказки щодо результату, як-от quality, outputFormat і
background, передаються, коли вони доступні, а якщо провайдер не заявляє
про їх підтримку, вони позначаються як проігноровані. Вбудована підтримка
прозорого тла є специфічною для OpenAI; інші провайдери також можуть зберігати
альфа-канал PNG, якщо його створює їхня серверна система.
Підтримувані провайдери
Використовуйте
action: "list", щоб перевірити доступних провайдерів і моделі
під час виконання:
action: "status", щоб перевірити активне завдання генерування
зображень для поточного сеансу:
Можливості провайдерів
Параметри інструмента
string
обов'язково
Текстовий запит для генерування зображення. Обов’язковий для
action: "generate"."generate" | "status" | "list"
за замовчуванням:"generate"
Використовуйте
"status", щоб перевірити активне завдання сеансу, або
"list", щоб перевірити доступних провайдерів і моделі під час виконання.string
Перевизначення провайдера або моделі (наприклад,
openai/gpt-image-2).
Використовуйте openai/gpt-image-1.5 для прозорого тла OpenAI.string
Шлях або URL-адреса одного еталонного зображення для режиму редагування.
string[]
Кілька еталонних зображень для режиму редагування або моделей зі стильовими
референсами (до 14 через спільний інструмент; специфічні для провайдера
обмеження все одно застосовуються).
string
Підказка щодо розміру:
1024x1024, 1536x1024, 1024x1536, 2048x2048,
3840x2160.string
Співвідношення сторін:
1:1, 2:1, 20:9, 19.5:9, 2:3, 3:2,
2.35:1, 3:4, 4:3, 4:5, 5:4, 9:16, 9:19.5, 9:20, 16:9,
21:9, 1:2, 4:1, 1:4, 8:1, 1:8. Провайдери перевіряють власну
підмножину, специфічну для моделі."1K" | "2K" | "4K"
Підказка щодо роздільної здатності.
"low" | "medium" | "high" | "auto"
Підказка щодо якості, якщо провайдер її підтримує.
"png" | "jpeg" | "webp"
Підказка щодо формату результату, якщо провайдер її підтримує.
"transparent" | "opaque" | "auto"
Підказка щодо тла, якщо провайдер її підтримує. Використовуйте
transparent
з outputFormat: "png" або "webp" для провайдерів, здатних створювати
прозоре тло.number
Кількість зображень для генерування (1–4).
number
Необов’язковий час очікування запиту до провайдера в мілісекундах. Коли Codex
викликає
image_generate через динамічні інструменти, це значення для
окремого виклику все одно перевизначає налаштоване значення за замовчуванням
і обмежується 600000 мс.string
Підказка щодо назви вихідного файлу.
object
Підказки лише для OpenAI:
background, moderation, outputCompression і
user."raw" | "low" | "medium" | "high"
Керування креативністю fal Krea 2. Значення за замовчуванням —
medium.Не всі провайдери підтримують усі параметри. Якщо резервний провайдер
підтримує близький варіант геометрії замість точно запитаного, OpenClaw перед
надсиланням зіставляє запит із найближчим підтримуваним розміром,
співвідношенням сторін або роздільною здатністю. Непідтримувані підказки щодо
результату відкидаються для провайдерів, які не заявляють про їх підтримку, і
зазначаються в результаті інструмента. Результати інструмента містять
застосовані параметри;
details.normalization фіксує будь-яке перетворення
запитаних значень на застосовані.Конфігурація
Вибір моделі
Порядок вибору провайдерів
OpenClaw випробовує провайдерів у такому порядку:- Параметр
modelіз виклику інструмента (якщо агент його вказує). imageGenerationModel.primaryіз конфігурації.imageGenerationModel.fallbacksу заданому порядку.- Автовиявлення — лише стандартні постачальники з налаштованою автентифікацією:
- спочатку поточний стандартний постачальник;
- потім решта зареєстрованих постачальників генерації зображень у порядку ідентифікаторів постачальників.
Per-call model overrides are exact
Per-call model overrides are exact
Перевизначення
model для окремого виклику випробовує лише зазначеного постачальника/модель і
не переходить до налаштованої основної, резервних або автоматично виявлених постачальників.Auto-detection is auth-aware
Auto-detection is auth-aware
Стандартна модель постачальника потрапляє до списку кандидатів лише тоді, коли OpenClaw може
фактично автентифікуватися в цього постачальника. Установіть
agents.defaults.mediaGenerationAutoProviderFallback: false, щоб використовувати лише
явно задані записи model, primary і fallbacks.Timeouts
Timeouts
Для повільних систем обробки зображень установіть
agents.defaults.imageGenerationModel.timeoutMs.
Параметр інструмента timeoutMs для окремого виклику перевизначає налаштоване
стандартне значення, а налаштовані стандартні значення перевизначають стандартні значення
постачальника, задані плагіном. Розміщені в Google і OpenRouter постачальники зображень використовують стандартне значення
180 секунд; генерація зображень Microsoft Foundry MAI, xAI та Azure OpenAI використовує
600 секунд. Виклики динамічних інструментів Codex використовують стандартне значення 120 секунд для мосту
image_generate і дотримуються того самого налаштованого бюджету часу очікування, обмеженого
максимальним значенням мосту динамічних інструментів OpenClaw у 600000 мс.Inspect at runtime
Inspect at runtime
Використовуйте
action: "list", щоб переглянути поточних зареєстрованих постачальників,
їхні стандартні моделі та підказки щодо змінних середовища для автентифікації.Редагування зображень
OpenAI, OpenRouter, Google, DeepInfra, fal, Microsoft Foundry, MiniMax, ComfyUI та xAI підтримують редагування еталонних зображень. Моделі Krea 2 у fal використовують ті самі поляimage / images як стильові еталони, а не як вхідні дані
для редагування. Передайте шлях або URL еталонного зображення:
images; xAI підтримує до 3. fal підтримує 1 еталонне зображення для
перетворення зображення на зображення у Flux, до 10 для редагування GPT Image 2, до 10 стильових еталонів
для Krea 2 і до 14 для редагування Nano Banana 2. Microsoft Foundry, MiniMax
і ComfyUI підтримують 1.
Докладно про постачальників
OpenAI gpt-image-2 (and gpt-image-1.5)
OpenAI gpt-image-2 (and gpt-image-1.5)
Для генерації зображень OpenAI стандартно використовується
openai/gpt-image-2. Якщо налаштовано
профіль OAuth openai, OpenClaw повторно використовує той самий
профіль OAuth, що й моделі чату за передплатою Codex, і надсилає
запит зображення через серверну частину Codex Responses. Застарілі базові
URL-адреси Codex, як-от https://chatgpt.com/backend-api, канонізуються до
https://chatgpt.com/backend-api/codex для запитів зображень. OpenClaw
не переходить непомітно до OPENAI_API_KEY для такого запиту —
щоб примусово спрямувати запит безпосередньо до OpenAI Images API, явно налаштуйте
models.providers.openai із ключем API, власною базовою URL-адресою
або кінцевою точкою Azure.Моделі openai/gpt-image-1.5, openai/gpt-image-1 і
openai/gpt-image-1-mini усе ще можна вибрати явно. Використовуйте
gpt-image-1.5 для виведення PNG/WebP із прозорим тлом; поточний
API gpt-image-2 відхиляє background: "transparent".gpt-image-2 підтримує як генерацію зображень із тексту, так і
редагування еталонних зображень через той самий інструмент image_generate.
OpenClaw передає до OpenAI prompt, count, size, quality, outputFormat
та еталонні зображення. OpenAI не отримує
aspectRatio або resolution безпосередньо; коли це можливо, OpenClaw зіставляє
їх із підтримуваним значенням size, інакше інструмент повідомляє про них як про
проігноровані перевизначення.Параметри, специфічні для OpenAI, розміщено в об’єкті openai:openai.background приймає transparent, opaque або auto;
для прозорого виведення потрібен outputFormat зі значенням png або webp і
модель зображень OpenAI із підтримкою прозорості. OpenClaw спрямовує стандартні
запити gpt-image-2 із прозорим тлом до gpt-image-1.5.
openai.outputCompression застосовується до виведення JPEG/WebP та ігнорується
для виведення PNG.Підказка верхнього рівня background не залежить від постачальника й наразі зіставляється
з тим самим полем запиту OpenAI background, коли вибрано постачальника OpenAI.
Постачальники, які не заявляють підтримку тла, повертають
її в ignoredOverrides, замість того щоб отримувати непідтримуваний параметр.Щоб спрямувати генерацію зображень OpenAI через розгортання Azure OpenAI
замість api.openai.com, див.
Кінцеві точки Azure OpenAI.Microsoft Foundry MAI image models
Microsoft Foundry MAI image models
Генерація зображень Microsoft Foundry використовує імена розгорнутих розгортань зображень MAI
із префіксом постачальника Постачальник використовує API MAI від Microsoft Foundry, а не OpenAI Images API:
microsoft-foundry/. Стандартної моделі на рівні постачальника
немає, оскільки API MAI очікує ім’я вашого розгортання в
полі model:- Кінцева точка генерації:
/mai/v1/images/generations - Кінцева точка редагування:
/mai/v1/images/edits - Автентифікація:
AZURE_OPENAI_API_KEY/ ключ API постачальника або Entra ID черезaz login - Виведення: одне зображення PNG
- Розмір: стандартно
1024x1024; ширина й висота мають становити щонайменше 768 пікселів кожна, а загальна кількість пікселів не має перевищувати 1 048 576 - Редагування: одне еталонне зображення PNG або JPEG, підтримується лише
розгортаннями
MAI-Image-2.5-FlashіMAI-Image-2.5
MAI-Image-2.5-Flash або MAI-Image-2.5.Поточні моделі зображень MAI: MAI-Image-2.5-Flash, MAI-Image-2.5,
MAI-Image-2e і MAI-Image-2. Відомості про налаштування
та поведінку моделей чату див. у розділі плагін Microsoft Foundry.OpenRouter image models
OpenRouter image models
Генерація зображень OpenRouter використовує той самий OpenClaw передає до OpenRouter
OPENROUTER_API_KEY і
спрямовує запити через API зображень завершення чату OpenRouter. Вибирайте
моделі зображень OpenRouter із префіксом openrouter/:prompt, count, еталонні зображення та
сумісні з Gemini підказки aspectRatio / resolution.
Поточні вбудовані скорочення моделей зображень OpenRouter включають
google/gemini-3.1-flash-image-preview,
google/gemini-3-pro-image-preview і openai/gpt-5.4-image-2. Використовуйте
action: "list", щоб переглянути, що надає ваш налаштований плагін.fal Krea 2
fal Krea 2
Моделі Krea 2 у fal використовують власну схему Krea від fal замість універсальної
схеми Наразі Krea 2 повертає одне зображення на запит. Для Krea віддавайте перевагу
image_size, яку використовує Flux. OpenClaw надсилає:aspect_ratioдля підказок щодо співвідношення сторінcreativity, зі стандартним значеннямmediumimage_style_references, коли наданоimageабоimages
aspectRatio;
OpenClaw зіставляє size із найближчим підтримуваним співвідношенням сторін Krea та
відхиляє resolution для Krea, а не відкидає його. Використовуйте fal.creativity,
коли потрібен власний рівень творчості Krea:MiniMax dual-auth
MiniMax dual-auth
Генерація зображень MiniMax доступна через обидва вбудовані
шляхи автентифікації MiniMax:
minimax/image-01для налаштувань із ключем APIminimax-portal/image-01для налаштувань OAuth
xAI grok-imagine-image
xAI grok-imagine-image
Вбудований постачальник xAI використовує
/v1/images/generations для запитів
лише із запитом і /v1/images/edits, коли наявне image або images.- Моделі:
xai/grok-imagine-image,xai/grok-imagine-image-quality - Кількість: до 4
- Еталони: одне
imageабо до трьохimages - Співвідношення сторін:
1:1,16:9,9:16,4:3,3:4,3:2,2:3,2:1,1:2,19.5:9,9:19.5,20:9,9:20 - Роздільна здатність:
1K,2K - Виведення: повертається як вкладення зображень, керовані OpenClaw
quality, mask,
user або співвідношення сторін auto, доки ці засоби керування не з’являться в спільному
міжпостачальницькому контракті image_generate.Приклади
- Generate (4K landscape)
- Generate (transparent PNG)
- Generate (OpenAI low quality)
- Генерування (два квадратні)
- Редагування (одне референсне зображення)
- Редагування (кілька референсних зображень)
- Стильові референси Krea
--output-format, --background, --quality і
--openai-moderation доступні для openclaw infer image edit;
--openai-background залишається псевдонімом, специфічним для OpenAI. Наразі
вбудовані провайдери, окрім OpenAI, не оголошують явного керування тлом, тому
для них background: "transparent" позначається як проігнорований параметр.
Пов’язані матеріали
- Огляд інструментів — усі доступні інструменти агента
- ComfyUI — налаштування локальних робочих процесів ComfyUI та Comfy Cloud
- fal — налаштування провайдера зображень і відео fal
- Google (Gemini) — налаштування провайдера зображень Gemini
- Plugin Microsoft Foundry — налаштування чату Microsoft Foundry і зображень MAI
- MiniMax — налаштування провайдера зображень MiniMax
- OpenAI — налаштування провайдера OpenAI Images
- Vydra — налаштування зображень, відео та мовлення Vydra
- xAI — налаштування зображень, відео, пошуку, виконання коду та синтезу мовлення Grok
- Довідник із конфігурації — конфігурація
imageGenerationModel - Моделі — конфігурація моделей і перемикання в разі відмови