image_generate टूल आपके कॉन्फ़िगर किए गए प्रोवाइडरों के माध्यम से इमेज बनाता और संपादित करता है। चैट सत्रों में यह असिंक्रोनस रूप से चलता है: OpenClaw एक बैकग्राउंड टास्क दर्ज करता है, तुरंत टास्क आईडी लौटाता है और प्रोवाइडर का काम पूरा होने पर एजेंट को सक्रिय करता है। पूर्णता एजेंट सत्र के सामान्य दृश्यमान-जवाब मोड का पालन करता है: कॉन्फ़िगर होने पर अंतिम जवाब की स्वचालित डिलीवरी, या जब सत्र को संदेश टूल की आवश्यकता हो तब message(action="send")। यदि अनुरोधकर्ता सत्र निष्क्रिय है या उसका सक्रिय वेक विफल हो जाता है, तो OpenClaw जनरेट की गई इमेज के साथ एक आइडेम्पोटेंट प्रत्यक्ष फ़ॉलबैक भेजता है, ताकि परिणाम खो न जाए।
यह टूल केवल तभी दिखाई देता है, जब कम-से-कम एक इमेज-जनरेशन प्रोवाइडर उपलब्ध हो। यदि आपके एजेंट के टूल में
image_generate दिखाई नहीं देता, तो agents.defaults.mediaModels.image कॉन्फ़िगर करें, किसी प्रोवाइडर की API कुंजी सेट अप करें या OpenAI ChatGPT/Codex OAuth से साइन इन करें।त्वरित शुरुआत
1
प्रमाणीकरण कॉन्फ़िगर करें
कम-से-कम एक प्रोवाइडर के लिए API कुंजी सेट करें (उदाहरण के लिए
OPENAI_API_KEY, GEMINI_API_KEY, OPENROUTER_API_KEY) या OpenAI Codex OAuth से साइन इन करें।2
डिफ़ॉल्ट मॉडल चुनें (वैकल्पिक)
openai/gpt-image-2 मॉडल संदर्भ का उपयोग करता है। जब कोई openai OAuth प्रोफ़ाइल कॉन्फ़िगर होती है, तो OpenClaw पहले OPENAI_API_KEY को आज़माने के बजाय इमेज अनुरोधों को उस OAuth प्रोफ़ाइल के माध्यम से रूट करता है। स्पष्ट models.providers.openai कॉन्फ़िगरेशन (API कुंजी, कस्टम/Azure बेस URL) फिर से प्रत्यक्ष OpenAI Images API रूट का विकल्प चुनता है।3
एजेंट से कहें
“एक मित्रवत रोबोट मैस्कॉट की इमेज बनाएँ।”एजेंट स्वचालित रूप से
image_generate को कॉल करता है। टूल को अनुमति-सूची में डालने की आवश्यकता नहीं है—प्रोवाइडर उपलब्ध होने पर यह डिफ़ॉल्ट रूप से सक्षम होता है। टूल एक बैकग्राउंड टास्क आईडी लौटाता है, फिर तैयार होने पर पूर्णता एजेंट जनरेट किया गया अटैचमेंट message टूल के माध्यम से भेजता है।सामान्य रूट
यही टूल टेक्स्ट-से-इमेज और संदर्भ-इमेज संपादन दोनों को संभालता है। एक संदर्भ के लिए
image या एकाधिक संदर्भों के लिए images का उपयोग करें। fal पर Krea 2 मॉडल के लिए, उन संदर्भों को संपादन इनपुट के बजाय शैली संदर्भों के रूप में भेजा जाता है। प्रोवाइडर द्वारा समर्थित आउटपुट संकेत, जैसे quality, outputFormat और background, उपलब्ध होने पर आगे भेजे जाते हैं और यदि कोई प्रोवाइडर समर्थन घोषित नहीं करता, तो उन्हें अनदेखा किए गए के रूप में रिपोर्ट किया जाता है। बंडल किया गया पारदर्शी-बैकग्राउंड समर्थन OpenAI-विशिष्ट है; अन्य प्रोवाइडर भी PNG अल्फ़ा को बनाए रख सकते हैं, यदि उनका बैकएंड इसे उत्सर्जित करता है।
समर्थित प्रोवाइडर
रनटाइम पर उपलब्ध प्रोवाइडरों और मॉडलों का निरीक्षण करने के लिए
action: "list" का उपयोग करें:
action: "status" का उपयोग करें:
प्रोवाइडर क्षमताएँ
टूल पैरामीटर
string
आवश्यक
इमेज जनरेशन प्रॉम्प्ट।
action: "generate" के लिए आवश्यक।"generate" | "status" | "list"
डिफ़ॉल्ट:"generate"
सक्रिय सत्र टास्क का निरीक्षण करने के लिए
"status" या रनटाइम पर उपलब्ध प्रोवाइडरों और मॉडलों का निरीक्षण करने के लिए "list" का उपयोग करें।string
प्रोवाइडर/मॉडल ओवरराइड (जैसे
openai/gpt-image-2)। पारदर्शी OpenAI बैकग्राउंड के लिए openai/gpt-image-1.5 का उपयोग करें।string
संपादन मोड के लिए एकल संदर्भ इमेज पथ या URL।
string[]
संपादन मोड या शैली-संदर्भ मॉडल के लिए एकाधिक संदर्भ इमेज (साझा टूल के माध्यम से अधिकतम 14; प्रोवाइडर-विशिष्ट सीमाएँ फिर भी लागू होती हैं)।
string
आकार संकेत:
1024x1024, 1536x1024, 1024x1536, 2048x2048, 3840x2160।string
आस्पेक्ट रेशियो:
1:1, 2:1, 20:9, 19.5:9, 2:3, 3:2, 2.35:1, 3:4,
4:3, 4:5, 5:4, 9:16, 9:19.5, 9:20, 16:9, 21:9, 1:2, 4:1,
1:4, 8:1, 1:8। प्रोवाइडर अपने मॉडल-विशिष्ट उपसमुच्चय को सत्यापित करते हैं।"1K" | "2K" | "4K"
रिज़ॉल्यूशन संकेत।
"low" | "medium" | "high" | "auto"
प्रोवाइडर द्वारा समर्थित होने पर गुणवत्ता संकेत।
"png" | "jpeg" | "webp"
प्रोवाइडर द्वारा समर्थित होने पर आउटपुट फ़ॉर्मैट संकेत।
"transparent" | "opaque" | "auto"
प्रोवाइडर द्वारा समर्थित होने पर बैकग्राउंड संकेत। पारदर्शिता-सक्षम प्रोवाइडरों के लिए
outputFormat: "png" या "webp" के साथ transparent का उपयोग करें।number
जनरेट की जाने वाली इमेज की संख्या (1-4)।
number
मिलीसेकंड में वैकल्पिक प्रोवाइडर अनुरोध टाइमआउट। जब Codex डायनेमिक टूल के माध्यम से
image_generate को कॉल करता है, तब भी यह प्रति-कॉल मान कॉन्फ़िगर किए गए डिफ़ॉल्ट को ओवरराइड करता है और इसकी अधिकतम सीमा 600000 ms होती है।string
आउटपुट फ़ाइलनाम संकेत।
object
केवल OpenAI के संकेत:
background, moderation, outputCompression और user।"raw" | "low" | "medium" | "high"
fal Krea 2 रचनात्मकता नियंत्रण। डिफ़ॉल्ट
medium है।सभी प्रोवाइडर सभी पैरामीटरों का समर्थन नहीं करते। जब कोई फ़ॉलबैक प्रोवाइडर बिल्कुल अनुरोधित विकल्प के बजाय निकटवर्ती ज्यामिति विकल्प का समर्थन करता है, तो OpenClaw सबमिशन से पहले उसे निकटतम समर्थित आकार, आस्पेक्ट रेशियो या रिज़ॉल्यूशन पर रीमैप करता है। असमर्थित आउटपुट संकेत उन प्रोवाइडरों के लिए हटा दिए जाते हैं जो समर्थन घोषित नहीं करते और टूल परिणाम में रिपोर्ट किए जाते हैं। टूल परिणाम लागू की गई सेटिंग रिपोर्ट करते हैं;
details.normalization अनुरोधित-से-लागू रूपांतरण को दर्ज करता है।कॉन्फ़िगरेशन
मॉडल चयन
प्रदाता चयन क्रम
OpenClaw इस क्रम में प्रदाताओं को आज़माता है:- टूल कॉल से
modelपैरामीटर (यदि एजेंट कोई निर्दिष्ट करता है)। - कॉन्फ़िगरेशन से
imageGenerationModel.primary। - क्रमानुसार
imageGenerationModel.fallbacks। - स्वतः पहचान - केवल प्रमाणीकरण-समर्थित प्रदाता डिफ़ॉल्ट:
- पहले वर्तमान डिफ़ॉल्ट प्रदाता;
- फिर शेष पंजीकृत इमेज-जनरेशन प्रदाता, प्रदाता आईडी के क्रम में।
प्रति-कॉल मॉडल ओवरराइड सटीक होते हैं
प्रति-कॉल मॉडल ओवरराइड सटीक होते हैं
प्रति-कॉल
model ओवरराइड केवल उसी प्रदाता/मॉडल को आज़माता है और
कॉन्फ़िगर किए गए प्राथमिक/फ़ॉलबैक या स्वतः पहचाने गए प्रदाताओं पर आगे नहीं बढ़ता।स्वतः पहचान प्रमाणीकरण-सचेत है
स्वतः पहचान प्रमाणीकरण-सचेत है
किसी प्रदाता का डिफ़ॉल्ट उम्मीदवार सूची में तभी शामिल होता है, जब OpenClaw
वास्तव में उस प्रदाता को प्रमाणित कर सकता है। प्रमाणित प्रदाताओं में स्वचालित
फ़ॉलबैक हमेशा सक्षम रहता है; प्रति-कॉल
model प्रामाणिक बना रहता है।समय-सीमाएँ
समय-सीमाएँ
धीमे इमेज बैकएंड के लिए
agents.defaults.mediaModels.image.timeoutMs
सेट करें। प्रति-कॉल timeoutMs टूल पैरामीटर कॉन्फ़िगर किए गए
डिफ़ॉल्ट को ओवरराइड करता है, और कॉन्फ़िगर किए गए डिफ़ॉल्ट Plugin-निर्धारित प्रदाता
डिफ़ॉल्ट को ओवरराइड करते हैं। Google और OpenRouter द्वारा होस्ट किए गए इमेज प्रदाता
180 सेकंड के डिफ़ॉल्ट का उपयोग करते हैं; Microsoft Foundry MAI, xAI और Azure OpenAI
इमेज जनरेशन 600 सेकंड का उपयोग करते हैं। Codex डायनेमिक-टूल कॉल 120 सेकंड के
image_generate ब्रिज डिफ़ॉल्ट का उपयोग करते हैं और कॉन्फ़िगर किए जाने पर उसी
समय-सीमा बजट का पालन करते हैं, जो OpenClaw के 600000 ms डायनेमिक-टूल ब्रिज
अधिकतम तक सीमित होता है।रनटाइम पर निरीक्षण करें
रनटाइम पर निरीक्षण करें
वर्तमान में पंजीकृत प्रदाताओं, उनके डिफ़ॉल्ट मॉडलों और प्रमाणीकरण env-var संकेतों
का निरीक्षण करने के लिए
action: "list" का उपयोग करें।इमेज संपादन
OpenAI, OpenRouter, Google, DeepInfra, fal, Microsoft Foundry, MiniMax, ComfyUI और xAI संदर्भ इमेज के संपादन का समर्थन करते हैं। fal पर Krea 2 मॉडल संपादन इनपुट के बजाय शैली संदर्भों के रूप में उन्हींimage / images
फ़ील्ड का उपयोग करते हैं। संदर्भ इमेज का पथ या URL दें:
images पैरामीटर के माध्यम से अधिकतम 5
संदर्भ इमेज का समर्थन करते हैं; xAI अधिकतम 3 का समर्थन करता है। fal Flux
इमेज-टू-इमेज के लिए 1 संदर्भ इमेज, GPT Image 2 संपादनों के लिए अधिकतम 10,
Krea 2 के लिए अधिकतम 10 शैली संदर्भ और Nano Banana 2 संपादनों के लिए अधिकतम
14 का समर्थन करता है। Microsoft Foundry, MiniMax और ComfyUI 1 का समर्थन करते हैं।
प्रदाताओं का गहन विवरण
OpenAI gpt-image-2 (और gpt-image-1.5)
OpenAI gpt-image-2 (और gpt-image-1.5)
OpenAI इमेज जनरेशन का डिफ़ॉल्ट
openai/gpt-image-2 है। यदि कोई
openai OAuth प्रोफ़ाइल कॉन्फ़िगर की गई है, तो OpenClaw Codex
सदस्यता चैट मॉडलों द्वारा उपयोग की जाने वाली उसी OAuth प्रोफ़ाइल का पुनः उपयोग
करता है और इमेज अनुरोध को Codex Responses बैकएंड के माध्यम से भेजता है।
https://chatgpt.com/backend-api जैसे पुराने Codex बेस URL को इमेज अनुरोधों के लिए
https://chatgpt.com/backend-api/codex में कैननिकलाइज़ किया जाता है। OpenClaw उस अनुरोध के लिए
चुपचाप OPENAI_API_KEY पर फ़ॉलबैक नहीं करता - सीधे OpenAI Images API
के माध्यम से रूटिंग बाध्य करने के लिए API कुंजी, कस्टम बेस URL या Azure
एंडपॉइंट के साथ models.providers.openai को स्पष्ट रूप से कॉन्फ़िगर करें।openai/gpt-image-1.5, openai/gpt-image-1 और openai/gpt-image-1-mini
मॉडल अब भी स्पष्ट रूप से चुने जा सकते हैं। पारदर्शी पृष्ठभूमि वाले PNG/WebP
आउटपुट के लिए gpt-image-1.5 का उपयोग करें; वर्तमान gpt-image-2
API background: "transparent" को अस्वीकार करता है।gpt-image-2 उसी image_generate टूल के माध्यम से टेक्स्ट-टू-इमेज
जनरेशन और संदर्भ-इमेज संपादन, दोनों का समर्थन करता है। OpenClaw
prompt, count, size, quality, outputFormat
और संदर्भ इमेज OpenAI को अग्रेषित करता है। OpenAI को aspectRatio
या resolution सीधे नहीं मिलते; जहाँ संभव हो, OpenClaw उन्हें
समर्थित size में मैप करता है, अन्यथा टूल उन्हें उपेक्षित
ओवरराइड के रूप में रिपोर्ट करता है।OpenAI-विशिष्ट विकल्प openai ऑब्जेक्ट के अंतर्गत होते हैं:openai.background, transparent, opaque या
auto स्वीकार करता है; पारदर्शी आउटपुट के लिए
outputFormat png या webp और पारदर्शिता
में सक्षम OpenAI इमेज मॉडल आवश्यक है। OpenClaw डिफ़ॉल्ट
gpt-image-2 पारदर्शी-पृष्ठभूमि अनुरोधों को gpt-image-1.5
पर रूट करता है। openai.outputCompression JPEG/WebP आउटपुट पर लागू होता है और
PNG आउटपुट के लिए उपेक्षित किया जाता है।शीर्ष-स्तरीय background संकेत प्रदाता-निरपेक्ष है और OpenAI प्रदाता
चुने जाने पर वर्तमान में उसी OpenAI background अनुरोध फ़ील्ड में
मैप होता है। जो प्रदाता पृष्ठभूमि समर्थन घोषित नहीं करते, वे असमर्थित पैरामीटर
प्राप्त करने के बजाय उसे ignoredOverrides में लौटाते हैं।OpenAI इमेज जनरेशन को api.openai.com के बजाय Azure OpenAI डिप्लॉयमेंट
के माध्यम से रूट करने के लिए
Azure OpenAI एंडपॉइंट देखें।Microsoft Foundry MAI इमेज मॉडल
Microsoft Foundry MAI इमेज मॉडल
Microsoft Foundry इमेज जनरेशन प्रदाता OpenAI Images API का नहीं, बल्कि Microsoft Foundry के MAI API का उपयोग करता है:
microsoft-foundry/ प्रदाता प्रीफ़िक्स के
अंतर्गत डिप्लॉय किए गए MAI इमेज डिप्लॉयमेंट नामों का उपयोग करता है।
प्रदाता-स्तरीय कोई डिफ़ॉल्ट मॉडल नहीं है, क्योंकि MAI API को model
फ़ील्ड में आपके डिप्लॉयमेंट नाम की अपेक्षा होती है:- जनरेशन एंडपॉइंट:
/mai/v1/images/generations - संपादन एंडपॉइंट:
/mai/v1/images/edits - प्रमाणीकरण:
AZURE_OPENAI_API_KEY/ प्रदाता API कुंजी, याaz loginके माध्यम से Entra ID - आउटपुट: एक PNG इमेज
- आकार: डिफ़ॉल्ट
1024x1024; चौड़ाई और ऊँचाई प्रत्येक कम-से-कम 768 px होनी चाहिए और कुल पिक्सेल अधिकतम 1,048,576 होने चाहिए - संपादन: एक PNG या JPEG संदर्भ इमेज, जो केवल
MAI-Image-2.5-FlashऔरMAI-Image-2.5डिप्लॉयमेंट द्वारा समर्थित है
MAI-Image-2.5-Flash या MAI-Image-2.5 द्वारा
समर्थित है।वर्तमान MAI इमेज मॉडल MAI-Image-2.5-Flash, MAI-Image-2.5,
MAI-Image-2e और MAI-Image-2 हैं। सेटअप और चैट-मॉडल व्यवहार
के लिए Microsoft Foundry Plugin देखें।OpenRouter इमेज मॉडल
OpenRouter इमेज मॉडल
OpenRouter इमेज जनरेशन उसी OpenClaw
OPENROUTER_API_KEY का उपयोग करता है और
OpenRouter के चैट कम्प्लीशन्स इमेज API के माध्यम से रूट करता है।
openrouter/ प्रीफ़िक्स के साथ OpenRouter इमेज मॉडल चुनें:prompt, count, संदर्भ इमेज और
Gemini-संगत aspectRatio / resolution संकेत OpenRouter को
अग्रेषित करता है। वर्तमान अंतर्निहित OpenRouter इमेज मॉडल शॉर्टकट में
google/gemini-3.1-flash-image, google/gemini-3-pro-image और openai/gpt-5.4-image-2 शामिल हैं।
आपका कॉन्फ़िगर किया गया Plugin क्या उपलब्ध कराता है, यह देखने के लिए
action: "list" का उपयोग करें।fal Krea 2
fal Krea 2
fal पर Krea 2 मॉडल Flux द्वारा उपयोग किए जाने वाले सामान्य
Krea 2 वर्तमान में प्रति अनुरोध एक इमेज लौटाता है। Krea के लिए
image_size स्कीमा के बजाय fal के मूल Krea स्कीमा का उपयोग करते हैं।
OpenClaw भेजता है:- आस्पेक्ट-रेशियो संकेतों के लिए
aspect_ratio creativity, जिसका डिफ़ॉल्टmediumहैimageयाimagesदिए जाने परimage_style_references
aspectRatio को प्राथमिकता दें; OpenClaw size को निकटतम
समर्थित Krea आस्पेक्ट रेशियो में मैप करता है और resolution को हटाने
के बजाय Krea के लिए अस्वीकार करता है। मूल Krea रचनात्मकता स्तर चाहिए, तो
fal.creativity का उपयोग करें:MiniMax दोहरा प्रमाणीकरण
MiniMax दोहरा प्रमाणीकरण
MiniMax इमेज जनरेशन दोनों बंडल किए गए MiniMax प्रमाणीकरण पथों के माध्यम से
उपलब्ध है:
- API-कुंजी सेटअप के लिए
minimax/image-01 - OAuth सेटअप के लिए
minimax-portal/image-01
xAI grok-imagine-image
xAI grok-imagine-image
बंडल किया गया xAI प्रदाता केवल-प्रॉम्प्ट अनुरोधों के लिए
/v1/images/generations
और image या images मौजूद होने पर /v1/images/edits
का उपयोग करता है।- मॉडल:
xai/grok-imagine-image,xai/grok-imagine-image-quality - संख्या: अधिकतम 4
- संदर्भ: एक
imageया अधिकतम तीनimages - आस्पेक्ट रेशियो:
1:1,16:9,9:16,4:3,3:4,3:2,2:3,2:1,1:2,19.5:9,9:19.5,20:9,9:20 - रिज़ॉल्यूशन:
1K,2K - आउटपुट: OpenClaw-प्रबंधित इमेज अटैचमेंट के रूप में लौटाए जाते हैं
quality, mask,
user या auto आस्पेक्ट रेशियो को तब तक उपलब्ध
नहीं कराता, जब तक वे नियंत्रण साझा अंतर-प्रदाता image_generate
अनुबंध में मौजूद नहीं होते।उदाहरण
- जनरेट करें (4K लैंडस्केप)
- जनरेट करें (पारदर्शी PNG)
- जनरेट करें (OpenAI निम्न गुणवत्ता)
- जनरेट करें (दो वर्गाकार)
- संपादित करें (एक संदर्भ)
- संपादित करें (कई संदर्भ)
- Krea शैली संदर्भ
--output-format, --background, --quality, और
--openai-moderation फ़्लैग openclaw infer image edit पर उपलब्ध हैं;
--openai-background OpenAI-विशिष्ट उपनाम के रूप में बना हुआ है। OpenAI के
अलावा अन्य बंडल किए गए प्रदाता वर्तमान में स्पष्ट पृष्ठभूमि नियंत्रण घोषित नहीं करते,
इसलिए उनके लिए background: "transparent" को अनदेखा किया गया बताया जाता है।
संबंधित
- टूल का अवलोकन - सभी उपलब्ध एजेंट टूल
- ComfyUI - स्थानीय ComfyUI और Comfy Cloud वर्कफ़्लो सेटअप
- fal - fal छवि और वीडियो प्रदाता सेटअप
- Google (Gemini) - Gemini छवि प्रदाता सेटअप
- Microsoft Foundry Plugin - Microsoft Foundry चैट और MAI छवि सेटअप
- MiniMax - MiniMax छवि प्रदाता सेटअप
- OpenAI - OpenAI Images प्रदाता सेटअप
- Vydra - Vydra छवि, वीडियो और वाक् सेटअप
- xAI - Grok छवि, वीडियो, खोज, कोड निष्पादन और TTS सेटअप
- कॉन्फ़िगरेशन संदर्भ -
imageGenerationModelकॉन्फ़िगरेशन - मॉडल - मॉडल कॉन्फ़िगरेशन और फ़ेलओवर