Skip to main content
image_generate टूल आपके कॉन्फ़िगर किए गए प्रोवाइडरों के माध्यम से इमेज बनाता और संपादित करता है। चैट सत्रों में यह असिंक्रोनस रूप से चलता है: OpenClaw एक बैकग्राउंड टास्क दर्ज करता है, तुरंत टास्क आईडी लौटाता है और प्रोवाइडर का काम पूरा होने पर एजेंट को सक्रिय करता है। पूर्णता एजेंट सत्र के सामान्य दृश्यमान-जवाब मोड का पालन करता है: कॉन्फ़िगर होने पर अंतिम जवाब की स्वचालित डिलीवरी, या जब सत्र को संदेश टूल की आवश्यकता हो तब message(action="send")। यदि अनुरोधकर्ता सत्र निष्क्रिय है या उसका सक्रिय वेक विफल हो जाता है, तो OpenClaw जनरेट की गई इमेज के साथ एक आइडेम्पोटेंट प्रत्यक्ष फ़ॉलबैक भेजता है, ताकि परिणाम खो न जाए।
यह टूल केवल तभी दिखाई देता है, जब कम-से-कम एक इमेज-जनरेशन प्रोवाइडर उपलब्ध हो। यदि आपके एजेंट के टूल में image_generate दिखाई नहीं देता, तो agents.defaults.mediaModels.image कॉन्फ़िगर करें, किसी प्रोवाइडर की API कुंजी सेट अप करें या OpenAI ChatGPT/Codex OAuth से साइन इन करें।

त्वरित शुरुआत

1

प्रमाणीकरण कॉन्फ़िगर करें

कम-से-कम एक प्रोवाइडर के लिए API कुंजी सेट करें (उदाहरण के लिए OPENAI_API_KEY, GEMINI_API_KEY, OPENROUTER_API_KEY) या OpenAI Codex OAuth से साइन इन करें।
2

डिफ़ॉल्ट मॉडल चुनें (वैकल्पिक)

ChatGPT/Codex OAuth उसी openai/gpt-image-2 मॉडल संदर्भ का उपयोग करता है। जब कोई openai OAuth प्रोफ़ाइल कॉन्फ़िगर होती है, तो OpenClaw पहले OPENAI_API_KEY को आज़माने के बजाय इमेज अनुरोधों को उस OAuth प्रोफ़ाइल के माध्यम से रूट करता है। स्पष्ट models.providers.openai कॉन्फ़िगरेशन (API कुंजी, कस्टम/Azure बेस URL) फिर से प्रत्यक्ष OpenAI Images API रूट का विकल्प चुनता है।
3

एजेंट से कहें

“एक मित्रवत रोबोट मैस्कॉट की इमेज बनाएँ।”एजेंट स्वचालित रूप से image_generate को कॉल करता है। टूल को अनुमति-सूची में डालने की आवश्यकता नहीं है—प्रोवाइडर उपलब्ध होने पर यह डिफ़ॉल्ट रूप से सक्षम होता है। टूल एक बैकग्राउंड टास्क आईडी लौटाता है, फिर तैयार होने पर पूर्णता एजेंट जनरेट किया गया अटैचमेंट message टूल के माध्यम से भेजता है।
LocalAI जैसे OpenAI-संगत LAN एंडपॉइंट के लिए, कस्टम models.providers.openai.baseUrl बनाए रखें और browser.ssrfPolicy.dangerouslyAllowPrivateNetwork: true के साथ स्पष्ट रूप से विकल्प चुनें। निजी और आंतरिक इमेज एंडपॉइंट डिफ़ॉल्ट रूप से अवरुद्ध रहते हैं।

सामान्य रूट

यही टूल टेक्स्ट-से-इमेज और संदर्भ-इमेज संपादन दोनों को संभालता है। एक संदर्भ के लिए image या एकाधिक संदर्भों के लिए images का उपयोग करें। fal पर Krea 2 मॉडल के लिए, उन संदर्भों को संपादन इनपुट के बजाय शैली संदर्भों के रूप में भेजा जाता है। प्रोवाइडर द्वारा समर्थित आउटपुट संकेत, जैसे quality, outputFormat और background, उपलब्ध होने पर आगे भेजे जाते हैं और यदि कोई प्रोवाइडर समर्थन घोषित नहीं करता, तो उन्हें अनदेखा किए गए के रूप में रिपोर्ट किया जाता है। बंडल किया गया पारदर्शी-बैकग्राउंड समर्थन OpenAI-विशिष्ट है; अन्य प्रोवाइडर भी PNG अल्फ़ा को बनाए रख सकते हैं, यदि उनका बैकएंड इसे उत्सर्जित करता है।

समर्थित प्रोवाइडर

रनटाइम पर उपलब्ध प्रोवाइडरों और मॉडलों का निरीक्षण करने के लिए action: "list" का उपयोग करें:
वर्तमान सत्र के सक्रिय इमेज-जनरेशन टास्क का निरीक्षण करने के लिए action: "status" का उपयोग करें:

प्रोवाइडर क्षमताएँ

टूल पैरामीटर

string
आवश्यक
इमेज जनरेशन प्रॉम्प्ट। action: "generate" के लिए आवश्यक।
"generate" | "status" | "list"
डिफ़ॉल्ट:"generate"
सक्रिय सत्र टास्क का निरीक्षण करने के लिए "status" या रनटाइम पर उपलब्ध प्रोवाइडरों और मॉडलों का निरीक्षण करने के लिए "list" का उपयोग करें।
string
प्रोवाइडर/मॉडल ओवरराइड (जैसे openai/gpt-image-2)। पारदर्शी OpenAI बैकग्राउंड के लिए openai/gpt-image-1.5 का उपयोग करें।
string
संपादन मोड के लिए एकल संदर्भ इमेज पथ या URL।
string[]
संपादन मोड या शैली-संदर्भ मॉडल के लिए एकाधिक संदर्भ इमेज (साझा टूल के माध्यम से अधिकतम 14; प्रोवाइडर-विशिष्ट सीमाएँ फिर भी लागू होती हैं)।
string
आकार संकेत: 1024x1024, 1536x1024, 1024x1536, 2048x2048, 3840x2160
string
आस्पेक्ट रेशियो: 1:1, 2:1, 20:9, 19.5:9, 2:3, 3:2, 2.35:1, 3:4, 4:3, 4:5, 5:4, 9:16, 9:19.5, 9:20, 16:9, 21:9, 1:2, 4:1, 1:4, 8:1, 1:8। प्रोवाइडर अपने मॉडल-विशिष्ट उपसमुच्चय को सत्यापित करते हैं।
"1K" | "2K" | "4K"
रिज़ॉल्यूशन संकेत।
"low" | "medium" | "high" | "auto"
प्रोवाइडर द्वारा समर्थित होने पर गुणवत्ता संकेत।
"png" | "jpeg" | "webp"
प्रोवाइडर द्वारा समर्थित होने पर आउटपुट फ़ॉर्मैट संकेत।
"transparent" | "opaque" | "auto"
प्रोवाइडर द्वारा समर्थित होने पर बैकग्राउंड संकेत। पारदर्शिता-सक्षम प्रोवाइडरों के लिए outputFormat: "png" या "webp" के साथ transparent का उपयोग करें।
number
जनरेट की जाने वाली इमेज की संख्या (1-4)।
number
मिलीसेकंड में वैकल्पिक प्रोवाइडर अनुरोध टाइमआउट। जब Codex डायनेमिक टूल के माध्यम से image_generate को कॉल करता है, तब भी यह प्रति-कॉल मान कॉन्फ़िगर किए गए डिफ़ॉल्ट को ओवरराइड करता है और इसकी अधिकतम सीमा 600000 ms होती है।
string
आउटपुट फ़ाइलनाम संकेत।
object
केवल OpenAI के संकेत: background, moderation, outputCompression और user
"raw" | "low" | "medium" | "high"
fal Krea 2 रचनात्मकता नियंत्रण। डिफ़ॉल्ट medium है।
सभी प्रोवाइडर सभी पैरामीटरों का समर्थन नहीं करते। जब कोई फ़ॉलबैक प्रोवाइडर बिल्कुल अनुरोधित विकल्प के बजाय निकटवर्ती ज्यामिति विकल्प का समर्थन करता है, तो OpenClaw सबमिशन से पहले उसे निकटतम समर्थित आकार, आस्पेक्ट रेशियो या रिज़ॉल्यूशन पर रीमैप करता है। असमर्थित आउटपुट संकेत उन प्रोवाइडरों के लिए हटा दिए जाते हैं जो समर्थन घोषित नहीं करते और टूल परिणाम में रिपोर्ट किए जाते हैं। टूल परिणाम लागू की गई सेटिंग रिपोर्ट करते हैं; details.normalization अनुरोधित-से-लागू रूपांतरण को दर्ज करता है।

कॉन्फ़िगरेशन

मॉडल चयन

प्रदाता चयन क्रम

OpenClaw इस क्रम में प्रदाताओं को आज़माता है:
  1. टूल कॉल से model पैरामीटर (यदि एजेंट कोई निर्दिष्ट करता है)।
  2. कॉन्फ़िगरेशन से imageGenerationModel.primary
  3. क्रमानुसार imageGenerationModel.fallbacks
  4. स्वतः पहचान - केवल प्रमाणीकरण-समर्थित प्रदाता डिफ़ॉल्ट:
    • पहले वर्तमान डिफ़ॉल्ट प्रदाता;
    • फिर शेष पंजीकृत इमेज-जनरेशन प्रदाता, प्रदाता आईडी के क्रम में।
यदि कोई प्रदाता विफल होता है (प्रमाणीकरण त्रुटि, दर सीमा आदि), तो अगले कॉन्फ़िगर किए गए उम्मीदवार को स्वचालित रूप से आज़माया जाता है। यदि सभी विफल होते हैं, तो त्रुटि में प्रत्येक प्रयास का विवरण शामिल होता है।
प्रति-कॉल model ओवरराइड केवल उसी प्रदाता/मॉडल को आज़माता है और कॉन्फ़िगर किए गए प्राथमिक/फ़ॉलबैक या स्वतः पहचाने गए प्रदाताओं पर आगे नहीं बढ़ता।
किसी प्रदाता का डिफ़ॉल्ट उम्मीदवार सूची में तभी शामिल होता है, जब OpenClaw वास्तव में उस प्रदाता को प्रमाणित कर सकता है। प्रमाणित प्रदाताओं में स्वचालित फ़ॉलबैक हमेशा सक्षम रहता है; प्रति-कॉल model प्रामाणिक बना रहता है।
धीमे इमेज बैकएंड के लिए agents.defaults.mediaModels.image.timeoutMs सेट करें। प्रति-कॉल timeoutMs टूल पैरामीटर कॉन्फ़िगर किए गए डिफ़ॉल्ट को ओवरराइड करता है, और कॉन्फ़िगर किए गए डिफ़ॉल्ट Plugin-निर्धारित प्रदाता डिफ़ॉल्ट को ओवरराइड करते हैं। Google और OpenRouter द्वारा होस्ट किए गए इमेज प्रदाता 180 सेकंड के डिफ़ॉल्ट का उपयोग करते हैं; Microsoft Foundry MAI, xAI और Azure OpenAI इमेज जनरेशन 600 सेकंड का उपयोग करते हैं। Codex डायनेमिक-टूल कॉल 120 सेकंड के image_generate ब्रिज डिफ़ॉल्ट का उपयोग करते हैं और कॉन्फ़िगर किए जाने पर उसी समय-सीमा बजट का पालन करते हैं, जो OpenClaw के 600000 ms डायनेमिक-टूल ब्रिज अधिकतम तक सीमित होता है।
वर्तमान में पंजीकृत प्रदाताओं, उनके डिफ़ॉल्ट मॉडलों और प्रमाणीकरण env-var संकेतों का निरीक्षण करने के लिए action: "list" का उपयोग करें।

इमेज संपादन

OpenAI, OpenRouter, Google, DeepInfra, fal, Microsoft Foundry, MiniMax, ComfyUI और xAI संदर्भ इमेज के संपादन का समर्थन करते हैं। fal पर Krea 2 मॉडल संपादन इनपुट के बजाय शैली संदर्भों के रूप में उन्हीं image / images फ़ील्ड का उपयोग करते हैं। संदर्भ इमेज का पथ या URL दें:
OpenAI, OpenRouter और Google images पैरामीटर के माध्यम से अधिकतम 5 संदर्भ इमेज का समर्थन करते हैं; xAI अधिकतम 3 का समर्थन करता है। fal Flux इमेज-टू-इमेज के लिए 1 संदर्भ इमेज, GPT Image 2 संपादनों के लिए अधिकतम 10, Krea 2 के लिए अधिकतम 10 शैली संदर्भ और Nano Banana 2 संपादनों के लिए अधिकतम 14 का समर्थन करता है। Microsoft Foundry, MiniMax और ComfyUI 1 का समर्थन करते हैं।

प्रदाताओं का गहन विवरण

OpenAI इमेज जनरेशन का डिफ़ॉल्ट openai/gpt-image-2 है। यदि कोई openai OAuth प्रोफ़ाइल कॉन्फ़िगर की गई है, तो OpenClaw Codex सदस्यता चैट मॉडलों द्वारा उपयोग की जाने वाली उसी OAuth प्रोफ़ाइल का पुनः उपयोग करता है और इमेज अनुरोध को Codex Responses बैकएंड के माध्यम से भेजता है। https://chatgpt.com/backend-api जैसे पुराने Codex बेस URL को इमेज अनुरोधों के लिए https://chatgpt.com/backend-api/codex में कैननिकलाइज़ किया जाता है। OpenClaw उस अनुरोध के लिए चुपचाप OPENAI_API_KEY पर फ़ॉलबैक नहीं करता - सीधे OpenAI Images API के माध्यम से रूटिंग बाध्य करने के लिए API कुंजी, कस्टम बेस URL या Azure एंडपॉइंट के साथ models.providers.openai को स्पष्ट रूप से कॉन्फ़िगर करें।openai/gpt-image-1.5, openai/gpt-image-1 और openai/gpt-image-1-mini मॉडल अब भी स्पष्ट रूप से चुने जा सकते हैं। पारदर्शी पृष्ठभूमि वाले PNG/WebP आउटपुट के लिए gpt-image-1.5 का उपयोग करें; वर्तमान gpt-image-2 API background: "transparent" को अस्वीकार करता है।gpt-image-2 उसी image_generate टूल के माध्यम से टेक्स्ट-टू-इमेज जनरेशन और संदर्भ-इमेज संपादन, दोनों का समर्थन करता है। OpenClaw prompt, count, size, quality, outputFormat और संदर्भ इमेज OpenAI को अग्रेषित करता है। OpenAI को aspectRatio या resolution सीधे नहीं मिलते; जहाँ संभव हो, OpenClaw उन्हें समर्थित size में मैप करता है, अन्यथा टूल उन्हें उपेक्षित ओवरराइड के रूप में रिपोर्ट करता है।OpenAI-विशिष्ट विकल्प openai ऑब्जेक्ट के अंतर्गत होते हैं:
openai.background, transparent, opaque या auto स्वीकार करता है; पारदर्शी आउटपुट के लिए outputFormat png या webp और पारदर्शिता में सक्षम OpenAI इमेज मॉडल आवश्यक है। OpenClaw डिफ़ॉल्ट gpt-image-2 पारदर्शी-पृष्ठभूमि अनुरोधों को gpt-image-1.5 पर रूट करता है। openai.outputCompression JPEG/WebP आउटपुट पर लागू होता है और PNG आउटपुट के लिए उपेक्षित किया जाता है।शीर्ष-स्तरीय background संकेत प्रदाता-निरपेक्ष है और OpenAI प्रदाता चुने जाने पर वर्तमान में उसी OpenAI background अनुरोध फ़ील्ड में मैप होता है। जो प्रदाता पृष्ठभूमि समर्थन घोषित नहीं करते, वे असमर्थित पैरामीटर प्राप्त करने के बजाय उसे ignoredOverrides में लौटाते हैं।OpenAI इमेज जनरेशन को api.openai.com के बजाय Azure OpenAI डिप्लॉयमेंट के माध्यम से रूट करने के लिए Azure OpenAI एंडपॉइंट देखें।
Microsoft Foundry इमेज जनरेशन microsoft-foundry/ प्रदाता प्रीफ़िक्स के अंतर्गत डिप्लॉय किए गए MAI इमेज डिप्लॉयमेंट नामों का उपयोग करता है। प्रदाता-स्तरीय कोई डिफ़ॉल्ट मॉडल नहीं है, क्योंकि MAI API को model फ़ील्ड में आपके डिप्लॉयमेंट नाम की अपेक्षा होती है:
प्रदाता OpenAI Images API का नहीं, बल्कि Microsoft Foundry के MAI API का उपयोग करता है:
  • जनरेशन एंडपॉइंट: /mai/v1/images/generations
  • संपादन एंडपॉइंट: /mai/v1/images/edits
  • प्रमाणीकरण: AZURE_OPENAI_API_KEY / प्रदाता API कुंजी, या az login के माध्यम से Entra ID
  • आउटपुट: एक PNG इमेज
  • आकार: डिफ़ॉल्ट 1024x1024; चौड़ाई और ऊँचाई प्रत्येक कम-से-कम 768 px होनी चाहिए और कुल पिक्सेल अधिकतम 1,048,576 होने चाहिए
  • संपादन: एक PNG या JPEG संदर्भ इमेज, जो केवल MAI-Image-2.5-Flash और MAI-Image-2.5 डिप्लॉयमेंट द्वारा समर्थित है
केवल-प्रॉम्प्ट जनरेशन में केवल Foundry एंडपॉइंट कॉन्फ़िगर करके कस्टम डिप्लॉयमेंट नाम का उपयोग किया जा सकता है। कस्टम डिप्लॉयमेंट नामों वाले संपादनों के लिए ऑनबोर्डिंग/मॉडल मेटाडेटा आवश्यक है, ताकि OpenClaw सत्यापित कर सके कि डिप्लॉयमेंट MAI-Image-2.5-Flash या MAI-Image-2.5 द्वारा समर्थित है।वर्तमान MAI इमेज मॉडल MAI-Image-2.5-Flash, MAI-Image-2.5, MAI-Image-2e और MAI-Image-2 हैं। सेटअप और चैट-मॉडल व्यवहार के लिए Microsoft Foundry Plugin देखें।
OpenRouter इमेज जनरेशन उसी OPENROUTER_API_KEY का उपयोग करता है और OpenRouter के चैट कम्प्लीशन्स इमेज API के माध्यम से रूट करता है। openrouter/ प्रीफ़िक्स के साथ OpenRouter इमेज मॉडल चुनें:
OpenClaw prompt, count, संदर्भ इमेज और Gemini-संगत aspectRatio / resolution संकेत OpenRouter को अग्रेषित करता है। वर्तमान अंतर्निहित OpenRouter इमेज मॉडल शॉर्टकट में google/gemini-3.1-flash-image, google/gemini-3-pro-image और openai/gpt-5.4-image-2 शामिल हैं। आपका कॉन्फ़िगर किया गया Plugin क्या उपलब्ध कराता है, यह देखने के लिए action: "list" का उपयोग करें।
fal पर Krea 2 मॉडल Flux द्वारा उपयोग किए जाने वाले सामान्य image_size स्कीमा के बजाय fal के मूल Krea स्कीमा का उपयोग करते हैं। OpenClaw भेजता है:
  • आस्पेक्ट-रेशियो संकेतों के लिए aspect_ratio
  • creativity, जिसका डिफ़ॉल्ट medium है
  • image या images दिए जाने पर image_style_references
अधिक तेज़, अभिव्यंजक चित्रण के लिए Krea 2 Medium और अधिक धीमे, अधिक विस्तृत फ़ोटोयथार्थवादी तथा टेक्सचरयुक्त रूप के लिए Krea 2 Large चुनें:
Krea 2 वर्तमान में प्रति अनुरोध एक इमेज लौटाता है। Krea के लिए aspectRatio को प्राथमिकता दें; OpenClaw size को निकटतम समर्थित Krea आस्पेक्ट रेशियो में मैप करता है और resolution को हटाने के बजाय Krea के लिए अस्वीकार करता है। मूल Krea रचनात्मकता स्तर चाहिए, तो fal.creativity का उपयोग करें:
MiniMax इमेज जनरेशन दोनों बंडल किए गए MiniMax प्रमाणीकरण पथों के माध्यम से उपलब्ध है:
  • API-कुंजी सेटअप के लिए minimax/image-01
  • OAuth सेटअप के लिए minimax-portal/image-01
बंडल किया गया xAI प्रदाता केवल-प्रॉम्प्ट अनुरोधों के लिए /v1/images/generations और image या images मौजूद होने पर /v1/images/edits का उपयोग करता है।
  • मॉडल: xai/grok-imagine-image, xai/grok-imagine-image-quality
  • संख्या: अधिकतम 4
  • संदर्भ: एक image या अधिकतम तीन images
  • आस्पेक्ट रेशियो: 1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 2:1, 1:2, 19.5:9, 9:19.5, 20:9, 9:20
  • रिज़ॉल्यूशन: 1K, 2K
  • आउटपुट: OpenClaw-प्रबंधित इमेज अटैचमेंट के रूप में लौटाए जाते हैं
OpenClaw जानबूझकर xAI-मूल quality, mask, user या auto आस्पेक्ट रेशियो को तब तक उपलब्ध नहीं कराता, जब तक वे नियंत्रण साझा अंतर-प्रदाता image_generate अनुबंध में मौजूद नहीं होते।

उदाहरण

समान --output-format, --background, --quality, और --openai-moderation फ़्लैग openclaw infer image edit पर उपलब्ध हैं; --openai-background OpenAI-विशिष्ट उपनाम के रूप में बना हुआ है। OpenAI के अलावा अन्य बंडल किए गए प्रदाता वर्तमान में स्पष्ट पृष्ठभूमि नियंत्रण घोषित नहीं करते, इसलिए उनके लिए background: "transparent" को अनदेखा किया गया बताया जाता है।

संबंधित

  • टूल का अवलोकन - सभी उपलब्ध एजेंट टूल
  • ComfyUI - स्थानीय ComfyUI और Comfy Cloud वर्कफ़्लो सेटअप
  • fal - fal छवि और वीडियो प्रदाता सेटअप
  • Google (Gemini) - Gemini छवि प्रदाता सेटअप
  • Microsoft Foundry Plugin - Microsoft Foundry चैट और MAI छवि सेटअप
  • MiniMax - MiniMax छवि प्रदाता सेटअप
  • OpenAI - OpenAI Images प्रदाता सेटअप
  • Vydra - Vydra छवि, वीडियो और वाक् सेटअप
  • xAI - Grok छवि, वीडियो, खोज, कोड निष्पादन और TTS सेटअप
  • कॉन्फ़िगरेशन संदर्भ - imageGenerationModel कॉन्फ़िगरेशन
  • मॉडल - मॉडल कॉन्फ़िगरेशन और फ़ेलओवर