Skip to main content
OpenClaw एजेंट टेक्स्ट प्रॉम्प्ट, संदर्भ छवियों या मौजूदा वीडियो से video_generate के माध्यम से वीडियो जनरेट करते हैं। सोलह प्रदाता बैकएंड समर्थित हैं; एजेंट कॉन्फ़िगरेशन और उपलब्ध API कुंजियों के आधार पर स्वचालित रूप से सही बैकएंड चुनता है।
video_generate केवल तब दिखाई देता है, जब कम-से-कम एक वीडियो-जनरेशन प्रदाता उपलब्ध हो। यदि यह आपके एजेंट टूल में नहीं है, तो प्रदाता API कुंजी सेट करें या agents.defaults.mediaModels.video कॉन्फ़िगर करें।
video_generate के तीन रनटाइम मोड हैं, जिनका निर्धारण कॉल में दिए गए संदर्भ इनपुट से होता है:
  • generate - कोई संदर्भ मीडिया नहीं (टेक्स्ट-टू-वीडियो)।
  • imageToVideo - एक या अधिक संदर्भ छवियाँ।
  • videoToVideo - एक या अधिक संदर्भ वीडियो।
प्रदाता इनमें से किसी भी मोड-समूह का समर्थन कर सकते हैं। टूल सबमिशन से पहले सक्रिय मोड को सत्यापित करता है और action=list में समर्थित मोड की जानकारी देता है।

तुरंत शुरू करें

1

प्रमाणीकरण कॉन्फ़िगर करें

किसी भी समर्थित प्रदाता के लिए API कुंजी सेट करें:
2

डिफ़ॉल्ट मॉडल चुनें (वैकल्पिक)

3

एजेंट से कहें

सूर्यास्त के समय सर्फ़िंग करते हुए एक दोस्ताना लॉब्स्टर का 5-सेकंड का सिनेमाई वीडियो जनरेट करें।
एजेंट स्वचालित रूप से video_generate को कॉल करता है। किसी टूल को अनुमति-सूची में जोड़ने की आवश्यकता नहीं है।

एसिंक्रोनस जनरेशन कैसे काम करता है

वीडियो जनरेशन एसिंक्रोनस है:
  1. OpenClaw प्रदाता को अनुरोध सबमिट करता है और तुरंत एक टास्क आईडी लौटाता है।
  2. प्रदाता बैकग्राउंड में कार्य को प्रोसेस करता है (प्रदाता और रिज़ॉल्यूशन के आधार पर आमतौर पर 30 सेकंड से कई मिनट तक; धीमे कतार-समर्थित प्रदाता कॉन्फ़िगर किए गए टाइमआउट तक चल सकते हैं)।
  3. वीडियो तैयार होने पर OpenClaw आंतरिक पूर्णता इवेंट के साथ उसी सत्र को सक्रिय करता है।
  4. एजेंट सत्र के सामान्य दृश्यमान-उत्तर मोड के माध्यम से इसकी जानकारी देता है: स्वचालित अंतिम उत्तर, या जब सत्र को संदेश टूल की आवश्यकता हो तब message(action="send")। यदि अनुरोधकर्ता सत्र निष्क्रिय है, या उसका सक्रियण विफल हो जाता है और पूर्णता उत्तर में जनरेट किया गया मीडिया अब भी मौजूद नहीं है, तो OpenClaw मीडिया के साथ एक आइडेम्पोटेंट प्रत्यक्ष फ़ॉलबैक भेजता है।
जब कोई कार्य चल रहा हो, तो उसी सत्र में डुप्लिकेट video_generate कॉल एक और जनरेशन शुरू करने के बजाय वर्तमान टास्क की स्थिति लौटाते हैं। नया जनरेशन ट्रिगर किए बिना जाँचने के लिए action: "status", या CLI से openclaw tasks list / openclaw tasks show <lookup> का उपयोग करें (बैकग्राउंड टास्क देखें)। सत्र-समर्थित एजेंट रन के बाहर (उदाहरण के लिए, प्रत्यक्ष टूल इनवोकेशन में), टूल इनलाइन जनरेशन का उपयोग करता है और उसी टर्न में अंतिम मीडिया पथ लौटाता है। जब प्रदाता बाइट्स लौटाता है, तब जनरेट की गई वीडियो फ़ाइलें OpenClaw-प्रबंधित मीडिया स्टोरेज में सहेजी जाती हैं। डिफ़ॉल्ट सीमा 16MB (साझा वीडियो मीडिया सीमा) है; बड़े रेंडर के लिए agents.defaults.mediaMaxMb इसे बढ़ाता है। जब कोई प्रदाता होस्ट किया गया आउटपुट URL भी लौटाता है, तब स्थानीय स्थायित्व द्वारा अत्यधिक बड़ी फ़ाइल अस्वीकार होने पर टास्क को विफल करने के बजाय OpenClaw वह URL वितरित करता है।

टास्क जीवनचक्र

CLI से स्थिति जाँचें:

समर्थित प्रदाता

कुछ प्रदाता अतिरिक्त या वैकल्पिक API कुंजी एनवायरनमेंट वेरिएबल स्वीकार करते हैं। विवरण के लिए अलग-अलग प्रदाता पृष्ठ देखें। रनटाइम पर उपलब्ध प्रदाताओं, मॉडलों और रनटाइम मोड का निरीक्षण करने के लिए video_generate action=list चलाएँ।

क्षमता मैट्रिक्स

video_generate, अनुबंध परीक्षणों और साझा लाइव स्वीप द्वारा उपयोग किया जाने वाला स्पष्ट मोड अनुबंध:

टूल पैरामीटर

आवश्यक

string
आवश्यक
जनरेट किए जाने वाले वीडियो का टेक्स्ट विवरण। action: "generate" के लिए आवश्यक।

सामग्री इनपुट

string
एकल संदर्भ छवि (पथ या URL)।
string[]
एकाधिक संदर्भ छवियाँ (अधिकतम 9)।
string[]
संयुक्त छवि सूची के समानांतर, प्रत्येक स्थिति के लिए वैकल्पिक भूमिका संकेत। मानक मान: first_frame, last_frame, reference_image
string
एकल संदर्भ वीडियो (पथ या URL)।
string[]
एकाधिक संदर्भ वीडियो (अधिकतम 4)।
string[]
संयुक्त वीडियो सूची के समानांतर, प्रत्येक स्थिति के लिए वैकल्पिक भूमिका संकेत। मानक मान: reference_video
string
एकल संदर्भ ऑडियो (पथ या URL)। जब प्रदाता ऑडियो इनपुट का समर्थन करता है, तब इसका उपयोग पृष्ठभूमि संगीत या आवाज़ के संदर्भ के लिए किया जाता है।
string[]
एकाधिक संदर्भ ऑडियो (अधिकतम 3)।
string[]
संयुक्त ऑडियो सूची के समानांतर, प्रत्येक स्थिति के लिए वैकल्पिक भूमिका संकेत। मानक मान: reference_audio
भूमिका संकेत प्रदाता को बिना किसी बदलाव के अग्रेषित किए जाते हैं। मानक मान VideoGenerationAssetRole यूनियन से आते हैं, लेकिन प्रदाता अतिरिक्त भूमिका स्ट्रिंग स्वीकार कर सकते हैं। *Roles सरणियों में संबंधित संदर्भ सूची से अधिक प्रविष्टियाँ नहीं होनी चाहिए; एक स्थान की त्रुटियाँ स्पष्ट त्रुटि के साथ विफल होती हैं। किसी स्थान को सेट न रखने के लिए रिक्त स्ट्रिंग का उपयोग करें। xAI के लिए, उसके reference_images जनरेशन मोड का उपयोग करने हेतु प्रत्येक छवि भूमिका को reference_image पर सेट करें; एकल-छवि से वीडियो के लिए भूमिका छोड़ दें या first_frame का उपयोग करें।

शैली नियंत्रण

string
1:1, 16:9, 9:16, adaptive जैसा पक्षानुपात संकेत या प्रदाता-विशिष्ट मान। OpenClaw प्रत्येक प्रदाता के अनुसार असमर्थित मानों को सामान्यीकृत करता है या अनदेखा करता है।
string
360P, 480P, 540P, 720P, 768P, 1080P, 4K जैसा रिज़ॉल्यूशन संकेत या प्रदाता-विशिष्ट मान। OpenClaw प्रत्येक प्रदाता के अनुसार असमर्थित मानों को सामान्यीकृत करता है या अनदेखा करता है।
number
लक्षित अवधि सेकंड में (प्रदाता द्वारा समर्थित निकटतम मान पर पूर्णांकित)।
string
प्रदाता द्वारा समर्थित होने पर आकार का संकेत।
boolean
समर्थित होने पर आउटपुट में जनरेट किया गया ऑडियो सक्षम करें। यह audioRef* (इनपुट) से अलग है।
boolean
समर्थित होने पर प्रदाता के वॉटरमार्क को चालू या बंद करें।
adaptive एक प्रदाता-विशिष्ट सेंटिनल है: इसे उन प्रदाताओं को बिना किसी बदलाव के अग्रेषित किया जाता है जो अपनी क्षमताओं में adaptive घोषित करते हैं (उदाहरण के लिए, BytePlus Seedance इनपुट छवि के आयामों से अनुपात का स्वतः पता लगाने के लिए इसका उपयोग करता है)। जो प्रदाता इसे घोषित नहीं करते, वे टूल परिणाम में details.ignoredOverrides के माध्यम से मान दिखाते हैं, ताकि हटाया जाना दृश्यमान रहे।

उन्नत

"generate" | "status" | "list"
डिफ़ॉल्ट:"generate"
"status" वर्तमान सत्र का कार्य लौटाता है; "list" प्रदाताओं का निरीक्षण करता है।
string
प्रदाता/मॉडल ओवरराइड (उदाहरण के लिए, runway/gen4.5)।
string
आउटपुट फ़ाइल नाम का संकेत।
number
प्रदाता की कार्रवाई के लिए वैकल्पिक टाइमआउट, मिलीसेकंड में। इसे छोड़ने पर, यदि कॉन्फ़िगर किया गया हो तो OpenClaw agents.defaults.mediaModels.video.timeoutMs का उपयोग करता है, अन्यथा उपलब्ध होने पर Plugin में निर्धारित प्रदाता डिफ़ॉल्ट का उपयोग करता है।
object
JSON ऑब्जेक्ट के रूप में प्रदाता-विशिष्ट विकल्प (उदाहरण के लिए, {"seed": 42, "draft": true})। टाइप की गई स्कीमा घोषित करने वाले प्रदाता कुंजियों और प्रकारों को मान्य करते हैं; अज्ञात कुंजियाँ या बेमेल प्रकार फ़ॉलबैक के दौरान उम्मीदवार को छोड़ देते हैं। घोषित स्कीमा के बिना प्रदाताओं को विकल्प बिना किसी बदलाव के प्राप्त होते हैं। प्रत्येक प्रदाता क्या स्वीकार करता है, यह देखने के लिए video_generate action=list चलाएँ।
सभी प्रदाता सभी पैरामीटर का समर्थन नहीं करते। OpenClaw अवधि को प्रदाता द्वारा समर्थित निकटतम मान पर सामान्यीकृत करता है और जब कोई फ़ॉलबैक प्रदाता अलग नियंत्रण सतह उपलब्ध कराता है, तो आकार-से-पक्षानुपात जैसे रूपांतरित ज्यामिति संकेतों की मैपिंग बदलता है। वास्तव में असमर्थित ओवरराइड सर्वोत्तम प्रयास के आधार पर अनदेखे किए जाते हैं और टूल परिणाम में चेतावनियों के रूप में रिपोर्ट किए जाते हैं। कठोर क्षमता सीमाएँ (जैसे बहुत अधिक संदर्भ इनपुट) सबमिशन से पहले विफल हो जाती हैं। टूल परिणाम लागू सेटिंग्स रिपोर्ट करते हैं; details.normalization अनुरोधित-से-लागू रूपांतरण को दर्ज करता है।
संदर्भ इनपुट रनटाइम मोड चुनते हैं:
  • कोई संदर्भ मीडिया नहीं -> generate
  • कोई भी छवि संदर्भ -> imageToVideo
  • कोई भी वीडियो संदर्भ -> videoToVideo
  • संदर्भ ऑडियो इनपुट समाधान किए गए मोड को नहीं बदलते; वे छवि/वीडियो संदर्भों द्वारा चुने गए किसी भी मोड के ऊपर लागू होते हैं और केवल उन प्रदाताओं के साथ काम करते हैं जो maxInputAudios घोषित करते हैं।
मिश्रित छवि और वीडियो संदर्भ एक स्थिर साझा क्षमता सतह नहीं हैं। प्रत्येक अनुरोध में एक ही संदर्भ प्रकार को प्राथमिकता दें।

फ़ॉलबैक और टाइप किए गए विकल्प

कुछ क्षमता जाँच टूल सीमा के बजाय फ़ॉलबैक परत पर लागू होती हैं, इसलिए प्राथमिक प्रदाता की सीमाएँ पार करने वाला अनुरोध भी किसी सक्षम फ़ॉलबैक पर चल सकता है:
  • जब अनुरोध में ऑडियो संदर्भ होते हैं, तब कोई maxInputAudios (या 0) घोषित न करने वाले सक्रिय उम्मीदवार को छोड़ दिया जाता है; अगला उम्मीदवार आज़माया जाता है। यही सुरक्षा जाँच छवि और वीडियो संदर्भों की संख्या पर maxInputImages/maxInputVideos के विरुद्ध लागू होती है।
  • सक्रिय उम्मीदवार का maxDurationSeconds, अनुरोधित durationSeconds से कम है और कोई supportedDurationSeconds सूची घोषित नहीं है -> छोड़ दिया जाता है।
  • अनुरोध में providerOptions है और सक्रिय उम्मीदवार स्पष्ट रूप से टाइप की गई providerOptions स्कीमा घोषित करता है -> यदि दी गई कुंजियाँ स्कीमा में नहीं हैं या मानों के प्रकार मेल नहीं खाते, तो छोड़ दिया जाता है। घोषित स्कीमा के बिना प्रदाताओं को विकल्प बिना किसी बदलाव के प्राप्त होते हैं (पश्चगामी-संगत पास-थ्रू)। कोई प्रदाता रिक्त स्कीमा (capabilities.providerOptions: {}) घोषित करके सभी प्रदाता विकल्पों से बाहर हो सकता है, जिससे प्रकार बेमेल होने जैसा ही उम्मीदवार छोड़ना होता है।
अनुरोध में उम्मीदवार छोड़ने का पहला कारण warn स्तर पर लॉग होता है, ताकि ऑपरेटर देख सकें कि उनके प्राथमिक प्रदाता को कब छोड़ दिया गया; लंबी फ़ॉलबैक शृंखलाओं को शांत रखने के लिए बाद के कारण debug स्तर पर लॉग होते हैं। यदि प्रत्येक उम्मीदवार छोड़ दिया जाता है, तो समेकित त्रुटि में प्रत्येक के लिए छोड़ने का कारण शामिल होता है।

कार्रवाइयाँ

मॉडल चयन

OpenClaw मॉडल का समाधान इस क्रम में करता है:
  1. model टूल पैरामीटर - यदि एजेंट कॉल में कोई मान निर्दिष्ट करता है।
  2. कॉन्फ़िगरेशन से videoGenerationModel.primary
  3. क्रमानुसार videoGenerationModel.fallbacks
  4. स्वतः पहचान - वे प्रदाता जिनके पास मान्य प्रमाणीकरण है, वर्तमान डिफ़ॉल्ट प्रदाता से शुरू होकर, फिर शेष प्रदाता वर्णानुक्रम में।
यदि कोई प्रदाता विफल होता है, तो अगला उम्मीदवार स्वचालित रूप से आज़माया जाता है। यदि सभी उम्मीदवार विफल होते हैं, तो त्रुटि में प्रत्येक प्रयास का विवरण शामिल होता है। प्रमाणीकृत प्रदाताओं के बीच स्वचालित फ़ॉलबैक हमेशा सक्षम रहता है। प्रति-कॉल model प्रामाणिक रहता है।

प्रदाता संबंधी टिप्पणियाँ

DashScope / Model Studio के एसिंक्रोनस एंडपॉइंट का उपयोग करता है। संदर्भ छवियाँ और वीडियो दूरस्थ http(s) URL होने चाहिए।
प्रदाता आईडी: byteplusमॉडल: seedance-1-0-pro-250528 (डिफ़ॉल्ट), seedance-1-5-pro-251215एकीकृत content[] API का उपयोग करता है। अधिकतम 2 इनपुट छवियों (first_frame + last_frame) का समर्थन करता है। छवियों को स्थिति के अनुसार पास करें या प्रत्येक छवि का role स्पष्ट रूप से सेट करें।समर्थित providerOptions कुंजियाँ: seed (संख्या), draft (बूलियन - 480p को बाध्य करता है), camera_fixed (बूलियन)।
@openclaw/byteplus-modelark Plugin की आवश्यकता है (बाहरी, बंडल नहीं किया हुआ)। प्रदाता आईडी: byteplus-seedance15। मॉडल: seedance-1-5-pro-251215एकीकृत content[] API का उपयोग करता है। अधिकतम 2 इनपुट छवियों (first_frame + last_frame) का समर्थन करता है। सभी इनपुट दूरस्थ https:// URL होने चाहिए। प्रत्येक छवि पर role: "first_frame" / "last_frame" सेट करें या छवियों को स्थिति के अनुसार पास करें।aspectRatio: "adaptive" इनपुट छवि से अनुपात का स्वतः पता लगाता है। audio: true, generate_audio पर मैप होता है। providerOptions.seed (संख्या) अग्रेषित की जाती है।
@openclaw/byteplus-modelark Plugin की आवश्यकता है (बाहरी, बंडल नहीं किया हुआ)। प्रदाता आईडी: byteplus-seedance2। मॉडल: dreamina-seedance-2-0-260128, dreamina-seedance-2-0-fast-260128एकीकृत content[] API का उपयोग करता है। अधिकतम 9 संदर्भ छवियों, 3 संदर्भ वीडियो और 3 संदर्भ ऑडियो का समर्थन करता है। सभी इनपुट दूरस्थ https:// URL होने चाहिए। प्रत्येक एसेट पर role सेट करें - समर्थित मान: "first_frame", "last_frame", "reference_image", "reference_video", "reference_audio"aspectRatio: "adaptive" इनपुट छवि से अनुपात का स्वतः पता लगाता है। audio: true, generate_audio पर मैप होता है। providerOptions.seed (संख्या) अग्रेषित की जाती है।
वर्कफ़्लो-संचालित स्थानीय या क्लाउड निष्पादन। कॉन्फ़िगर किए गए ग्राफ़ के माध्यम से टेक्स्ट-से-वीडियो और इमेज-से-वीडियो का समर्थन करता है।
लंबे समय तक चलने वाले कार्यों के लिए कतार-समर्थित प्रवाह का उपयोग करता है। OpenClaw किसी प्रगतिरत fal कतार कार्य को टाइम आउट मानने से पहले डिफ़ॉल्ट रूप से अधिकतम 20 मिनट तक प्रतीक्षा करता है। अधिकांश fal वीडियो मॉडल एकल इमेज संदर्भ स्वीकार करते हैं। Seedance 2.0 संदर्भ-से-वीडियो मॉडल अधिकतम 9 इमेज, 3 वीडियो और 3 ऑडियो संदर्भ स्वीकार करते हैं, जिनमें कुल संदर्भ फ़ाइलों की अधिकतम संख्या 12 होती है।
एक इमेज या एक वीडियो संदर्भ का समर्थन करता है। Gemini API पथ पर जनरेटेड-ऑडियो अनुरोधों को चेतावनी के साथ अनदेखा कर दिया जाता है, क्योंकि वह API वर्तमान Veo वीडियो जनरेशन के लिए generateAudio पैरामीटर अस्वीकार करता है।
केवल एकल इमेज संदर्भ। MiniMax 768P और 1080P रिज़ॉल्यूशन स्वीकार करता है; 720P जैसे अनुरोधों को सबमिशन से पहले निकटतम समर्थित मान में सामान्यीकृत किया जाता है।
केवल size ओवरराइड अग्रेषित किया जाता है। अन्य शैली ओवरराइड (aspectRatio, resolution, audio, watermark) को चेतावनी के साथ अनदेखा कर दिया जाता है।
OpenRouter के एसिंक्रोनस /videos API का उपयोग करता है। OpenClaw कार्य सबमिट करता है, polling_url को पोल करता है, और unsigned_urls या प्रलेखित कार्य-सामग्री एंडपॉइंट में से किसी एक से डाउनलोड करता है। बंडल किया गया google/veo-3.1-fast डिफ़ॉल्ट 4/6/8 सेकंड की अवधियाँ, 720P/1080P रिज़ॉल्यूशन और 16:9/9:16 आस्पेक्ट रेशियो घोषित करता है।
Alibaba के समान DashScope बैकएंड। संदर्भ इनपुट दूरस्थ http(s) URL होने चाहिए; स्थानीय फ़ाइलें पहले ही अस्वीकार कर दी जाती हैं।
डेटा URI के माध्यम से स्थानीय फ़ाइलों का समर्थन करता है। वीडियो-से-वीडियो के लिए runway/gen4_aleph आवश्यक है। केवल-टेक्स्ट रन में 16:9 और 9:16 आस्पेक्ट रेशियो उपलब्ध होते हैं।
केवल एकल इमेज संदर्भ।
प्रमाणीकरण हटाने वाले रीडायरेक्ट से बचने के लिए सीधे https://www.vydra.ai/api/v1 का उपयोग करता है। veo3 केवल टेक्स्ट-से-वीडियो के रूप में बंडल किया गया है; kling के लिए दूरस्थ इमेज URL आवश्यक है।
डिफ़ॉल्ट grok-imagine-video मॉडल टेक्स्ट-से-वीडियो, एकल प्रथम-फ़्रेम इमेज-से-वीडियो, xAI reference_images के माध्यम से अधिकतम 7 reference_image इनपुट और दूरस्थ वीडियो संपादन/विस्तार प्रवाह का समर्थन करता है। जनरेशन डिफ़ॉल्ट रूप से 480P का उपयोग करता है; aspectRatio छोड़े जाने पर एकल-इमेज इमेज-से-वीडियो स्रोत अनुपात प्राप्त करता है। वीडियो संपादन/विस्तार इनपुट ज्यामिति प्राप्त करते हैं और आस्पेक्ट-रेशियो या रिज़ॉल्यूशन ओवरराइड स्वीकार नहीं करते। विस्तार 2-10 सेकंड स्वीकार करता है।grok-imagine-video-1.5 केवल इमेज-से-वीडियो है: ठीक एक इमेज प्रदान करें। यह 1-15 सेकंड और 480P, 720P या 1080P का समर्थन करता है, जिसका डिफ़ॉल्ट 480P है; स्रोत इमेज अनुपात प्राप्त करने के लिए aspectRatio छोड़ दें। पूर्वावलोकन और दिनांकित 1.5 पहचानकर्ताओं को समान सत्यापन मिलता है और उन्हें अपरिवर्तित अग्रेषित किया जाता है।

प्रदाता क्षमता मोड

साझा वीडियो-जनरेशन अनुबंध केवल समतल समग्र सीमाओं के बजाय मोड-विशिष्ट क्षमताओं का समर्थन करता है। नए प्रदाता कार्यान्वयनों को स्पष्ट मोड ब्लॉक को प्राथमिकता देनी चाहिए:
maxInputImages और maxInputVideos जैसे समतल समग्र फ़ील्ड रूपांतरण-मोड समर्थन घोषित करने के लिए पर्याप्त नहीं हैं। प्रदाताओं को generate, imageToVideo और videoToVideo स्पष्ट रूप से घोषित करने चाहिए, ताकि लाइव परीक्षण, अनुबंध परीक्षण और साझा video_generate टूल मोड समर्थन को नियतात्मक रूप से सत्यापित कर सकें। जब किसी प्रदाता का एक मॉडल अन्य मॉडलों की तुलना में अधिक व्यापक संदर्भ-इनपुट समर्थन देता हो, तो मोड-व्यापी सीमा बढ़ाने के बजाय maxInputImagesByModel, maxInputVideosByModel या maxInputAudiosByModel का उपयोग करें।

लाइव परीक्षण

साझा बंडल किए गए प्रदाताओं के लिए ऑप्ट-इन लाइव कवरेज:
रेपो रैपर:
यह लाइव फ़ाइल डिफ़ॉल्ट रूप से संग्रहीत प्रमाणीकरण प्रोफ़ाइल से पहले पहले से एक्सपोर्ट किए गए प्रदाता एनवायरनमेंट वेरिएबल का उपयोग करती है, और डिफ़ॉल्ट रूप से रिलीज़-सुरक्षित स्मोक परीक्षण चलाती है:
  • generate स्वीप में प्रत्येक गैर-FAL प्रदाता के लिए।
  • एक-सेकंड का लॉब्स्टर प्रॉम्प्ट।
  • OPENCLAW_LIVE_VIDEO_GENERATION_TIMEOUT_MS से प्रति-प्रदाता ऑपरेशन सीमा (डिफ़ॉल्ट रूप से 180000)।
FAL ऑप्ट-इन है, क्योंकि प्रदाता-पक्ष की कतार विलंबता रिलीज़ समय पर हावी हो सकती है:
घोषित रूपांतरण मोड भी चलाने के लिए OPENCLAW_LIVE_VIDEO_GENERATION_FULL_MODES=1 सेट करें, जिनका साझा स्वीप स्थानीय मीडिया के साथ सुरक्षित रूप से प्रयोग कर सकता है:
  • imageToVideo, जब capabilities.imageToVideo.enabled
  • videoToVideo, जब capabilities.videoToVideo.enabled और प्रदाता/मॉडल साझा स्वीप में बफ़र-समर्थित स्थानीय वीडियो इनपुट स्वीकार करता हो।
वर्तमान में साझा videoToVideo लाइव लेन केवल तभी runway को कवर करती है, जब आप runway/gen4_aleph चुनते हैं।

कॉन्फ़िगरेशन

अपने OpenClaw कॉन्फ़िगरेशन में डिफ़ॉल्ट वीडियो-जनरेशन मॉडल सेट करें:
या CLI के माध्यम से:

संबंधित