Skip to main content
OpenClaw छवियाँ, वीडियो और संगीत जनरेट करता है, आने वाले मीडिया (छवियाँ, ऑडियो, वीडियो) को समझता है और टेक्स्ट-टू-स्पीच से उत्तरों को बोलकर सुनाता है। सभी मीडिया क्षमताएँ टूल-संचालित हैं: एजेंट बातचीत के आधार पर तय करता है कि उनका उपयोग कब करना है, और प्रत्येक टूल केवल तभी दिखाई देता है जब कम-से-कम एक सहायक प्रदाता कॉन्फ़िगर हो। लाइव वाणी वन-शॉट मीडिया टूल पथ के बजाय Talk सत्र अनुबंध का उपयोग करती है। Talk के तीन मोड हैं: प्रदाता-नेटिव realtime, स्थानीय या स्ट्रीमिंग stt-tts, और केवल-अवलोकन वाणी कैप्चर के लिए transcription। ये मोड टेलीफ़ोनी, मीटिंग, ब्राउज़र रियलटाइम और नेटिव पुश-टू-टॉक क्लाइंट के साथ प्रदाता कैटलॉग, इवेंट एनवेलप और रद्दीकरण सिमैंटिक्स साझा करते हैं।

क्षमताएँ

छवि जनरेशन

image_generate के माध्यम से टेक्स्ट प्रॉम्प्ट या संदर्भ छवियों से छवियाँ बनाएँ और संपादित करें। चैट सत्रों में एसिंक्रोनस — पृष्ठभूमि में चलता है और तैयार होने पर परिणाम पोस्ट करता है।

वीडियो जनरेशन

video_generate के माध्यम से टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और वीडियो-टू-वीडियो। एसिंक्रोनस — पृष्ठभूमि में चलता है और तैयार होने पर परिणाम पोस्ट करता है।

संगीत जनरेशन

music_generate के माध्यम से संगीत या ऑडियो ट्रैक जनरेट करें। साझा मीडिया-जनरेशन कार्य जीवनचक्र पर चैट सत्रों में एसिंक्रोनस।

टेक्स्ट-टू-स्पीच

tts टूल और tts कॉन्फ़िगरेशन के माध्यम से आउटबाउंड उत्तरों को बोले गए ऑडियो में बदलें। सिंक्रोनस।

मीडिया समझ

विज़न-सक्षम मॉडल प्रदाताओं और समर्पित मीडिया-समझ Plugin का उपयोग करके आने वाली छवियों, ऑडियो और वीडियो का सारांश बनाएँ।

स्पीच-टू-टेक्स्ट

बैच STT या Voice Call स्ट्रीमिंग STT प्रदाताओं के माध्यम से आने वाले वॉइस संदेशों को ट्रांसक्राइब करें।

प्रदाता क्षमता मैट्रिक्स

यह तालिका समर्पित मीडिया-जनरेशन, TTS और STT Plugin को शामिल करती है। कई चैट-मॉडल प्रदाता (Anthropic, Google, OpenAI और अन्य) अपने उत्तर मॉडल के माध्यम से आने वाले मीडिया को भी समझते हैं; पूरी प्रदाता सूची मीडिया समझ में देखें।
यहाँ रियलटाइम वॉइस का अर्थ प्रदाता-नेटिव द्विदिश रियलटाइम (Talk realtime मोड, जैसे Gemini Live या OpenAI Realtime API) है — आज केवल Google और OpenAI इसे पंजीकृत करते हैं। Deepgram, ElevenLabs, Mistral, OpenAI और xAI Voice Call स्ट्रीमिंग STT (एकतरफ़ा ऑडियो-टू-टेक्स्ट) को अलग से पंजीकृत करते हैं; नीचे स्पीच-टू-टेक्स्ट और Voice Call देखें। xAI Realtime वॉइस एक अपस्ट्रीम क्षमता है, लेकिन जब तक साझा रियलटाइम-वॉइस अनुबंध इसे निरूपित नहीं कर सकता, तब तक यह OpenClaw में पंजीकृत नहीं होती।

एसिंक्रोनस बनाम सिंक्रोनस

एसिंक्रोनस टूल के लिए, OpenClaw अनुरोध को प्रदाता के पास सबमिट करता है, तुरंत एक कार्य आईडी लौटाता है और कार्य लेज़र में जॉब को ट्रैक करता है। जॉब चलने के दौरान एजेंट अन्य संदेशों का उत्तर देना जारी रखता है। प्रदाता का काम पूरा होने पर, OpenClaw जनरेट किए गए मीडिया पथों के साथ एजेंट को जगाता है, ताकि वह सत्र के सामान्य दृश्य-उत्तर मोड के माध्यम से उपयोगकर्ता को बता सके: कॉन्फ़िगर होने पर स्वचालित अंतिम उत्तर डिलीवरी, या जब सत्र को संदेश टूल की आवश्यकता हो तब message(action="send")। यदि अनुरोधकर्ता सत्र निष्क्रिय है या उसका सक्रिय वेक विफल हो जाता है, और कुछ जनरेट किया गया मीडिया अभी भी पूर्णता उत्तर से अनुपस्थित है, तो OpenClaw केवल अनुपस्थित मीडिया के साथ एक आइडेम्पोटेंट प्रत्यक्ष फ़ॉलबैक भेजता है। पूर्णता उत्तर द्वारा पहले ही डिलीवर किया गया मीडिया दोबारा पोस्ट नहीं किया जाता।

स्पीच-टू-टेक्स्ट और Voice Call

कॉन्फ़िगर होने पर Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio और xAI सभी बैच tools.media.audio पथ के माध्यम से आने वाले ऑडियो को ट्रांसक्राइब कर सकते हैं। मेंशन गेटिंग या कमांड पार्सिंग के लिए किसी वॉइस नोट की पूर्व-जाँच करने वाले चैनल Plugin आने वाले संदर्भ पर ट्रांसक्राइब किए गए अटैचमेंट को चिह्नित करते हैं, ताकि साझा मीडिया-समझ चरण उसी ऑडियो के लिए दूसरी STT कॉल करने के बजाय उस ट्रांसक्रिप्ट का पुनः उपयोग करे। Deepgram, ElevenLabs, Mistral, OpenAI और xAI Voice Call स्ट्रीमिंग STT प्रदाताओं को भी पंजीकृत करते हैं, ताकि पूर्ण रिकॉर्डिंग की प्रतीक्षा किए बिना लाइव फ़ोन ऑडियो को चयनित विक्रेता को अग्रेषित किया जा सके। लाइव उपयोगकर्ता वार्तालापों के लिए, Talk मोड को प्राथमिकता दें। बैच ऑडियो अटैचमेंट मीडिया पथ पर बने रहते हैं; ब्राउज़र रियलटाइम, नेटिव पुश-टू-टॉक, टेलीफ़ोनी और मीटिंग ऑडियो को Talk इवेंट तथा Gateway द्वारा लौटाए गए सत्र-स्कोप्ड कैटलॉग का उपयोग करना चाहिए।

प्रदाता मैपिंग (विक्रेता विभिन्न सतहों में कैसे विभाजित होते हैं)

छवि, वीडियो, संगीत, बैच TTS, बैच STT, बैकएंड रियलटाइम वॉइस और मीडिया-समझ सतहें।
छवि, वीडियो, बैच TTS, बैच STT, Voice Call स्ट्रीमिंग STT, बैकएंड रियलटाइम वॉइस और मेमोरी-एम्बेडिंग सतहें।
चैट/मॉडल रूटिंग, छवि जनरेशन/संपादन, टेक्स्ट-टू-वीडियो, बैच TTS, बैच STT, छवि मीडिया समझ और मेमोरी-एम्बेडिंग सतहें। DeepInfra पुनःरैंकिंग, वर्गीकरण, ऑब्जेक्ट-डिटेक्शन और अन्य नेटिव मॉडल प्रकार भी उपलब्ध कराता है; OpenClaw के पास अभी उन श्रेणियों के लिए कोई प्रदाता अनुबंध नहीं है, इसलिए यह Plugin उन्हें पंजीकृत नहीं करता।
छवि, वीडियो, खोज, कोड-निष्पादन, बैच TTS, बैच STT और Voice Call स्ट्रीमिंग STT। xAI Realtime वॉइस एक अपस्ट्रीम क्षमता है, लेकिन जब तक साझा रियलटाइम-वॉइस अनुबंध इसे निरूपित नहीं कर सकता, तब तक यह OpenClaw में पंजीकृत नहीं होती।

संबंधित