Skip to main content
Google Plugin, Google AI Studio के माध्यम से Gemini मॉडल तक पहुँच प्रदान करता है, साथ ही इमेज जनरेशन, मीडिया समझ (इमेज/ऑडियो/वीडियो), टेक्स्ट-टू-स्पीच और Gemini Grounding के माध्यम से वेब खोज भी उपलब्ध कराता है।
  • प्रदाता: google
  • प्रमाणीकरण: GEMINI_API_KEY या GOOGLE_API_KEY
  • API: Google Gemini API
  • रनटाइम विकल्प: agentRuntime.id: "google-gemini-cli" मॉडल संदर्भों को google/* के रूप में मानक बनाए रखते हुए Gemini CLI OAuth का पुनः उपयोग करता है।

आरंभ करना

अपनी पसंदीदा प्रमाणीकरण विधि चुनें और सेटअप चरणों का पालन करें।
इनके लिए सर्वोत्तम: Google AI Studio के माध्यम से मानक Gemini API पहुँच।
1

API कुंजी प्राप्त करें

Google AI Studio में एक निःशुल्क कुंजी बनाएँ।
2

ऑनबोर्डिंग चलाएँ

या कुंजी सीधे प्रदान करें:
3

डिफ़ॉल्ट मॉडल सेट करें

4

सत्यापित करें कि मॉडल उपलब्ध है

GEMINI_API_KEY और GOOGLE_API_KEY दोनों स्वीकार किए जाते हैं। जिसका कॉन्फ़िगरेशन आपके पास पहले से है, उसका उपयोग करें।
कॉन्फ़िगर की गई API कुंजी के साथ, OpenClaw Gemini models.list API से Google AI Studio की टेक्स्ट-मॉडल सूची को रीफ़्रेश करता है। इसलिए नए जारी किए गए Gemini 3 Pro, Flash और Flash-Lite प्रकार OpenClaw रिलीज़ की प्रतीक्षा किए बिना openclaw models list --provider google में दिखाई देते हैं। यदि खोज उपलब्ध नहीं है, तो OpenClaw बंडल की गई फ़ॉलबैक सूची बनाए रखता है।
google/gemini-3-pro-preview को 2026-03-09 को हटा दिया गया था; इसके बजाय google/gemini-3.1-pro-preview का उपयोग करें। Gemini API कुंजी सेटअप (openclaw onboard --auth-choice gemini-api-key या openclaw models auth login --provider google) फिर से चलाने पर पुराना कॉन्फ़िगर किया गया डिफ़ॉल्ट वर्तमान मॉडल से बदल दिया जाता है।

क्षमताएँ

वेब खोज

बंडल किया गया gemini वेब-खोज प्रदाता Gemini Google Search Grounding का उपयोग करता है। plugins.entries.google.config.webSearch के अंतर्गत एक समर्पित खोज कुंजी कॉन्फ़िगर करें, या GEMINI_API_KEY के बाद इसे models.providers.google.apiKey का पुनः उपयोग करने दें:
क्रेडेंशियल प्राथमिकता में पहले समर्पित webSearch.apiKey, फिर GEMINI_API_KEY, और फिर models.providers.google.apiKey आता है। webSearch.baseUrl वैकल्पिक है और ऑपरेटर प्रॉक्सी या संगत Gemini API एंडपॉइंट के लिए उपलब्ध है; इसे न देने पर Gemini वेब खोज models.providers.google.baseUrl का पुनः उपयोग करती है। प्रदाता-विशिष्ट टूल व्यवहार के लिए Gemini खोज देखें।
Gemini 3 मॉडल thinkingBudget के बजाय thinkingLevel का उपयोग करते हैं। OpenClaw Gemini 3, Gemini 3.1 और gemini-*-latest उपनाम के तर्क नियंत्रणों को thinkingLevel से मैप करता है, ताकि डिफ़ॉल्ट/कम-विलंबता वाले रन अक्षम thinkingBudget मान न भेजें।/think adaptive निश्चित OpenClaw स्तर चुनने के बजाय Google की डायनेमिक चिंतन शब्दार्थ को बनाए रखता है। Gemini 3 और Gemini 3.1 निश्चित thinkingLevel को छोड़ देते हैं, ताकि Google स्तर चुन सके; Gemini 2.5 Google का डायनेमिक सेंटिनल thinkingBudget: -1 भेजता है।Gemma 4 मॉडल (उदाहरण के लिए gemma-4-26b-a4b-it) चिंतन मोड का समर्थन करते हैं। OpenClaw Gemma 4 के लिए thinkingBudget को समर्थित Google thinkingLevel में बदलता है। चिंतन को off पर सेट करने से इसे MINIMAL में मैप करने के बजाय चिंतन अक्षम रहता है।Gemini 2.5 Pro केवल चिंतन मोड में काम करता है और स्पष्ट thinkingBudget: 0 को अस्वीकार करता है; OpenClaw इसे भेजने के बजाय Gemini 2.5 Pro अनुरोधों से उस मान को हटा देता है।

इमेज जनरेशन

बंडल किया गया google इमेज-जनरेशन प्रदाता डिफ़ॉल्ट रूप से google/gemini-3.1-flash-image का उपयोग करता है।
  • google/gemini-3-pro-image का भी समर्थन करता है
  • जनरेट करें: प्रत्येक अनुरोध में अधिकतम 4 इमेज
  • संपादन मोड: सक्षम, अधिकतम 5 इनपुट इमेज
  • ज्यामिति नियंत्रण: size, aspectRatio और resolution
Google को डिफ़ॉल्ट इमेज प्रदाता के रूप में उपयोग करने के लिए:
साझा टूल पैरामीटर, प्रदाता चयन और फ़ेलओवर व्यवहार के लिए इमेज जनरेशन देखें।

वीडियो जनरेशन

बंडल किया गया google Plugin साझा video_generate टूल के माध्यम से वीडियो जनरेशन भी पंजीकृत करता है।
  • डिफ़ॉल्ट वीडियो मॉडल: google/veo-3.1-fast-generate-preview
  • मोड: टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और एकल-वीडियो संदर्भ प्रवाह
  • aspectRatio (16:9, 9:16) और resolution (720P, 1080P) का समर्थन करता है; वर्तमान में Veo ऑडियो आउटपुट का समर्थन नहीं करता
  • समर्थित अवधियाँ: 4, 6 या 8 सेकंड (अन्य मान निकटतम अनुमत मान पर समायोजित होते हैं)
Google को डिफ़ॉल्ट वीडियो प्रदाता के रूप में उपयोग करने के लिए:
साझा टूल पैरामीटर, प्रदाता चयन और फ़ेलओवर व्यवहार के लिए वीडियो जनरेशन देखें।

संगीत जनरेशन

बंडल किया गया google Plugin साझा music_generate टूल के माध्यम से संगीत जनरेशन भी पंजीकृत करता है।
  • डिफ़ॉल्ट संगीत मॉडल: google/lyria-3-clip-preview
  • google/lyria-3-pro-preview का भी समर्थन करता है
  • प्रॉम्प्ट नियंत्रण: lyrics और instrumental
  • आउटपुट प्रारूप: डिफ़ॉल्ट रूप से mp3, साथ ही google/lyria-3-pro-preview पर wav
  • संदर्भ इनपुट: अधिकतम 10 इमेज
  • सत्र-समर्थित रन साझा कार्य/स्थिति प्रवाह के माध्यम से अलग हो जाते हैं, जिसमें action: "status" भी शामिल है
Google को डिफ़ॉल्ट संगीत प्रदाता के रूप में उपयोग करने के लिए:
साझा टूल पैरामीटर, प्रदाता चयन और फ़ेलओवर व्यवहार के लिए संगीत जनरेशन देखें।

टेक्स्ट-टू-स्पीच

बंडल किया गया google वाक् प्रदाता gemini-3.1-flash-tts-preview के साथ Gemini API TTS पथ का उपयोग करता है।
  • डिफ़ॉल्ट आवाज़: Kore
  • प्रमाणीकरण: tts.providers.google.apiKey, models.providers.google.apiKey, GEMINI_API_KEY या GOOGLE_API_KEY
  • आउटपुट: नियमित TTS अटैचमेंट के लिए WAV, वॉइस-नोट लक्ष्यों के लिए Opus, Talk/टेलीफ़ोनी के लिए PCM
  • वॉइस-नोट आउटपुट: Google PCM को WAV के रूप में रैप करके ffmpeg से 48 kHz Opus में ट्रांसकोड किया जाता है
Google का बैच Gemini TTS पथ पूर्ण generateContent प्रतिक्रिया में जनरेट किया गया ऑडियो लौटाता है। न्यूनतम-विलंबता वाली मौखिक बातचीत के लिए बैच TTS के बजाय Gemini Live API द्वारा समर्थित Google रीयलटाइम वॉइस प्रदाता का उपयोग करें। Google को डिफ़ॉल्ट TTS प्रदाता के रूप में उपयोग करने के लिए:
Gemini API TTS शैली नियंत्रण के लिए प्राकृतिक-भाषा प्रॉम्प्टिंग का उपयोग करता है। बोले जाने वाले टेक्स्ट से पहले पुनः उपयोग योग्य शैली प्रॉम्प्ट जोड़ने के लिए audioProfile सेट करें। जब आपके प्रॉम्प्ट टेक्स्ट में किसी नामित वक्ता का उल्लेख हो, तो speakerName सेट करें। Gemini API TTS टेक्स्ट में अभिव्यंजक वर्ग-कोष्ठक वाले ऑडियो टैग भी स्वीकार करता है, जैसे [whispers] या [laughs]। टैग को दृश्यमान चैट उत्तर से बाहर रखते हुए उन्हें TTS में भेजने के लिए, उन्हें [[tts:text]]...[[/tts:text]] ब्लॉक के अंदर रखें:
Gemini API तक सीमित Google Cloud Console API कुंजी इस प्रदाता के लिए मान्य है। यह अलग Cloud Text-to-Speech API पथ नहीं है।

रीयलटाइम वॉइस

बंडल किया गया google Plugin, Voice Call और Google Meet जैसे बैकएंड ऑडियो ब्रिज के लिए Gemini Live API द्वारा समर्थित रीयलटाइम वॉइस प्रदाता पंजीकृत करता है। Voice Call रीयलटाइम कॉन्फ़िगरेशन का उदाहरण:
Google Live API, WebSocket पर द्विदिश ऑडियो और फ़ंक्शन कॉलिंग का उपयोग करता है। OpenClaw टेलीफ़ोनी/Meet ब्रिज ऑडियो को Gemini की PCM Live API स्ट्रीम के अनुकूल बनाता है और टूल कॉल को साझा रीयलटाइम वॉइस अनुबंध पर रखता है। जब तक सैंपलिंग में बदलाव आवश्यक न हों, temperature को सेट न करें; OpenClaw गैर-धनात्मक मानों को छोड़ देता है क्योंकि Google Live, temperature: 0 के लिए ऑडियो के बिना ट्रांसक्रिप्ट लौटा सकता है। Gemini API ट्रांसक्रिप्शन languageCodes के बिना सक्षम होता है; मौजूदा Google SDK इस API पथ पर भाषा-कोड संकेतों को अस्वीकार करता है।
Gemini 3.1 Live रीयलटाइम इनपुट के माध्यम से संवादात्मक टेक्स्ट स्वीकार करता है और क्रमिक फ़ंक्शन कॉलिंग का उपयोग करता है। OpenClaw इस मॉडल के लिए पुराने NON_BLOCKING, फ़ंक्शन प्रतिक्रिया शेड्यूलिंग और भावात्मक-संवाद फ़ील्ड को छोड़ देता है। thinkingLevel को प्राथमिकता दें; कॉन्फ़िगर किए गए धनात्मक thinkingBudget मान निकटतम समर्थित स्तर पर मैप किए जाते हैं, जबकि -1 Google के डिफ़ॉल्ट को यथावत रखता है। Gemini Live क्षमता तुलना देखें।
Control UI Talk सीमित, एक-बार उपयोग वाले टोकन के साथ Google Live ब्राउज़र सत्रों का समर्थन करता है। Video Talk में, ब्राउज़र सीमित JPEG फ़्रेम सीधे Google Live को प्रदाता की अधिकतम एक फ़्रेम प्रति सेकंड की दर से भेजता है। describe_view फ़ंक्शन बताता है कि वह कैमरा स्ट्रीम सक्रिय है या नहीं। कैमरा फ़्रेम Gateway से होकर नहीं गुजरते। केवल-बैकएंड रीयलटाइम वॉइस प्रदाता सामान्य Gateway रिले ट्रांसपोर्ट के माध्यम से भी चल सकते हैं, जो प्रदाता क्रेडेंशियल को Gateway पर रखता है।
मेंटेनर द्वारा लाइव सत्यापन के लिए, OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts चलाएँ। स्मोक परीक्षण OpenAI बैकएंड/WebRTC पथों को भी कवर करता है; Google चरण उसी सीमित Live API टोकन स्वरूप को जारी करता है जिसका उपयोग Control UI Talk करता है, ब्राउज़र WebSocket एंडपॉइंट खोलता है, प्रारंभिक सेटअप पेलोड के साथ एक JPEG फ़्रेम भेजता है, और टेक्स्ट प्रतिक्रिया तथा describe_view फ़ंक्शन राउंडट्रिप को सत्यापित करता है।

उन्नत कॉन्फ़िगरेशन

प्रत्यक्ष Gemini API रन (api: "google-generative-ai") के लिए, OpenClaw कॉन्फ़िगर किए गए cachedContent हैंडल को Gemini अनुरोधों में भेजता है।
  • प्रति-मॉडल या वैश्विक पैरामीटर को cachedContent या पुराने cached_content में से किसी एक के साथ कॉन्फ़िगर करें
  • अधिक विशिष्ट दायरे के पैरामीटर (वैश्विक के ऊपर मॉडल-स्तर) हमेशा प्रभावी होते हैं। एक ही दायरे में, यदि दोनों कुंजियाँ सेट हैं, तो cached_content प्रभावी होता है। अप्रत्याशित परिणामों से बचने के लिए प्रति दायरा केवल एक कुंजी का उपयोग करें।
  • उदाहरण मान: cachedContents/prebuilt-context
  • Gemini कैश-हिट उपयोग को अपस्ट्रीम cachedContentTokenCount से OpenClaw cacheRead में सामान्यीकृत किया जाता है
google-gemini-cli OAuth प्रदाता का उपयोग करते समय, OpenClaw डिफ़ॉल्ट रूप से Gemini CLI stream-json आउटपुट का उपयोग करता है और अंतिम stats पेलोड से उपयोग को सामान्यीकृत करता है। पुराने --output-format json ओवरराइड अब भी JSON पार्सर का उपयोग करते हैं।
  • स्ट्रीम किए गए उत्तर का टेक्स्ट सहायक message इवेंट से आता है।
  • पुराने JSON आउटपुट के लिए, उत्तर का टेक्स्ट CLI JSON response फ़ील्ड से आता है।
  • जब CLI usage को खाली छोड़ता है, तो उपयोग के लिए stats का उपयोग किया जाता है।
  • stats.cached को OpenClaw cacheRead में सामान्यीकृत किया जाता है।
  • यदि stats.input अनुपस्थित है, तो OpenClaw stats.input_tokens - stats.cached से इनपुट टोकन प्राप्त करता है।
यदि Gateway डेमन (launchd/systemd) के रूप में चलता है, तो सुनिश्चित करें कि GEMINI_API_KEY उस प्रक्रिया के लिए उपलब्ध हो (उदाहरण के लिए, ~/.openclaw/.env में या env.shellEnv के माध्यम से)।

संबंधित

मॉडल चयन

प्रदाताओं, मॉडल संदर्भों और फ़ेलओवर व्यवहार का चयन।

छवि निर्माण

साझा छवि टूल पैरामीटर और प्रदाता चयन।

वीडियो निर्माण

साझा वीडियो टूल पैरामीटर और प्रदाता चयन।

संगीत निर्माण

साझा संगीत टूल पैरामीटर और प्रदाता चयन।