Skip to main content
De Google-Plugin biedt toegang tot Gemini-modellen via Google AI Studio, plus beeldgeneratie, mediabegrip (beeld/audio/video), tekst-naar-spraak en zoeken op het web via Gemini Grounding.
  • Provider: google
  • Authenticatie: GEMINI_API_KEY of GOOGLE_API_KEY
  • API: Google Gemini API
  • Runtime-optie: agentRuntime.id: "google-gemini-cli" hergebruikt Gemini CLI OAuth en houdt modelverwijzingen canoniek als google/*.

Aan de slag

Kies de gewenste authenticatiemethode en volg de configuratiestappen.
Het meest geschikt voor: standaardtoegang tot de Gemini API via Google AI Studio.
1

Een API-sleutel verkrijgen

Maak een gratis sleutel aan in Google AI Studio.
2

De onboarding uitvoeren

Of geef de sleutel rechtstreeks door:
3

Een standaardmodel instellen

4

Controleren of het model beschikbaar is

GEMINI_API_KEY en GOOGLE_API_KEY worden beide geaccepteerd. Gebruik de variant die je al hebt geconfigureerd.
Met een geconfigureerde API-sleutel vernieuwt OpenClaw de catalogus met tekstmodellen van Google AI Studio via de Gemini models.list-API. Nieuw uitgebrachte varianten van Gemini 3 Pro, Flash en Flash-Lite verschijnen daardoor in openclaw models list --provider google zonder dat je op een nieuwe OpenClaw-versie hoeft te wachten. Als detectie niet beschikbaar is, behoudt OpenClaw de meegeleverde reservecatalogus.
google/gemini-3-pro-preview is op 2026-03-09 buiten gebruik gesteld; gebruik in plaats daarvan google/gemini-3.1-pro-preview. Als je de configuratie van de Gemini API-sleutel opnieuw uitvoert (openclaw onboard --auth-choice gemini-api-key of openclaw models auth login --provider google), wordt een verouderd geconfigureerd standaardmodel vervangen door het huidige model.

Mogelijkheden

Zoeken op het web

De meegeleverde webzoekprovider gemini gebruikt Gemini Google Search Grounding. Configureer een specifieke zoeksleutel onder plugins.entries.google.config.webSearch, of laat deze models.providers.google.apiKey hergebruiken na GEMINI_API_KEY:
De volgorde van prioriteit voor inloggegevens is eerst de specifieke webSearch.apiKey, vervolgens GEMINI_API_KEY en daarna models.providers.google.apiKey. webSearch.baseUrl is optioneel en bestaat voor operatorproxy’s of compatibele Gemini API-eindpunten; als deze wordt weggelaten, hergebruikt Gemini-webzoekfunctie models.providers.google.baseUrl. Zie Zoeken met Gemini voor het providerspecifieke gedrag van de tool.
Gemini 3-modellen gebruiken thinkingLevel in plaats van thinkingBudget. OpenClaw wijst de besturingselementen voor redeneren van Gemini 3, Gemini 3.1 en de alias gemini-*-latest toe aan thinkingLevel, zodat standaarduitvoeringen en uitvoeringen met lage latentie geen uitgeschakelde waarden voor thinkingBudget verzenden./think adaptive behoudt de dynamische denksemantiek van Google in plaats van een vast OpenClaw-niveau te kiezen. Gemini 3 en Gemini 3.1 laten een vaste thinkingLevel weg, zodat Google het niveau kan kiezen; Gemini 2.5 verzendt de dynamische sentinelwaarde thinkingBudget: -1 van Google.Gemma 4-modellen (bijvoorbeeld gemma-4-26b-a4b-it) ondersteunen de denkmodus. OpenClaw herschrijft thinkingBudget naar een ondersteunde Google-waarde voor thinkingLevel voor Gemma 4. Als denken wordt ingesteld op off, blijft denken uitgeschakeld in plaats van dat dit wordt toegewezen aan MINIMAL.Gemini 2.5 Pro werkt alleen in de denkmodus en weigert een expliciete thinkingBudget: 0; OpenClaw verwijdert die waarde uit verzoeken voor Gemini 2.5 Pro in plaats van deze te verzenden.

Beeldgeneratie

De meegeleverde provider voor beeldgeneratie google gebruikt standaard google/gemini-3.1-flash-image.
  • Ondersteunt ook google/gemini-3-pro-image
  • Genereren: maximaal 4 beelden per verzoek
  • Bewerkingsmodus: ingeschakeld, maximaal 5 invoerbeelden
  • Geometriebesturing: size, aspectRatio en resolution
Google als standaardprovider voor beelden gebruiken:
Zie Beeldgeneratie voor gedeelde toolparameters, providerselectie en failovergedrag.

Videogeneratie

De meegeleverde Plugin google registreert ook videogeneratie via de gedeelde tool video_generate.
  • Standaardvideomodel: google/veo-3.1-fast-generate-preview
  • Modi: tekst-naar-video, beeld-naar-video en stromen met één video als referentie
  • Ondersteunt aspectRatio (16:9, 9:16) en resolution (720P, 1080P); audio-uitvoer wordt momenteel niet ondersteund door Veo
  • Ondersteunde tijdsduren: 4, 6 of 8 seconden (andere waarden worden afgerond naar de dichtstbijzijnde toegestane waarde)
Google als standaardprovider voor video gebruiken:
Zie Videogeneratie voor gedeelde toolparameters, providerselectie en failovergedrag.

Muziekgeneratie

De meegeleverde Plugin google registreert ook muziekgeneratie via de gedeelde tool music_generate.
  • Standaardmuziekmodel: google/lyria-3-clip-preview
  • Ondersteunt ook google/lyria-3-pro-preview
  • Promptbesturing: lyrics en instrumental
  • Uitvoerformaat: standaard mp3, plus wav op google/lyria-3-pro-preview
  • Referentie-invoer: maximaal 10 beelden
  • Uitvoeringen met een sessie worden losgekoppeld via de gedeelde taak-/statusstroom, waaronder action: "status"
Google als standaardprovider voor muziek gebruiken:
Zie Muziekgeneratie voor gedeelde toolparameters, providerselectie en failovergedrag.

Tekst-naar-spraak

De meegeleverde spraakprovider google gebruikt het TTS-pad van de Gemini API met gemini-3.1-flash-tts-preview.
  • Standaardstem: Kore
  • Authenticatie: tts.providers.google.apiKey, models.providers.google.apiKey, GEMINI_API_KEY of GOOGLE_API_KEY
  • Uitvoer: WAV voor gewone TTS-bijlagen, Opus voor spraakberichtdoelen, PCM voor Talk/telefonie
  • Uitvoer voor spraakberichten: Google PCM wordt verpakt als WAV en met ffmpeg getranscodeerd naar 48 kHz Opus
Het batchpad voor Gemini TTS van Google retourneert de gegenereerde audio in het voltooide antwoord generateContent. Gebruik voor gesproken gesprekken met de laagste latentie de provider voor realtime spraak van Google, die wordt aangedreven door de Gemini Live API, in plaats van batch-TTS. Google als standaard-TTS-provider gebruiken:
Gemini API TTS gebruikt prompts in natuurlijke taal voor stijlbesturing. Stel audioProfile in om vóór de gesproken tekst een herbruikbare stijlprompt toe te voegen. Stel speakerName in wanneer je prompttekst verwijst naar een spreker met een naam. Gemini API TTS accepteert in de tekst ook expressieve audiotags tussen vierkante haken, zoals [whispers] of [laughs]. Plaats tags in een [[tts:text]]...[[/tts:text]]-blok om ze buiten het zichtbare chatantwoord te houden en tegelijkertijd naar TTS te verzenden:
Een API-sleutel van Google Cloud Console die beperkt is tot de Gemini API, is geldig voor deze provider. Dit is niet het afzonderlijke API-pad van Cloud Text-to-Speech.

Realtime spraak

De meegeleverde Plugin google registreert een provider voor realtime spraak, die wordt aangedreven door de Gemini Live API, voor audioverbindingen aan de backend, zoals Voice Call en Google Meet. Voorbeeld van een realtimeconfiguratie voor Voice Call:
Google Live API gebruikt bidirectionele audio en functieaanroepen via een WebSocket. OpenClaw past audio van de telefonie-/Meet-bridge aan voor Gemini’s PCM Live API-stream en houdt toolaanroepen binnen het gedeelde realtime spraakcontract. Laat temperature niet ingesteld, tenzij je de sampling wilt wijzigen; OpenClaw laat niet-positieve waarden weg, omdat Google Live voor temperature: 0 transcripties zonder audio kan retourneren. Transcriptie via de Gemini API wordt ingeschakeld zonder languageCodes; de huidige Google SDK weigert hints voor taalcodes op dit API-pad.
Gemini 3.1 Live accepteert gesprekstekst via realtime-invoer en gebruikt opeenvolgende functieaanroepen. OpenClaw laat voor dit model de oudere NON_BLOCKING, planning van functieresponsen en velden voor affectieve dialogen weg. Geef de voorkeur aan thinkingLevel; geconfigureerde positieve waarden voor thinkingBudget worden toegewezen aan het dichtstbijzijnde ondersteunde niveau, terwijl -1 de standaardwaarde van Google behoudt. Zie de vergelijking van Gemini Live-mogelijkheden.
Control UI Talk ondersteunt Google Live-browsersessies met beperkte tokens voor eenmalig gebruik. In Video Talk stuurt de browser begrensde JPEG-frames rechtstreeks naar Google Live, met het maximum van de provider van één frame per seconde. De functie describe_view meldt of die camerastream actief is. Cameraframes gaan niet door de Gateway. Realtime spraakproviders die alleen via de backend werken, kunnen ook via het generieke Gateway-relaytransport worden uitgevoerd, waarbij providerreferenties op de Gateway blijven.
Voer voor liveverificatie door beheerders OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts uit. De smoketest omvat ook OpenAI-backend-/WebRTC-paden; het Google-gedeelte maakt dezelfde beperkte Live API-tokenvorm aan die Control UI Talk gebruikt, opent het WebSocket-eindpunt van de browser, verzendt de initiële installatiepayload plus een JPEG-frame en verifieert een tekstrespons en een functierondreis voor describe_view.

Geavanceerde configuratie

Voor rechtstreekse Gemini API-uitvoeringen (api: "google-generative-ai") geeft OpenClaw een geconfigureerde cachedContent-handle door aan Gemini-aanvragen.
  • Configureer parameters per model of globaal met cachedContent of de verouderde cached_content
  • Parameters uit een specifiekere scope (modelniveau boven globaal) krijgen altijd voorrang. Als beide sleutels binnen dezelfde scope zijn ingesteld, krijgt cached_content voorrang. Gebruik slechts één sleutel per scope om verrassingen te voorkomen.
  • Voorbeeldwaarde: cachedContents/prebuilt-context
  • Gemini-cachetreffergebruik wordt genormaliseerd naar OpenClaw cacheRead vanuit upstream cachedContentTokenCount
Bij gebruik van de OAuth-provider google-gemini-cli gebruikt OpenClaw standaard uitvoer van Gemini CLI stream-json en normaliseert het gebruik vanuit de uiteindelijke stats-payload. Verouderde overschrijvingen voor --output-format json gebruiken nog steeds de JSON-parser.
  • Gestreamde antwoordtekst is afkomstig van assistentgebeurtenissen van message.
  • Voor verouderde JSON-uitvoer is de antwoordtekst afkomstig uit het CLI JSON-veld response.
  • Het gebruik valt terug op stats wanneer de CLI usage leeg laat.
  • stats.cached wordt genormaliseerd naar OpenClaw cacheRead.
  • Als stats.input ontbreekt, leidt OpenClaw invoertokens af uit stats.input_tokens - stats.cached.
Als de Gateway als daemon (launchd/systemd) wordt uitgevoerd, zorg er dan voor dat GEMINI_API_KEY beschikbaar is voor dat proces (bijvoorbeeld in ~/.openclaw/.env of via env.shellEnv).

Gerelateerd

Modelselectie

Providers, modelreferenties en failovergedrag kiezen.

Afbeeldingen genereren

Gedeelde parameters voor afbeeldingstools en providerselectie.

Video's genereren

Gedeelde parameters voor videotools en providerselectie.

Muziek genereren

Gedeelde parameters voor muziektools en providerselectie.