- Provider:
google - Authenticatie:
GEMINI_API_KEYofGOOGLE_API_KEY - API: Google Gemini API
- Runtime-optie:
agentRuntime.id: "google-gemini-cli"hergebruikt Gemini CLI OAuth en houdt modelverwijzingen canoniek alsgoogle/*.
Aan de slag
Kies de gewenste authenticatiemethode en volg de configuratiestappen.- API-sleutel
- Gemini CLI (OAuth)
Het meest geschikt voor: standaardtoegang tot de Gemini API via Google AI Studio.Of geef de sleutel rechtstreeks door:Met een geconfigureerde API-sleutel vernieuwt OpenClaw de catalogus met
tekstmodellen van Google AI Studio via de Gemini
1
Een API-sleutel verkrijgen
Maak een gratis sleutel aan in Google AI Studio.
2
De onboarding uitvoeren
3
Een standaardmodel instellen
4
Controleren of het model beschikbaar is
models.list-API. Nieuw
uitgebrachte varianten van Gemini 3 Pro, Flash en Flash-Lite verschijnen
daardoor in openclaw models list --provider google zonder dat je op een nieuwe OpenClaw-versie
hoeft te wachten. Als detectie niet beschikbaar is, behoudt OpenClaw de
meegeleverde reservecatalogus.google/gemini-3-pro-preview is op 2026-03-09 buiten gebruik gesteld; gebruik in plaats daarvan google/gemini-3.1-pro-preview. Als je de configuratie van de Gemini API-sleutel opnieuw uitvoert (openclaw onboard --auth-choice gemini-api-key of openclaw models auth login --provider google), wordt een verouderd geconfigureerd standaardmodel vervangen door het huidige model.Mogelijkheden
Zoeken op het web
De meegeleverde webzoekprovidergemini gebruikt Gemini Google Search Grounding.
Configureer een specifieke zoeksleutel onder plugins.entries.google.config.webSearch,
of laat deze models.providers.google.apiKey hergebruiken na GEMINI_API_KEY:
webSearch.apiKey, vervolgens GEMINI_API_KEY en daarna models.providers.google.apiKey.
webSearch.baseUrl is optioneel en bestaat voor operatorproxy’s of compatibele
Gemini API-eindpunten; als deze wordt weggelaten, hergebruikt Gemini-webzoekfunctie
models.providers.google.baseUrl. Zie Zoeken met Gemini voor het
providerspecifieke gedrag van de tool.
Beeldgeneratie
De meegeleverde provider voor beeldgeneratiegoogle gebruikt
standaard google/gemini-3.1-flash-image.
- Ondersteunt ook
google/gemini-3-pro-image - Genereren: maximaal 4 beelden per verzoek
- Bewerkingsmodus: ingeschakeld, maximaal 5 invoerbeelden
- Geometriebesturing:
size,aspectRatioenresolution
Zie Beeldgeneratie voor gedeelde toolparameters, providerselectie en failovergedrag.
Videogeneratie
De meegeleverde Plugingoogle registreert ook videogeneratie via de
gedeelde tool video_generate.
- Standaardvideomodel:
google/veo-3.1-fast-generate-preview - Modi: tekst-naar-video, beeld-naar-video en stromen met één video als referentie
- Ondersteunt
aspectRatio(16:9,9:16) enresolution(720P,1080P); audio-uitvoer wordt momenteel niet ondersteund door Veo - Ondersteunde tijdsduren: 4, 6 of 8 seconden (andere waarden worden afgerond naar de dichtstbijzijnde toegestane waarde)
Zie Videogeneratie voor gedeelde toolparameters, providerselectie en failovergedrag.
Muziekgeneratie
De meegeleverde Plugingoogle registreert ook muziekgeneratie via de
gedeelde tool music_generate.
- Standaardmuziekmodel:
google/lyria-3-clip-preview - Ondersteunt ook
google/lyria-3-pro-preview - Promptbesturing:
lyricseninstrumental - Uitvoerformaat: standaard
mp3, pluswavopgoogle/lyria-3-pro-preview - Referentie-invoer: maximaal 10 beelden
- Uitvoeringen met een sessie worden losgekoppeld via de gedeelde taak-/statusstroom, waaronder
action: "status"
Zie Muziekgeneratie voor gedeelde toolparameters, providerselectie en failovergedrag.
Tekst-naar-spraak
De meegeleverde spraakprovidergoogle gebruikt het TTS-pad van de
Gemini API met gemini-3.1-flash-tts-preview.
- Standaardstem:
Kore - Authenticatie:
tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEYofGOOGLE_API_KEY - Uitvoer: WAV voor gewone TTS-bijlagen, Opus voor spraakberichtdoelen, PCM voor Talk/telefonie
- Uitvoer voor spraakberichten: Google PCM wordt verpakt als WAV en met
ffmpeggetranscodeerd naar 48 kHz Opus
generateContent. Gebruik voor gesproken gesprekken met de
laagste latentie de provider voor realtime spraak van Google, die wordt
aangedreven door de Gemini Live API, in plaats van batch-TTS.
Google als standaard-TTS-provider gebruiken:
audioProfile in om vóór de gesproken tekst een herbruikbare stijlprompt toe
te voegen. Stel speakerName in wanneer je prompttekst verwijst naar een
spreker met een naam.
Gemini API TTS accepteert in de tekst ook expressieve audiotags tussen vierkante
haken, zoals [whispers] of [laughs]. Plaats tags in een
[[tts:text]]...[[/tts:text]]-blok om ze buiten het zichtbare chatantwoord te houden en
tegelijkertijd naar TTS te verzenden:
Een API-sleutel van Google Cloud Console die beperkt is tot de Gemini API, is
geldig voor deze provider. Dit is niet het afzonderlijke API-pad van Cloud
Text-to-Speech.
Realtime spraak
De meegeleverde Plugingoogle registreert een provider voor realtime
spraak, die wordt aangedreven door de Gemini Live API, voor audioverbindingen
aan de backend, zoals Voice Call en Google Meet.
Voorbeeld van een realtimeconfiguratie voor Voice Call:
Google Live API gebruikt bidirectionele audio en functieaanroepen via een WebSocket.
OpenClaw past audio van de telefonie-/Meet-bridge aan voor Gemini’s PCM Live API-stream en
houdt toolaanroepen binnen het gedeelde realtime spraakcontract. Laat
temperature
niet ingesteld, tenzij je de sampling wilt wijzigen; OpenClaw laat niet-positieve waarden weg,
omdat Google Live voor temperature: 0 transcripties zonder audio kan retourneren.
Transcriptie via de Gemini API wordt ingeschakeld zonder languageCodes; de huidige Google
SDK weigert hints voor taalcodes op dit API-pad.Gemini 3.1 Live accepteert gesprekstekst via realtime-invoer en gebruikt
opeenvolgende functieaanroepen. OpenClaw laat voor dit model de oudere
NON_BLOCKING,
planning van functieresponsen en velden voor affectieve dialogen weg. Geef de voorkeur aan
thinkingLevel; geconfigureerde positieve waarden voor thinkingBudget worden toegewezen aan het
dichtstbijzijnde ondersteunde niveau, terwijl -1 de standaardwaarde van Google behoudt. Zie de
vergelijking van Gemini Live-mogelijkheden.Control UI Talk ondersteunt Google Live-browsersessies met beperkte tokens voor eenmalig gebruik.
In Video Talk stuurt de browser begrensde JPEG-frames rechtstreeks naar
Google Live, met het maximum van de provider van één frame per seconde. De functie
describe_view meldt of die camerastream actief is.
Cameraframes gaan niet door de Gateway. Realtime spraakproviders die alleen via de backend werken,
kunnen ook via het generieke Gateway-relaytransport worden uitgevoerd, waarbij
providerreferenties op de Gateway blijven.OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts uit.
De smoketest omvat ook OpenAI-backend-/WebRTC-paden; het Google-gedeelte maakt dezelfde
beperkte Live API-tokenvorm aan die Control UI Talk gebruikt, opent het
WebSocket-eindpunt van de browser, verzendt de initiële installatiepayload plus een JPEG-frame en
verifieert een tekstrespons en een functierondreis voor describe_view.
Geavanceerde configuratie
Direct hergebruik van Gemini-cache
Direct hergebruik van Gemini-cache
Voor rechtstreekse Gemini API-uitvoeringen (
api: "google-generative-ai") geeft OpenClaw
een geconfigureerde cachedContent-handle door aan Gemini-aanvragen.- Configureer parameters per model of globaal met
cachedContentof de verouderdecached_content - Parameters uit een specifiekere scope (modelniveau boven globaal) krijgen altijd voorrang.
Als beide sleutels binnen dezelfde scope zijn ingesteld, krijgt
cached_contentvoorrang. Gebruik slechts één sleutel per scope om verrassingen te voorkomen. - Voorbeeldwaarde:
cachedContents/prebuilt-context - Gemini-cachetreffergebruik wordt genormaliseerd naar OpenClaw
cacheReadvanuit upstreamcachedContentTokenCount
Gebruiksopmerkingen voor Gemini CLI
Gebruiksopmerkingen voor Gemini CLI
Bij gebruik van de OAuth-provider
google-gemini-cli gebruikt OpenClaw standaard
uitvoer van Gemini CLI stream-json en normaliseert het gebruik vanuit de uiteindelijke
stats-payload. Verouderde overschrijvingen voor --output-format json gebruiken nog steeds de
JSON-parser.- Gestreamde antwoordtekst is afkomstig van assistentgebeurtenissen van
message. - Voor verouderde JSON-uitvoer is de antwoordtekst afkomstig uit het CLI JSON-veld
response. - Het gebruik valt terug op
statswanneer de CLIusageleeg laat. stats.cachedwordt genormaliseerd naar OpenClawcacheRead.- Als
stats.inputontbreekt, leidt OpenClaw invoertokens af uitstats.input_tokens - stats.cached.
Omgevings- en daemonconfiguratie
Omgevings- en daemonconfiguratie
Als de Gateway als daemon (launchd/systemd) wordt uitgevoerd, zorg er dan voor dat
GEMINI_API_KEY
beschikbaar is voor dat proces (bijvoorbeeld in ~/.openclaw/.env of via
env.shellEnv).Gerelateerd
Modelselectie
Providers, modelreferenties en failovergedrag kiezen.
Afbeeldingen genereren
Gedeelde parameters voor afbeeldingstools en providerselectie.
Video's genereren
Gedeelde parameters voor videotools en providerselectie.
Muziek genereren
Gedeelde parameters voor muziektools en providerselectie.