- Provider:
google - Authentifizierung:
GEMINI_API_KEYoderGOOGLE_API_KEY - API: Google Gemini API
- Laufzeitoption:
agentRuntime.id: "google-gemini-cli"verwendet Gemini CLI OAuth wieder, während Modellreferenzen weiterhin kanonisch alsgoogle/*angegeben werden.
Erste Schritte
Wählen Sie Ihre bevorzugte Authentifizierungsmethode und führen Sie die Einrichtungsschritte aus.- API-Schlüssel
- Gemini CLI (OAuth)
Am besten geeignet für: standardmäßigen Zugriff auf die Gemini API über Google AI Studio.Alternativ können Sie den Schlüssel direkt übergeben:Mit einem konfigurierten API-Schlüssel aktualisiert OpenClaw den Textmodellkatalog
von Google AI Studio über die Gemini-API
1
API-Schlüssel abrufen
Erstellen Sie in Google AI Studio einen kostenlosen Schlüssel.
2
Onboarding ausführen
3
Standardmodell festlegen
4
Verfügbarkeit des Modells überprüfen
models.list. Neu veröffentlichte Varianten von Gemini 3 Pro, Flash
und Flash-Lite erscheinen daher in
openclaw models list --provider google, ohne dass auf eine OpenClaw-Version
gewartet werden muss. Wenn die Erkennung nicht verfügbar ist, behält OpenClaw den mitgelieferten Ausweichkatalog
bei.google/gemini-3-pro-preview wurde am 2026-03-09 eingestellt; verwenden Sie stattdessen google/gemini-3.1-pro-preview. Durch erneutes Ausführen der Einrichtung des Gemini-API-Schlüssels (openclaw onboard --auth-choice gemini-api-key oder openclaw models auth login --provider google) wird ein veraltetes konfiguriertes Standardmodell auf das aktuelle Modell umgestellt.Funktionen
Websuche
Der mitgelieferte Websuch-Providergemini verwendet Gemini Google Search Grounding.
Konfigurieren Sie unter plugins.entries.google.config.webSearch einen eigenen Suchschlüssel,
oder lassen Sie ihn nach GEMINI_API_KEY den Wert models.providers.google.apiKey wiederverwenden:
webSearch.apiKey Vorrang, gefolgt von GEMINI_API_KEY
und anschließend models.providers.google.apiKey. webSearch.baseUrl ist optional und
für Betreiber-Proxys oder kompatible Gemini-API-Endpunkte vorgesehen; wenn der Wert nicht angegeben wird,
verwendet die Gemini-Websuche models.providers.google.baseUrl wieder. Informationen zum providerspezifischen Werkzeugverhalten finden Sie unter
Gemini-Suche.
Bilderzeugung
Der mitgelieferte Bilderzeugungs-Providergoogle verwendet standardmäßig
google/gemini-3.1-flash-image.
- Unterstützt außerdem
google/gemini-3-pro-image - Erzeugung: bis zu 4 Bilder pro Anfrage
- Bearbeitungsmodus: aktiviert, bis zu 5 Eingabebilder
- Geometriesteuerung:
size,aspectRatioundresolution
Unter Bilderzeugung finden Sie Informationen zu gemeinsamen Werkzeugparametern, zur Provider-Auswahl und zum Failover-Verhalten.
Videoerzeugung
Das mitgelieferte Plugingoogle registriert außerdem die Videoerzeugung über das gemeinsame
Werkzeug video_generate.
- Standard-Videomodell:
google/veo-3.1-fast-generate-preview - Modi: Text-zu-Video, Bild-zu-Video und Abläufe mit einer einzelnen Videoreferenz
- Unterstützt
aspectRatio(16:9,9:16) undresolution(720P,1080P); die Audioausgabe wird derzeit von Veo nicht unterstützt - Unterstützte Dauern: 4, 6 oder 8 Sekunden (andere Werte werden auf den nächstgelegenen zulässigen Wert gesetzt)
Unter Videoerzeugung finden Sie Informationen zu gemeinsamen Werkzeugparametern, zur Provider-Auswahl und zum Failover-Verhalten.
Musikerzeugung
Das mitgelieferte Plugingoogle registriert außerdem die Musikerzeugung über das gemeinsame
Werkzeug music_generate.
- Standard-Musikmodell:
google/lyria-3-clip-preview - Unterstützt außerdem
google/lyria-3-pro-preview - Prompt-Steuerung:
lyricsundinstrumental - Ausgabeformat: standardmäßig
mp3, zusätzlichwavuntergoogle/lyria-3-pro-preview - Referenzeingaben: bis zu 10 Bilder
- Sitzungsgestützte Ausführungen werden über den gemeinsamen Aufgaben-/Statusablauf abgekoppelt, einschließlich
action: "status"
Unter Musikerzeugung finden Sie Informationen zu gemeinsamen Werkzeugparametern, zur Provider-Auswahl und zum Failover-Verhalten.
Text-to-Speech
Der mitgelieferte Sprach-Providergoogle verwendet den TTS-Pfad der Gemini API mit
gemini-3.1-flash-tts-preview.
- Standardstimme:
Kore - Authentifizierung:
tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEYoderGOOGLE_API_KEY - Ausgabe: WAV für reguläre TTS-Anhänge, Opus für Sprachnachrichtenziele, PCM für Talk/Telefonie
- Sprachnachrichtenausgabe: Google PCM wird als WAV verpackt und mit
ffmpegin Opus mit 48 kHz transkodiert
generateContent zurück. Verwenden Sie für gesprochene Unterhaltungen mit niedrigster Latenz den
Echtzeit-Sprach-Provider von Google auf Basis der Gemini Live API anstelle von Batch-
TTS.
So verwenden Sie Google als standardmäßigen TTS-Provider:
audioProfile fest, um dem gesprochenen Text einen wiederverwendbaren Stil-Prompt voranzustellen. Legen Sie
speakerName fest, wenn sich Ihr Prompt-Text auf einen benannten Sprecher bezieht.
Gemini API TTS akzeptiert im Text außerdem ausdrucksbezogene, in eckige Klammern gesetzte Audio-Tags,
beispielsweise [whispers] oder [laughs]. Um Tags aus der sichtbaren Chat-Antwort
herauszuhalten und dennoch an TTS zu senden, platzieren Sie sie in einem
Block vom Typ [[tts:text]]...[[/tts:text]]:
Ein auf die Gemini API beschränkter API-Schlüssel aus der Google Cloud Console ist für diesen
Provider gültig. Dies ist nicht der separate API-Pfad von Cloud Text-to-Speech.
Echtzeit-Sprache
Das mitgelieferte Plugingoogle registriert einen Echtzeit-Sprach-Provider auf Basis der
Gemini Live API für backendseitige Audiobrücken wie Voice Call und Google Meet.
Beispielkonfiguration für Voice Call in Echtzeit:
Die Google Live API verwendet bidirektionales Audio und Funktionsaufrufe über einen WebSocket.
OpenClaw passt das Audio der Telefonie-/Meet-Bridge an den PCM-Live-API-Stream von Gemini an und
belässt Tool-Aufrufe im gemeinsamen Echtzeit-Sprachvertrag. Lassen Sie
temperature
nicht festgelegt, sofern Sie keine Änderungen am Sampling benötigen. OpenClaw lässt nicht positive Werte
weg, da Google Live für temperature: 0 Transkripte ohne Audio zurückgeben kann.
Die Transkription der Gemini API wird ohne languageCodes aktiviert; das aktuelle Google
SDK lehnt Hinweise zum Sprachcode auf diesem API-Pfad ab.Gemini 3.1 Live akzeptiert Konversationstext über Echtzeiteingaben und verwendet
sequenzielle Funktionsaufrufe. OpenClaw lässt für dieses Modell die älteren Felder
NON_BLOCKING, die Zeitplanung von Funktionsantworten und affektive Dialogfelder weg. Bevorzugen Sie
thinkingLevel; konfigurierte positive Werte für thinkingBudget werden der
nächstgelegenen unterstützten Stufe zugeordnet, während -1 den Google-Standardwert beibehält. Siehe den
Vergleich der Funktionen von Gemini Live.Control UI Talk unterstützt Google-Live-Browsersitzungen mit eingeschränkten Einmal-
Tokens. In Video Talk sendet der Browser begrenzte JPEG-Frames direkt an
Google Live, mit dem Maximum des Providers von einem Frame pro Sekunde. Die Funktion
describe_view meldet, ob dieser Kamerastream aktiv ist.
Kameraframes durchlaufen nicht den Gateway. Nur im Backend ausgeführte Echtzeit-Sprach-
Provider können auch über den generischen Gateway-Relay-Transport ausgeführt werden, der
die Provider-Anmeldedaten auf dem Gateway hält.OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts aus.
Der Smoke-Test deckt außerdem die OpenAI-Backend-/WebRTC-Pfade ab; der Google-Teil stellt denselben
eingeschränkten Live-API-Token-Typ aus, den Control UI Talk verwendet, öffnet den Browser-
WebSocket-Endpunkt, sendet die anfängliche Setup-Nutzlast zusammen mit einem JPEG-Frame und
überprüft eine Textantwort sowie den Funktions-Roundtrip von describe_view.
Erweiterte Konfiguration
Direkte Wiederverwendung des Gemini-Caches
Direkte Wiederverwendung des Gemini-Caches
Bei direkten Gemini-API-Ausführungen (
api: "google-generative-ai") übergibt OpenClaw
ein konfiguriertes cachedContent-Handle an Gemini-Anfragen.- Konfigurieren Sie modellspezifische oder globale Parameter entweder mit
cachedContentoder dem veraltetencached_content - Parameter aus einem spezifischeren Gültigkeitsbereich (Modellebene vor globaler Ebene) haben stets Vorrang.
Wenn beide Schlüssel innerhalb desselben Gültigkeitsbereichs festgelegt sind, hat
cached_contentVorrang. Verwenden Sie nur einen Schlüssel pro Gültigkeitsbereich, um Überraschungen zu vermeiden. - Beispielwert:
cachedContents/prebuilt-context - Die Nutzung bei einem Gemini-Cache-Treffer wird aus dem vorgelagerten
cachedContentTokenCountin OpenClawcacheReadnormalisiert
Hinweise zur Verwendung der Gemini CLI
Hinweise zur Verwendung der Gemini CLI
Bei Verwendung des OAuth-Providers
google-gemini-cli verwendet OpenClaw standardmäßig die
Ausgabe stream-json der Gemini CLI und normalisiert die Nutzung aus der abschließenden
stats-Nutzlast. Veraltete Überschreibungen von --output-format json verwenden weiterhin den
JSON-Parser.- Der gestreamte Antworttext stammt aus den
message-Ereignissen des Assistenten. - Bei veralteter JSON-Ausgabe stammt der Antworttext aus dem Feld
responsedes CLI-JSON. - Die Nutzung fällt auf
statszurück, wenn die CLIusageleer lässt. stats.cachedwird in OpenClawcacheReadnormalisiert.- Wenn
stats.inputfehlt, leitet OpenClaw die Eingabe-Tokens ausstats.input_tokens - stats.cachedab.
Einrichtung von Umgebung und Daemon
Einrichtung von Umgebung und Daemon
Wenn der Gateway als Daemon (launchd/systemd) ausgeführt wird, stellen Sie sicher, dass
GEMINI_API_KEY
für diesen Prozess verfügbar ist (beispielsweise in ~/.openclaw/.env oder über
env.shellEnv).Verwandte Themen
Modellauswahl
Auswahl von Providern, Modellreferenzen und Failover-Verhalten.
Bilderzeugung
Gemeinsame Parameter des Bild-Tools und Provider-Auswahl.
Videoerzeugung
Gemeinsame Parameter des Video-Tools und Provider-Auswahl.
Musikerzeugung
Gemeinsame Parameter des Musik-Tools und Provider-Auswahl.