- Fournisseur :
google - Authentification :
GEMINI_API_KEYouGOOGLE_API_KEY - API : API Google Gemini
- Option d’exécution :
agentRuntime.id: "google-gemini-cli"réutilise l’OAuth de Gemini CLI tout en conservant les références de modèles sous leur forme canoniquegoogle/*.
Prise en main
Choisissez votre méthode d’authentification préférée et suivez les étapes de configuration.- Clé API
- Gemini CLI (OAuth)
Idéal pour : l’accès standard à l’API Gemini via Google AI Studio.Vous pouvez également transmettre directement la clé :
1
Obtenir une clé API
Créez une clé gratuite dans Google AI Studio.
2
Exécuter l’intégration initiale
3
Définir un modèle par défaut
4
Vérifier que le modèle est disponible
google/gemini-3-pro-preview a été retiré le 2026-03-09 ; utilisez google/gemini-3.1-pro-preview à la place. Relancer la configuration de la clé API Gemini (openclaw onboard --auth-choice gemini-api-key ou openclaw models auth login --provider google) remplace un modèle par défaut obsolète dans la configuration par le modèle actuel.Fonctionnalités
Recherche web
Le fournisseur de recherche webgemini inclus utilise l’ancrage Google Search de Gemini.
Configurez une clé de recherche dédiée sous plugins.entries.google.config.webSearch,
ou laissez-le réutiliser models.providers.google.apiKey après GEMINI_API_KEY :
webSearch.apiKey dédié, puis GEMINI_API_KEY,
puis models.providers.google.apiKey. webSearch.baseUrl est facultatif et
sert aux proxys d’exploitation ou aux points de terminaison compatibles avec l’API Gemini ; lorsqu’il est omis,
la recherche web Gemini réutilise models.providers.google.baseUrl. Consultez
Recherche Gemini pour connaître le comportement de l’outil propre au fournisseur.
Génération d’images
Le fournisseur de génération d’imagesgoogle inclus utilise par défaut
google/gemini-3.1-flash-image-preview.
- Prend également en charge
google/gemini-3-pro-image-preview - Génération : jusqu’à 4 images par requête
- Mode d’édition : activé, jusqu’à 5 images d’entrée
- Contrôles géométriques :
size,aspectRatioetresolution
Consultez Génération d’images pour connaître les paramètres d’outil partagés, la sélection du fournisseur et le comportement de basculement.
Génération de vidéos
Le plugingoogle inclus enregistre également la génération de vidéos via l’outil partagé
video_generate.
- Modèle vidéo par défaut :
google/veo-3.1-fast-generate-preview - Modes : texte vers vidéo, image vers vidéo et processus de référence à une seule vidéo
- Prend en charge
aspectRatio(16:9,9:16) etresolution(720P,1080P) ; Veo ne prend actuellement pas en charge la sortie audio - Durées prises en charge : 4, 6 ou 8 secondes (les autres valeurs sont ajustées à la valeur autorisée la plus proche)
Consultez Génération de vidéos pour connaître les paramètres d’outil partagés, la sélection du fournisseur et le comportement de basculement.
Génération musicale
Le plugingoogle inclus enregistre également la génération musicale via l’outil partagé
music_generate.
- Modèle musical par défaut :
google/lyria-3-clip-preview - Prend également en charge
google/lyria-3-pro-preview - Contrôles des invites :
lyricsetinstrumental - Format de sortie :
mp3par défaut, ainsi quewavsurgoogle/lyria-3-pro-preview - Entrées de référence : jusqu’à 10 images
- Les exécutions associées à une session se détachent via le processus partagé de tâche et d’état, notamment
action: "status"
Consultez Génération musicale pour connaître les paramètres d’outil partagés, la sélection du fournisseur et le comportement de basculement.
Synthèse vocale
Le fournisseur vocalgoogle inclus utilise le parcours TTS de l’API Gemini avec
gemini-3.1-flash-tts-preview.
- Voix par défaut :
Kore - Authentification :
messages.tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEYouGOOGLE_API_KEY - Sortie : WAV pour les pièces jointes TTS ordinaires, Opus pour les destinations de notes vocales, PCM pour Talk/la téléphonie
- Sortie de note vocale : le PCM de Google est encapsulé au format WAV et transcodé en Opus à 48 kHz avec
ffmpeg
generateContent terminée. Pour obtenir la latence la plus faible dans les conversations vocales, utilisez le
fournisseur vocal Google en temps réel, reposant sur l’API Gemini Live, plutôt que le TTS
par lots.
Pour utiliser Google comme fournisseur TTS par défaut :
audioProfile afin d’ajouter une invite de style réutilisable avant le texte prononcé. Définissez
speakerName lorsque le texte de votre invite fait référence à un locuteur nommé.
Le TTS de l’API Gemini accepte également des balises audio expressives entre crochets dans le texte,
telles que [whispers] ou [laughs]. Pour exclure les balises de la réponse visible dans le chat
tout en les envoyant au TTS, placez-les dans un bloc [[tts:text]]...[[/tts:text]] :
Une clé API Google Cloud Console limitée à l’API Gemini est valide pour ce
fournisseur. Il ne s’agit pas du parcours distinct de l’API Cloud Text-to-Speech.
Voix en temps réel
Le plugingoogle inclus enregistre un fournisseur vocal en temps réel reposant sur
l’API Gemini Live pour les ponts audio côté serveur tels que Voice Call et Google Meet.
Exemple de configuration en temps réel de Voice Call :
L’API Google Live utilise l’audio bidirectionnel et l’appel de fonctions via un WebSocket.
OpenClaw adapte l’audio de la passerelle de téléphonie/Meet au flux de l’API PCM Live de Gemini et
conserve les appels d’outils dans le contrat vocal en temps réel partagé. Laissez
temperature
non défini sauf si vous devez modifier l’échantillonnage ; OpenClaw omet les valeurs non positives,
car Google Live peut renvoyer des transcriptions sans audio pour temperature: 0.
La transcription de l’API Gemini est activée sans languageCodes ; le SDK Google actuel
rejette les indications de code de langue sur ce chemin d’API.Gemini 3.1 Live accepte le texte conversationnel via l’entrée en temps réel et utilise
l’appel séquentiel de fonctions. OpenClaw omet l’ancien
NON_BLOCKING, la planification
des réponses de fonctions et les champs de dialogue affectif pour ce modèle. Préférez
thinkingLevel ; les valeurs positives configurées de thinkingBudget sont associées au
niveau pris en charge le plus proche, tandis que -1 conserve la valeur par défaut de Google. Consultez la
comparaison des fonctionnalités de Gemini Live.La fonction Talk de l’interface de contrôle prend en charge les sessions Google Live dans le navigateur avec des
jetons contraints à usage unique. Les fournisseurs de voix en temps réel réservés au backend peuvent également fonctionner via le
transport de relais générique du Gateway, qui conserve les identifiants du fournisseur sur le Gateway.
OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts.
Le test rapide couvre également les chemins backend/WebRTC d’OpenAI ; la partie Google génère le même
format de jeton contraint de l’API Live que celui utilisé par la fonction Talk de l’interface de contrôle, ouvre le
point de terminaison WebSocket du navigateur, envoie la charge utile de configuration initiale et attend
setupComplete.
Configuration avancée
Réutilisation directe du cache Gemini
Réutilisation directe du cache Gemini
Pour les exécutions directes de l’API Gemini (
api: "google-generative-ai"), OpenClaw
transmet un identifiant cachedContent configuré aux requêtes Gemini.- Configurez les paramètres par modèle ou globaux avec
cachedContentou l’anciencached_content - Les paramètres de la portée la plus précise (niveau du modèle plutôt que global) sont toujours prioritaires.
Au sein d’une même portée, si les deux clés sont définies,
cached_contentest prioritaire. N’utilisez qu’une seule clé par portée afin d’éviter les surprises. - Exemple de valeur :
cachedContents/prebuilt-context - L’utilisation des accès au cache Gemini est normalisée dans le champ OpenClaw
cacheReadà partir du champ en amontcachedContentTokenCount
Notes d’utilisation de la CLI Gemini
Notes d’utilisation de la CLI Gemini
Lors de l’utilisation du fournisseur OAuth
google-gemini-cli, OpenClaw utilise par défaut
la sortie stream-json de la CLI Gemini et normalise l’utilisation à partir de la charge utile
stats finale. Les remplacements --output-format json hérités continuent d’utiliser
l’analyseur JSON.- Le texte de réponse diffusé provient des événements assistant
message. - Pour l’ancienne sortie JSON, le texte de réponse provient du champ
responsedu JSON de la CLI. - L’utilisation se rabat sur
statslorsque la CLI laisseusagevide. stats.cachedest normalisé dans le champ OpenClawcacheRead.- Si
stats.inputest absent, OpenClaw déduit les jetons d’entrée à partir destats.input_tokens - stats.cached.
Configuration de l’environnement et du démon
Configuration de l’environnement et du démon
Si le Gateway s’exécute en tant que démon (launchd/systemd), assurez-vous que
GEMINI_API_KEY
est disponible pour ce processus (par exemple, dans ~/.openclaw/.env ou via
env.shellEnv).Rubriques connexes
Sélection du modèle
Choix des fournisseurs, des références de modèles et du comportement de basculement.
Génération d’images
Paramètres partagés de l’outil d’image et sélection du fournisseur.
Génération de vidéos
Paramètres partagés de l’outil vidéo et sélection du fournisseur.
Génération de musique
Paramètres partagés de l’outil musical et sélection du fournisseur.