- Proveedor:
google - Autenticación:
GEMINI_API_KEYoGOOGLE_API_KEY - API: API de Google Gemini
- Opción de entorno de ejecución:
agentRuntime.id: "google-gemini-cli"reutiliza el OAuth de la CLI de Gemini y mantiene las referencias de modelos en su forma canónica comogoogle/*.
Primeros pasos
Elija el método de autenticación que prefiera y siga los pasos de configuración.- Clave de API
- CLI de Gemini (OAuth)
Ideal para: acceso estándar a la API de Gemini mediante Google AI Studio.O proporcione la clave directamente:Con una clave de API configurada, OpenClaw actualiza el catálogo de modelos
de texto de Google AI Studio desde la API
1
Obtener una clave de API
Cree una clave gratuita en Google AI Studio.
2
Ejecutar la incorporación
3
Establecer un modelo predeterminado
4
Verificar que el modelo esté disponible
models.list de Gemini. Por lo tanto, las variantes
de Gemini 3 Pro, Flash y Flash-Lite recién publicadas aparecen en
openclaw models list --provider google sin esperar a una nueva versión de OpenClaw.
Si la detección no está disponible, OpenClaw conserva el catálogo
alternativo incluido.google/gemini-3-pro-preview se retiró el 2026-03-09; utilice google/gemini-3.1-pro-preview en su lugar. Al volver a ejecutar la configuración de la clave de la API de Gemini (openclaw onboard --auth-choice gemini-api-key o openclaw models auth login --provider google), se sustituye un valor predeterminado configurado obsoleto por el modelo actual.Capacidades
Búsqueda web
El proveedor de búsqueda webgemini incluido utiliza el Grounding de Google Search de Gemini.
Configure una clave de búsqueda específica en plugins.entries.google.config.webSearch,
o permita que reutilice models.providers.google.apiKey después de GEMINI_API_KEY:
webSearch.apiKey específica, luego GEMINI_API_KEY
y después models.providers.google.apiKey. webSearch.baseUrl es opcional y
existe para proxies de operadores o endpoints compatibles con la API de Gemini; cuando se omite,
la búsqueda web de Gemini reutiliza models.providers.google.baseUrl. Consulte
Búsqueda de Gemini para conocer el comportamiento de la herramienta específico del proveedor.
Generación de imágenes
El proveedor de generación de imágenesgoogle incluido utiliza de forma predeterminada
google/gemini-3.1-flash-image.
- También admite
google/gemini-3-pro-image - Generación: hasta 4 imágenes por solicitud
- Modo de edición: habilitado, hasta 5 imágenes de entrada
- Controles de geometría:
size,aspectRatioyresolution
Consulte Generación de imágenes para conocer los parámetros compartidos de la herramienta, la selección del proveedor y el comportamiento de conmutación por error.
Generación de vídeo
El plugingoogle incluido también registra la generación de vídeo mediante la herramienta
compartida video_generate.
- Modelo de vídeo predeterminado:
google/veo-3.1-fast-generate-preview - Modos: texto a vídeo, imagen a vídeo y flujos de referencia de un solo vídeo
- Admite
aspectRatio(16:9,9:16) yresolution(720P,1080P); actualmente Veo no admite la salida de audio - Duraciones admitidas: 4, 6 u 8 segundos (los demás valores se ajustan al valor permitido más cercano)
Consulte Generación de vídeo para conocer los parámetros compartidos de la herramienta, la selección del proveedor y el comportamiento de conmutación por error.
Generación de música
El plugingoogle incluido también registra la generación de música mediante la herramienta
compartida music_generate.
- Modelo de música predeterminado:
google/lyria-3-clip-preview - También admite
google/lyria-3-pro-preview - Controles del prompt:
lyricsyinstrumental - Formato de salida:
mp3de forma predeterminada, además dewavengoogle/lyria-3-pro-preview - Entradas de referencia: hasta 10 imágenes
- Las ejecuciones respaldadas por una sesión se desvinculan mediante el flujo compartido de tareas/estado, incluido
action: "status"
Consulte Generación de música para conocer los parámetros compartidos de la herramienta, la selección del proveedor y el comportamiento de conmutación por error.
Texto a voz
El proveedor de vozgoogle incluido utiliza la ruta TTS de la API de Gemini con
gemini-3.1-flash-tts-preview.
- Voz predeterminada:
Kore - Autenticación:
tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEYoGOOGLE_API_KEY - Salida: WAV para archivos adjuntos TTS normales, Opus para destinos de notas de voz y PCM para Talk/telefonía
- Salida de notas de voz: el PCM de Google se encapsula como WAV y se transcodifica a Opus de 48 kHz con
ffmpeg
generateContent completada. Para obtener conversaciones habladas con la menor latencia, utilice el
proveedor de voz en tiempo real de Google basado en la API Live de Gemini en lugar del TTS
por lotes.
Para utilizar Google como proveedor TTS predeterminado:
audioProfile para anteponer una instrucción de estilo reutilizable al texto hablado. Establezca
speakerName cuando el texto de la instrucción haga referencia a un hablante con nombre.
El TTS de la API de Gemini también acepta etiquetas de audio expresivas entre corchetes en el texto,
como [whispers] o [laughs]. Para que las etiquetas no aparezcan en la respuesta visible del chat
pero se envíen al TTS, colóquelas dentro de un bloque
[[tts:text]]...[[/tts:text]]:
Una clave de API de Google Cloud Console restringida a la API de Gemini es válida para este
proveedor. Esta no es la ruta independiente de la API Cloud Text-to-Speech.
Voz en tiempo real
El plugingoogle incluido registra un proveedor de voz en tiempo real basado en la
API Live de Gemini para puentes de audio de backend como Voice Call y Google Meet.
Ejemplo de configuración en tiempo real de llamadas de voz:
La API Live de Google usa audio bidireccional y llamadas a funciones mediante un WebSocket.
OpenClaw adapta el audio del puente de telefonía/Meet al flujo de la API Live PCM de Gemini y
mantiene las llamadas a herramientas en el contrato compartido de voz en tiempo real. Deje
temperature
sin establecer salvo que necesite cambiar el muestreo; OpenClaw omite los valores no positivos
porque Google Live puede devolver transcripciones sin audio para temperature: 0.
La transcripción de la API de Gemini se habilita sin languageCodes; el SDK actual de Google
rechaza las sugerencias de código de idioma en esta ruta de la API.Gemini 3.1 Live acepta texto conversacional mediante la entrada en tiempo real y utiliza
llamadas secuenciales a funciones. OpenClaw omite los campos antiguos
NON_BLOCKING, de
programación de respuestas de funciones y de diálogo afectivo para este modelo. Se recomienda
thinkingLevel; los valores positivos configurados de thinkingBudget se asignan al
nivel compatible más cercano, mientras que -1 conserva el valor predeterminado de Google. Consulte la
comparación de capacidades de Gemini Live.Talk de la interfaz de control admite sesiones de navegador de Google Live con tokens
restringidos de un solo uso. En Video Talk, el navegador envía directamente fotogramas JPEG
acotados a Google Live, con el máximo del proveedor de un fotograma por segundo. La función
describe_view indica si ese flujo de cámara está activo.
Los fotogramas de la cámara no pasan por el Gateway. Los proveedores de voz en tiempo real
exclusivos del backend también pueden ejecutarse mediante el transporte de retransmisión
genérico del Gateway, que mantiene las credenciales del proveedor en el Gateway.OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts.
La prueba de humo también cubre las rutas del backend/WebRTC de OpenAI; el tramo de Google
genera el mismo formato restringido de token de la API Live que utiliza Talk de la interfaz
de control, abre el endpoint WebSocket del navegador, envía la carga útil de configuración
inicial junto con un fotograma JPEG y verifica una respuesta de texto y una comunicación
bidireccional de la función describe_view.
Configuración avanzada
Reutilización directa de la caché de Gemini
Reutilización directa de la caché de Gemini
Para ejecuciones directas de la API de Gemini (
api: "google-generative-ai"), OpenClaw
transmite a las solicitudes de Gemini un identificador cachedContent configurado.- Configure parámetros globales o por modelo mediante
cachedContento la opción heredadacached_content - Los parámetros del ámbito más específico (nivel de modelo sobre global) siempre prevalecen.
Dentro del mismo ámbito, si ambas claves están establecidas, prevalece
cached_content. Utilice solo una clave por ámbito para evitar resultados inesperados. - Valor de ejemplo:
cachedContents/prebuilt-context - El uso de aciertos de caché de Gemini se normaliza en
cacheReadde OpenClaw a partir decachedContentTokenCountdel sistema de origen
Notas de uso de la CLI de Gemini
Notas de uso de la CLI de Gemini
Al utilizar el proveedor OAuth
google-gemini-cli, OpenClaw usa de forma
predeterminada la salida stream-json de la CLI de Gemini y normaliza el uso a partir
de la carga útil final stats. Las anulaciones heredadas de --output-format json
siguen utilizando el analizador JSON.- El texto de respuesta transmitido procede de los eventos
messagedel asistente. - Para la salida JSON heredada, el texto de respuesta procede del campo
responsedel JSON de la CLI. - El uso recurre a
statscuando la CLI deja vacíousage. stats.cachedse normaliza encacheReadde OpenClaw.- Si falta
stats.input, OpenClaw obtiene los tokens de entrada a partir destats.input_tokens - stats.cached.
Configuración del entorno y del demonio
Configuración del entorno y del demonio
Si el Gateway se ejecuta como demonio (launchd/systemd), asegúrese de que
GEMINI_API_KEY
esté disponible para ese proceso (por ejemplo, en ~/.openclaw/.env o mediante
env.shellEnv).Temas relacionados
Selección de modelos
Selección de proveedores, referencias de modelos y comportamiento de conmutación por error.
Generación de imágenes
Parámetros compartidos de la herramienta de imágenes y selección de proveedores.
Generación de vídeos
Parámetros compartidos de la herramienta de vídeo y selección de proveedores.
Generación de música
Parámetros compartidos de la herramienta de música y selección de proveedores.