- Provedor:
google - Autenticação:
GEMINI_API_KEYouGOOGLE_API_KEY - API: API Google Gemini
- Opção de runtime:
agentRuntime.id: "google-gemini-cli"reutiliza o OAuth da CLI do Gemini, mantendo as referências de modelo canônicas comogoogle/*.
Primeiros passos
Escolha o método de autenticação de sua preferência e siga as etapas de configuração.- Chave de API
- CLI do Gemini (OAuth)
Ideal para: acesso padrão à API Gemini por meio do Google AI Studio.Ou forneça a chave diretamente:
1
Obter uma chave de API
Crie uma chave gratuita no Google AI Studio.
2
Executar a integração inicial
3
Definir um modelo padrão
4
Verificar se o modelo está disponível
google/gemini-3-pro-preview foi descontinuado em 2026-03-09; use google/gemini-3.1-pro-preview em seu lugar. Executar novamente a configuração da chave da API Gemini (openclaw onboard --auth-choice gemini-api-key ou openclaw models auth login --provider google) substitui um padrão configurado obsoleto pelo modelo atual.Recursos
Pesquisa na web
O provedor integrado de pesquisa na webgemini usa o grounding da Pesquisa Google do Gemini.
Configure uma chave de pesquisa dedicada em plugins.entries.google.config.webSearch,
ou permita que ele reutilize models.providers.google.apiKey após GEMINI_API_KEY:
webSearch.apiKey dedicado, depois GEMINI_API_KEY
e, por fim, models.providers.google.apiKey. webSearch.baseUrl é opcional e
existe para proxies de operadores ou endpoints compatíveis da API Gemini; quando omitido,
a pesquisa na web do Gemini reutiliza models.providers.google.baseUrl. Consulte
Pesquisa do Gemini para saber o comportamento da ferramenta específico do provedor.
Geração de imagens
O provedor integrado de geração de imagensgoogle usa
google/gemini-3.1-flash-image-preview por padrão.
- Também oferece suporte a
google/gemini-3-pro-image-preview - Geração: até 4 imagens por solicitação
- Modo de edição: ativado, até 5 imagens de entrada
- Controles de geometria:
size,aspectRatioeresolution
Consulte Geração de imagens para conhecer os parâmetros compartilhados da ferramenta, a seleção de provedor e o comportamento de failover.
Geração de vídeo
O plugin integradogoogle também registra a geração de vídeo por meio da ferramenta compartilhada
video_generate.
- Modelo de vídeo padrão:
google/veo-3.1-fast-generate-preview - Modos: texto para vídeo, imagem para vídeo e fluxos de referência de vídeo único
- Oferece suporte a
aspectRatio(16:9,9:16) eresolution(720P,1080P); atualmente, o Veo não oferece suporte à saída de áudio - Durações compatíveis: 4, 6 ou 8 segundos (outros valores são ajustados para o valor permitido mais próximo)
Consulte Geração de vídeo para conhecer os parâmetros compartilhados da ferramenta, a seleção de provedor e o comportamento de failover.
Geração de música
O plugin integradogoogle também registra a geração de música por meio da ferramenta compartilhada
music_generate.
- Modelo de música padrão:
google/lyria-3-clip-preview - Também oferece suporte a
google/lyria-3-pro-preview - Controles de prompt:
lyricseinstrumental - Formato de saída:
mp3por padrão, além dewavemgoogle/lyria-3-pro-preview - Entradas de referência: até 10 imagens
- Execuções baseadas em sessão são desacopladas por meio do fluxo compartilhado de tarefa/status, incluindo
action: "status"
Consulte Geração de música para conhecer os parâmetros compartilhados da ferramenta, a seleção de provedor e o comportamento de failover.
Conversão de texto em fala
O provedor de fala integradogoogle usa o caminho TTS da API Gemini com
gemini-3.1-flash-tts-preview.
- Voz padrão:
Kore - Autenticação:
messages.tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEYouGOOGLE_API_KEY - Saída: WAV para anexos TTS comuns, Opus para destinos de mensagem de voz, PCM para Talk/telefonia
- Saída de mensagem de voz: o PCM do Google é encapsulado como WAV e transcodificado para Opus a 48 kHz com
ffmpeg
generateContent concluída. Para conversas faladas com a menor latência, use o
provedor de voz em tempo real do Google baseado na Gemini Live API em vez do TTS
em lote.
Para usar o Google como provedor TTS padrão:
audioProfile para adicionar um prompt de estilo reutilizável antes do texto falado. Defina
speakerName quando o texto do prompt fizer referência a um locutor pelo nome.
O TTS da API Gemini também aceita tags de áudio expressivas entre colchetes no texto,
como [whispers] ou [laughs]. Para manter as tags fora da resposta visível do chat
e ainda enviá-las ao TTS, coloque-as dentro de um bloco [[tts:text]]...[[/tts:text]]:
Uma chave de API do Google Cloud Console restrita à API Gemini é válida para este
provedor. Este não é o caminho separado da API Cloud Text-to-Speech.
Voz em tempo real
O plugin integradogoogle registra um provedor de voz em tempo real baseado na
Gemini Live API para pontes de áudio de back-end, como Voice Call e Google Meet.
Exemplo de configuração em tempo real para chamadas de voz:
A API Google Live usa áudio bidirecional e chamadas de função por WebSocket.
O OpenClaw adapta o áudio da ponte de telefonia/Meet ao fluxo da API PCM Live do Gemini e
mantém as chamadas de ferramentas no contrato compartilhado de voz em tempo real. Deixe
temperature
não definido, a menos que seja necessário alterar a amostragem; o OpenClaw omite valores não positivos
porque o Google Live pode retornar transcrições sem áudio para temperature: 0.
A transcrição da API Gemini é ativada sem languageCodes; o SDK atual do Google
rejeita dicas de código de idioma nesse caminho da API.O Gemini 3.1 Live aceita texto conversacional pela entrada em tempo real e usa
chamadas de função sequenciais. O OpenClaw omite os campos antigos de
NON_BLOCKING, agendamento
de respostas de função e diálogo afetivo para esse modelo. Prefira
thinkingLevel; valores positivos configurados de thinkingBudget são mapeados para o
nível compatível mais próximo, enquanto -1 mantém o padrão do Google. Consulte a
comparação de recursos do Gemini Live.O Talk da Control UI é compatível com sessões do Google Live no navegador usando tokens
restritos de uso único. Provedores de voz em tempo real exclusivos do backend também podem operar
pelo transporte de retransmissão genérico do Gateway, que mantém as credenciais do provedor no Gateway.
OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts.
O teste de fumaça também abrange os caminhos de backend/WebRTC da OpenAI; a etapa do Google emite o mesmo
formato restrito de token da API Live usado pelo Talk da Control UI, abre o endpoint
WebSocket do navegador, envia a carga útil de configuração inicial e aguarda
setupComplete.
Configuração avançada
Reutilização direta do cache do Gemini
Reutilização direta do cache do Gemini
Para execuções diretas da API Gemini (
api: "google-generative-ai"), o OpenClaw
repassa um identificador cachedContent configurado às solicitações do Gemini.- Configure parâmetros globais ou por modelo com
cachedContentou com a opção legadacached_content - Os parâmetros de um escopo mais específico (nível do modelo em vez do global) sempre prevalecem.
No mesmo escopo, se ambas as chaves estiverem definidas,
cached_contentprevalece. Use apenas uma chave por escopo para evitar surpresas. - Valor de exemplo:
cachedContents/prebuilt-context - O uso de acertos de cache do Gemini é normalizado no
cacheReaddo OpenClaw a partir docachedContentTokenCountupstream
Observações sobre o uso da CLI do Gemini
Observações sobre o uso da CLI do Gemini
Ao usar o provedor OAuth
google-gemini-cli, o OpenClaw usa, por padrão,
a saída stream-json da CLI do Gemini e normaliza o uso da carga útil
stats final. As substituições legadas de --output-format json ainda usam o
analisador JSON.- O texto da resposta transmitida vem dos eventos
messagedo assistente. - Para a saída JSON legada, o texto da resposta vem do campo
responsedo JSON da CLI. - O uso recorre a
statsquando a CLI deixausagevazio. stats.cachedé normalizado nocacheReaddo OpenClaw.- Se
stats.inputestiver ausente, o OpenClaw deriva os tokens de entrada destats.input_tokens - stats.cached.
Configuração do ambiente e do daemon
Configuração do ambiente e do daemon
Se o Gateway for executado como daemon (launchd/systemd), garanta que
GEMINI_API_KEY
esteja disponível para esse processo (por exemplo, em ~/.openclaw/.env ou por meio de
env.shellEnv).Relacionados
Seleção de modelos
Escolha de provedores, referências de modelos e comportamento de failover.
Geração de imagens
Parâmetros compartilhados da ferramenta de imagens e seleção de provedores.
Geração de vídeos
Parâmetros compartilhados da ferramenta de vídeos e seleção de provedores.
Geração de música
Parâmetros compartilhados da ferramenta de música e seleção de provedores.