- Penyedia:
google - Autentikasi:
GEMINI_API_KEYatauGOOGLE_API_KEY - API: Google Gemini API
- Opsi runtime:
agentRuntime.id: "google-gemini-cli"menggunakan kembali OAuth Gemini CLI sambil mempertahankan referensi model kanonis sebagaigoogle/*.
Memulai
Pilih metode autentikasi yang diinginkan dan ikuti langkah-langkah penyiapannya.- Kunci API
- Gemini CLI (OAuth)
Paling sesuai untuk: akses standar Gemini API melalui Google AI Studio.Atau teruskan kunci secara langsung:
1
Dapatkan kunci API
Buat kunci gratis di Google AI Studio.
2
Jalankan orientasi awal
3
Tetapkan model default
4
Verifikasi bahwa model tersedia
google/gemini-3-pro-preview dihentikan pada 2026-03-09; gunakan google/gemini-3.1-pro-preview sebagai gantinya. Menjalankan ulang penyiapan kunci Gemini API (openclaw onboard --auth-choice gemini-api-key atau openclaw models auth login --provider google) menulis ulang model default lama yang dikonfigurasi menjadi model saat ini.Kemampuan
Pencarian web
Penyedia pencarian webgemini yang disertakan menggunakan grounding Google Search dari Gemini.
Konfigurasikan kunci pencarian khusus di bawah plugins.entries.google.config.webSearch,
atau biarkan kunci tersebut menggunakan kembali models.providers.google.apiKey setelah GEMINI_API_KEY:
webSearch.apiKey khusus, lalu GEMINI_API_KEY,
kemudian models.providers.google.apiKey. webSearch.baseUrl bersifat opsional dan
disediakan untuk proksi operator atau endpoint Gemini API yang kompatibel; jika dihilangkan,
pencarian web Gemini menggunakan kembali models.providers.google.baseUrl. Lihat
Pencarian Gemini untuk perilaku alat khusus penyedia.
Pembuatan gambar
Penyedia pembuatan gambargoogle yang disertakan secara default menggunakan
google/gemini-3.1-flash-image.
- Juga mendukung
google/gemini-3-pro-image - Pembuatan: hingga 4 gambar per permintaan
- Mode penyuntingan: diaktifkan, hingga 5 gambar masukan
- Kontrol geometri:
size,aspectRatio, danresolution
Lihat Pembuatan Gambar untuk parameter alat bersama, pemilihan penyedia, dan perilaku failover.
Pembuatan video
Plugingoogle yang disertakan juga mendaftarkan pembuatan video melalui alat bersama
video_generate.
- Model video default:
google/veo-3.1-fast-generate-preview - Mode: teks-ke-video, gambar-ke-video, dan alur referensi satu video
- Mendukung
aspectRatio(16:9,9:16) danresolution(720P,1080P); keluaran audio saat ini tidak didukung oleh Veo - Durasi yang didukung: 4, 6, atau 8 detik (nilai lain disesuaikan ke nilai terdekat yang diizinkan)
Lihat Pembuatan Video untuk parameter alat bersama, pemilihan penyedia, dan perilaku failover.
Pembuatan musik
Plugingoogle yang disertakan juga mendaftarkan pembuatan musik melalui alat bersama
music_generate.
- Model musik default:
google/lyria-3-clip-preview - Juga mendukung
google/lyria-3-pro-preview - Kontrol perintah:
lyricsdaninstrumental - Format keluaran:
mp3secara default, sertawavpadagoogle/lyria-3-pro-preview - Masukan referensi: hingga 10 gambar
- Proses berbasis sesi dilepas melalui alur tugas/status bersama, termasuk
action: "status"
Lihat Pembuatan Musik untuk parameter alat bersama, pemilihan penyedia, dan perilaku failover.
Teks-ke-ucapan
Penyedia ucapangoogle yang disertakan menggunakan jalur TTS Gemini API dengan
gemini-3.1-flash-tts-preview.
- Suara default:
Kore - Autentikasi:
messages.tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEY, atauGOOGLE_API_KEY - Keluaran: WAV untuk lampiran TTS biasa, Opus untuk target catatan suara, PCM untuk Talk/telefoni
- Keluaran catatan suara: PCM Google dibungkus sebagai WAV dan ditranskode menjadi Opus 48 kHz dengan
ffmpeg
generateContent yang telah selesai. Untuk percakapan lisan dengan latensi terendah, gunakan
penyedia suara waktu nyata Google yang didukung oleh Gemini Live API, bukan TTS
batch.
Untuk menggunakan Google sebagai penyedia TTS default:
audioProfile untuk menambahkan perintah gaya yang dapat digunakan kembali sebelum teks yang diucapkan. Tetapkan
speakerName jika teks perintah merujuk pada pembicara bernama.
TTS Gemini API juga menerima tag audio ekspresif dalam tanda kurung siku di dalam teks,
seperti [whispers] atau [laughs]. Agar tag tidak muncul dalam balasan percakapan yang terlihat
sekaligus tetap dikirim ke TTS, letakkan tag tersebut di dalam blok [[tts:text]]...[[/tts:text]]:
Kunci API Google Cloud Console yang dibatasi untuk Gemini API berlaku bagi
penyedia ini. Ini bukan jalur Cloud Text-to-Speech API yang terpisah.
Suara waktu nyata
Plugingoogle yang disertakan mendaftarkan penyedia suara waktu nyata yang didukung oleh
Gemini Live API untuk jembatan audio backend seperti Voice Call dan Google Meet.
Contoh konfigurasi waktu nyata Panggilan Suara:
Google Live API menggunakan audio dua arah dan pemanggilan fungsi melalui WebSocket.
OpenClaw menyesuaikan audio jembatan telepon/Meet ke aliran PCM Live API Gemini dan
mempertahankan pemanggilan alat pada kontrak suara waktu nyata bersama. Biarkan
temperature
tidak ditetapkan kecuali Anda perlu mengubah pengambilan sampel; OpenClaw menghilangkan nilai nonpositif
karena Google Live dapat mengembalikan transkrip tanpa audio untuk temperature: 0.
Transkripsi Gemini API diaktifkan tanpa languageCodes; SDK Google saat ini
menolak petunjuk kode bahasa pada jalur API ini.Gemini 3.1 Live menerima teks percakapan melalui input waktu nyata dan menggunakan
pemanggilan fungsi berurutan. OpenClaw menghilangkan
NON_BLOCKING, penjadwalan
respons fungsi, dan bidang dialog afektif yang lebih lama untuk model ini. Utamakan
thinkingLevel; nilai positif thinkingBudget yang dikonfigurasi dipetakan ke
tingkat terdekat yang didukung, sedangkan -1 mempertahankan default Google. Lihat
perbandingan kemampuan Gemini Live.Talk di Control UI mendukung sesi browser Google Live dengan token sekali pakai
yang dibatasi. Dalam Video Talk, browser mengirim frame JPEG terbatas secara langsung ke
Google Live pada batas maksimum penyedia, yaitu satu frame per detik. Fungsi
describe_view melaporkan apakah aliran kamera tersebut aktif.
Frame kamera tidak melewati Gateway. Penyedia suara waktu nyata khusus backend
juga dapat berjalan melalui transportasi relai Gateway generik, yang
menyimpan kredensial penyedia di Gateway.OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts.
Smoke test ini juga mencakup jalur backend/WebRTC OpenAI; bagian Google membuat token
Live API terbatas dengan bentuk yang sama seperti yang digunakan Talk di Control UI, membuka
endpoint WebSocket browser, mengirim payload penyiapan awal beserta satu frame JPEG, dan
memverifikasi respons teks serta perjalanan pulang-pergi fungsi describe_view.
Konfigurasi lanjutan
Penggunaan ulang cache Gemini secara langsung
Penggunaan ulang cache Gemini secara langsung
Untuk eksekusi langsung Gemini API (
api: "google-generative-ai"), OpenClaw
meneruskan handle cachedContent yang dikonfigurasi ke permintaan Gemini.- Konfigurasikan parameter per model atau global dengan
cachedContentataucached_contentversi lama - Parameter dari cakupan yang lebih spesifik (tingkat model di atas global) selalu diutamakan.
Dalam cakupan yang sama, jika kedua kunci ditetapkan,
cached_contentdiutamakan. Gunakan hanya satu kunci per cakupan untuk menghindari hasil yang tidak terduga. - Contoh nilai:
cachedContents/prebuilt-context - Penggunaan cache-hit Gemini dinormalisasi ke
cacheReadOpenClaw daricachedContentTokenCounthulu
Catatan penggunaan Gemini CLI
Catatan penggunaan Gemini CLI
Saat menggunakan penyedia OAuth
google-gemini-cli, OpenClaw menggunakan output
stream-json Gemini CLI secara default dan menormalisasi penggunaan dari payload
stats terakhir. Penggantian --output-format json versi lama masih menggunakan
parser JSON.- Teks balasan yang dialirkan berasal dari peristiwa
messageasisten. - Untuk output JSON versi lama, teks balasan berasal dari bidang
responseJSON CLI. - Penggunaan beralih ke
statsketika CLI membiarkanusagekosong. stats.cacheddinormalisasi kecacheReadOpenClaw.- Jika
stats.inputtidak tersedia, OpenClaw memperoleh token input daristats.input_tokens - stats.cached.
Penyiapan lingkungan dan daemon
Penyiapan lingkungan dan daemon
Jika Gateway berjalan sebagai daemon (launchd/systemd), pastikan
GEMINI_API_KEY
tersedia bagi proses tersebut (misalnya, di ~/.openclaw/.env atau melalui
env.shellEnv).Terkait
Pemilihan model
Memilih penyedia, referensi model, dan perilaku failover.
Pembuatan gambar
Parameter alat gambar bersama dan pemilihan penyedia.
Pembuatan video
Parameter alat video bersama dan pemilihan penyedia.
Pembuatan musik
Parameter alat musik bersama dan pemilihan penyedia.