- Dostawca:
google - Uwierzytelnianie:
GEMINI_API_KEYlubGOOGLE_API_KEY - API: Google Gemini API
- Opcja środowiska uruchomieniowego:
agentRuntime.id: "google-gemini-cli"ponownie wykorzystuje OAuth Gemini CLI, zachowując kanoniczne odwołania do modeli w postacigoogle/*.
Pierwsze kroki
Należy wybrać preferowaną metodę uwierzytelniania i wykonać odpowiednie czynności konfiguracyjne.- Klucz API
- Gemini CLI (OAuth)
Najlepsze zastosowanie: standardowy dostęp do Gemini API przez Google AI Studio.Klucz można też przekazać bezpośrednio:
1
Uzyskanie klucza API
Bezpłatny klucz można utworzyć w Google AI Studio.
2
Uruchomienie wdrażania
3
Ustawienie modelu domyślnego
4
Sprawdzenie dostępności modelu
google/gemini-3-pro-preview wycofano 2026-03-09; zamiast niego należy używać google/gemini-3.1-pro-preview. Ponowne uruchomienie konfiguracji klucza Gemini API (openclaw onboard --auth-choice gemini-api-key lub openclaw models auth login --provider google) zastępuje nieaktualny skonfigurowany model domyślny bieżącym modelem.Możliwości
Wyszukiwanie w internecie
Dołączony dostawca wyszukiwania w interneciegemini korzysta z ugruntowywania wyników Google Search przez Gemini.
Należy skonfigurować osobny klucz wyszukiwania w plugins.entries.google.config.webSearch
lub pozwolić mu ponownie wykorzystać models.providers.google.apiKey po GEMINI_API_KEY:
webSearch.apiKey, następnie GEMINI_API_KEY,
a potem models.providers.google.apiKey. webSearch.baseUrl jest opcjonalne i
służy do obsługi serwerów proxy operatora lub zgodnych punktów końcowych Gemini API; jeśli je pominięto,
wyszukiwanie Gemini w internecie ponownie wykorzystuje models.providers.google.baseUrl. Zachowanie narzędzia właściwe dla tego dostawcy opisano w sekcji
Wyszukiwanie Gemini.
Generowanie obrazów
Dołączony dostawca generowania obrazówgoogle domyślnie używa
google/gemini-3.1-flash-image-preview.
- Obsługuje także
google/gemini-3-pro-image-preview - Generowanie: maksymalnie 4 obrazy na żądanie
- Tryb edycji: włączony, maksymalnie 5 obrazów wejściowych
- Sterowanie geometrią:
size,aspectRatioiresolution
Wspólne parametry narzędzia, wybór dostawcy i zachowanie mechanizmu przełączania awaryjnego opisano w sekcji Generowanie obrazów.
Generowanie wideo
Dołączony plugingoogle rejestruje również generowanie wideo za pośrednictwem współdzielonego
narzędzia video_generate.
- Domyślny model wideo:
google/veo-3.1-fast-generate-preview - Tryby: zamiana tekstu na wideo, obrazu na wideo oraz przepływy z pojedynczym wideo referencyjnym
- Obsługuje
aspectRatio(16:9,9:16) iresolution(720P,1080P); Veo obecnie nie obsługuje wyjściowego dźwięku - Obsługiwane czasy trwania: 4, 6 lub 8 sekund (inne wartości są zaokrąglane do najbliższej dozwolonej wartości)
Wspólne parametry narzędzia, wybór dostawcy i zachowanie mechanizmu przełączania awaryjnego opisano w sekcji Generowanie wideo.
Generowanie muzyki
Dołączony plugingoogle rejestruje również generowanie muzyki za pośrednictwem współdzielonego
narzędzia music_generate.
- Domyślny model muzyczny:
google/lyria-3-clip-preview - Obsługuje także
google/lyria-3-pro-preview - Sterowanie poleceniem:
lyricsiinstrumental - Format wyjściowy: domyślnie
mp3, a takżewavwgoogle/lyria-3-pro-preview - Dane referencyjne: maksymalnie 10 obrazów
- Uruchomienia korzystające z sesji są odłączane za pośrednictwem współdzielonego przepływu zadań/stanu, w tym
action: "status"
Wspólne parametry narzędzia, wybór dostawcy i zachowanie mechanizmu przełączania awaryjnego opisano w sekcji Generowanie muzyki.
Zamiana tekstu na mowę
Dołączony dostawca mowygoogle korzysta ze ścieżki TTS Gemini API z
gemini-3.1-flash-tts-preview.
- Domyślny głos:
Kore - Uwierzytelnianie:
messages.tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEYlubGOOGLE_API_KEY - Dane wyjściowe: WAV dla zwykłych załączników TTS, Opus dla docelowych wiadomości głosowych, PCM dla Talk/telefonii
- Dane wyjściowe wiadomości głosowych: format PCM Google jest opakowywany jako WAV i transkodowany do Opus 48 kHz za pomocą
ffmpeg
generateContent. W rozmowach głosowych wymagających najmniejszych opóźnień należy użyć
dostawcy głosu Google działającego w czasie rzeczywistym, opartego na Gemini Live API, zamiast wsadowego
TTS.
Aby używać Google jako domyślnego dostawcy TTS:
audioProfile, aby dodać wielokrotnie używane polecenie stylu przed wypowiadanym tekstem. Należy ustawić
speakerName, jeśli tekst polecenia odwołuje się do nazwanego mówcy.
TTS Gemini API akceptuje również ekspresyjne znaczniki dźwiękowe w nawiasach kwadratowych,
takie jak [whispers] lub [laughs]. Aby znaczniki nie pojawiały się w widocznej odpowiedzi czatu,
ale były wysyłane do TTS, należy umieścić je w bloku [[tts:text]]...[[/tts:text]]:
Klucz API z Google Cloud Console ograniczony do Gemini API jest prawidłowy dla tego
dostawcy. Nie jest to osobna ścieżka Cloud Text-to-Speech API.
Głos w czasie rzeczywistym
Dołączony plugingoogle rejestruje dostawcę głosu w czasie rzeczywistym opartego na
Gemini Live API dla mostów dźwiękowych zaplecza, takich jak Voice Call i Google Meet.
Przykładowa konfiguracja połączeń głosowych w czasie rzeczywistym:
Interfejs Google Live API używa dwukierunkowego dźwięku i wywoływania funkcji przez WebSocket.
OpenClaw dostosowuje dźwięk z mostka telefonicznego/Meet do strumienia PCM interfejsu Gemini Live API i
utrzymuje wywołania narzędzi we wspólnym kontrakcie głosowym czasu rzeczywistego. Należy pozostawić
temperature
bez ustawienia, chyba że konieczna jest zmiana próbkowania; OpenClaw pomija wartości niedodatnie,
ponieważ Google Live może zwracać transkrypcje bez dźwięku dla temperature: 0.
Transkrypcja Gemini API jest włączona bez languageCodes; obecna wersja zestawu Google
SDK odrzuca wskazówki dotyczące kodu języka w tej ścieżce API.Gemini 3.1 Live przyjmuje tekst konwersacyjny przez dane wejściowe czasu rzeczywistego i używa
sekwencyjnego wywoływania funkcji. OpenClaw pomija dla tego modelu starsze
NON_BLOCKING,
planowanie odpowiedzi funkcji i pola dialogu afektywnego. Zalecane jest
thinkingLevel; skonfigurowane dodatnie wartości thinkingBudget są mapowane na
najbliższy obsługiwany poziom, natomiast -1 pozostawia wartość domyślną Google. Zobacz
porównanie możliwości Gemini Live.Funkcja rozmowy w interfejsie Control UI obsługuje sesje Google Live w przeglądarce z ograniczonymi tokenami
jednorazowego użytku. Dostawcy głosu czasu rzeczywistego działający wyłącznie po stronie zaplecza mogą również korzystać z ogólnego
transportu przekaźnikowego Gateway, który przechowuje dane uwierzytelniające dostawcy w Gateway.
OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts.
Test dymny obejmuje również ścieżki zaplecza/WebRTC OpenAI; etap Google generuje token
Live API o takim samym ograniczonym formacie, jakiego używa funkcja rozmowy w interfejsie Control UI, otwiera punkt końcowy
WebSocket przeglądarki, wysyła początkowy ładunek konfiguracji i oczekuje na
setupComplete.
Konfiguracja zaawansowana
Bezpośrednie ponowne użycie pamięci podręcznej Gemini
Bezpośrednie ponowne użycie pamięci podręcznej Gemini
W przypadku bezpośrednich uruchomień Gemini API (
api: "google-generative-ai") OpenClaw
przekazuje skonfigurowany uchwyt cachedContent do żądań Gemini.- Parametry dla modelu lub parametry globalne można skonfigurować za pomocą
cachedContentalbo starszegocached_content - Parametry z bardziej szczegółowego zakresu (poziom modelu zamiast globalnego) zawsze mają pierwszeństwo.
Jeśli oba klucze są ustawione w tym samym zakresie, pierwszeństwo ma
cached_content. Aby uniknąć niespodziewanego działania, należy używać tylko jednego klucza w każdym zakresie. - Przykładowa wartość:
cachedContents/prebuilt-context - Użycie wynikające z trafienia w pamięci podręcznej Gemini jest normalizowane do OpenClaw
cacheReadz nadrzędnegocachedContentTokenCount
Uwagi dotyczące używania Gemini CLI
Uwagi dotyczące używania Gemini CLI
Podczas korzystania z dostawcy OAuth
google-gemini-cli OpenClaw domyślnie używa danych wyjściowych
Gemini CLI stream-json i normalizuje użycie na podstawie końcowego
ładunku stats. Starsze nadpisania --output-format json nadal korzystają z
parsera JSON.- Tekst odpowiedzi przesyłanej strumieniowo pochodzi ze zdarzeń asystenta
message. - W przypadku starszych danych wyjściowych JSON tekst odpowiedzi pochodzi z pola
responsew danych JSON interfejsu CLI. - Jeśli interfejs CLI pozostawi
usagepuste, użycie wykorzystuje zastępczostats. stats.cachedjest normalizowane do OpenClawcacheRead.- Jeśli brakuje
stats.input, OpenClaw wylicza tokeny wejściowe zstats.input_tokens - stats.cached.
Konfiguracja środowiska i demona
Konfiguracja środowiska i demona
Jeśli Gateway działa jako demon (launchd/systemd), należy upewnić się, że
GEMINI_API_KEY
jest dostępne dla tego procesu (na przykład w ~/.openclaw/.env lub za pośrednictwem
env.shellEnv).Powiązane
Wybór modelu
Wybieranie dostawców, odwołań do modeli i sposobu przełączania awaryjnego.
Generowanie obrazów
Wspólne parametry narzędzia do obrazów i wybór dostawcy.
Generowanie wideo
Wspólne parametry narzędzia do wideo i wybór dostawcy.
Generowanie muzyki
Wspólne parametry narzędzia do muzyki i wybór dostawcy.