realtime, lokalny lub strumieniowy
stt-tts oraz transcription do przechwytywania mowy wyłącznie w celu obserwacji. Tryby te
współdzielą katalogi dostawców, koperty zdarzeń i semantykę anulowania z
telefonią, spotkaniami, komunikacją w czasie rzeczywistym w przeglądarce oraz natywnymi klientami „naciśnij, aby mówić”.
Możliwości
Generowanie obrazów
Twórz i edytuj obrazy na podstawie poleceń tekstowych lub obrazów referencyjnych za pomocą
image_generate. Asynchroniczne w sesjach czatu — działa w tle i
publikuje wynik, gdy jest gotowy.Generowanie filmów
Zamiana tekstu na film, obrazu na film i filmu na film za pomocą
video_generate.
Asynchroniczne — działa w tle i publikuje wynik, gdy jest gotowy.Generowanie muzyki
Generuj muzykę lub ścieżki dźwiękowe za pomocą
music_generate. Asynchroniczne w
sesjach czatu, ze współdzielonym cyklem życia zadania generowania multimediów.Synteza mowy
Konwertuj wychodzące odpowiedzi na mowę za pomocą narzędzia
tts oraz
konfiguracji messages.tts. Synchroniczne.Rozumienie multimediów
Podsumowuj przychodzące obrazy, dźwięk i filmy przy użyciu dostawców modeli
obsługujących analizę obrazu oraz wyspecjalizowanych pluginów do rozumienia multimediów.
Rozpoznawanie mowy
Transkrybuj przychodzące wiadomości głosowe za pomocą wsadowych dostawców STT lub
dostawców strumieniowego STT dla Voice Call.
Macierz możliwości dostawców
Ta tabela obejmuje wyspecjalizowane pluginy generowania multimediów, TTS i STT. Wielu
dostawców modeli czatu (Anthropic, Google, OpenAI i inni) również rozumie
przychodzące multimedia za pomocą modelu generującego odpowiedzi; pełną listę dostawców zawiera
sekcja Rozumienie multimediów.
Głos w czasie rzeczywistym oznacza tutaj natywną dla dostawcy dwukierunkową komunikację w czasie rzeczywistym (tryb
realtime Talk, np. Gemini Live lub OpenAI Realtime API) — obecnie rejestrują ją tylko Google
i OpenAI. Deepgram, ElevenLabs, Mistral, OpenAI i xAI
oddzielnie rejestrują strumieniowe STT dla Voice Call (jednokierunkową zamianę dźwięku na tekst); zobacz
poniżej Rozpoznawanie mowy i Voice Call.
Głos xAI w czasie rzeczywistym jest funkcją dostępną u dostawcy nadrzędnego, ale nie jest rejestrowany w
OpenClaw, dopóki współdzielony kontrakt głosu w czasie rzeczywistym nie będzie w stanie go reprezentować.Tryb asynchroniczny a synchroniczny
W przypadku narzędzi asynchronicznych OpenClaw przesyła żądanie do dostawcy, natychmiast zwraca
identyfikator zadania i śledzi zadanie w rejestrze zadań. Agent kontynuuje
odpowiadanie na inne wiadomości podczas wykonywania zadania. Gdy dostawca zakończy pracę,
OpenClaw wybudza agenta, przekazując mu ścieżki wygenerowanych multimediów, aby mógł poinformować
użytkownika za pomocą zwykłego trybu widocznej odpowiedzi sesji: automatycznego dostarczenia odpowiedzi końcowej,
jeśli jest skonfigurowane, lub
message(action="send"), gdy sesja wymaga
narzędzia wiadomości. Jeśli sesja osoby wysyłającej żądanie jest nieaktywna lub jej aktywne wybudzenie
się nie powiedzie, a w odpowiedzi końcowej nadal brakuje części wygenerowanych multimediów,
OpenClaw wysyła idempotentną bezpośrednią odpowiedź awaryjną zawierającą wyłącznie brakujące multimedia. Multimedia
dostarczone już w odpowiedzi końcowej nie są publikowane ponownie.
Rozpoznawanie mowy i Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio i xAI mogą transkrybować przychodzący dźwięk za pomocą wsadowej ścieżkitools.media.audio, jeśli są skonfigurowane. Pluginy kanałów, które wstępnie przetwarzają
wiadomość głosową na potrzeby filtrowania wzmianek lub analizy poleceń, oznaczają transkrybowany
załącznik w kontekście przychodzącym, dzięki czemu współdzielony etap rozumienia multimediów
ponownie wykorzystuje tę transkrypcję zamiast wykonywać drugie wywołanie STT dla tego samego
dźwięku.
Deepgram, ElevenLabs, Mistral, OpenAI i xAI rejestrują również dostawców
strumieniowego STT dla Voice Call, dzięki czemu dźwięk rozmowy telefonicznej na żywo może być przekazywany do wybranego
dostawcy bez oczekiwania na ukończenie nagrania.
W przypadku rozmów z użytkownikami na żywo preferuj tryb Talk. Wsadowe załączniki
dźwiękowe pozostają na ścieżce multimediów; komunikacja w czasie rzeczywistym w przeglądarce, natywne rozwiązania „naciśnij, aby mówić”,
telefonia i dźwięk ze spotkań powinny korzystać ze zdarzeń Talk oraz katalogów o zakresie sesji
zwracanych przez Gateway.
Przypisania dostawców (podział dostawców między obszary)
Google
Obszary obrazów, filmów, muzyki, wsadowego TTS, wsadowego STT, głosu w czasie rzeczywistym po stronie zaplecza
oraz rozumienia multimediów.
OpenAI
OpenAI
Obszary obrazów, filmów, wsadowego TTS, wsadowego STT, strumieniowego STT dla Voice Call, głosu
w czasie rzeczywistym po stronie zaplecza oraz osadzeń pamięci.
DeepInfra
DeepInfra
Obszary routingu czatu/modeli, generowania i edycji obrazów, zamiany tekstu na film, wsadowego TTS,
wsadowego STT, rozumienia multimediów obrazowych oraz osadzeń pamięci.
DeepInfra udostępnia również ponowne szeregowanie, klasyfikację, wykrywanie obiektów i
inne natywne typy modeli; OpenClaw nie ma jeszcze kontraktu dostawcy dla tych
kategorii, dlatego ten plugin ich nie rejestruje.
xAI
xAI
Obrazy, filmy, wyszukiwanie, wykonywanie kodu, wsadowe TTS, wsadowe STT oraz strumieniowe STT dla Voice
Call. Głos xAI w czasie rzeczywistym jest funkcją dostępną u dostawcy nadrzędnego, ale
nie jest rejestrowany w OpenClaw, dopóki współdzielony kontrakt głosu w czasie rzeczywistym nie będzie w stanie
go reprezentować.