realtime, lokales oder streamendes
stt-tts und transcription für die reine Beobachtung der Spracherfassung. Diese Modi
verwenden dieselben Provider-Kataloge, Ereignis-Umschläge und Abbruchsemantiken wie
Telefonie, Besprechungen, Browser-Echtzeitkommunikation und native Push-to-Talk-Clients.
Funktionen
Bilderzeugung
Erstellen und bearbeiten Sie Bilder anhand von Text-Prompts oder Referenzbildern über
image_generate. In Chatsitzungen asynchron — wird im Hintergrund ausgeführt und
veröffentlicht das Ergebnis, sobald es bereit ist.Videoerzeugung
Text-zu-Video, Bild-zu-Video und Video-zu-Video über
video_generate.
Asynchron — wird im Hintergrund ausgeführt und veröffentlicht das Ergebnis, sobald es bereit ist.Musikerzeugung
Generieren Sie Musik oder Audiospuren über
music_generate. In
Chatsitzungen asynchron im gemeinsamen Task-Lebenszyklus für die Medienerzeugung.Text-to-Speech
Wandeln Sie ausgehende Antworten über das Tool
tts und die
Konfiguration tts in gesprochene Audiodaten um. Synchron.Medienverständnis
Fassen Sie eingehende Bilder, Audio- und Videodaten mithilfe visionsfähiger
Modell-Provider und spezieller Plugins für das Medienverständnis zusammen.
Speech-to-Text
Transkribieren Sie eingehende Sprachnachrichten über Batch-STT oder
Streaming-STT-Provider für Voice Call.
Provider-Funktionsmatrix
Diese Tabelle behandelt die speziellen Plugins für Medienerzeugung, TTS und STT. Viele
Chatmodell-Provider (Anthropic, Google, OpenAI und andere) verstehen außerdem
eingehende Medien über ihr Antwortmodell; die vollständige Provider-Liste finden Sie unter
Medienverständnis.
Echtzeit-Sprache bezeichnet hier die Provider-native bidirektionale Echtzeitkommunikation (Talk-
Modus
realtime, z. B. Gemini Live oder die OpenAI Realtime API) — derzeit registrieren sie nur Google
und OpenAI. Deepgram, ElevenLabs, Mistral, OpenAI und xAI
registrieren separat Voice-Call-Streaming-STT (unidirektionales Audio-zu-Text); siehe
Speech-to-Text und Voice Call weiter unten.
Echtzeit-Sprache von xAI ist eine Upstream-Funktion, wird jedoch erst in
OpenClaw registriert, wenn der gemeinsame Vertrag für Echtzeit-Sprache sie abbilden kann.Asynchron im Vergleich zu synchron
Bei asynchronen Tools übermittelt OpenClaw die Anfrage an den Provider, gibt sofort eine
Task-ID zurück und verfolgt den Auftrag im Task-Verzeichnis. Der Agent beantwortet
weiterhin andere Nachrichten, während der Auftrag ausgeführt wird. Sobald der Provider fertig ist,
weckt OpenClaw den Agenten mit den Pfaden der generierten Medien auf, damit er den
Benutzer über den normalen sichtbaren Antwortmodus der Sitzung informieren kann: automatische Zustellung
der abschließenden Antwort, sofern konfiguriert, oder
message(action="send"), wenn die Sitzung
das Nachrichten-Tool erfordert. Wenn die anfordernde Sitzung inaktiv ist oder ihr aktiver
Weckvorgang fehlschlägt und einige generierte Medien noch in der Abschlussantwort fehlen,
sendet OpenClaw einen idempotenten direkten Fallback, der nur die fehlenden Medien enthält. Medien,
die bereits durch die Abschlussantwort zugestellt wurden, werden nicht erneut veröffentlicht.
Speech-to-Text und Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio und xAI können bei entsprechender Konfiguration eingehende Audiodaten über den Batch- Pfadtools.media.audio transkribieren. Channel-Plugins, die eine
Sprachnachricht vorab auf Erwähnungsfilterung oder Befehlsanalyse prüfen, markieren den transkribierten
Anhang im eingehenden Kontext, sodass der gemeinsame Durchlauf für das Medienverständnis
dieses Transkript wiederverwendet, anstatt für dieselben Audiodaten einen zweiten STT-Aufruf
durchzuführen.
Deepgram, ElevenLabs, Mistral, OpenAI und xAI registrieren außerdem
Streaming-STT-Provider für Voice Call, sodass Live-Telefonaudio an den ausgewählten
Provider weitergeleitet werden kann, ohne auf eine abgeschlossene Aufnahme zu warten.
Für Live-Unterhaltungen mit Benutzern sollte der Talk-Modus bevorzugt werden. Batch-Audioanhänge
bleiben auf dem Medienpfad; Browser-Echtzeitkommunikation, natives Push-to-Talk,
Telefonie und Besprechungsaudio sollten Talk-Ereignisse und die vom
Gateway zurückgegebenen sitzungsbezogenen Kataloge verwenden.
Provider-Zuordnungen (Aufteilung der Anbieter auf die Oberflächen)
Google
Oberflächen für Bild, Video, Musik, Batch-TTS, Batch-STT, Backend-Echtzeit-Sprache und
Medienverständnis.
OpenAI
OpenAI
Oberflächen für Bild, Video, Batch-TTS, Batch-STT, Voice-Call-Streaming-STT, Backend-
Echtzeit-Sprache und Speicher-Embeddings.
DeepInfra
DeepInfra
Oberflächen für Chat-/Modell-Routing, Bilderzeugung/-bearbeitung, Text-zu-Video, Batch-TTS,
Batch-STT, Medienverständnis für Bilder und Speicher-Embeddings.
DeepInfra stellt außerdem Re-Ranking, Klassifizierung, Objekterkennung und
andere native Modelltypen bereit; OpenClaw verfügt noch über keinen Provider-Vertrag für diese
Kategorien, daher registriert dieses Plugin sie nicht.
xAI
xAI
Bild, Video, Suche, Codeausführung, Batch-TTS, Batch-STT und Voice-
Call-Streaming-STT. Echtzeit-Sprache von xAI ist eine Upstream-Funktion, wird jedoch
erst in OpenClaw registriert, wenn der gemeinsame Vertrag für Echtzeit-Sprache sie
abbilden kann.