Skip to main content
OpenClaw generiert Bilder, Videos und Musik, versteht eingehende Medien (Bilder, Audio, Video) und spricht Antworten mithilfe von Text-to-Speech laut aus. Alle Medienfunktionen werden durch Tools gesteuert: Der Agent entscheidet anhand der Konversation, wann sie verwendet werden, und jedes Tool wird nur angezeigt, wenn mindestens ein unterstützender Provider konfiguriert ist. Live-Sprache verwendet den Talk-Sitzungsvertrag anstelle des Medien-Tool-Pfads für Einzelvorgänge. Talk verfügt über drei Modi: Provider-natives realtime, lokales oder streamendes stt-tts und transcription für die reine Beobachtung der Spracherfassung. Diese Modi verwenden dieselben Provider-Kataloge, Ereignis-Umschläge und Abbruchsemantiken wie Telefonie, Besprechungen, Browser-Echtzeitkommunikation und native Push-to-Talk-Clients.

Funktionen

Bilderzeugung

Erstellen und bearbeiten Sie Bilder anhand von Text-Prompts oder Referenzbildern über image_generate. In Chatsitzungen asynchron — wird im Hintergrund ausgeführt und veröffentlicht das Ergebnis, sobald es bereit ist.

Videoerzeugung

Text-zu-Video, Bild-zu-Video und Video-zu-Video über video_generate. Asynchron — wird im Hintergrund ausgeführt und veröffentlicht das Ergebnis, sobald es bereit ist.

Musikerzeugung

Generieren Sie Musik oder Audiospuren über music_generate. In Chatsitzungen asynchron im gemeinsamen Task-Lebenszyklus für die Medienerzeugung.

Text-to-Speech

Wandeln Sie ausgehende Antworten über das Tool tts und die Konfiguration tts in gesprochene Audiodaten um. Synchron.

Medienverständnis

Fassen Sie eingehende Bilder, Audio- und Videodaten mithilfe visionsfähiger Modell-Provider und spezieller Plugins für das Medienverständnis zusammen.

Speech-to-Text

Transkribieren Sie eingehende Sprachnachrichten über Batch-STT oder Streaming-STT-Provider für Voice Call.

Provider-Funktionsmatrix

Diese Tabelle behandelt die speziellen Plugins für Medienerzeugung, TTS und STT. Viele Chatmodell-Provider (Anthropic, Google, OpenAI und andere) verstehen außerdem eingehende Medien über ihr Antwortmodell; die vollständige Provider-Liste finden Sie unter Medienverständnis.
Echtzeit-Sprache bezeichnet hier die Provider-native bidirektionale Echtzeitkommunikation (Talk- Modus realtime, z. B. Gemini Live oder die OpenAI Realtime API) — derzeit registrieren sie nur Google und OpenAI. Deepgram, ElevenLabs, Mistral, OpenAI und xAI registrieren separat Voice-Call-Streaming-STT (unidirektionales Audio-zu-Text); siehe Speech-to-Text und Voice Call weiter unten. Echtzeit-Sprache von xAI ist eine Upstream-Funktion, wird jedoch erst in OpenClaw registriert, wenn der gemeinsame Vertrag für Echtzeit-Sprache sie abbilden kann.

Asynchron im Vergleich zu synchron

Bei asynchronen Tools übermittelt OpenClaw die Anfrage an den Provider, gibt sofort eine Task-ID zurück und verfolgt den Auftrag im Task-Verzeichnis. Der Agent beantwortet weiterhin andere Nachrichten, während der Auftrag ausgeführt wird. Sobald der Provider fertig ist, weckt OpenClaw den Agenten mit den Pfaden der generierten Medien auf, damit er den Benutzer über den normalen sichtbaren Antwortmodus der Sitzung informieren kann: automatische Zustellung der abschließenden Antwort, sofern konfiguriert, oder message(action="send"), wenn die Sitzung das Nachrichten-Tool erfordert. Wenn die anfordernde Sitzung inaktiv ist oder ihr aktiver Weckvorgang fehlschlägt und einige generierte Medien noch in der Abschlussantwort fehlen, sendet OpenClaw einen idempotenten direkten Fallback, der nur die fehlenden Medien enthält. Medien, die bereits durch die Abschlussantwort zugestellt wurden, werden nicht erneut veröffentlicht.

Speech-to-Text und Voice Call

Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio und xAI können bei entsprechender Konfiguration eingehende Audiodaten über den Batch- Pfad tools.media.audio transkribieren. Channel-Plugins, die eine Sprachnachricht vorab auf Erwähnungsfilterung oder Befehlsanalyse prüfen, markieren den transkribierten Anhang im eingehenden Kontext, sodass der gemeinsame Durchlauf für das Medienverständnis dieses Transkript wiederverwendet, anstatt für dieselben Audiodaten einen zweiten STT-Aufruf durchzuführen. Deepgram, ElevenLabs, Mistral, OpenAI und xAI registrieren außerdem Streaming-STT-Provider für Voice Call, sodass Live-Telefonaudio an den ausgewählten Provider weitergeleitet werden kann, ohne auf eine abgeschlossene Aufnahme zu warten. Für Live-Unterhaltungen mit Benutzern sollte der Talk-Modus bevorzugt werden. Batch-Audioanhänge bleiben auf dem Medienpfad; Browser-Echtzeitkommunikation, natives Push-to-Talk, Telefonie und Besprechungsaudio sollten Talk-Ereignisse und die vom Gateway zurückgegebenen sitzungsbezogenen Kataloge verwenden.

Provider-Zuordnungen (Aufteilung der Anbieter auf die Oberflächen)

Oberflächen für Bild, Video, Musik, Batch-TTS, Batch-STT, Backend-Echtzeit-Sprache und Medienverständnis.
Oberflächen für Bild, Video, Batch-TTS, Batch-STT, Voice-Call-Streaming-STT, Backend- Echtzeit-Sprache und Speicher-Embeddings.
Oberflächen für Chat-/Modell-Routing, Bilderzeugung/-bearbeitung, Text-zu-Video, Batch-TTS, Batch-STT, Medienverständnis für Bilder und Speicher-Embeddings. DeepInfra stellt außerdem Re-Ranking, Klassifizierung, Objekterkennung und andere native Modelltypen bereit; OpenClaw verfügt noch über keinen Provider-Vertrag für diese Kategorien, daher registriert dieses Plugin sie nicht.
Bild, Video, Suche, Codeausführung, Batch-TTS, Batch-STT und Voice- Call-Streaming-STT. Echtzeit-Sprache von xAI ist eine Upstream-Funktion, wird jedoch erst in OpenClaw registriert, wenn der gemeinsame Vertrag für Echtzeit-Sprache sie abbilden kann.

Verwandte Themen