realtime natif du fournisseur, stt-tts local ou en streaming,
et transcription pour la capture vocale en observation seule. Ces modes
partagent les catalogues de fournisseurs, les enveloppes d’événements et la sémantique d’annulation avec
la téléphonie, les réunions, le temps réel dans le navigateur et les clients natifs de conversation par appui.
Fonctionnalités
Génération d’images
Créez et modifiez des images à partir d’instructions textuelles ou d’images de référence via
image_generate. Asynchrone dans les sessions de discussion — s’exécute en arrière-plan et
publie le résultat lorsqu’il est prêt.Génération de vidéos
Conversion de texte en vidéo, d’image en vidéo et de vidéo en vidéo via
video_generate.
Asynchrone — s’exécute en arrière-plan et publie le résultat lorsqu’il est prêt.Génération de musique
Générez de la musique ou des pistes audio via
music_generate. Asynchrone dans les sessions
de discussion, selon le cycle de vie partagé des tâches de génération multimédia.Synthèse vocale
Convertissez les réponses sortantes en audio parlé via l’outil
tts et la configuration
messages.tts. Synchrone.Compréhension des médias
Résumez les images, les contenus audio et les vidéos entrants à l’aide de fournisseurs de modèles
dotés de capacités visuelles et de plugins dédiés à la compréhension des médias.
Reconnaissance vocale
Transcrivez les messages vocaux entrants au moyen de fournisseurs de STT par lots ou de STT
en streaming pour Voice Call.
Matrice des fonctionnalités des fournisseurs
Ce tableau couvre les plugins dédiés à la génération multimédia, à la TTS et à la STT. De nombreux
fournisseurs de modèles de discussion (Anthropic, Google, OpenAI et d’autres) comprennent également
les médias entrants au moyen de leur modèle de réponse ; consultez la liste complète des fournisseurs dans
Compréhension des médias.
Voix en temps réel désigne ici le temps réel bidirectionnel natif du fournisseur (mode
realtime de Talk, par exemple Gemini Live ou l’API OpenAI Realtime) — seuls Google
et OpenAI l’enregistrent actuellement. Deepgram, ElevenLabs, Mistral, OpenAI et xAI
enregistrent séparément la STT en streaming de Voice Call (audio vers texte unidirectionnel) ; consultez
Reconnaissance vocale et Voice Call ci-dessous.
La voix en temps réel de xAI est une fonctionnalité en amont, mais elle n’est pas enregistrée dans
OpenClaw tant que le contrat partagé de voix en temps réel ne peut pas la représenter.Asynchrone ou synchrone
Pour les outils asynchrones, OpenClaw soumet la requête au fournisseur, renvoie immédiatement un
identifiant de tâche et suit le travail dans le registre des tâches. L’agent continue
de répondre aux autres messages pendant l’exécution du travail. Lorsque le fournisseur termine,
OpenClaw réveille l’agent avec les chemins des médias générés afin qu’il puisse en informer
l’utilisateur au moyen du mode normal de réponse visible de la session : remise automatique de la réponse
finale lorsqu’elle est configurée, ou
message(action="send") lorsque la session nécessite
l’outil de messagerie. Si la session du demandeur est inactive ou si son réveil actif
échoue, et que certains médias générés sont toujours absents de la réponse d’achèvement,
OpenClaw envoie directement, de manière idempotente, uniquement les médias manquants. Les médias
déjà remis par la réponse d’achèvement ne sont pas publiés à nouveau.
Reconnaissance vocale et Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio et xAI peuvent tous transcrire l’audio entrant au moyen du chemin par lotstools.media.audio lorsqu’ils sont configurés. Les plugins de canal qui préanalysent une
note vocale pour le filtrage des mentions ou l’analyse des commandes marquent la pièce jointe transcrite
dans le contexte entrant, afin que le passage partagé de compréhension des médias
réutilise cette transcription au lieu d’effectuer un second appel STT pour le même
contenu audio.
Deepgram, ElevenLabs, Mistral, OpenAI et xAI enregistrent également des fournisseurs de STT
en streaming pour Voice Call, afin que l’audio téléphonique en direct puisse être transmis au fournisseur
sélectionné sans attendre la fin d’un enregistrement.
Pour les conversations en direct avec les utilisateurs, privilégiez le mode Talk. Les pièces jointes audio
par lots restent sur le chemin multimédia ; le temps réel dans le navigateur, la conversation native par appui,
la téléphonie et l’audio des réunions doivent utiliser les événements Talk et les catalogues limités à la session
renvoyés par le Gateway.
Correspondances des fournisseurs (répartition des éditeurs entre les surfaces)
Google
Surfaces d’image, de vidéo, de musique, de TTS par lots, de STT par lots, de voix en temps réel côté serveur
et de compréhension des médias.
OpenAI
OpenAI
Surfaces d’image, de vidéo, de TTS par lots, de STT par lots, de STT en streaming pour Voice Call, de voix
en temps réel côté serveur et d’intégration vectorielle de la mémoire.
DeepInfra
DeepInfra
Surfaces de routage des discussions et des modèles, de génération et de modification d’images, de conversion de texte en vidéo,
de TTS par lots, de STT par lots, de compréhension des médias visuels et d’intégration vectorielle de la mémoire.
DeepInfra expose également le reclassement, la classification, la détection d’objets et
d’autres types de modèles natifs ; OpenClaw ne dispose pas encore de contrat de fournisseur pour ces
catégories, ce plugin ne les enregistre donc pas.
xAI
xAI
Image, vidéo, recherche, exécution de code, TTS par lots, STT par lots et STT en streaming pour Voice
Call. La voix en temps réel de xAI est une fonctionnalité en amont, mais elle
n’est pas enregistrée dans OpenClaw tant que le contrat partagé de voix en temps réel ne peut pas
la représenter.