realtime nativo del proveedor,
stt-tts local o por streaming y transcription para capturar voz únicamente
con fines de observación. Esos modos comparten catálogos de proveedores, envoltorios de eventos
y semántica de cancelación con la telefonía, las reuniones, el tiempo real del navegador
y los clientes nativos de pulsar para hablar.
Capacidades
Generación de imágenes
Crea y edita imágenes a partir de instrucciones de texto o imágenes de referencia mediante
image_generate. Asíncrona en las sesiones de chat: se ejecuta en segundo plano y
publica el resultado cuando está listo.Generación de vídeo
Generación de texto a vídeo, de imagen a vídeo y de vídeo a vídeo mediante
video_generate.
Asíncrona: se ejecuta en segundo plano y publica el resultado cuando está listo.Generación de música
Genera música o pistas de audio mediante
music_generate. Asíncrona en las sesiones
de chat, con el ciclo de vida compartido de las tareas de generación multimedia.Texto a voz
Convierte las respuestas salientes en audio hablado mediante la herramienta
tts y la configuración tts. Síncrona.Comprensión multimedia
Resume imágenes, audio y vídeo entrantes mediante proveedores de modelos
con capacidad de visión y plugins específicos de comprensión multimedia.
Voz a texto
Transcribe mensajes de voz entrantes mediante STT por lotes o proveedores
de STT por streaming de Voice Call.
Matriz de capacidades de proveedores
Esta tabla abarca los plugins específicos de generación multimedia, TTS y STT. Muchos
proveedores de modelos de chat (Anthropic, Google, OpenAI y otros) también comprenden
contenido multimedia entrante mediante su modelo de respuesta; consulte la lista completa de proveedores en
Comprensión multimedia.
Voz en tiempo real significa aquí tiempo real bidireccional nativo del proveedor (modo
realtime de Talk, por ejemplo, Gemini Live o la API Realtime de OpenAI); actualmente solo Google
y OpenAI lo registran. Deepgram, ElevenLabs, Mistral, OpenAI y xAI
registran por separado STT por streaming de Voice Call (audio a texto unidireccional); consulte
Voz a texto y Voice Call a continuación.
La voz en tiempo real de xAI es una capacidad del servicio de origen, pero no se registra en
OpenClaw hasta que el contrato compartido de voz en tiempo real pueda representarla.Asíncrono frente a síncrono
Para las herramientas asíncronas, OpenClaw envía la solicitud al proveedor, devuelve
inmediatamente un identificador de tarea y realiza el seguimiento del trabajo en el registro de tareas. El agente continúa
respondiendo a otros mensajes mientras se ejecuta el trabajo. Cuando el proveedor finaliza,
OpenClaw activa al agente con las rutas del contenido multimedia generado para que pueda informar al
usuario mediante el modo normal de respuesta visible de la sesión: entrega automática de la respuesta final
cuando está configurada, o
message(action="send") cuando la sesión requiere
la herramienta de mensajes. Si la sesión solicitante está inactiva o falla su activación,
y todavía falta contenido multimedia generado en la respuesta de finalización,
OpenClaw envía una alternativa directa idempotente que contiene únicamente el contenido multimedia faltante. El contenido multimedia
ya entregado mediante la respuesta de finalización no se vuelve a publicar.
Voz a texto y Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio y xAI pueden transcribir audio entrante mediante la ruta por lotestools.media.audio cuando están configurados. Los plugins de canales que comprueban previamente una
nota de voz para el filtrado de menciones o el análisis de comandos marcan el archivo adjunto
transcrito en el contexto entrante, de modo que el paso compartido de comprensión multimedia
reutilice esa transcripción en lugar de realizar una segunda llamada STT para el mismo
audio.
Deepgram, ElevenLabs, Mistral, OpenAI y xAI también registran proveedores
de STT por streaming de Voice Call, por lo que el audio telefónico en directo puede reenviarse al proveedor
seleccionado sin esperar a que se complete una grabación.
Para conversaciones en directo con usuarios, se recomienda el modo Talk. Los archivos adjuntos de audio
por lotes permanecen en la ruta multimedia; el tiempo real del navegador, la función nativa de pulsar para hablar,
la telefonía y el audio de reuniones deben utilizar eventos de Talk y los catálogos
con ámbito de sesión devueltos por el Gateway.
Asignaciones de proveedores (cómo se distribuyen entre las superficies)
Google
Superficies de imagen, vídeo, música, TTS por lotes, STT por lotes, voz en tiempo real del backend
y comprensión multimedia.
OpenAI
OpenAI
Superficies de imagen, vídeo, TTS por lotes, STT por lotes, STT por streaming de Voice Call, voz en
tiempo real del backend e incrustaciones de memoria.
DeepInfra
DeepInfra
Superficies de enrutamiento de chat/modelos, generación y edición de imágenes, texto a vídeo, TTS por lotes,
STT por lotes, comprensión multimedia de imágenes e incrustaciones de memoria.
DeepInfra también ofrece reclasificación, clasificación, detección de objetos y
otros tipos de modelos nativos; OpenClaw aún no dispone de un contrato de proveedor para esas
categorías, por lo que este plugin no las registra.
xAI
xAI
Imagen, vídeo, búsqueda, ejecución de código, TTS por lotes, STT por lotes y STT por streaming
de Voice Call. La voz en tiempo real de xAI es una capacidad del servicio de origen, pero
no se registra en OpenClaw hasta que el contrato compartido de voz en tiempo real pueda
representarla.