tools.media.audio y para
la conversión de voz a texto (STT) en streaming de Voice Call mediante
plugins.entries.voice-call.config.streaming.
La transcripción por lotes carga el archivo de audio completo en Deepgram e inserta
la transcripción en el pipeline de respuestas (bloque {{Transcript}} + [Audio]).
El streaming de Voice Call reenvía en tiempo real tramas G.711 u-law mediante el endpoint
WebSocket listen de Deepgram y emite transcripciones parciales y finales a
medida que Deepgram las devuelve.
Primeros pasos
1
Establecer la clave de API
2
Habilitar el proveedor de audio
3
Enviar una nota de voz
Envíe un mensaje de audio mediante cualquier canal conectado. OpenClaw lo
transcribe mediante Deepgram e inserta la transcripción en el pipeline de respuestas.
Opciones de configuración
providerOptions.deepgram combina parámetros de consulta adicionales directamente con la
solicitud /listen de Deepgram, por lo que funciona cualquier nombre de
parámetro compatible con Deepgram (por ejemplo, detect_language,
punctuate, smart_format):
- Con indicación de idioma
- Con opciones de Deepgram
STT en streaming de Voice Call
El plugindeepgram incluido también registra un proveedor de transcripción
en tiempo real para el plugin Voice Call.
baseUrl en la raíz del endpoint, incluida cualquier ruta base,
pero no /listen. Los endpoints en tiempo real aceptan
http://, https://, ws:// y wss://.
HTTP se asigna a WS, HTTPS se asigna a WSS y los esquemas WebSocket explícitos
permanecen sin cambios. Las URL con formato incorrecto y otros esquemas provocan
un fallo durante la configuración de la sesión.
Voice Call recibe audio de telefonía como G.711 u-law a 8 kHz. El proveedor de
streaming de Deepgram utiliza de forma predeterminada
encoding: "mulaw" y
sampleRate: 8000, por lo que las tramas multimedia de Twilio pueden reenviarse
directamente.Notas
Autenticación
Autenticación
La autenticación sigue el orden estándar de autenticación de proveedores.
DEEPGRAM_API_KEY es la opción más sencilla.Proxy y endpoints personalizados
Proxy y endpoints personalizados
Sobrescriba los endpoints o encabezados en la entrada
tools.media.models[] de
Deepgram cuando utilice un proxy.Comportamiento de la salida
Comportamiento de la salida
La salida sigue las mismas reglas de audio que los demás proveedores (límites
de tamaño, tiempos de espera e inserción de la transcripción).
Contenido relacionado
Herramientas multimedia
Descripción general del pipeline de procesamiento de audio, imágenes y vídeo.
Configuración
Referencia completa de configuración, incluidos los ajustes de las herramientas multimedia.
Solución de problemas
Problemas habituales y pasos de depuración.
Preguntas frecuentes
Preguntas frecuentes sobre la configuración de OpenClaw.