tools.media.audio oraz do strumieniowego STT połączeń głosowych
za pośrednictwem plugins.entries.voice-call.config.streaming.
Transkrypcja wsadowa przesyła kompletny plik audio do Deepgram i wprowadza
transkrypcję do potoku odpowiedzi (blok {{Transcript}} + [Audio]).
Strumieniowanie połączeń głosowych przekazuje na żywo ramki G.711 u-law przez punkt końcowy
WebSocket listen Deepgram i emituje częściowe/końcowe transkrypcje w miarę ich
zwracania przez Deepgram.
Pierwsze kroki
1
Ustaw klucz API
2
Włącz dostawcę audio
3
Wyślij notatkę głosową
Wyślij wiadomość audio przez dowolny połączony kanał. OpenClaw transkrybuje ją
za pomocą Deepgram i wprowadza transkrypcję do potoku odpowiedzi.
Opcje konfiguracji
providerOptions.deepgram scala dodatkowe parametry zapytania bezpośrednio z
żądaniem /listen Deepgram, dlatego działa każda nazwa parametru obsługiwana przez Deepgram
(na przykład detect_language, punctuate, smart_format):
- Ze wskazówką dotyczącą języka
- Z opcjami Deepgram
Strumieniowe STT połączeń głosowych
Dołączony Plugindeepgram rejestruje również dostawcę transkrypcji w czasie rzeczywistym
dla Pluginu połączeń głosowych.
baseUrl na katalog główny punktu końcowego, uwzględniając ścieżkę bazową, ale bez /listen.
Punkty końcowe czasu rzeczywistego akceptują http://, https://, ws:// i wss://. HTTP
jest mapowany na WS, HTTPS na WSS, a jawnie określone schematy WebSocket pozostają bez zmian.
Nieprawidłowe adresy URL i inne schematy powodują błąd podczas konfigurowania sesji.
Połączenia głosowe odbierają dźwięk telefoniczny w formacie 8 kHz G.711 u-law. Dostawca
strumieniowy Deepgram domyślnie używa
encoding: "mulaw" i sampleRate: 8000, dzięki czemu
ramki multimedialne Twilio można przekazywać bezpośrednio.Uwagi
Uwierzytelnianie
Uwierzytelnianie
Uwierzytelnianie przebiega zgodnie ze standardową kolejnością uwierzytelniania dostawców.
DEEPGRAM_API_KEY to
najprostsza ścieżka.Serwer proxy i niestandardowe punkty końcowe
Serwer proxy i niestandardowe punkty końcowe
Podczas korzystania z serwera proxy nadpisz punkty końcowe lub nagłówki za pomocą
tools.media.audio.baseUrl i
tools.media.audio.headers.Sposób generowania danych wyjściowych
Sposób generowania danych wyjściowych
Dane wyjściowe podlegają tym samym regułom dotyczącym audio co u innych dostawców (limity rozmiaru, limity czasu,
wprowadzanie transkrypcji).
Powiązane
Narzędzia multimedialne
Omówienie potoku przetwarzania dźwięku, obrazów i filmów.
Konfiguracja
Pełna dokumentacja konfiguracji, w tym ustawień narzędzi multimedialnych.
Rozwiązywanie problemów
Typowe problemy i kroki diagnostyczne.
Często zadawane pytania
Często zadawane pytania dotyczące konfiguracji OpenClaw.