tools.media.audio을 통한 수신 오디오/음성 메모
전사와 plugins.entries.voice-call.config.streaming을 통한 음성 통화 스트리밍 STT에 이를
사용합니다.
일괄 전사는 전체 오디오 파일을 Deepgram에 업로드하고
전사문을 응답 파이프라인에 삽입합니다({{Transcript}} + [Audio] 블록).
음성 통화 스트리밍은 실시간 G.711 u-law 프레임을 Deepgram의 WebSocket
listen 엔드포인트로 전달하고, Deepgram이 반환하는 대로 부분/최종 전사문을
내보냅니다.
시작하기
1
API 키 설정
2
오디오 제공자 활성화
3
음성 메모 전송
연결된 채널을 통해 오디오 메시지를 전송하십시오. OpenClaw은 Deepgram을 통해 이를 전사하고
전사문을 응답 파이프라인에 삽입합니다.
구성 옵션
providerOptions.deepgram은 추가 쿼리 매개변수를 Deepgram
/listen 요청에 직접 병합하므로 Deepgram에서 지원하는 모든 매개변수 이름을 사용할 수 있습니다
(예: detect_language, punctuate, smart_format).
- 언어 힌트 사용
- Deepgram 옵션 사용
음성 통화 스트리밍 STT
번들로 제공되는deepgram Plugin은 음성 통화 Plugin용 실시간 전사 제공자도
등록합니다.
baseUrl을 기본 경로를 포함하되 /listen은 제외한 엔드포인트 루트로 설정하십시오.
실시간 엔드포인트는 http://, https://, ws://, wss://을 허용합니다. HTTP는
WS로, HTTPS는 WSS로 매핑되며 명시적인 WebSocket 스킴은 변경되지 않습니다.
잘못된 형식의 URL과 기타 스킴은 세션 설정 중 실패합니다.
음성 통화는 전화 통신 오디오를 8 kHz G.711 u-law 형식으로 수신합니다. Deepgram
스트리밍 제공자의 기본값은
encoding: "mulaw" 및 sampleRate: 8000이므로
Twilio 미디어 프레임을 직접 전달할 수 있습니다.참고 사항
인증
인증
인증은 표준 제공자 인증 순서를 따릅니다.
DEEPGRAM_API_KEY이
가장 간단한 방법입니다.프록시 및 사용자 지정 엔드포인트
프록시 및 사용자 지정 엔드포인트
프록시를 사용할 때는
tools.media.audio.baseUrl 및
tools.media.audio.headers을 사용하여 엔드포인트나 헤더를 재정의하십시오.출력 동작
출력 동작
출력은 다른 제공자와 동일한 오디오 규칙(크기 제한, 시간 초과,
전사문 삽입)을 따릅니다.
관련 문서
미디어 도구
오디오, 이미지 및 동영상 처리 파이프라인 개요입니다.
구성
미디어 도구 설정을 포함한 전체 구성 참조입니다.
문제 해결
일반적인 문제와 디버깅 단계입니다.
FAQ
OpenClaw 설정에 관해 자주 묻는 질문입니다.