Skip to main content
Deepgram은 음성을 텍스트로 변환하는 API입니다. OpenClaw은 tools.media.audio을 통한 수신 오디오/음성 메모 전사와 plugins.entries.voice-call.config.streaming을 통한 음성 통화 스트리밍 STT에 이를 사용합니다. 일괄 전사는 전체 오디오 파일을 Deepgram에 업로드하고 전사문을 응답 파이프라인에 삽입합니다({{Transcript}} + [Audio] 블록). 음성 통화 스트리밍은 실시간 G.711 u-law 프레임을 Deepgram의 WebSocket listen 엔드포인트로 전달하고, Deepgram이 반환하는 대로 부분/최종 전사문을 내보냅니다.

시작하기

1

API 키 설정

2

오디오 제공자 활성화

3

음성 메모 전송

연결된 채널을 통해 오디오 메시지를 전송하십시오. OpenClaw은 Deepgram을 통해 이를 전사하고 전사문을 응답 파이프라인에 삽입합니다.

구성 옵션

providerOptions.deepgram은 추가 쿼리 매개변수를 Deepgram /listen 요청에 직접 병합하므로 Deepgram에서 지원하는 모든 매개변수 이름을 사용할 수 있습니다 (예: detect_language, punctuate, smart_format).

음성 통화 스트리밍 STT

번들로 제공되는 deepgram Plugin은 음성 통화 Plugin용 실시간 전사 제공자도 등록합니다.
Deepgram 사용자 지정 엔드포인트의 경우 baseUrl을 기본 경로를 포함하되 /listen은 제외한 엔드포인트 루트로 설정하십시오. 실시간 엔드포인트는 http://, https://, ws://, wss://을 허용합니다. HTTP는 WS로, HTTPS는 WSS로 매핑되며 명시적인 WebSocket 스킴은 변경되지 않습니다. 잘못된 형식의 URL과 기타 스킴은 세션 설정 중 실패합니다.
음성 통화는 전화 통신 오디오를 8 kHz G.711 u-law 형식으로 수신합니다. Deepgram 스트리밍 제공자의 기본값은 encoding: "mulaw"sampleRate: 8000이므로 Twilio 미디어 프레임을 직접 전달할 수 있습니다.

참고 사항

인증은 표준 제공자 인증 순서를 따릅니다. DEEPGRAM_API_KEY이 가장 간단한 방법입니다.
프록시를 사용할 때는 tools.media.audio.baseUrltools.media.audio.headers을 사용하여 엔드포인트나 헤더를 재정의하십시오.
출력은 다른 제공자와 동일한 오디오 규칙(크기 제한, 시간 초과, 전사문 삽입)을 따릅니다.

관련 문서

미디어 도구

오디오, 이미지 및 동영상 처리 파이프라인 개요입니다.

구성

미디어 도구 설정을 포함한 전체 구성 참조입니다.

문제 해결

일반적인 문제와 디버깅 단계입니다.

FAQ

OpenClaw 설정에 관해 자주 묻는 질문입니다.