realtime, 로컬 또는 스트리밍
stt-tts, 관찰 전용 음성 캡처를 위한 transcription의 세 가지 모드가 있습니다. 이러한 모드는
전화 통신, 회의, 브라우저 실시간 통신, 네이티브 푸시투토크 클라이언트와
제공자 카탈로그, 이벤트 엔벌로프, 취소 의미 체계를 공유합니다.
기능
이미지 생성
image_generate를 통해 텍스트 프롬프트 또는 참조 이미지로 이미지를
생성하고 편집합니다. 채팅 세션에서는 비동기로 백그라운드에서 실행되며
준비되면 결과를 게시합니다.동영상 생성
video_generate를 통해 텍스트-동영상, 이미지-동영상, 동영상-동영상 변환을 수행합니다.
비동기로 백그라운드에서 실행되며 준비되면 결과를 게시합니다.음악 생성
music_generate를 통해 음악 또는 오디오 트랙을 생성합니다. 채팅
세션에서는 공유 미디어 생성 작업 수명 주기에 따라 비동기로 실행됩니다.텍스트 음성 변환
tts 도구와 messages.tts 구성을 통해 발신 응답을 음성 오디오로
변환합니다. 동기 방식입니다.미디어 이해
비전 기능을 지원하는 모델 제공자와 전용 미디어 이해 Plugin을 사용하여
수신 이미지, 오디오, 동영상을 요약합니다.
음성 텍스트 변환
배치 STT 또는 Voice Call 스트리밍 STT 제공자를 통해 수신 음성 메시지를
전사합니다.
제공자 기능 매트릭스
이 표는 전용 미디어 생성, TTS, STT Plugin을 다룹니다. 많은
채팅 모델 제공자(Anthropic, Google, OpenAI 등)도 응답 모델을 통해
수신 미디어를 이해합니다. 전체 제공자 목록은
미디어 이해를 참조하세요.
여기서 실시간 음성은 제공자 네이티브 양방향 실시간 통신(Talk
realtime 모드, 예: Gemini Live 또는 OpenAI Realtime API)을 의미하며, 현재는 Google과
OpenAI만 이를 등록합니다. Deepgram, ElevenLabs, Mistral, OpenAI, xAI는
별도로 Voice Call 스트리밍 STT(단방향 오디오-텍스트 변환)를 등록합니다. 아래의
음성 텍스트 변환 및 Voice Call을 참조하세요.
xAI 실시간 음성은 업스트림 기능이지만 공유 실시간 음성 계약이 이를
표현할 수 있을 때까지 OpenClaw에 등록되지 않습니다.비동기와 동기
비동기 도구의 경우 OpenClaw은 제공자에게 요청을 제출하고 즉시 작업
ID를 반환하며 작업 원장에서 작업을 추적합니다. 작업이 실행되는 동안 에이전트는
다른 메시지에 계속 응답합니다. 제공자의 처리가 완료되면
OpenClaw은 생성된 미디어 경로와 함께 에이전트를 깨워 세션의 일반적인 표시 응답 모드를 통해
사용자에게 알릴 수 있게 합니다. 구성된 경우 자동 최종 응답 전달을 사용하거나, 세션에서
메시지 도구가 필요한 경우
message(action="send")를 사용합니다. 요청자 세션이 비활성 상태이거나 활성 깨우기가
실패하고 생성된 미디어 일부가 완료 응답에서 여전히 누락된 경우,
OpenClaw은 누락된 미디어만 포함하는 멱등성 직접 대체 전송을 수행합니다. 완료 응답으로
이미 전달된 미디어는 다시 게시되지 않습니다.
음성 텍스트 변환 및 Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio, xAI는 모두 구성된 경우 배치tools.media.audio 경로를 통해 수신 오디오를 전사할 수 있습니다. 멘션 게이팅 또는 명령 구문 분석을 위해
음성 메모를 사전 검사하는 채널 Plugin은 수신 컨텍스트에서 전사된
첨부 파일을 표시하므로 공유 미디어 이해 단계가 동일한
오디오에 대해 두 번째 STT 호출을 수행하지 않고 해당 전사를 재사용합니다.
Deepgram, ElevenLabs, Mistral, OpenAI, xAI는 Voice Call
스트리밍 STT 제공자도 등록하므로 녹음이 완료될 때까지 기다리지 않고 실시간 전화 오디오를 선택한
공급업체로 전달할 수 있습니다.
실시간 사용자 대화에는 Talk 모드를 권장합니다. 배치 오디오
첨부 파일은 미디어 경로에 유지됩니다. 브라우저 실시간 통신, 네이티브 푸시투토크,
전화 통신, 회의 오디오는 Talk 이벤트와 Gateway가 반환하는 세션 범위
카탈로그를 사용해야 합니다.
제공자 매핑(공급업체 기능이 여러 영역에 배치되는 방식)
Google
이미지, 동영상, 음악, 배치 TTS, 배치 STT, 백엔드 실시간 음성,
미디어 이해 영역.
OpenAI
OpenAI
이미지, 동영상, 배치 TTS, 배치 STT, Voice Call 스트리밍 STT, 백엔드
실시간 음성, 메모리 임베딩 영역.
DeepInfra
DeepInfra
채팅/모델 라우팅, 이미지 생성/편집, 텍스트-동영상 변환, 배치 TTS,
배치 STT, 이미지 미디어 이해, 메모리 임베딩 영역.
DeepInfra는 재순위화, 분류, 객체 감지 및
기타 네이티브 모델 유형도 제공합니다. OpenClaw에는 아직 이러한
범주에 대한 제공자 계약이 없으므로 이 Plugin은 해당 기능을 등록하지 않습니다.
xAI
xAI
이미지, 동영상, 검색, 코드 실행, 배치 TTS, 배치 STT, Voice
Call 스트리밍 STT. xAI 실시간 음성은 업스트림 기능이지만 공유 실시간 음성 계약이
이를 표현할 수 있을 때까지 OpenClaw에 등록되지 않습니다.