realtime bawaan penyedia, stt-tts lokal atau streaming,
dan transcription untuk menangkap ucapan dalam mode pengamatan saja. Mode-mode tersebut
berbagi katalog penyedia, amplop peristiwa, dan semantik pembatalan dengan
telepon, rapat, waktu nyata peramban, dan klien tekan-untuk-bicara bawaan.
Kemampuan
Pembuatan gambar
Buat dan edit gambar dari perintah teks atau gambar referensi melalui
image_generate. Asinkron dalam sesi obrolan — berjalan di latar belakang dan
mengirimkan hasil saat siap.Pembuatan video
Teks-ke-video, gambar-ke-video, dan video-ke-video melalui
video_generate.
Asinkron — berjalan di latar belakang dan mengirimkan hasil saat siap.Pembuatan musik
Hasilkan musik atau trek audio melalui
music_generate. Asinkron dalam sesi
obrolan pada siklus hidup tugas pembuatan media bersama.Teks-ke-ucapan
Ubah balasan keluar menjadi audio ucapan melalui alat
tts beserta
konfigurasi messages.tts. Sinkron.Pemahaman media
Ringkas gambar, audio, dan video masuk menggunakan penyedia model
berkemampuan visi dan plugin khusus pemahaman media.
Ucapan-ke-teks
Transkripsikan pesan suara masuk melalui STT batch atau penyedia STT
streaming Panggilan Suara.
Matriks kemampuan penyedia
Tabel ini mencakup plugin khusus pembuatan media, TTS, dan STT. Banyak
penyedia model obrolan (Anthropic, Google, OpenAI, dan lainnya) juga memahami
media masuk melalui model balasan mereka; lihat daftar lengkap penyedia di
Pemahaman media.
Suara waktu nyata di sini berarti komunikasi waktu nyata dua arah bawaan penyedia (mode
realtime Talk, misalnya Gemini Live atau OpenAI Realtime API) — saat ini hanya Google
dan OpenAI yang mendaftarkannya. Deepgram, ElevenLabs, Mistral, OpenAI, dan xAI
secara terpisah mendaftarkan STT streaming Panggilan Suara (audio-ke-teks satu arah); lihat
Ucapan-ke-teks dan Panggilan Suara di bawah.
Suara waktu nyata xAI adalah kemampuan hulu, tetapi belum didaftarkan di
OpenClaw hingga kontrak suara waktu nyata bersama dapat merepresentasikannya.Asinkron dibandingkan sinkron
Untuk alat asinkron, OpenClaw mengirimkan permintaan kepada penyedia, segera mengembalikan
ID tugas, dan melacak pekerjaan tersebut dalam buku besar tugas. Agen terus
merespons pesan lain selama pekerjaan berjalan. Ketika penyedia selesai,
OpenClaw membangunkan agen dengan jalur media yang dihasilkan agar agen dapat memberi tahu
pengguna melalui mode balasan terlihat normal sesi: pengiriman balasan akhir otomatis
jika dikonfigurasi, atau
message(action="send") jika sesi mewajibkan
alat pesan. Jika sesi peminta tidak aktif atau pembangkitan aktifnya
gagal, dan sebagian media yang dihasilkan masih tidak ada dalam balasan penyelesaian,
OpenClaw mengirimkan fallback langsung idempoten yang hanya berisi media yang belum terkirim. Media
yang telah dikirimkan oleh balasan penyelesaian tidak dikirim lagi.
Ucapan-ke-teks dan Panggilan Suara
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio, dan xAI semuanya dapat mentranskripsikan audio masuk melalui jalur batchtools.media.audio jika dikonfigurasi. Plugin saluran yang melakukan pemeriksaan awal terhadap
catatan suara untuk penyaringan penyebutan atau penguraian perintah menandai lampiran yang telah
ditranskripsikan pada konteks masuk, sehingga proses pemahaman media bersama
menggunakan kembali transkrip tersebut alih-alih melakukan panggilan STT kedua untuk audio yang sama.
Deepgram, ElevenLabs, Mistral, OpenAI, dan xAI juga mendaftarkan penyedia STT
streaming Panggilan Suara, sehingga audio telepon langsung dapat diteruskan ke vendor yang dipilih
tanpa menunggu rekaman selesai.
Untuk percakapan pengguna secara langsung, utamakan mode Talk. Lampiran audio
batch tetap berada pada jalur media; waktu nyata peramban, tekan-untuk-bicara bawaan,
telepon, dan audio rapat harus menggunakan peristiwa Talk dan katalog dalam cakupan sesi
yang dikembalikan oleh Gateway.
Pemetaan penyedia (cara vendor dibagi di berbagai permukaan)
Google
Permukaan gambar, video, musik, TTS batch, STT batch, suara waktu nyata backend, dan
pemahaman media.
OpenAI
OpenAI
Permukaan gambar, video, TTS batch, STT batch, STT streaming Panggilan Suara, suara
waktu nyata backend, dan embedding memori.
DeepInfra
DeepInfra
Permukaan perutean obrolan/model, pembuatan/penyuntingan gambar, teks-ke-video, TTS batch,
STT batch, pemahaman media gambar, dan embedding memori.
DeepInfra juga menyediakan pemeringkatan ulang, klasifikasi, deteksi objek, dan
jenis model bawaan lainnya; OpenClaw belum memiliki kontrak penyedia untuk
kategori tersebut, sehingga plugin ini tidak mendaftarkannya.
xAI
xAI
Gambar, video, pencarian, eksekusi kode, TTS batch, STT batch, dan STT
streaming Panggilan Suara. Suara waktu nyata xAI adalah kemampuan hulu, tetapi
belum didaftarkan di OpenClaw hingga kontrak suara waktu nyata bersama dapat
merepresentasikannya.