Skip to main content
OpenClaw menghasilkan gambar, video, dan musik, memahami media masuk (gambar, audio, video), serta mengucapkan balasan dengan lantang menggunakan teks-ke-ucapan. Semua kemampuan media digerakkan oleh alat: agen memutuskan kapan menggunakannya berdasarkan percakapan, dan setiap alat hanya muncul jika setidaknya satu penyedia pendukung telah dikonfigurasi. Ucapan langsung menggunakan kontrak sesi Talk, bukan jalur alat media sekali jalan. Talk memiliki tiga mode: realtime bawaan penyedia, stt-tts lokal atau streaming, dan transcription untuk menangkap ucapan dalam mode pengamatan saja. Mode-mode tersebut berbagi katalog penyedia, amplop peristiwa, dan semantik pembatalan dengan telepon, rapat, waktu nyata peramban, dan klien tekan-untuk-bicara bawaan.

Kemampuan

Pembuatan gambar

Buat dan edit gambar dari perintah teks atau gambar referensi melalui image_generate. Asinkron dalam sesi obrolan — berjalan di latar belakang dan mengirimkan hasil saat siap.

Pembuatan video

Teks-ke-video, gambar-ke-video, dan video-ke-video melalui video_generate. Asinkron — berjalan di latar belakang dan mengirimkan hasil saat siap.

Pembuatan musik

Hasilkan musik atau trek audio melalui music_generate. Asinkron dalam sesi obrolan pada siklus hidup tugas pembuatan media bersama.

Teks-ke-ucapan

Ubah balasan keluar menjadi audio ucapan melalui alat tts beserta konfigurasi messages.tts. Sinkron.

Pemahaman media

Ringkas gambar, audio, dan video masuk menggunakan penyedia model berkemampuan visi dan plugin khusus pemahaman media.

Ucapan-ke-teks

Transkripsikan pesan suara masuk melalui STT batch atau penyedia STT streaming Panggilan Suara.

Matriks kemampuan penyedia

Tabel ini mencakup plugin khusus pembuatan media, TTS, dan STT. Banyak penyedia model obrolan (Anthropic, Google, OpenAI, dan lainnya) juga memahami media masuk melalui model balasan mereka; lihat daftar lengkap penyedia di Pemahaman media.
Suara waktu nyata di sini berarti komunikasi waktu nyata dua arah bawaan penyedia (mode realtime Talk, misalnya Gemini Live atau OpenAI Realtime API) — saat ini hanya Google dan OpenAI yang mendaftarkannya. Deepgram, ElevenLabs, Mistral, OpenAI, dan xAI secara terpisah mendaftarkan STT streaming Panggilan Suara (audio-ke-teks satu arah); lihat Ucapan-ke-teks dan Panggilan Suara di bawah. Suara waktu nyata xAI adalah kemampuan hulu, tetapi belum didaftarkan di OpenClaw hingga kontrak suara waktu nyata bersama dapat merepresentasikannya.

Asinkron dibandingkan sinkron

Untuk alat asinkron, OpenClaw mengirimkan permintaan kepada penyedia, segera mengembalikan ID tugas, dan melacak pekerjaan tersebut dalam buku besar tugas. Agen terus merespons pesan lain selama pekerjaan berjalan. Ketika penyedia selesai, OpenClaw membangunkan agen dengan jalur media yang dihasilkan agar agen dapat memberi tahu pengguna melalui mode balasan terlihat normal sesi: pengiriman balasan akhir otomatis jika dikonfigurasi, atau message(action="send") jika sesi mewajibkan alat pesan. Jika sesi peminta tidak aktif atau pembangkitan aktifnya gagal, dan sebagian media yang dihasilkan masih tidak ada dalam balasan penyelesaian, OpenClaw mengirimkan fallback langsung idempoten yang hanya berisi media yang belum terkirim. Media yang telah dikirimkan oleh balasan penyelesaian tidak dikirim lagi.

Ucapan-ke-teks dan Panggilan Suara

Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio, dan xAI semuanya dapat mentranskripsikan audio masuk melalui jalur batch tools.media.audio jika dikonfigurasi. Plugin saluran yang melakukan pemeriksaan awal terhadap catatan suara untuk penyaringan penyebutan atau penguraian perintah menandai lampiran yang telah ditranskripsikan pada konteks masuk, sehingga proses pemahaman media bersama menggunakan kembali transkrip tersebut alih-alih melakukan panggilan STT kedua untuk audio yang sama. Deepgram, ElevenLabs, Mistral, OpenAI, dan xAI juga mendaftarkan penyedia STT streaming Panggilan Suara, sehingga audio telepon langsung dapat diteruskan ke vendor yang dipilih tanpa menunggu rekaman selesai. Untuk percakapan pengguna secara langsung, utamakan mode Talk. Lampiran audio batch tetap berada pada jalur media; waktu nyata peramban, tekan-untuk-bicara bawaan, telepon, dan audio rapat harus menggunakan peristiwa Talk dan katalog dalam cakupan sesi yang dikembalikan oleh Gateway.

Pemetaan penyedia (cara vendor dibagi di berbagai permukaan)

Permukaan gambar, video, musik, TTS batch, STT batch, suara waktu nyata backend, dan pemahaman media.
Permukaan gambar, video, TTS batch, STT batch, STT streaming Panggilan Suara, suara waktu nyata backend, dan embedding memori.
Permukaan perutean obrolan/model, pembuatan/penyuntingan gambar, teks-ke-video, TTS batch, STT batch, pemahaman media gambar, dan embedding memori. DeepInfra juga menyediakan pemeringkatan ulang, klasifikasi, deteksi objek, dan jenis model bawaan lainnya; OpenClaw belum memiliki kontrak penyedia untuk kategori tersebut, sehingga plugin ini tidak mendaftarkannya.
Gambar, video, pencarian, eksekusi kode, TTS batch, STT batch, dan STT streaming Panggilan Suara. Suara waktu nyata xAI adalah kemampuan hulu, tetapi belum didaftarkan di OpenClaw hingga kontrak suara waktu nyata bersama dapat merepresentasikannya.

Terkait