realtime, yerel veya akışlı
stt-tts ve yalnızca gözlem amaçlı konuşma yakalama için transcription. Bu modlar
sağlayıcı kataloglarını, olay zarflarını ve iptal semantiğini telefon,
toplantı, tarayıcı gerçek zamanlı ve yerel bas-konuş istemcileriyle paylaşır.
Yetenekler
Görüntü oluşturma
image_generate aracılığıyla metin istemlerinden veya referans görüntülerden
görüntüler oluşturun ve düzenleyin. Sohbet oturumlarında eşzamansızdır — arka
planda çalışır ve hazır olduğunda sonucu gönderir.Video oluşturma
video_generate aracılığıyla metinden videoya, görüntüden videoya ve videodan
videoya dönüştürme. Eşzamansızdır — arka planda çalışır ve hazır olduğunda sonucu gönderir.Müzik oluşturma
music_generate aracılığıyla müzik veya ses parçaları oluşturun. Sohbet
oturumlarında, paylaşılan medya oluşturma görevi yaşam döngüsünde eşzamansızdır.Metinden konuşmaya
tts aracı ve tts yapılandırması aracılığıyla giden
yanıtları konuşma sesine dönüştürün. Eşzamanlıdır.Medya anlama
Gelen görüntüleri, sesleri ve videoları görsel yetenekli model
sağlayıcılarını ve özel medya anlama pluginlerini kullanarak özetleyin.
Konuşmadan metne
Gelen sesli mesajları toplu STT veya Voice Call akışlı STT
sağlayıcıları aracılığıyla yazıya dökün.
Sağlayıcı yetenek matrisi
Bu tablo, özel medya oluşturma, TTS ve STT pluginlerini kapsar. Birçok
sohbet modeli sağlayıcısı (Anthropic, Google, OpenAI ve diğerleri) gelen
medyayı yanıt modelleri aracılığıyla da anlar; sağlayıcıların tam listesi için
Medya anlama bölümüne bakın.
Buradaki gerçek zamanlı ses, sağlayıcıya özgü çift yönlü gerçek zamanlı iletişim
(Talk
realtime modu; ör. Gemini Live veya OpenAI Realtime API) anlamına gelir —
şu anda bunu yalnızca Google ve OpenAI kaydeder. Deepgram, ElevenLabs, Mistral, OpenAI ve xAI
ayrıca Voice Call akışlı STT’yi (tek yönlü sesten metne) ayrı olarak kaydeder; aşağıdaki
Konuşmadan metne ve Voice Call bölümüne bakın.
xAI Realtime ses, üst kaynakta bulunan bir yetenektir ancak paylaşılan gerçek zamanlı ses
sözleşmesi bunu temsil edebilene kadar OpenClaw’da kaydedilmez.Eşzamansız ve eşzamanlı
Eşzamansız araçlarda OpenClaw, isteği sağlayıcıya gönderir, hemen bir görev
kimliği döndürür ve işi görev defterinde izler. İş çalışırken agent diğer
mesajlara yanıt vermeye devam eder. Sağlayıcı işlemi tamamladığında OpenClaw,
oturumun normal görünür yanıt modu üzerinden kullanıcıyı bilgilendirebilmesi
için agent’ı oluşturulan medya yollarıyla uyandırır: yapılandırıldığında
otomatik nihai yanıt teslimi veya oturum mesaj aracını gerektirdiğinde
message(action="send"). İstek sahibi oturum etkin değilse ya da etkin uyandırması
başarısız olursa ve oluşturulan medyanın bir kısmı hâlâ tamamlama yanıtında
eksikse OpenClaw yalnızca eksik medyayı içeren eşgüçlü bir doğrudan yedek
gönderim yapar. Tamamlama yanıtıyla zaten teslim edilmiş medya yeniden gönderilmez.
Konuşmadan metne ve Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio ve xAI, yapılandırıldıklarında gelen sesleri toplutools.media.audio yolu üzerinden yazıya dökebilir. Bahsetme denetimi veya
komut ayrıştırma için bir sesli notu önceden denetleyen kanal pluginleri,
yazıya dökülmüş eki gelen bağlamda işaretler; böylece paylaşılan medya anlama
geçişi aynı ses için ikinci bir STT çağrısı yapmak yerine bu dökümü yeniden
kullanır.
Deepgram, ElevenLabs, Mistral, OpenAI ve xAI ayrıca Voice Call akışlı STT
sağlayıcılarını kaydeder; böylece canlı telefon sesi, tamamlanmış bir kayıt
beklenmeden seçilen satıcıya iletilebilir.
Canlı kullanıcı konuşmaları için Talk modunu tercih edin. Toplu ses
ekleri medya yolunda kalır; tarayıcı gerçek zamanlı sesi, yerel bas-konuş,
telefon ve toplantı sesleri Talk olaylarını ve Gateway tarafından döndürülen
oturum kapsamlı katalogları kullanmalıdır.
Sağlayıcı eşlemeleri (satıcıların yüzeylere dağılımı)
Google
Görüntü, video, müzik, toplu TTS, toplu STT, arka uç gerçek zamanlı ses ve
medya anlama yüzeyleri.
OpenAI
OpenAI
Görüntü, video, toplu TTS, toplu STT, Voice Call akışlı STT, arka uç
gerçek zamanlı ses ve bellek gömme yüzeyleri.
DeepInfra
DeepInfra
Sohbet/model yönlendirme, görüntü oluşturma/düzenleme, metinden videoya,
toplu TTS, toplu STT, görüntü medyası anlama ve bellek gömme yüzeyleri.
DeepInfra ayrıca yeniden sıralama, sınıflandırma, nesne algılama ve diğer
yerel model türlerini sunar; OpenClaw henüz bu kategoriler için bir
sağlayıcı sözleşmesine sahip olmadığından bu plugin bunları kaydetmez.
xAI
xAI
Görüntü, video, arama, kod yürütme, toplu TTS, toplu STT ve Voice Call
akışlı STT. xAI Realtime ses, üst kaynakta bulunan bir yetenektir ancak
paylaşılan gerçek zamanlı ses sözleşmesi bunu temsil edebilene kadar
OpenClaw’da kaydedilmez.