stt-tts modunun konuşma çıktısı yarısıdır (talk.speak çağrıları da
aynı sentez yolunu kullanır). Sağlayıcıya özgü realtime Talk oturumları konuşmayı
gerçek zamanlı sağlayıcının içinde sentezler; transcription oturumları ise hiçbir zaman
sesli bir asistan yanıtı sentezlemez.
Hızlı başlangıç
1
Bir sağlayıcı seçin
OpenAI ve ElevenLabs, barındırılan seçenekler arasında en güvenilir olanlardır. Microsoft ve
Yerel CLI, API anahtarı olmadan çalışır. Tam liste için sağlayıcı matrisine
bakın.
2
API anahtarını ayarlayın
Sağlayıcınızın ortam değişkenini dışa aktarın (örneğin
OPENAI_API_KEY,
ELEVENLABS_API_KEY). Microsoft ve Yerel CLI anahtar gerektirmez.3
Yapılandırmada etkinleştirin
tts.auto: "always" ve tts.provider değerlerini ayarlayın:4
Sohbette deneyin
/tts status mevcut durumu gösterir. /tts audio Hello from OpenClaw
tek seferlik bir sesli yanıt gönderir.Otomatik TTS varsayılan olarak kapalıdır.
tts.provider ayarlanmamışsa
OpenClaw, kayıt defterinin otomatik seçim sırasındaki ilk yapılandırılmış sağlayıcıyı seçer.
Yerleşik tts agent aracı yalnızca açık niyetle çalışır: kullanıcı ses istemedikçe,
/tts kullanmadıkça veya Otomatik TTS/yönerge
konuşmasını etkinleştirmedikçe normal sohbet metin olarak kalır.Desteklenen sağlayıcılar
Birden fazla sağlayıcı yapılandırılmışsa önce seçilen sağlayıcı kullanılır,
diğerleri ise yedek seçeneklerdir. Otomatik özet
summaryModel (veya
agents.defaults.model.primary) kullanır; bu nedenle özetleri etkin tutarsanız
bu sağlayıcının kimlik doğrulamasının da yapılması gerekir.
Yapılandırma
TTS yapılandırması,~/.openclaw/openclaw.json içindeki tts altında bulunur. Bir
ön ayar seçip sağlayıcı bloğunu uyarlayın. Aşağıda gösterilen speakerVoice/speakerVoiceId
alanları standarttır; her sağlayıcının kendi voice/voiceId/
voiceName alan adları eski takma adlar olarak çalışmaya devam eder.
- Azure Speech
- ElevenLabs
- Google Gemini
- Gradium
- Inworld
- Yerel CLI
- Microsoft (anahtarsız)
- MiniMax
- OpenAI + ElevenLabs
- OpenRouter
- Volcengine
- xAI
- Xiaomi MiMo
mimo-v2.5-tts-voicedesign için speakerVoice alanını atlayın ve style değerini
ses tasarımı istemi olarak ayarlayın. OpenClaw bu istemi TTS user mesajı olarak gönderir
ve voicedesign modeli için audio.voice göndermez.
Agent başına ses geçersiz kılmaları
Bir agent’ın farklı bir sağlayıcı, ses, model, kişilik veya otomatik TTS moduyla konuşması gerektiğindeagents.entries.*.tts kullanın. Agent bloğu tts üzerine
derin birleştirme uygular; böylece sağlayıcı kimlik bilgileri genel sağlayıcı yapılandırmasında kalabilir:
agents.entries.*.tts.persona ayarını yapın — bu ayar yalnızca söz konusu aracı için genel tts.persona ayarını geçersiz kılar.
Otomatik yanıtlar, /tts audio, /tts status ve
tts aracı aracı için öncelik sırası:
tts- etkin
agents.entries.*.tts - kanal
channels.<channel>.ttsdesteklediğinde kanal geçersiz kılması - kanal
channels.<channel>.accounts.<id>.ttsilettiğinde hesap geçersiz kılması - bu ana makineye ait yerel
/ttstercihleri - model geçersiz kılmaları etkinleştirildiğinde satır içi
[[tts:...]]yönergeleri
tts ile aynı yapıyı kullanır ve
önceki katmanların üzerine derin birleştirme uygular; böylece paylaşılan sağlayıcı kimlik bilgileri
tts içinde kalabilirken bir kanal veya bot hesabı yalnızca konuşmacı sesini, modeli, personayı
ya da otomatik modu değiştirebilir:
Personalar
Bir persona, sağlayıcılar arasında belirlenimsel olarak uygulanabilen kararlı bir sözlü kimliktir. Belirli bir sağlayıcıyı tercih edebilir, sağlayıcıdan bağımsız istem amacını tanımlayabilir ve sesler, modeller, istem şablonları, seed değerleri ve ses ayarları için sağlayıcıya özgü bağlamalar taşıyabilir.Minimal persona
Tam persona (sağlayıcıya özgü şekillendirme)
Persona çözümleme
Etkin persona belirlenimsel olarak seçilir:- ayarlanmışsa yerel
/tts persona <id>tercihi. - ayarlanmışsa
tts.persona. - Persona yok.
- Doğrudan geçersiz kılmalar (CLI, Gateway, Talk, izin verilen TTS yönergeleri).
- Yerel
/tts provider <id>tercihi. - Etkin personanın
providerdeğeri. tts.provider.- Kayıt defterinden otomatik seçim.
tts.providers.<id>tts.personas.<persona>.providers.<id>- Güvenilir istek geçersiz kılmaları
- İzin verilen, model tarafından yayımlanmış TTS yönergesi geçersiz kılmaları
Özel persona şekillendirme
Sağlayıcıdan bağımsızpersonas.<id>.prompt.* yapılandırması kullanımdan kaldırılmıştır. Doctor bu
alanları kaldırır ve konuşma sağlayıcısı bağlantı noktasına yönlendirir. Yerleşik sağlayıcı
ayarlarını personas.<id>.providers.<provider> altına yerleştirin (örneğin Google
personaPrompt veya OpenAI instructions). Özel şekillendirme için prepareSynthesis(ctx) içeren bir
konuşma sağlayıcısı plugini uygulayın ve synthesize() çalışmadan önce ayarlanmış metni,
sağlayıcı yapılandırmasını veya geçersiz kılmaları döndürün. Bu yaklaşım, etkileyici
istem oluşturmayı istek semantiğinin bilindiği sağlayıcı kodunda tutar.
Geri dönüş politikası
fallbackPolicy, bir personanın denenen sağlayıcı için bağlaması olmadığında
davranışı denetler:
TTS isteğinin tamamı yalnızca denenen tüm sağlayıcılar atlandığında
veya başarısız olduğunda başarısız olur.
Talk oturumu sağlayıcı seçimi oturum kapsamındadır. Bir Talk istemcisi
sağlayıcı kimliklerini, model kimliklerini, ses kimliklerini ve yerel ayarları
talk.catalog içinden seçmeli ve
bunları Talk oturumu veya devir isteği üzerinden iletmelidir. Bir ses oturumunun açılması
tts ya da genel Talk sağlayıcı varsayılanlarını değiştirmemelidir.
Model güdümlü yönergeler
Varsayılan olarak asistan, tek bir yanıt için sesi, modeli veya hızı geçersiz kılmak üzere[[tts:...]] yönergeleri ve yalnızca
seste görünmesi gereken etkileyici ipuçları için isteğe bağlı bir [[tts:text]]...[[/tts:text]] bloğu yayımlayabilir:
tts.auto, "tagged" olduğunda sesi tetiklemek için yönergeler zorunludur.
Akışlı blok teslimi, bitişik bloklara bölünmüş olsalar bile kanal görmeden önce
yönergeleri görünür metinden çıkarır.
provider=..., modelOverrides.allowProvider: true olmadığı sürece yok sayılır. Bir
yanıt provider=... bildirdiğinde, bu yönergedeki diğer anahtarlar
yalnızca söz konusu sağlayıcı tarafından ayrıştırılır; desteklenmeyen anahtarlar çıkarılır ve TTS
yönergesi uyarıları olarak bildirilir.
Kullanılabilir yönerge anahtarları:
provider(kayıtlı sağlayıcı kimliği;allowProvider: truegerektirir)speakerVoice/speakerVoiceId(eski diğer adlar:voice,voiceName,voice_name,google_voice,voiceId)model/google_modelstability,similarityBoost,style,speed,useSpeakerBoostvol/volume(MiniMax ses düzeyi,(0, 10])pitch(MiniMax tam sayı perde değeri, −12 ile 12; kesirli değerler kırpılır)emotion(Volcengine duygu etiketi)applyTextNormalization(auto|on|off)languageCode(ISO 639-1)seed
Eğik çizgi komutları
Tek komut:/tts. Discord üzerinde OpenClaw ayrıca /voice kaydeder; çünkü
/tts yerleşik bir Discord komutudur — metin olarak /tts ... yine çalışır.
Komutlar yetkili bir gönderici gerektirir (izin verilenler listesi/sahip kuralları geçerlidir) ve
commands.text ya da yerel komut kaydı etkinleştirilmiş olmalıdır./tts on, yerel TTS tercihinialwayskonumuna yazar;/tts offiseoffkonumuna yazar./tts chat on|off|default, geçerli sohbet için oturum kapsamlı bir otomatik TTS geçersiz kılması yazar./tts persona <id>, yerel persona tercihini yazar;/tts persona offbunu temizler./tts latest, geçerli oturum dökümündeki en son asistan yanıtını okur ve bir kez ses olarak gönderir. Yinelenen ses gönderimlerini önlemek için oturum girdisinde yalnızca bu yanıtın karmasını saklar./tts audio, tek seferlik bir sesli yanıt oluşturur (TTS’yi etkinleştirmez)./tts limit <chars>, 100–4096 aralığını kabul eder (4096, Telegram açıklama/mesaj üst sınırıdır); bu aralığın dışındaki değerler reddedilir.limitvesummary, ana yapılandırmada değil yerel tercihlerde saklanır./tts status, son denemeye ait geri dönüş tanılamalarını içerir —Fallback: <primary> -> <used>,Attempts: ...ve deneme başına ayrıntı (provider:outcome(reasonCode) latency)./status, TTS etkinleştirildiğinde yapılandırılmış sağlayıcı, model, ses ve temizlenmiş özel uç nokta meta verileriyle birlikte etkin TTS modunu gösterir.
Kullanıcı başına tercihler
Eğik çizgi komutları, yerel geçersiz kılmaları TTS tercihleri yoluna yazar. Varsayılan değer~/.openclaw/settings/tts.json; bunu OPENCLAW_TTS_PREFS ile geçersiz kılın. Doctor,
kullanımdan kaldırılmış genel tts.prefsPath değerini paylaşılan makine durumuna taşır.
Gelişmiş çok aracılı kurulumlarda aracılar kasıtlı olarak ayrı tercih depoları kullandığında
agents.entries.<id>.tts.prefsPath ayarı yine yapılabilir.
Bunlar,
tts ile söz konusu ana makinenin etkin
agents.entries.*.tts bloğundan elde edilen etkili yapılandırmayı geçersiz kılar.
Çıktı biçimleri
TTS ses teslimi kanal yetenekleri tarafından yönlendirilir. Kanal pluginleri, ses tarzı TTS’nin sağlayıcılardan yerel birvoice-note hedefi istemesi mi
yoksa normal audio-file sentezini sürdürmesi mi gerektiğini ve kanalın
yerel olmayan çıktıyı göndermeden önce dönüştürüp dönüştürmediğini bildirir.
Sağlayıcıya özgü notlar:
- Feishu / WhatsApp kod dönüştürme: Sesli not yanıtı MP3/WebM/WAV/M4A veya başka bir olası ses dosyası olarak geldiğinde, kanal Plugin’i yerel sesli mesajı göndermeden önce dosyayı
ffmpeg(libopus, 64 kbps) ile 48 kHz Ogg/Opus biçimine dönüştürür. WhatsApp, sonucuptt: trueveaudio/ogg; codecs=opusile Baileysaudioyükü üzerinden gönderir. Kod dönüştürme başarısız olduğunda: Feishu hatayı yakalar ve özgün dosyayı düz bir ek olarak göndermeye geri döner; WhatsApp’ta geri dönüş yoktur, bu nedenle uyumsuz bir PTT yükü yayımlamak yerine gönderimin kendisi başarısız olur. - MiniMax: Normal ses ekleri için MP3 (
speech-2.8-hdmodeli, 32 kHz örnekleme hızı); kanalın sesli not desteği bildirdiği hedefler içinffmpegile 48 kHz Opus biçimine dönüştürülür. - Xiaomi MiMo: Varsayılan olarak MP3 veya yapılandırıldığında WAV; kanalın sesli not desteği bildirdiği hedefler için
ffmpegile 48 kHz Opus biçimine dönüştürülür. - Yerel CLI: Yapılandırılmış
outputFormatdeğerini kullanır. Sesli not hedefleri Ogg/Opus biçimine, telefon çıktısı iseffmpegile ham 16 kHz mono PCM biçimine dönüştürülür. - Google Gemini: Ham 24 kHz PCM döndürür. OpenClaw, ses ekleri için bunu WAV olarak sarmalar, sesli not hedefleri için 48 kHz Opus biçimine dönüştürür ve Talk/telefon için doğrudan PCM döndürür.
- Gradium: Ses ekleri için WAV, sesli not hedefleri için Opus ve telefon için 8 kHz’de
ulaw_8000. - Inworld: Normal ses ekleri için MP3, sesli not hedefleri için yerel
OGG_OPUSve Talk/telefon için 22050 Hz’de hamPCM. - xAI: Varsayılan olarak MP3; ses dosyası sentezi, hem arabelleğe alınan hem de akış çıktısı için
mp3,wav,pcm,mulawveyaalawkullanabilir. xAI’ınpcm,mulawvealawçıktıları başlıksız ham ses olduğundan, sesli not hedefleri akış için MP3 ve arabelleğe alınan geri dönüş için MP3 kullanır. Arabelleğe alınan sentez, xAI’ın toplu REST/v1/ttsuç noktasını kullanır;textToSpeechStreamyerelwss://api.x.ai/v1/ttskullanır. Bu, gerçek zamanlı ses sözleşmesi değildir. Yerel Opus sesli not biçimi desteklenmez. - Microsoft:
microsoft.outputFormatkullanır (varsayılanaudio-24khz-48kbitrate-mono-mp3).- Paketle birlikte gelen taşıma, bir
outputFormatkabul eder ancak hizmette tüm biçimler kullanılamaz. - Çıktı biçimi değerleri Microsoft Speech çıktı biçimlerini izler (Ogg/WebM Opus dâhil).
- Telegram
sendVoice, OGG/MP3/M4A kabul eder; Opus sesli mesajlarının garanti edilmesi gerekiyorsa OpenAI/ElevenLabs kullanın. - Yapılandırılmış Microsoft çıktı biçimi başarısız olursa OpenClaw MP3 ile yeniden dener.
- Açık bir ses geçersiz kılması ayarlanmadığında ve varsayılan İngilizce ses kullanıldığında, yanıt metninde CJK karakterleri baskınsa OpenClaw otomatik olarak Çince bir sinirsel sese (
zh-CN-XiaoxiaoNeural,zh-CNyerel ayarı) geçer.
- Paketle birlikte gelen taşıma, bir
Otomatik TTS davranışı
tts.auto etkinleştirildiğinde OpenClaw:
- Yanıt zaten yapılandırılmış medya içeriyorsa TTS’yi atlar.
- Çok kısa yanıtları (10 karakterden az) atlar.
- Özetler etkinleştirildiğinde uzun yanıtları
summaryModel(veyaagents.defaults.model.primary) kullanarak özetler. - Oluşturulan sesi yanıta ekler.
mode: "final"içinde, metin akışı tamamlandıktan sonra akışla iletilen son yanıtlar için yine de yalnızca ses içeren TTS gönderir; oluşturulan medya, normal yanıt ekleriyle aynı kanal medya normalleştirmesinden geçer.
maxLength değerini aşarsa OpenClaw sesi hiçbir zaman tamamen atlamaz:
- Özet açık (varsayılan) ve bir özet modeli kullanılabiliyorsa: metni
yaklaşık
maxLengthkaraktere özetler, ardından özeti sentezler. - Özet kapalıysa, özetleme başarısız olursa veya özet modeli için API anahtarı
yoksa: metni
maxLengthkaraktere kısaltır ve kısaltılmış metni sentezler.
Alan başvurusu
Üst düzey tts.*
Üst düzey tts.*
"off" | "always" | "inbound" | "tagged"
Otomatik TTS modu.
inbound yalnızca gelen bir sesli mesajdan sonra ses gönderir; tagged yalnızca yanıt [[tts:...]] yönergeleri veya bir [[tts:text]] bloğu içerdiğinde ses gönderir.boolean
kullanımdan kaldırıldı
Eski anahtar.
openclaw doctor --fix bunu auto değerine geçirir."final" | "all"
varsayılan:"final"
"all", son yanıtlara ek olarak araç/blok yanıtlarını da içerir.string
Konuşma sağlayıcısı kimliği. Ayarlanmadığında OpenClaw, kayıt defterinin otomatik seçim sırasındaki ilk yapılandırılmış sağlayıcıyı kullanır. Eski
provider: "edge", openclaw doctor --fix tarafından "microsoft" olarak yeniden yazılır.string
personas içindeki etkin persona kimliği. Küçük harfe normalleştirilir.object
Kararlı sözlü kimlik. Alanlar:
label, description, provider, fallbackPolicy, prompt, providers.<provider>. Bkz. Personalar.string
Otomatik özet için düşük maliyetli model; varsayılanı
agents.defaults.model.primary. provider/model veya yapılandırılmış bir model diğer adını kabul eder.object
Modelin TTS yönergeleri üretmesine izin verir.
enabled varsayılan olarak true; allowProvider varsayılan olarak false değerini kullanır.object
Konuşma sağlayıcısı kimliğine göre anahtarlanan, sağlayıcıya ait ayarlar. Eski doğrudan bloklar (
tts.openai, .elevenlabs, .microsoft, .edge) openclaw doctor --fix tarafından yeniden yazılır; yalnızca tts.providers.<id> işleyin.number
varsayılan:"4096"
TTS giriş karakterleri için kesin üst sınır. Aşılırsa
/tts audio, tts.convert ve tts.speak başarısız olur.number
varsayılan:"30000"
Milisaniye cinsinden istek zaman aşımı. Çağrı başına
timeoutMs (ajan aracı, Gateway) ayarlanmışsa önceliklidir; aksi takdirde açıkça yapılandırılmış tts.timeoutMs, Plugin tarafından tanımlanmış sağlayıcı varsayılanlarına göre önceliklidir.apiKey alanları ham dizeler veya SecretRef’ler olabilir. Soğuk Gateway
başlatması sırasında kullanılamayan bir TTS SecretRef, Gateway’i durdurmak yerine
yerleşik TTS yeteneğini yapılandırılmış-kullanılamaz olarak işaretler. Ardından tts.speak,
SECRET_SURFACE_UNAVAILABLE nedeniyle UNAVAILABLE döndürür ve hiçbir sağlayıcı isteği
gönderilmez. Durum ve doctor, performansı düşmüş TTS sahibini ve yapılandırma yollarını listeler.
Açık başvurular çalışma zamanı anlık görüntüsünde kalır; böylece ortam veya profil
kimlik bilgileri sessizce farklı bir hesap seçemez. Yeniden yüklemeler ve yapılandırma yazma
ön denetimi, sahip farkındalığı olan performans düşürme politikasını uygular: değişmemiş ve uygun bir TTS
sahibi, son çalıştığı bilinen kimlik bilgilerini eski olarak koruyabilirken yeni veya değiştirilmiş bir
başarısızlık, sağlıklı sahipleri engellemeden soğuk duruma geçer. Yapısal olarak geçersiz başvurular
ve çözümlenmiş değerler yine başlatmanın başarısız olmasına veya güncellemenin reddedilmesine neden olur.Azure Speech
Azure Speech
string
Ortam:
AZURE_SPEECH_KEY, AZURE_SPEECH_API_KEY veya SPEECH_KEY.string
Azure Speech bölgesi (ör.
eastus). Ortam: AZURE_SPEECH_REGION veya SPEECH_REGION.string
İsteğe bağlı Azure Speech uç noktası geçersiz kılması (diğer adı
baseUrl).string
Azure ses ShortName değeri. Varsayılan
en-US-JennyNeural. Eski diğer ad: voice.string
SSML dil kodu. Varsayılan
en-US.string
Standart ses için Azure
X-Microsoft-OutputFormat. Varsayılan audio-24khz-48kbitrate-mono-mp3.string
Sesli not çıktısı için Azure
X-Microsoft-OutputFormat. Varsayılan ogg-24khz-16bit-mono-opus.ElevenLabs
ElevenLabs
string
ELEVENLABS_API_KEY veya XI_API_KEY değerine geri döner.string
Model kimliği. Varsayılan
eleven_multilingual_v2. Eski eleven_turbo_v2_5/eleven_turbo_v2 kimlikleri, eşleşen flash modeline normalleştirilir.string
ElevenLabs ses kimliği. Varsayılan
pMsXgVXv3BLzUgSXRplE. Eski diğer ad: voiceId.object
stability, similarityBoost, style (her biri 0..1, varsayılanlar 0.5/0.75/0), useSpeakerBoost (true|false, varsayılan true), speed (0.5..2.0, varsayılan 1.0)."auto" | "on" | "off"
Metin normalleştirme modu.
string
2 harfli ISO 639-1 (ör.
en, de).number
En iyi çabayla belirlenimlilik için tamsayı
0..4294967295.string
ElevenLabs API temel URL’sini geçersiz kılar.
Google Gemini
Google Gemini
string
GEMINI_API_KEY / GOOGLE_API_KEY değerlerine geri döner. Belirtilmezse TTS, ortam değişkenine geri dönmeden önce models.providers.google.apiKey değerini yeniden kullanabilir.string
Gemini TTS modeli. Varsayılan:
gemini-3.1-flash-tts-preview.string
Gemini hazır ses adı. Varsayılan:
Kore. Eski takma adlar: voiceName, voice.string
Seslendirilecek metnin başına eklenen doğal dilde stil istemi.
string
İstem adlandırılmış bir konuşmacı kullanıyorsa seslendirilecek metnin başına eklenen isteğe bağlı konuşmacı etiketi.
"audio-profile-v1"
Etkin persona istemi alanlarını deterministik bir Gemini TTS istem yapısıyla sarmalamak için
audio-profile-v1 olarak ayarlayın.string
Şablonun Director’s Notes bölümüne eklenen, Google’a özgü ek persona istem metni.
string
Yalnızca
https://generativelanguage.googleapis.com kabul edilir.Gradium
Gradium
Inworld
Inworld
Yerel CLI (tts-local-cli)
Yerel CLI (tts-local-cli)
string
CLI TTS için yerel yürütülebilir dosya veya komut dizesi.
string[]
Komut bağımsız değişkenleri.
{{Text}}, {{OutputPath}}, {{OutputDir}}, {{OutputBase}} yer tutucularını destekler."mp3" | "opus" | "wav"
Beklenen CLI çıktı biçimi. Ses ekleri için varsayılan:
mp3.number
Milisaniye cinsinden komut zaman aşımı. Varsayılan:
120000.string
İsteğe bağlı komut çalışma dizini.
Record<string, string>
Komut için isteğe bağlı ortam değişkeni geçersiz kılmaları.
Microsoft (API anahtarı yok)
Microsoft (API anahtarı yok)
boolean
varsayılan:"true"
Microsoft konuşma kullanımına izin verin.
string
Microsoft nöral ses adı (ör.
en-US-MichelleNeural). Eski takma ad: voice. Varsayılan İngilizce ses etkinse ve yanıt metninde CJK karakterleri baskınsa OpenClaw otomatik olarak zh-CN-XiaoxiaoNeural değerine geçer.string
Dil kodu (ör.
en-US).string
Microsoft çıktı biçimi. Varsayılan:
audio-24khz-48kbitrate-mono-mp3. Tüm biçimler, paketle birlikte sunulan Edge tabanlı aktarım tarafından desteklenmez.string
Yüzde dizeleri (ör.
+10%, -5%).boolean
Ses dosyasının yanına JSON altyazıları yazın.
string
Microsoft konuşma istekleri için proxy URL’si.
number
İstek zaman aşımını geçersiz kılma değeri (ms).
object
kullanımdan kaldırıldı
Eski takma ad. Kalıcı yapılandırmayı
providers.microsoft olarak yeniden yazmak için openclaw doctor --fix komutunu çalıştırın.MiniMax
MiniMax
string
MINIMAX_API_KEY değerine geri döner. MINIMAX_OAUTH_TOKEN, MINIMAX_CODE_PLAN_KEY veya MINIMAX_CODING_API_KEY aracılığıyla Token Plan kimlik doğrulaması.string
Varsayılan:
https://api.minimax.io. Ortam değişkeni: MINIMAX_API_HOST.string
Varsayılan:
speech-2.8-hd. Ortam değişkeni: MINIMAX_TTS_MODEL.string
Varsayılan:
English_expressive_narrator. Ortam değişkeni: MINIMAX_TTS_VOICE_ID. Eski takma ad: voiceId.number
0.5..2.0. Varsayılan: 1.0.number
(0, 10]. Varsayılan: 1.0.number
Tam sayı
-12..12. Varsayılan: 0. Kesirli değerler istekten önce kesilir.OpenAI
OpenAI
string
OPENAI_API_KEY değerine geri döner.string
OpenAI TTS model kimliği. Varsayılan:
gpt-4o-mini-tts.string
Ses adı (ör.
alloy, cedar). Varsayılan: coral. Eski takma ad: voice.string
Açık OpenAI
instructions alanı. Ayarlandığında persona istemi alanları otomatik olarak eşlenmez.Record<string, unknown>
Oluşturulan OpenAI TTS alanlarından sonra
/audio/speech istek gövdeleriyle birleştirilen ek JSON alanları. Bunu, lang gibi sağlayıcıya özgü anahtarlar gerektiren Kokoro gibi OpenAI uyumlu uç noktalar için kullanın; güvenli olmayan prototip anahtarları yok sayılır.string
OpenAI TTS uç noktasını geçersiz kılın. Çözümleme sırası: yapılandırma →
OPENAI_TTS_BASE_URL → https://api.openai.com/v1. Varsayılan olmayan değerler OpenAI uyumlu TTS uç noktaları olarak değerlendirilir; bu nedenle özel model ve ses adları kabul edilir ve speed, 0.25..4.0 aralık denetimini kaybeder.OpenRouter
OpenRouter
string
Ortam değişkeni:
OPENROUTER_API_KEY. models.providers.openrouter.apiKey yeniden kullanılabilir.string
Varsayılan:
https://openrouter.ai/api/v1. Eski https://openrouter.ai/v1 normalleştirilir.string
Varsayılan:
hexgrad/kokoro-82m. Takma ad: modelId.string
Varsayılan:
af_alloy. Eski takma adlar: voice, voiceId."mp3" | "pcm"
Varsayılan:
mp3.number
Sağlayıcıya özgü hız geçersiz kılma değeri.
Volcengine (BytePlus Seed Speech)
Volcengine (BytePlus Seed Speech)
string
Ortam değişkeni:
VOLCENGINE_TTS_API_KEY veya BYTEPLUS_SEED_SPEECH_API_KEY.string
Varsayılan:
seed-tts-1.0. Ortam değişkeni: VOLCENGINE_TTS_RESOURCE_ID. Projeniz TTS 2.0 yetkisine sahipse seed-tts-2.0 kullanın.string
Uygulama anahtarı üstbilgisi. Varsayılan:
aGjiRDfUWi. Ortam değişkeni: VOLCENGINE_TTS_APP_KEY.string
Seed Speech TTS HTTP uç noktasını geçersiz kılın. Ortam değişkeni:
VOLCENGINE_TTS_BASE_URL.string
Ses türü. Varsayılan:
en_female_anna_mars_bigtts. Ortam değişkeni: VOLCENGINE_TTS_VOICE. Eski takma ad: voice.number
Sağlayıcıya özgü hız oranı,
0.2..3.string
Sağlayıcıya özgü duygu etiketi.
string
kullanımdan kaldırıldı
Eski Volcengine Speech Console alanları. Ortam değişkenleri:
VOLCENGINE_TTS_APPID, VOLCENGINE_TTS_TOKEN, VOLCENGINE_TTS_CLUSTER (varsayılan: volcano_tts).xAI
xAI
string
Ortam değişkeni:
XAI_API_KEY.string
Varsayılan:
https://api.x.ai/v1. Ortam değişkeni: XAI_BASE_URL.string
Varsayılan:
eve. Kimlik doğrulamasıyla openclaw infer tts voices --provider xai güncel yerleşik kataloğu getirir; kimlik doğrulaması olmadan çevrimdışı geri dönüş seçenekleri olan ara, eve, leo, rex ve sal listelenir. Hesaba özel ses kimlikleri, yerleşik listede bulunmasalar bile iletilir. Eski takma ad: voiceId.string
BCP-47 dil kodu veya
auto. Varsayılan: en."mp3" | "wav" | "pcm" | "mulaw" | "alaw"
Varsayılan:
mp3.number
Sağlayıcıya özgü hız geçersiz kılma değeri,
0.7..1.5.Xiaomi MiMo
Xiaomi MiMo
string
Ortam değişkeni:
XIAOMI_API_KEY.string
Varsayılan:
https://api.xiaomimimo.com/v1. Ortam değişkeni: XIAOMI_BASE_URL.string
Varsayılan:
mimo-v2.5-tts. Ortam değişkeni: XIAOMI_TTS_MODEL. mimo-v2.5-tts-voicedesign değerini de destekler.string
Hazır ses modelleri için varsayılan:
mimo_default. Ortam değişkeni: XIAOMI_TTS_VOICE. Eski takma ad: voice. mimo-v2.5-tts-voicedesign için gönderilmez."mp3" | "wav"
Varsayılan:
mp3. Ortam değişkeni: XIAOMI_TTS_FORMAT.string
Kullanıcı mesajı olarak gönderilen, isteğe bağlı doğal dilde stil talimatı; seslendirilmez.
mimo-v2.5-tts-voicedesign için bu, ses tasarımı istemidir; belirtilmezse OpenClaw varsayılan bir değer sağlar.Agent aracı
tts aracı, metni konuşmaya dönüştürür ve yanıtın
iletilmesi için bir ses eki döndürür. Feishu, Matrix, Telegram ve WhatsApp’ta ses,
dosya eki yerine sesli mesaj olarak iletilir. Feishu ve
WhatsApp, ffmpeg kullanılabiliyorsa bu yolda Opus olmayan TTS çıktısının
kodunu dönüştürebilir.
WhatsApp, sesi Baileys üzerinden PTT sesli notu olarak gönderir (audio ve
ptt: true) ve istemciler sesli notlardaki altyazıları tutarlı biçimde
göstermediği için görünür metni PTT sesinden ayrı olarak gönderir.
Araç, isteğe bağlı channel ve timeoutMs alanlarını kabul eder; timeoutMs,
çağrı başına milisaniye cinsinden sağlayıcı isteği zaman aşımıdır. Çağrı başına değerler
tts.timeoutMs değerini geçersiz kılar; yapılandırılmış TTS zaman aşımları, Plugin tarafından
belirlenen tüm sağlayıcı varsayılanlarını geçersiz kılar.
Gateway RPC
Hizmet bağlantıları
- OpenAI metinden sese dönüştürme kılavuzu
- OpenAI Audio API referansı
- Azure Speech REST metinden sese dönüştürme
- Azure Speech sağlayıcısı
- ElevenLabs Metinden Sese Dönüştürme
- ElevenLabs Kimlik Doğrulaması
- Gradium
- Inworld TTS API
- MiniMax T2A v2 API
- Volcengine TTS HTTP API
- Xiaomi MiMo konuşma sentezi
- node-edge-tts
- Microsoft Speech çıkış biçimleri
- xAI metinden sese dönüştürme