Skip to main content
OpenClaw, giden yanıtları 14 konuşma sağlayıcısı üzerinden sese dönüştürür: Feishu, Matrix, Telegram ve WhatsApp’ta yerel sesli mesajlar; diğer her yerde ses ekleri; telefon ve Talk için PCM/Ulaw akışları. TTS, Talk’ın stt-tts modunun konuşma çıktısı yarısıdır (talk.speak çağrıları da aynı sentez yolunu kullanır). Sağlayıcıya özgü realtime Talk oturumları konuşmayı gerçek zamanlı sağlayıcının içinde sentezler; transcription oturumları ise hiçbir zaman sesli bir asistan yanıtı sentezlemez.

Hızlı başlangıç

1

Bir sağlayıcı seçin

OpenAI ve ElevenLabs, barındırılan seçenekler arasında en güvenilir olanlardır. Microsoft ve Yerel CLI, API anahtarı olmadan çalışır. Tam liste için sağlayıcı matrisine bakın.
2

API anahtarını ayarlayın

Sağlayıcınızın ortam değişkenini dışa aktarın (örneğin OPENAI_API_KEY, ELEVENLABS_API_KEY). Microsoft ve Yerel CLI anahtar gerektirmez.
3

Yapılandırmada etkinleştirin

tts.auto: "always" ve tts.provider değerlerini ayarlayın:
4

Sohbette deneyin

/tts status mevcut durumu gösterir. /tts audio Hello from OpenClaw tek seferlik bir sesli yanıt gönderir.
Otomatik TTS varsayılan olarak kapalıdır. tts.provider ayarlanmamışsa OpenClaw, kayıt defterinin otomatik seçim sırasındaki ilk yapılandırılmış sağlayıcıyı seçer. Yerleşik tts agent aracı yalnızca açık niyetle çalışır: kullanıcı ses istemedikçe, /tts kullanmadıkça veya Otomatik TTS/yönerge konuşmasını etkinleştirmedikçe normal sohbet metin olarak kalır.

Desteklenen sağlayıcılar

Birden fazla sağlayıcı yapılandırılmışsa önce seçilen sağlayıcı kullanılır, diğerleri ise yedek seçeneklerdir. Otomatik özet summaryModel (veya agents.defaults.model.primary) kullanır; bu nedenle özetleri etkin tutarsanız bu sağlayıcının kimlik doğrulamasının da yapılması gerekir.
Paketle gelen Microsoft sağlayıcısı, node-edge-tts üzerinden Microsoft Edge’in çevrimiçi sinirsel TTS hizmetini kullanır. Bu, yayımlanmış bir SLA’sı veya kotası bulunmayan herkese açık bir web hizmetidir; en iyi çaba esaslı kabul edin. Eski sağlayıcı kimliği edge, microsoft olarak normalleştirilir ve openclaw doctor --fix kalıcı yapılandırmayı yeniden yazar; yeni yapılandırmalar her zaman microsoft kullanmalıdır.

Yapılandırma

TTS yapılandırması, ~/.openclaw/openclaw.json içindeki tts altında bulunur. Bir ön ayar seçip sağlayıcı bloğunu uyarlayın. Aşağıda gösterilen speakerVoice/speakerVoiceId alanları standarttır; her sağlayıcının kendi voice/voiceId/ voiceName alan adları eski takma adlar olarak çalışmaya devam eder.
Xiaomi mimo-v2.5-tts-voicedesign için speakerVoice alanını atlayın ve style değerini ses tasarımı istemi olarak ayarlayın. OpenClaw bu istemi TTS user mesajı olarak gönderir ve voicedesign modeli için audio.voice göndermez.

Agent başına ses geçersiz kılmaları

Bir agent’ın farklı bir sağlayıcı, ses, model, kişilik veya otomatik TTS moduyla konuşması gerektiğinde agents.entries.*.tts kullanın. Agent bloğu tts üzerine derin birleştirme uygular; böylece sağlayıcı kimlik bilgileri genel sağlayıcı yapılandırmasında kalabilir:
Aracı başına bir personayı sabitlemek için sağlayıcı yapılandırmasının yanında agents.entries.*.tts.persona ayarını yapın — bu ayar yalnızca söz konusu aracı için genel tts.persona ayarını geçersiz kılar. Otomatik yanıtlar, /tts audio, /tts status ve tts aracı aracı için öncelik sırası:
  1. tts
  2. etkin agents.entries.*.tts
  3. kanal channels.<channel>.tts desteklediğinde kanal geçersiz kılması
  4. kanal channels.<channel>.accounts.<id>.tts ilettiğinde hesap geçersiz kılması
  5. bu ana makineye ait yerel /tts tercihleri
  6. model geçersiz kılmaları etkinleştirildiğinde satır içi [[tts:...]] yönergeleri
Kanal ve hesap geçersiz kılmaları, tts ile aynı yapıyı kullanır ve önceki katmanların üzerine derin birleştirme uygular; böylece paylaşılan sağlayıcı kimlik bilgileri tts içinde kalabilirken bir kanal veya bot hesabı yalnızca konuşmacı sesini, modeli, personayı ya da otomatik modu değiştirebilir:

Personalar

Bir persona, sağlayıcılar arasında belirlenimsel olarak uygulanabilen kararlı bir sözlü kimliktir. Belirli bir sağlayıcıyı tercih edebilir, sağlayıcıdan bağımsız istem amacını tanımlayabilir ve sesler, modeller, istem şablonları, seed değerleri ve ses ayarları için sağlayıcıya özgü bağlamalar taşıyabilir.

Minimal persona

Tam persona (sağlayıcıya özgü şekillendirme)

Persona çözümleme

Etkin persona belirlenimsel olarak seçilir:
  1. ayarlanmışsa yerel /tts persona <id> tercihi.
  2. ayarlanmışsa tts.persona.
  3. Persona yok.
Sağlayıcı seçimi, açık seçimlere öncelik vererek çalışır:
  1. Doğrudan geçersiz kılmalar (CLI, Gateway, Talk, izin verilen TTS yönergeleri).
  2. Yerel /tts provider <id> tercihi.
  3. Etkin personanın provider değeri.
  4. tts.provider.
  5. Kayıt defterinden otomatik seçim.
OpenClaw, her sağlayıcı denemesinde yapılandırmaları şu sırayla birleştirir:
  1. tts.providers.<id>
  2. tts.personas.<persona>.providers.<id>
  3. Güvenilir istek geçersiz kılmaları
  4. İzin verilen, model tarafından yayımlanmış TTS yönergesi geçersiz kılmaları

Özel persona şekillendirme

Sağlayıcıdan bağımsız personas.<id>.prompt.* yapılandırması kullanımdan kaldırılmıştır. Doctor bu alanları kaldırır ve konuşma sağlayıcısı bağlantı noktasına yönlendirir. Yerleşik sağlayıcı ayarlarını personas.<id>.providers.<provider> altına yerleştirin (örneğin Google personaPrompt veya OpenAI instructions). Özel şekillendirme için prepareSynthesis(ctx) içeren bir konuşma sağlayıcısı plugini uygulayın ve synthesize() çalışmadan önce ayarlanmış metni, sağlayıcı yapılandırmasını veya geçersiz kılmaları döndürün. Bu yaklaşım, etkileyici istem oluşturmayı istek semantiğinin bilindiği sağlayıcı kodunda tutar.

Geri dönüş politikası

fallbackPolicy, bir personanın denenen sağlayıcı için bağlaması olmadığında davranışı denetler: TTS isteğinin tamamı yalnızca denenen tüm sağlayıcılar atlandığında veya başarısız olduğunda başarısız olur. Talk oturumu sağlayıcı seçimi oturum kapsamındadır. Bir Talk istemcisi sağlayıcı kimliklerini, model kimliklerini, ses kimliklerini ve yerel ayarları talk.catalog içinden seçmeli ve bunları Talk oturumu veya devir isteği üzerinden iletmelidir. Bir ses oturumunun açılması tts ya da genel Talk sağlayıcı varsayılanlarını değiştirmemelidir.

Model güdümlü yönergeler

Varsayılan olarak asistan, tek bir yanıt için sesi, modeli veya hızı geçersiz kılmak üzere [[tts:...]] yönergeleri ve yalnızca seste görünmesi gereken etkileyici ipuçları için isteğe bağlı bir [[tts:text]]...[[/tts:text]] bloğu yayımlayabilir:
tts.auto, "tagged" olduğunda sesi tetiklemek için yönergeler zorunludur. Akışlı blok teslimi, bitişik bloklara bölünmüş olsalar bile kanal görmeden önce yönergeleri görünür metinden çıkarır. provider=..., modelOverrides.allowProvider: true olmadığı sürece yok sayılır. Bir yanıt provider=... bildirdiğinde, bu yönergedeki diğer anahtarlar yalnızca söz konusu sağlayıcı tarafından ayrıştırılır; desteklenmeyen anahtarlar çıkarılır ve TTS yönergesi uyarıları olarak bildirilir. Kullanılabilir yönerge anahtarları:
  • provider (kayıtlı sağlayıcı kimliği; allowProvider: true gerektirir)
  • speakerVoice / speakerVoiceId (eski diğer adlar: voice, voiceName, voice_name, google_voice, voiceId)
  • model / google_model
  • stability, similarityBoost, style, speed, useSpeakerBoost
  • vol / volume (MiniMax ses düzeyi, (0, 10])
  • pitch (MiniMax tam sayı perde değeri, −12 ile 12; kesirli değerler kırpılır)
  • emotion (Volcengine duygu etiketi)
  • applyTextNormalization (auto|on|off)
  • languageCode (ISO 639-1)
  • seed
Model geçersiz kılmalarını tamamen devre dışı bırakma:
Diğer ayarları yapılandırılabilir tutarken sağlayıcı değiştirmeye izin verme:

Eğik çizgi komutları

Tek komut: /tts. Discord üzerinde OpenClaw ayrıca /voice kaydeder; çünkü /tts yerleşik bir Discord komutudur — metin olarak /tts ... yine çalışır.
Komutlar yetkili bir gönderici gerektirir (izin verilenler listesi/sahip kuralları geçerlidir) ve commands.text ya da yerel komut kaydı etkinleştirilmiş olmalıdır.
Davranış notları:
  • /tts on, yerel TTS tercihini always konumuna yazar; /tts off ise off konumuna yazar.
  • /tts chat on|off|default, geçerli sohbet için oturum kapsamlı bir otomatik TTS geçersiz kılması yazar.
  • /tts persona <id>, yerel persona tercihini yazar; /tts persona off bunu temizler.
  • /tts latest, geçerli oturum dökümündeki en son asistan yanıtını okur ve bir kez ses olarak gönderir. Yinelenen ses gönderimlerini önlemek için oturum girdisinde yalnızca bu yanıtın karmasını saklar.
  • /tts audio, tek seferlik bir sesli yanıt oluşturur (TTS’yi etkinleştirmez).
  • /tts limit <chars>, 100–4096 aralığını kabul eder (4096, Telegram açıklama/mesaj üst sınırıdır); bu aralığın dışındaki değerler reddedilir.
  • limit ve summary, ana yapılandırmada değil yerel tercihlerde saklanır.
  • /tts status, son denemeye ait geri dönüş tanılamalarını içerir — Fallback: <primary> -> <used>, Attempts: ... ve deneme başına ayrıntı (provider:outcome(reasonCode) latency).
  • /status, TTS etkinleştirildiğinde yapılandırılmış sağlayıcı, model, ses ve temizlenmiş özel uç nokta meta verileriyle birlikte etkin TTS modunu gösterir.

Kullanıcı başına tercihler

Eğik çizgi komutları, yerel geçersiz kılmaları TTS tercihleri yoluna yazar. Varsayılan değer ~/.openclaw/settings/tts.json; bunu OPENCLAW_TTS_PREFS ile geçersiz kılın. Doctor, kullanımdan kaldırılmış genel tts.prefsPath değerini paylaşılan makine durumuna taşır. Gelişmiş çok aracılı kurulumlarda aracılar kasıtlı olarak ayrı tercih depoları kullandığında agents.entries.<id>.tts.prefsPath ayarı yine yapılabilir. Bunlar, tts ile söz konusu ana makinenin etkin agents.entries.*.tts bloğundan elde edilen etkili yapılandırmayı geçersiz kılar.

Çıktı biçimleri

TTS ses teslimi kanal yetenekleri tarafından yönlendirilir. Kanal pluginleri, ses tarzı TTS’nin sağlayıcılardan yerel bir voice-note hedefi istemesi mi yoksa normal audio-file sentezini sürdürmesi mi gerektiğini ve kanalın yerel olmayan çıktıyı göndermeden önce dönüştürüp dönüştürmediğini bildirir. Sağlayıcıya özgü notlar:
  • Feishu / WhatsApp kod dönüştürme: Sesli not yanıtı MP3/WebM/WAV/M4A veya başka bir olası ses dosyası olarak geldiğinde, kanal Plugin’i yerel sesli mesajı göndermeden önce dosyayı ffmpeg (libopus, 64 kbps) ile 48 kHz Ogg/Opus biçimine dönüştürür. WhatsApp, sonucu ptt: true ve audio/ogg; codecs=opus ile Baileys audio yükü üzerinden gönderir. Kod dönüştürme başarısız olduğunda: Feishu hatayı yakalar ve özgün dosyayı düz bir ek olarak göndermeye geri döner; WhatsApp’ta geri dönüş yoktur, bu nedenle uyumsuz bir PTT yükü yayımlamak yerine gönderimin kendisi başarısız olur.
  • MiniMax: Normal ses ekleri için MP3 (speech-2.8-hd modeli, 32 kHz örnekleme hızı); kanalın sesli not desteği bildirdiği hedefler için ffmpeg ile 48 kHz Opus biçimine dönüştürülür.
  • Xiaomi MiMo: Varsayılan olarak MP3 veya yapılandırıldığında WAV; kanalın sesli not desteği bildirdiği hedefler için ffmpeg ile 48 kHz Opus biçimine dönüştürülür.
  • Yerel CLI: Yapılandırılmış outputFormat değerini kullanır. Sesli not hedefleri Ogg/Opus biçimine, telefon çıktısı ise ffmpeg ile ham 16 kHz mono PCM biçimine dönüştürülür.
  • Google Gemini: Ham 24 kHz PCM döndürür. OpenClaw, ses ekleri için bunu WAV olarak sarmalar, sesli not hedefleri için 48 kHz Opus biçimine dönüştürür ve Talk/telefon için doğrudan PCM döndürür.
  • Gradium: Ses ekleri için WAV, sesli not hedefleri için Opus ve telefon için 8 kHz’de ulaw_8000.
  • Inworld: Normal ses ekleri için MP3, sesli not hedefleri için yerel OGG_OPUS ve Talk/telefon için 22050 Hz’de ham PCM.
  • xAI: Varsayılan olarak MP3; ses dosyası sentezi, hem arabelleğe alınan hem de akış çıktısı için mp3, wav, pcm, mulaw veya alaw kullanabilir. xAI’ın pcm, mulaw ve alaw çıktıları başlıksız ham ses olduğundan, sesli not hedefleri akış için MP3 ve arabelleğe alınan geri dönüş için MP3 kullanır. Arabelleğe alınan sentez, xAI’ın toplu REST /v1/tts uç noktasını kullanır; textToSpeechStream yerel wss://api.x.ai/v1/tts kullanır. Bu, gerçek zamanlı ses sözleşmesi değildir. Yerel Opus sesli not biçimi desteklenmez.
  • Microsoft: microsoft.outputFormat kullanır (varsayılan audio-24khz-48kbitrate-mono-mp3).
    • Paketle birlikte gelen taşıma, bir outputFormat kabul eder ancak hizmette tüm biçimler kullanılamaz.
    • Çıktı biçimi değerleri Microsoft Speech çıktı biçimlerini izler (Ogg/WebM Opus dâhil).
    • Telegram sendVoice, OGG/MP3/M4A kabul eder; Opus sesli mesajlarının garanti edilmesi gerekiyorsa OpenAI/ElevenLabs kullanın.
    • Yapılandırılmış Microsoft çıktı biçimi başarısız olursa OpenClaw MP3 ile yeniden dener.
    • Açık bir ses geçersiz kılması ayarlanmadığında ve varsayılan İngilizce ses kullanıldığında, yanıt metninde CJK karakterleri baskınsa OpenClaw otomatik olarak Çince bir sinirsel sese (zh-CN-XiaoxiaoNeural, zh-CN yerel ayarı) geçer.
OpenAI ve ElevenLabs çıktı biçimleri, yukarıda listelendiği şekilde kanal başına sabittir.

Otomatik TTS davranışı

tts.auto etkinleştirildiğinde OpenClaw:
  • Yanıt zaten yapılandırılmış medya içeriyorsa TTS’yi atlar.
  • Çok kısa yanıtları (10 karakterden az) atlar.
  • Özetler etkinleştirildiğinde uzun yanıtları summaryModel (veya agents.defaults.model.primary) kullanarak özetler.
  • Oluşturulan sesi yanıta ekler.
  • mode: "final" içinde, metin akışı tamamlandıktan sonra akışla iletilen son yanıtlar için yine de yalnızca ses içeren TTS gönderir; oluşturulan medya, normal yanıt ekleriyle aynı kanal medya normalleştirmesinden geçer.
Yanıt maxLength değerini aşarsa OpenClaw sesi hiçbir zaman tamamen atlamaz:
  • Özet açık (varsayılan) ve bir özet modeli kullanılabiliyorsa: metni yaklaşık maxLength karaktere özetler, ardından özeti sentezler.
  • Özet kapalıysa, özetleme başarısız olursa veya özet modeli için API anahtarı yoksa: metni maxLength karaktere kısaltır ve kısaltılmış metni sentezler.

Alan başvurusu

"off" | "always" | "inbound" | "tagged"
Otomatik TTS modu. inbound yalnızca gelen bir sesli mesajdan sonra ses gönderir; tagged yalnızca yanıt [[tts:...]] yönergeleri veya bir [[tts:text]] bloğu içerdiğinde ses gönderir.
boolean
kullanımdan kaldırıldı
Eski anahtar. openclaw doctor --fix bunu auto değerine geçirir.
"final" | "all"
varsayılan:"final"
"all", son yanıtlara ek olarak araç/blok yanıtlarını da içerir.
string
Konuşma sağlayıcısı kimliği. Ayarlanmadığında OpenClaw, kayıt defterinin otomatik seçim sırasındaki ilk yapılandırılmış sağlayıcıyı kullanır. Eski provider: "edge", openclaw doctor --fix tarafından "microsoft" olarak yeniden yazılır.
string
personas içindeki etkin persona kimliği. Küçük harfe normalleştirilir.
object
Kararlı sözlü kimlik. Alanlar: label, description, provider, fallbackPolicy, prompt, providers.<provider>. Bkz. Personalar.
string
Otomatik özet için düşük maliyetli model; varsayılanı agents.defaults.model.primary. provider/model veya yapılandırılmış bir model diğer adını kabul eder.
object
Modelin TTS yönergeleri üretmesine izin verir. enabled varsayılan olarak true; allowProvider varsayılan olarak false değerini kullanır.
object
Konuşma sağlayıcısı kimliğine göre anahtarlanan, sağlayıcıya ait ayarlar. Eski doğrudan bloklar (tts.openai, .elevenlabs, .microsoft, .edge) openclaw doctor --fix tarafından yeniden yazılır; yalnızca tts.providers.<id> işleyin.
number
varsayılan:"4096"
TTS giriş karakterleri için kesin üst sınır. Aşılırsa /tts audio, tts.convert ve tts.speak başarısız olur.
number
varsayılan:"30000"
Milisaniye cinsinden istek zaman aşımı. Çağrı başına timeoutMs (ajan aracı, Gateway) ayarlanmışsa önceliklidir; aksi takdirde açıkça yapılandırılmış tts.timeoutMs, Plugin tarafından tanımlanmış sağlayıcı varsayılanlarına göre önceliklidir.
Sağlayıcı apiKey alanları ham dizeler veya SecretRef’ler olabilir. Soğuk Gateway başlatması sırasında kullanılamayan bir TTS SecretRef, Gateway’i durdurmak yerine yerleşik TTS yeteneğini yapılandırılmış-kullanılamaz olarak işaretler. Ardından tts.speak, SECRET_SURFACE_UNAVAILABLE nedeniyle UNAVAILABLE döndürür ve hiçbir sağlayıcı isteği gönderilmez. Durum ve doctor, performansı düşmüş TTS sahibini ve yapılandırma yollarını listeler. Açık başvurular çalışma zamanı anlık görüntüsünde kalır; böylece ortam veya profil kimlik bilgileri sessizce farklı bir hesap seçemez. Yeniden yüklemeler ve yapılandırma yazma ön denetimi, sahip farkındalığı olan performans düşürme politikasını uygular: değişmemiş ve uygun bir TTS sahibi, son çalıştığı bilinen kimlik bilgilerini eski olarak koruyabilirken yeni veya değiştirilmiş bir başarısızlık, sağlıklı sahipleri engellemeden soğuk duruma geçer. Yapısal olarak geçersiz başvurular ve çözümlenmiş değerler yine başlatmanın başarısız olmasına veya güncellemenin reddedilmesine neden olur.
string
Ortam: AZURE_SPEECH_KEY, AZURE_SPEECH_API_KEY veya SPEECH_KEY.
string
Azure Speech bölgesi (ör. eastus). Ortam: AZURE_SPEECH_REGION veya SPEECH_REGION.
string
İsteğe bağlı Azure Speech uç noktası geçersiz kılması (diğer adı baseUrl).
string
Azure ses ShortName değeri. Varsayılan en-US-JennyNeural. Eski diğer ad: voice.
string
SSML dil kodu. Varsayılan en-US.
string
Standart ses için Azure X-Microsoft-OutputFormat. Varsayılan audio-24khz-48kbitrate-mono-mp3.
string
Sesli not çıktısı için Azure X-Microsoft-OutputFormat. Varsayılan ogg-24khz-16bit-mono-opus.
string
ELEVENLABS_API_KEY veya XI_API_KEY değerine geri döner.
string
Model kimliği. Varsayılan eleven_multilingual_v2. Eski eleven_turbo_v2_5/eleven_turbo_v2 kimlikleri, eşleşen flash modeline normalleştirilir.
string
ElevenLabs ses kimliği. Varsayılan pMsXgVXv3BLzUgSXRplE. Eski diğer ad: voiceId.
object
stability, similarityBoost, style (her biri 0..1, varsayılanlar 0.5/0.75/0), useSpeakerBoost (true|false, varsayılan true), speed (0.5..2.0, varsayılan 1.0).
"auto" | "on" | "off"
Metin normalleştirme modu.
string
2 harfli ISO 639-1 (ör. en, de).
number
En iyi çabayla belirlenimlilik için tamsayı 0..4294967295.
string
ElevenLabs API temel URL’sini geçersiz kılar.
string
GEMINI_API_KEY / GOOGLE_API_KEY değerlerine geri döner. Belirtilmezse TTS, ortam değişkenine geri dönmeden önce models.providers.google.apiKey değerini yeniden kullanabilir.
string
Gemini TTS modeli. Varsayılan: gemini-3.1-flash-tts-preview.
string
Gemini hazır ses adı. Varsayılan: Kore. Eski takma adlar: voiceName, voice.
string
Seslendirilecek metnin başına eklenen doğal dilde stil istemi.
string
İstem adlandırılmış bir konuşmacı kullanıyorsa seslendirilecek metnin başına eklenen isteğe bağlı konuşmacı etiketi.
"audio-profile-v1"
Etkin persona istemi alanlarını deterministik bir Gemini TTS istem yapısıyla sarmalamak için audio-profile-v1 olarak ayarlayın.
string
Şablonun Director’s Notes bölümüne eklenen, Google’a özgü ek persona istem metni.
string
Yalnızca https://generativelanguage.googleapis.com kabul edilir.
string
Ortam değişkeni: GRADIUM_API_KEY.
string
api.gradium.ai üzerindeki HTTPS Gradium API URL’si. Varsayılan: https://api.gradium.ai.
string
Varsayılan: Emma (YTpq7expH9539ERJ). Eski takma ad: voiceId.

Birincil Inworld

string
Ortam değişkeni: INWORLD_API_KEY.
string
Varsayılan: https://api.inworld.ai.
string
Varsayılan: inworld-tts-1.5-max. Diğerleri: inworld-tts-1.5-mini, inworld-tts-1-max, inworld-tts-1.
string
Varsayılan: Sarah. Eski takma ad: voiceId.
number
Örnekleme sıcaklığı 0..2 (0 hariç).
string
CLI TTS için yerel yürütülebilir dosya veya komut dizesi.
string[]
Komut bağımsız değişkenleri. {{Text}}, {{OutputPath}}, {{OutputDir}}, {{OutputBase}} yer tutucularını destekler.
"mp3" | "opus" | "wav"
Beklenen CLI çıktı biçimi. Ses ekleri için varsayılan: mp3.
number
Milisaniye cinsinden komut zaman aşımı. Varsayılan: 120000.
string
İsteğe bağlı komut çalışma dizini.
Record<string, string>
Komut için isteğe bağlı ortam değişkeni geçersiz kılmaları.
Komutun standart çıktısı ile oluşturulan veya dönüştürülen ses 50 MiB ile sınırlıdır. Tanılama amaçlı standart hata çıktısı 1 MiB ile sınırlıdır. Sınırlardan biri aşıldığında OpenClaw komutu sonlandırır ve sentezi başarısız sayar.
boolean
varsayılan:"true"
Microsoft konuşma kullanımına izin verin.
string
Microsoft nöral ses adı (ör. en-US-MichelleNeural). Eski takma ad: voice. Varsayılan İngilizce ses etkinse ve yanıt metninde CJK karakterleri baskınsa OpenClaw otomatik olarak zh-CN-XiaoxiaoNeural değerine geçer.
string
Dil kodu (ör. en-US).
string
Microsoft çıktı biçimi. Varsayılan: audio-24khz-48kbitrate-mono-mp3. Tüm biçimler, paketle birlikte sunulan Edge tabanlı aktarım tarafından desteklenmez.
string
Yüzde dizeleri (ör. +10%, -5%).
boolean
Ses dosyasının yanına JSON altyazıları yazın.
string
Microsoft konuşma istekleri için proxy URL’si.
number
İstek zaman aşımını geçersiz kılma değeri (ms).
object
kullanımdan kaldırıldı
Eski takma ad. Kalıcı yapılandırmayı providers.microsoft olarak yeniden yazmak için openclaw doctor --fix komutunu çalıştırın.
string
MINIMAX_API_KEY değerine geri döner. MINIMAX_OAUTH_TOKEN, MINIMAX_CODE_PLAN_KEY veya MINIMAX_CODING_API_KEY aracılığıyla Token Plan kimlik doğrulaması.
string
Varsayılan: https://api.minimax.io. Ortam değişkeni: MINIMAX_API_HOST.
string
Varsayılan: speech-2.8-hd. Ortam değişkeni: MINIMAX_TTS_MODEL.
string
Varsayılan: English_expressive_narrator. Ortam değişkeni: MINIMAX_TTS_VOICE_ID. Eski takma ad: voiceId.
number
0.5..2.0. Varsayılan: 1.0.
number
(0, 10]. Varsayılan: 1.0.
number
Tam sayı -12..12. Varsayılan: 0. Kesirli değerler istekten önce kesilir.
string
OPENAI_API_KEY değerine geri döner.
string
OpenAI TTS model kimliği. Varsayılan: gpt-4o-mini-tts.
string
Ses adı (ör. alloy, cedar). Varsayılan: coral. Eski takma ad: voice.
string
Açık OpenAI instructions alanı. Ayarlandığında persona istemi alanları otomatik olarak eşlenmez.
Record<string, unknown>
Oluşturulan OpenAI TTS alanlarından sonra /audio/speech istek gövdeleriyle birleştirilen ek JSON alanları. Bunu, lang gibi sağlayıcıya özgü anahtarlar gerektiren Kokoro gibi OpenAI uyumlu uç noktalar için kullanın; güvenli olmayan prototip anahtarları yok sayılır.
string
OpenAI TTS uç noktasını geçersiz kılın. Çözümleme sırası: yapılandırma → OPENAI_TTS_BASE_URLhttps://api.openai.com/v1. Varsayılan olmayan değerler OpenAI uyumlu TTS uç noktaları olarak değerlendirilir; bu nedenle özel model ve ses adları kabul edilir ve speed, 0.25..4.0 aralık denetimini kaybeder.
string
Ortam değişkeni: OPENROUTER_API_KEY. models.providers.openrouter.apiKey yeniden kullanılabilir.
string
Varsayılan: https://openrouter.ai/api/v1. Eski https://openrouter.ai/v1 normalleştirilir.
string
Varsayılan: hexgrad/kokoro-82m. Takma ad: modelId.
string
Varsayılan: af_alloy. Eski takma adlar: voice, voiceId.
"mp3" | "pcm"
Varsayılan: mp3.
number
Sağlayıcıya özgü hız geçersiz kılma değeri.
string
Ortam değişkeni: VOLCENGINE_TTS_API_KEY veya BYTEPLUS_SEED_SPEECH_API_KEY.
string
Varsayılan: seed-tts-1.0. Ortam değişkeni: VOLCENGINE_TTS_RESOURCE_ID. Projeniz TTS 2.0 yetkisine sahipse seed-tts-2.0 kullanın.
string
Uygulama anahtarı üstbilgisi. Varsayılan: aGjiRDfUWi. Ortam değişkeni: VOLCENGINE_TTS_APP_KEY.
string
Seed Speech TTS HTTP uç noktasını geçersiz kılın. Ortam değişkeni: VOLCENGINE_TTS_BASE_URL.
string
Ses türü. Varsayılan: en_female_anna_mars_bigtts. Ortam değişkeni: VOLCENGINE_TTS_VOICE. Eski takma ad: voice.
number
Sağlayıcıya özgü hız oranı, 0.2..3.
string
Sağlayıcıya özgü duygu etiketi.
string
kullanımdan kaldırıldı
Eski Volcengine Speech Console alanları. Ortam değişkenleri: VOLCENGINE_TTS_APPID, VOLCENGINE_TTS_TOKEN, VOLCENGINE_TTS_CLUSTER (varsayılan: volcano_tts).
string
Ortam değişkeni: XAI_API_KEY.
string
Varsayılan: https://api.x.ai/v1. Ortam değişkeni: XAI_BASE_URL.
string
Varsayılan: eve. Kimlik doğrulamasıyla openclaw infer tts voices --provider xai güncel yerleşik kataloğu getirir; kimlik doğrulaması olmadan çevrimdışı geri dönüş seçenekleri olan ara, eve, leo, rex ve sal listelenir. Hesaba özel ses kimlikleri, yerleşik listede bulunmasalar bile iletilir. Eski takma ad: voiceId.
string
BCP-47 dil kodu veya auto. Varsayılan: en.
"mp3" | "wav" | "pcm" | "mulaw" | "alaw"
Varsayılan: mp3.
number
Sağlayıcıya özgü hız geçersiz kılma değeri, 0.7..1.5.
string
Ortam değişkeni: XIAOMI_API_KEY.
string
Varsayılan: https://api.xiaomimimo.com/v1. Ortam değişkeni: XIAOMI_BASE_URL.
string
Varsayılan: mimo-v2.5-tts. Ortam değişkeni: XIAOMI_TTS_MODEL. mimo-v2.5-tts-voicedesign değerini de destekler.
string
Hazır ses modelleri için varsayılan: mimo_default. Ortam değişkeni: XIAOMI_TTS_VOICE. Eski takma ad: voice. mimo-v2.5-tts-voicedesign için gönderilmez.
"mp3" | "wav"
Varsayılan: mp3. Ortam değişkeni: XIAOMI_TTS_FORMAT.
string
Kullanıcı mesajı olarak gönderilen, isteğe bağlı doğal dilde stil talimatı; seslendirilmez. mimo-v2.5-tts-voicedesign için bu, ses tasarımı istemidir; belirtilmezse OpenClaw varsayılan bir değer sağlar.

Agent aracı

tts aracı, metni konuşmaya dönüştürür ve yanıtın iletilmesi için bir ses eki döndürür. Feishu, Matrix, Telegram ve WhatsApp’ta ses, dosya eki yerine sesli mesaj olarak iletilir. Feishu ve WhatsApp, ffmpeg kullanılabiliyorsa bu yolda Opus olmayan TTS çıktısının kodunu dönüştürebilir. WhatsApp, sesi Baileys üzerinden PTT sesli notu olarak gönderir (audio ve ptt: true) ve istemciler sesli notlardaki altyazıları tutarlı biçimde göstermediği için görünür metni PTT sesinden ayrı olarak gönderir. Araç, isteğe bağlı channel ve timeoutMs alanlarını kabul eder; timeoutMs, çağrı başına milisaniye cinsinden sağlayıcı isteği zaman aşımıdır. Çağrı başına değerler tts.timeoutMs değerini geçersiz kılar; yapılandırılmış TTS zaman aşımları, Plugin tarafından belirlenen tüm sağlayıcı varsayılanlarını geçersiz kılar.

Gateway RPC

Hizmet bağlantıları

İlgili