stt-tts do Talk (talk.speak usa esse
mesmo caminho de síntese). As sessões do Talk realtime nativas do provedor sintetizam
a fala dentro do provedor em tempo real; as sessões transcription nunca
sintetizam uma resposta de voz do assistente.
Início rápido
1
Escolha um provedor
OpenAI e ElevenLabs são as opções hospedadas mais confiáveis. Microsoft e
CLI local funcionam sem uma chave de API. Consulte a matriz de provedores
para ver a lista completa.
2
Defina a chave de API
Exporte a variável de ambiente do seu provedor (por exemplo,
OPENAI_API_KEY,
ELEVENLABS_API_KEY). Microsoft e CLI local não precisam de chave.3
Ative na configuração
Defina
messages.tts.auto: "always" e messages.tts.provider:4
Experimente no chat
/tts status mostra o estado atual. /tts audio Hello from OpenClaw
envia uma resposta de áudio avulsa.O Auto-TTS fica desativado por padrão. Quando
messages.tts.provider não está definido,
o OpenClaw escolhe o primeiro provedor configurado na ordem de seleção automática do registro.
A ferramenta de agente integrada tts funciona somente com intenção explícita: o chat comum permanece
em texto, a menos que o usuário peça áudio, use /tts ou ative a fala por
Auto-TTS/diretiva.Provedores compatíveis
Se vários provedores estiverem configurados, o selecionado será usado primeiro e os
demais serão opções de contingência. O resumo automático usa
summaryModel (ou
agents.defaults.model.primary), portanto esse provedor também deve estar autenticado
se os resumos permanecerem ativados.
Configuração
A configuração de TTS fica emmessages.tts no ~/.openclaw/openclaw.json. Escolha uma
predefinição e adapte o bloco do provedor. Os campos speakerVoice/speakerVoiceId
mostrados abaixo são canônicos; os nomes de campo voice/voiceId/
voiceName próprios de cada provedor ainda funcionam como aliases legados.
- Azure Speech
- ElevenLabs
- Google Gemini
- Gradium
- Inworld
- CLI local
- Microsoft (sem chave)
- MiniMax
- OpenAI + ElevenLabs
- OpenRouter
- Volcengine
- xAI
- Xiaomi MiMo
mimo-v2.5-tts-voicedesign, omita speakerVoice e defina style como
o prompt de criação da voz. O OpenClaw envia esse prompt como a mensagem user do TTS
e não envia audio.voice para o modelo voicedesign.
Substituições de voz por agente
Useagents.list[].tts quando um agente precisar falar com outro provedor,
outra voz, outro modelo, outra persona ou outro modo de TTS automático. O bloco do agente é mesclado profundamente sobre
messages.tts, portanto as credenciais do provedor podem permanecer na configuração global do provedor:
agents.list[].tts.persona junto à configuração do
provedor — ela substitui a messages.tts.persona global somente para esse agente.
Ordem de precedência para respostas automáticas, /tts audio, /tts status e a
ferramenta de agente tts:
messages.ttsagents.list[].ttsativo- substituição do canal, quando o canal oferece suporte a
channels.<channel>.tts - substituição da conta, quando o canal transmite
channels.<channel>.accounts.<id>.tts - preferências locais de
/ttspara este host - diretivas
[[tts:...]]embutidas quando as substituições orientadas pelo modelo estão habilitadas
messages.tts e
são mescladas profundamente sobre as camadas anteriores, portanto as credenciais compartilhadas do provedor podem permanecer em
messages.tts, enquanto um canal ou uma conta de bot altera somente a voz do locutor, o modelo, a persona
ou o modo automático:
Personas
Uma persona é uma identidade falada estável que pode ser aplicada de forma determinística entre provedores. Ela pode preferir um provedor, definir a intenção do prompt de modo independente do provedor e conter associações específicas de cada provedor para vozes, modelos, modelos de prompt, sementes e configurações de voz.Persona mínima
Persona completa (prompt independente do provedor)
Resolução da persona
A persona ativa é selecionada de forma determinística:- Preferência local de
/tts persona <id>, se definida. messages.tts.persona, se definida.- Nenhuma persona.
- Substituições diretas (CLI, Gateway, Talk, diretivas TTS permitidas).
- Preferência local de
/tts provider <id>. providerda persona ativa.messages.tts.provider.- Seleção automática do registro.
messages.tts.providers.<id>messages.tts.personas.<persona>.providers.<id>- Substituições de solicitações confiáveis
- Substituições de diretivas TTS permitidas emitidas pelo modelo
Como os provedores usam prompts de persona
Os campos de prompt da persona (profile, scene, sampleContext, style, accent,
pacing, constraints) são independentes do provedor. Cada provedor decide como
usá-los:
Google Gemini
Google Gemini
Encapsula os campos de prompt da persona em uma estrutura de prompt TTS do Gemini somente quando
a configuração efetiva do provedor Google define
promptTemplate: "audio-profile-v1"
ou personaPrompt. Os campos antigos audioProfile e speakerName ainda são
adicionados no início como texto de prompt específico do Google. Tags de áudio embutidas, como
[whispers] ou [laughs], dentro de um bloco [[tts:text]] são preservadas
na transcrição do Gemini; o OpenClaw não gera essas tags.OpenAI
OpenAI
Mapeia os campos de prompt da persona para o campo
instructions da solicitação somente quando
nenhum instructions explícito do OpenAI está configurado. O instructions explícito
sempre prevalece.Outros provedores
Outros provedores
Usam somente as associações de persona específicas do provedor em
personas.<id>.providers.<provider>. Os campos de prompt da persona são ignorados,
a menos que o provedor implemente seu próprio mapeamento de prompt de persona.Política de fallback
fallbackPolicy controla o comportamento quando uma persona não tem associação para o
provedor tentado:
A solicitação TTS inteira só falha quando todos os provedores tentados são ignorados
ou falham.
A seleção de provedor da sessão do Talk é restrita à sessão. Um cliente Talk deve escolher
IDs de provedores, IDs de modelos, IDs de vozes e localidades em
talk.catalog e transmiti-los
pela solicitação de sessão ou transferência do Talk. A abertura de uma sessão de voz não deve
alterar messages.tts nem os padrões globais de provedor do Talk.
Diretivas orientadas pelo modelo
Por padrão, o assistente pode emitir diretivas[[tts:...]] para substituir
voz, modelo ou velocidade em uma única resposta, além de um bloco
[[tts:text]]...[[/tts:text]] opcional para indicações expressivas que devem aparecer
somente no áudio:
messages.tts.auto é "tagged", as diretivas são obrigatórias para acionar
o áudio. A entrega de blocos por streaming remove as diretivas do texto visível antes que o
canal as receba, mesmo quando divididas entre blocos adjacentes.
provider=... é ignorado, a menos que modelOverrides.allowProvider: true. Quando uma
resposta declara provider=..., as outras chaves nessa diretiva são analisadas
somente por esse provedor; chaves sem suporte são removidas e relatadas como avisos de
diretiva TTS.
Chaves de diretiva disponíveis:
provider(ID de provedor registrado; requerallowProvider: true)speakerVoice/speakerVoiceId(aliases legados:voice,voiceName,voice_name,google_voice,voiceId)model/google_modelstability,similarityBoost,style,speed,useSpeakerBoostvol/volume(volume do MiniMax,(0, 10])pitch(tom inteiro do MiniMax, −12 a 12; valores fracionários são truncados)emotion(tag de emoção do Volcengine)applyTextNormalization(auto|on|off)languageCode(ISO 639-1)seed
Comandos de barra
Comando único/tts. No Discord, o OpenClaw também registra /voice porque
/tts é um comando integrado do Discord — o texto /tts ... ainda funciona.
Os comandos exigem um remetente autorizado (aplicam-se as regras de lista de permissões/proprietário) e
commands.text ou o registro de comandos nativos deve estar habilitado./tts ongrava a preferência local de TTS emalways;/tts offa grava emoff./tts chat on|off|defaultgrava uma substituição de TTS automático restrita à sessão para o chat atual./tts persona <id>grava a preferência local de persona;/tts persona offa limpa./tts latestlê a resposta mais recente do assistente na transcrição da sessão atual e a envia uma vez como áudio. Ele armazena somente um hash dessa resposta na entrada da sessão para impedir envios de voz duplicados./tts audiogera uma resposta de áudio avulsa (não ativa o TTS)./tts limit <chars>aceita 100–4096 (4096 é o máximo de legenda/mensagem do Telegram); valores fora desse intervalo são rejeitados.limitesummarysão armazenados nas preferências locais, não na configuração principal./tts statusinclui diagnósticos de fallback da tentativa mais recente —Fallback: <primary> -> <used>,Attempts: ...e detalhes por tentativa (provider:outcome(reasonCode) latency)./statusmostra o modo TTS ativo, além do provedor, modelo, voz e metadados sanitizados do endpoint personalizado configurados quando o TTS está habilitado.
Preferências por usuário
Os comandos de barra gravam substituições locais emprefsPath. O padrão é
~/.openclaw/settings/tts.json; substitua-o pela variável de ambiente OPENCLAW_TTS_PREFS
ou por messages.tts.prefsPath.
Esses valores substituem a configuração efetiva de
messages.tts mais o bloco
agents.list[].tts ativo desse host.
Formatos de saída
A entrega de voz por TTS é determinada pelos recursos do canal. Os plugins de canal informam se o TTS no estilo de voz deve solicitar aos provedores um destinovoice-note nativo ou
manter a síntese audio-file normal, e se o canal transcodifica
a saída não nativa antes do envio.
Observações por provedor:
- Transcodificação do Feishu / WhatsApp: quando uma resposta em mensagem de voz chega como MP3/WebM/WAV/M4A ou outro arquivo que provavelmente seja de áudio, o plugin do canal a transcodifica para Ogg/Opus de 48 kHz com
ffmpeg(libopus, 64 kbps) antes de enviar a mensagem de voz nativa. O WhatsApp envia o resultado pelo payloadaudiodo Baileys comptt: trueeaudio/ogg; codecs=opus. Em caso de falha na transcodificação: o Feishu captura o erro e recorre ao envio do arquivo original como um anexo comum; o WhatsApp não tem fallback, portanto o próprio envio falha em vez de publicar um payload PTT incompatível. - MiniMax: MP3 (modelo
speech-2.8-hd, taxa de amostragem de 32 kHz) para anexos de áudio normais; transcodificado para Opus de 48 kHz comffmpegpara destinos de mensagem de voz anunciados pelo canal. - Xiaomi MiMo: MP3 por padrão ou WAV quando configurado; transcodificado para Opus de 48 kHz com
ffmpegpara destinos de mensagem de voz anunciados pelo canal. - CLI local: usa o
outputFormatconfigurado. Destinos de mensagem de voz são convertidos para Ogg/Opus, e a saída de telefonia é convertida para PCM mono bruto de 16 kHz comffmpeg. - Google Gemini: retorna PCM bruto de 24 kHz. O OpenClaw o encapsula como WAV para anexos de áudio, transcodifica-o para Opus de 48 kHz para destinos de mensagem de voz e retorna PCM diretamente para Talk/telefonia.
- Gradium: WAV para anexos de áudio, Opus para destinos de mensagem de voz e
ulaw_8000a 8 kHz para telefonia. - Inworld: MP3 para anexos de áudio normais,
OGG_OPUSnativo para destinos de mensagem de voz ePCMbruto a 22050 Hz para Talk/telefonia. - xAI: MP3 por padrão; a síntese de arquivos de áudio pode usar
mp3,wav,pcm,mulawoualawtanto para saída armazenada em buffer quanto para saída por streaming. Os destinos de mensagem de voz usam MP3 para streaming e fallback com buffer porque as saídaspcm,mulawealawda xAI são áudio bruto sem cabeçalho. A síntese com buffer usa o endpoint REST em lote/v1/ttsda xAI;textToSpeechStreamusawss://api.x.ai/v1/ttsnativo. Esse não é o contrato de voz em tempo real. O formato Opus nativo para mensagens de voz não é compatível. - Microsoft: usa
microsoft.outputFormat(padrão:audio-24khz-48kbitrate-mono-mp3).- O transporte incluído aceita um
outputFormat, mas nem todos os formatos estão disponíveis no serviço. - Os valores do formato de saída seguem os formatos de saída do Microsoft Speech (incluindo Ogg/WebM Opus).
- O
sendVoicedo Telegram aceita OGG/MP3/M4A; use OpenAI/ElevenLabs se precisar de mensagens de voz Opus garantidas. - Se o formato de saída configurado da Microsoft falhar, o OpenClaw tenta novamente com MP3.
- Quando nenhuma substituição explícita de voz está definida e a voz padrão em inglês é usada, o OpenClaw muda automaticamente para uma voz neural chinesa (
zh-CN-XiaoxiaoNeural, localidadezh-CN) se o texto da resposta tiver predominância de CJK.
- O transporte incluído aceita um
Comportamento do TTS automático
Quandomessages.tts.auto está habilitado, o OpenClaw:
- Ignora o TTS se a resposta já contiver mídia estruturada.
- Ignora respostas muito curtas (com menos de 10 caracteres).
- Resume respostas longas quando os resumos estão habilitados, usando
summaryModel(ouagents.defaults.model.primary). - Anexa o áudio gerado à resposta.
- Em
mode: "final", ainda envia TTS somente em áudio para respostas finais transmitidas por streaming após a conclusão do fluxo de texto; a mídia gerada passa pela mesma normalização de mídia do canal que os anexos normais de resposta.
maxLength, o OpenClaw nunca ignora completamente o áudio:
- Resumo ativado (padrão) e há um modelo de resumo disponível: resume o
texto para aproximadamente
maxLengthcaracteres e, em seguida, sintetiza o resumo. - Resumo desativado, a geração do resumo falha ou nenhuma chave de API está disponível para o
modelo de resumo: trunca o texto para
maxLengthcaracteres e sintetiza o texto truncado.
Referência dos campos
messages.tts.* de nível superior
messages.tts.* de nível superior
"off" | "always" | "inbound" | "tagged"
Modo de TTS automático.
inbound só envia áudio após uma mensagem de voz recebida; tagged só envia áudio quando a resposta inclui diretivas [[tts:...]] ou um bloco [[tts:text]].boolean
obsoleto
Alternância legada.
openclaw doctor --fix migra isso para auto."final" | "all"
padrão:"final"
"all" inclui respostas de ferramentas/blocos além das respostas finais.string
ID do provedor de fala. Quando não definido, o OpenClaw usa o primeiro provedor configurado na ordem de seleção automática do registro. O valor legado
provider: "edge" é reescrito como "microsoft" por openclaw doctor --fix.string
ID da persona ativa de
personas. Normalizado para letras minúsculas.object
Identidade de fala estável. Campos:
label, description, provider, fallbackPolicy, prompt, providers.<provider>. Consulte Personas.string
Modelo de baixo custo para resumo automático; o padrão é
agents.defaults.model.primary. Aceita provider/model ou um alias de modelo configurado.object
Permite que o modelo emita diretivas de TTS.
enabled tem como padrão true; allowProvider tem como padrão false.object
Configurações pertencentes ao provedor, indexadas pelo ID do provedor de fala. Os blocos diretos legados (
messages.tts.openai, .elevenlabs, .microsoft, .edge) são reescritos por openclaw doctor --fix; confirme somente messages.tts.providers.<id>.number
padrão:"4096"
Limite rígido de caracteres da entrada de TTS.
/tts audio, tts.convert e tts.speak falham se ele for excedido.number
padrão:"30000"
Tempo limite da solicitação em milissegundos. Um
timeoutMs por chamada (ferramenta do agente, Gateway) prevalece quando definido; caso contrário, um messages.tts.timeoutMs configurado explicitamente prevalece sobre qualquer padrão do provedor definido pelo Plugin.string
Substitui o caminho JSON das preferências locais (provedor/limite/resumo). Padrão:
~/.openclaw/settings/tts.json.Azure Speech
Azure Speech
string
Variável de ambiente:
AZURE_SPEECH_KEY, AZURE_SPEECH_API_KEY ou SPEECH_KEY.string
Região do Azure Speech (por exemplo,
eastus). Variável de ambiente: AZURE_SPEECH_REGION ou SPEECH_REGION.string
Substituição opcional do endpoint do Azure Speech (alias
baseUrl).string
ShortName da voz do Azure. Padrão:
en-US-JennyNeural. Alias legado: voice.string
Código de idioma SSML. Padrão:
en-US.string
X-Microsoft-OutputFormat do Azure para áudio padrão. Padrão: audio-24khz-48kbitrate-mono-mp3.string
X-Microsoft-OutputFormat do Azure para saída de mensagem de voz. Padrão: ogg-24khz-16bit-mono-opus.ElevenLabs
ElevenLabs
string
Usa
ELEVENLABS_API_KEY ou XI_API_KEY como alternativa.string
ID do modelo. Padrão:
eleven_multilingual_v2. Os IDs legados eleven_turbo_v2_5/eleven_turbo_v2 são normalizados para o modelo flash correspondente.string
ID da voz do ElevenLabs. Padrão:
pMsXgVXv3BLzUgSXRplE. Alias legado: voiceId.object
stability, similarityBoost, style (cada um 0..1, padrões 0.5/0.75/0), useSpeakerBoost (true|false, padrão true), speed (0.5..2.0, padrão 1.0)."auto" | "on" | "off"
Modo de normalização de texto.
string
ISO 639-1 de 2 letras (por exemplo,
en, de).number
Inteiro
0..4294967295 para determinismo de melhor esforço.string
Substitui a URL base da API do ElevenLabs.
Google Gemini
Google Gemini
string
Recorre a
GEMINI_API_KEY / GOOGLE_API_KEY. Se omitida, a TTS pode reutilizar models.providers.google.apiKey antes de recorrer à variável de ambiente.string
Modelo de TTS do Gemini. Padrão:
gemini-3.1-flash-tts-preview.string
Nome da voz predefinida do Gemini. Padrão:
Kore. Aliases legados: voiceName, voice.string
Prompt de estilo em linguagem natural inserido antes do texto falado.
string
Rótulo opcional do locutor inserido antes do texto falado quando o prompt usa um locutor nomeado.
"audio-profile-v1"
Defina como
audio-profile-v1 para envolver os campos de prompt da persona ativa em uma estrutura determinística de prompt de TTS do Gemini.string
Texto adicional de prompt de persona específico do Google, acrescentado às Notas do Diretor do modelo.
string
Somente
https://generativelanguage.googleapis.com é aceito.Gradium
Gradium
Inworld
Inworld
CLI local (tts-local-cli)
CLI local (tts-local-cli)
string
Executável local ou string de comando para TTS via CLI.
string[]
Argumentos do comando. Compatível com os placeholders
{{Text}}, {{OutputPath}}, {{OutputDir}}, {{OutputBase}}."mp3" | "opus" | "wav"
Formato de saída esperado da CLI. Padrão:
mp3 para anexos de áudio.number
Tempo limite do comando em milissegundos. Padrão:
120000.string
Diretório de trabalho opcional do comando.
Record<string, string>
Substituições opcionais de variáveis de ambiente para o comando.
Microsoft (sem chave de API)
Microsoft (sem chave de API)
boolean
padrão:"true"
Permite o uso da síntese de voz da Microsoft.
string
Nome da voz neural da Microsoft (por exemplo,
en-US-MichelleNeural). Alias legado: voice. Se a voz padrão em inglês estiver em uso e o texto da resposta tiver predominância de CJK, o OpenClaw alternará automaticamente para zh-CN-XiaoxiaoNeural.string
Código do idioma (por exemplo,
en-US).string
Formato de saída da Microsoft. Padrão:
audio-24khz-48kbitrate-mono-mp3. Nem todos os formatos são compatíveis com o transporte incluído, baseado no Edge.string
Strings de porcentagem (por exemplo,
+10%, -5%).boolean
Grava legendas em JSON ao lado do arquivo de áudio.
string
URL do proxy para solicitações de síntese de voz da Microsoft.
number
Substituição do tempo limite da solicitação (ms).
object
obsoleto
Alias legado. Execute
openclaw doctor --fix para regravar a configuração persistida como providers.microsoft.MiniMax
MiniMax
string
Recorre a
MINIMAX_API_KEY. Autenticação do Token Plan por meio de MINIMAX_OAUTH_TOKEN, MINIMAX_CODE_PLAN_KEY ou MINIMAX_CODING_API_KEY.string
Padrão:
https://api.minimax.io. Variável de ambiente: MINIMAX_API_HOST.string
Padrão:
speech-2.8-hd. Variável de ambiente: MINIMAX_TTS_MODEL.string
Padrão:
English_expressive_narrator. Variável de ambiente: MINIMAX_TTS_VOICE_ID. Alias legado: voiceId.number
0.5..2.0. Padrão: 1.0.number
(0, 10]. Padrão: 1.0.number
Inteiro
-12..12. Padrão: 0. Valores fracionários são truncados antes da solicitação.OpenAI
OpenAI
string
Recorre a
OPENAI_API_KEY.string
ID do modelo de TTS da OpenAI. Padrão:
gpt-4o-mini-tts.string
Nome da voz (por exemplo,
alloy, cedar). Padrão: coral. Alias legado: voice.string
Campo
instructions explícito da OpenAI. Quando definido, os campos do prompt da persona não são mapeados automaticamente.Record<string, unknown>
Campos JSON adicionais mesclados aos corpos das solicitações
/audio/speech após os campos de TTS da OpenAI gerados. Use isso para endpoints compatíveis com a OpenAI, como o Kokoro, que exigem chaves específicas do provedor, como lang; chaves de protótipo inseguras são ignoradas.string
Substitui o endpoint de TTS da OpenAI. Ordem de resolução: configuração →
OPENAI_TTS_BASE_URL → https://api.openai.com/v1. Valores diferentes do padrão são tratados como endpoints de TTS compatíveis com a OpenAI, portanto nomes personalizados de modelos e vozes são aceitos, e speed deixa de ter sua verificação de intervalo 0.25..4.0.OpenRouter
OpenRouter
string
Variável de ambiente:
OPENROUTER_API_KEY. Pode reutilizar models.providers.openrouter.apiKey.string
Padrão:
https://openrouter.ai/api/v1. O valor legado https://openrouter.ai/v1 é normalizado.string
Padrão:
hexgrad/kokoro-82m. Alias: modelId.string
Padrão:
af_alloy. Aliases legados: voice, voiceId."mp3" | "pcm"
Padrão:
mp3.number
Substituição de velocidade nativa do provedor.
Volcengine (BytePlus Seed Speech)
Volcengine (BytePlus Seed Speech)
string
Variável de ambiente:
VOLCENGINE_TTS_API_KEY ou BYTEPLUS_SEED_SPEECH_API_KEY.string
Padrão:
seed-tts-1.0. Variável de ambiente: VOLCENGINE_TTS_RESOURCE_ID. Use seed-tts-2.0 quando o projeto tiver direito de uso da TTS 2.0.string
Cabeçalho da chave do aplicativo. Padrão:
aGjiRDfUWi. Variável de ambiente: VOLCENGINE_TTS_APP_KEY.string
Substitui o endpoint HTTP de TTS do Seed Speech. Variável de ambiente:
VOLCENGINE_TTS_BASE_URL.string
Tipo de voz. Padrão:
en_female_anna_mars_bigtts. Variável de ambiente: VOLCENGINE_TTS_VOICE. Alias legado: voice.number
Proporção de velocidade nativa do provedor,
0.2..3.string
Tag de emoção nativa do provedor.
string
obsoleto
Campos legados do Volcengine Speech Console. Variáveis de ambiente:
VOLCENGINE_TTS_APPID, VOLCENGINE_TTS_TOKEN, VOLCENGINE_TTS_CLUSTER (padrão: volcano_tts).xAI
xAI
string
Variável de ambiente:
XAI_API_KEY.string
Padrão:
https://api.x.ai/v1. Variável de ambiente: XAI_BASE_URL.string
Padrão:
eve. Com autenticação, openclaw infer tts voices --provider xai busca o catálogo integrado atual; sem autenticação, lista as alternativas offline ara, eve, leo, rex e sal. IDs de vozes personalizadas da conta são encaminhados mesmo quando ausentes da lista integrada. Alias legado: voiceId.string
Código de idioma BCP-47 ou
auto. Padrão: en."mp3" | "wav" | "pcm" | "mulaw" | "alaw"
Padrão:
mp3.number
Substituição de velocidade nativa do provedor,
0.7..1.5.Xiaomi MiMo
Xiaomi MiMo
string
Variável de ambiente:
XIAOMI_API_KEY.string
Padrão:
https://api.xiaomimimo.com/v1. Variável de ambiente: XIAOMI_BASE_URL.string
Padrão:
mimo-v2.5-tts. Variável de ambiente: XIAOMI_TTS_MODEL. Também oferece suporte a mimo-v2-tts e mimo-v2.5-tts-voicedesign.string
Padrão:
mimo_default para modelos com voz predefinida. Variável de ambiente: XIAOMI_TTS_VOICE. Alias legado: voice. Não é enviado para mimo-v2.5-tts-voicedesign."mp3" | "wav"
Padrão:
mp3. Variável de ambiente: XIAOMI_TTS_FORMAT.string
Instrução opcional de estilo em linguagem natural enviada como mensagem do usuário; não é falada. Para
mimo-v2.5-tts-voicedesign, este é o prompt de criação da voz; o OpenClaw fornece um valor padrão quando omitido.Ferramenta do agente
A ferramentatts converte texto em fala e retorna um anexo de áudio para
a entrega da resposta. No Feishu, Matrix, Telegram e WhatsApp, o áudio é
entregue como mensagem de voz em vez de anexo de arquivo. O Feishu e o
WhatsApp podem transcodificar uma saída de TTS que não seja Opus nesse caminho quando ffmpeg
estiver disponível.
O WhatsApp envia o áudio pelo Baileys como uma mensagem de voz PTT (audio com
ptt: true) e envia o texto visível separadamente do áudio PTT porque
os clientes não exibem legendas em mensagens de voz de forma consistente.
A ferramenta aceita os campos opcionais channel e timeoutMs; timeoutMs é um
tempo limite por chamada para a solicitação ao provedor, em milissegundos. Os valores por chamada substituem
messages.tts.timeoutMs; os tempos limite de TTS configurados substituem qualquer valor padrão
do provedor definido pelo plugin.
RPC do Gateway
Links de serviços
- Guia de conversão de texto em fala da OpenAI
- Referência da API de áudio da OpenAI
- Conversão de texto em fala pela API REST do Azure Speech
- Provedor Azure Speech
- Conversão de texto em fala da ElevenLabs
- Autenticação da ElevenLabs
- Gradium
- API de TTS da Inworld
- API MiniMax T2A v2
- API HTTP de TTS da Volcengine
- Síntese de fala do Xiaomi MiMo
- node-edge-tts
- Formatos de saída de fala da Microsoft
- Conversão de texto em fala da xAI