music_generate crea música o audio mediante la capacidad
compartida de generación de música, respaldada por ComfyUI, fal, Google, MiniMax y
OpenRouter.
music_generate solo aparece cuando hay al menos un proveedor de generación de música
disponible: una configuración explícita de agents.defaults.mediaModels.music o un
proveedor con autenticación configurada (por ejemplo, una clave de API establecida).music_generate se inicia como una tarea en segundo plano,
registra el progreso en el registro de tareas y, cuando la pista está
lista, reactiva al agente para que pueda informar al usuario y adjuntar el audio terminado. El agente
de finalización sigue el contrato de respuesta visible de la sesión: respuesta final automática
cuando está configurada, o message(action="send") cuando la sesión requiere la
herramienta de mensajes. Si la sesión solicitante está inactiva o su reactivación falla y
el audio generado todavía no aparece en la respuesta, OpenClaw envía un
recurso alternativo directo e idempotente que contiene únicamente el audio faltante.
Inicio rápido
- Respaldado por un proveedor compartido
- Flujo de trabajo de ComfyUI
1
Configurar la autenticación
Establezca una clave de API para al menos un proveedor; por ejemplo,
GEMINI_API_KEY o MINIMAX_API_KEY.2
Elegir un modelo predeterminado (opcional)
3
Solicitarlo al agente
“Genera una pista synthpop animada sobre un viaje nocturno en automóvil por una
ciudad de neón.”El agente llama automáticamente a
music_generate. No es necesario
incluir la herramienta en una lista de permitidas.action: "list" para consultar los proveedores/modelos disponibles y
action: "status" para consultar la tarea de música activa respaldada por la sesión:
Proveedores compatibles
MiniMax registra dos identificadores de proveedor que comparten los mismos modelos:
minimax para
la autenticación mediante clave de API y minimax-portal para OAuth. Las referencias de los modelos siguen la ruta de autenticación
(minimax/music-2.6 frente a minimax-portal/music-2.6); consulte
MiniMax.
fal también ofrece fal-ai/ace-step/prompt-to-audio (wav, sin letras ni
selector instrumental) y fal-ai/stable-audio-25/text-to-audio (wav,
solo solicitud), además de su modelo predeterminado respaldado por MiniMax. El modelo predeterminado de Google,
lyria-3-clip-preview, solo genera mp3; lyria-3-pro-preview también admite
wav. MiniMax también ofrece music-2.6-free, music-cover y
music-cover-free. OpenRouter también ofrece google/lyria-3-clip-preview.
Matriz de capacidades
El contrato de modo explícito utilizado pormusic_generate, las pruebas de contrato y el
barrido en vivo compartido:
Parámetros de la herramienta
string
requerido
Solicitud de generación de música. Obligatoria para
action: "generate"."generate" | "status" | "list"
predeterminado:"generate"
"status" devuelve la tarea de la sesión actual; "list" consulta los proveedores.string
Sustitución del proveedor/modelo (p. ej.,
google/lyria-3-pro-preview,
comfy/workflow).string
Letras opcionales cuando el proveedor admite una entrada explícita de letras.
boolean
Solicita una salida exclusivamente instrumental cuando el proveedor la admite.
string
Ruta o URL de una única imagen de referencia.
string[]
Varias imágenes de referencia (hasta 10 en los proveedores compatibles).
number
Duración objetivo en segundos cuando el proveedor admite indicaciones de duración.
"mp3" | "wav"
Indicación del formato de salida cuando el proveedor lo admite.
string
Indicación del nombre del archivo de salida.
No todos los proveedores admiten todos los parámetros. OpenClaw sigue validando los
límites estrictos, como el número de entradas, antes del envío. Cuando un proveedor admite
la duración, pero utiliza un máximo inferior al valor solicitado, OpenClaw
lo limita a la duración compatible más cercana. Las indicaciones opcionales que realmente no se admiten
se ignoran con una advertencia cuando el proveedor o modelo seleccionado no puede
respetarlas. Los resultados de la herramienta indican la configuración aplicada;
details.normalization
registra cualquier correspondencia entre el valor solicitado y el aplicado.agents.defaults.mediaModels.music.timeoutMs cuando está configurado, eleva
los valores inferiores a 120000ms hasta 120000ms y, en los demás casos, establece de forma predeterminada las solicitudes a proveedores
en 300000ms.
Comportamiento asíncrono
La generación de música respaldada por una sesión se ejecuta como una tarea en segundo plano:- Tarea en segundo plano:
music_generatecrea una tarea en segundo plano, devuelve inmediatamente una respuesta de inicio/tarea y publica posteriormente la pista terminada en un mensaje de seguimiento del agente. - Prevención de duplicados: mientras una tarea está en
queuedorunning, las llamadas posteriores amusic_generateen la misma sesión devuelven el estado de la tarea en lugar de iniciar otra generación. Useaction: "status"para comprobarlo explícitamente. Una solicitud coincidente completada recientemente también se desduplica durante 2 minutos. - Consulta de estado:
openclaw tasks listoopenclaw tasks show <taskId>consulta los estados en cola, en ejecución y terminales. - Reactivación al finalizar: OpenClaw vuelve a inyectar un evento interno de finalización en la misma sesión para que el propio modelo pueda redactar el seguimiento dirigido al usuario.
- Indicación de la solicitud: los turnos posteriores del usuario o manuales de la misma sesión reciben una pequeña
indicación en tiempo de ejecución cuando ya hay una tarea de música en curso, para que el modelo
no vuelva a llamar a
music_generatea ciegas. - Alternativa sin sesión: los contextos directos/locales sin una sesión real del agente se ejecutan en línea y devuelven el resultado final del audio en el mismo turno.
Ciclo de vida de las tareas
La tarea de música presenta los mismos estados que el registro general de tareas (consulte Tareas en segundo plano para ver la máquina de estados completa, incluidostimed_out, cancelled y lost). La mayoría de las ejecuciones de música
pasan por:
Compruebe el estado desde la CLI:
Configuración
Selección del modelo
Orden de selección de proveedores
OpenClaw prueba los proveedores en este orden:- Parámetro
modelde la llamada a la herramienta (si el agente especifica uno). musicGenerationModel.primaryde la configuración.musicGenerationModel.fallbacksen orden.- Detección automática utilizando únicamente los valores predeterminados de proveedores respaldados por autenticación:
- primero, el proveedor predeterminado actual del modelo de texto, si también ofrece generación de música;
- los demás proveedores de generación de música registrados, ordenados alfabéticamente por identificador del proveedor.
model por llamada sigue siendo determinante.
Notas sobre los proveedores
ComfyUI
ComfyUI
Se basa en flujos de trabajo y depende del grafo configurado, además de la asignación de nodos
para los campos de entrada y salida. El Plugin
comfy incluido se integra en la
herramienta compartida music_generate mediante el registro de proveedores
de generación de música.fal
fal
Usa los endpoints de modelos de fal mediante la ruta compartida de autenticación de proveedores. El
proveedor incluido utiliza
fal-ai/minimax-music/v2.6 de forma predeterminada y también ofrece
fal-ai/ace-step/prompt-to-audio y
fal-ai/stable-audio-25/text-to-audio para solicitudes de generación de audio a partir de indicaciones.
Las letras y el modo instrumental son exclusivos del modelo MiniMax; los otros dos
modelos solo admiten indicaciones.Google (Lyria 3)
Google (Lyria 3)
Usa la generación por lotes de Lyria 3. El flujo incluido actual admite
indicaciones, texto de letras opcional e imágenes de referencia opcionales. El
modelo predeterminado
lyria-3-clip-preview solo genera mp3; el
modelo lyria-3-pro-preview también admite wav.MiniMax
MiniMax
Usa el endpoint por lotes
music_generation. Admite indicaciones, letras opcionales,
modo instrumental y salida mp3 mediante autenticación con clave de API minimax
o mediante OAuth de minimax-portal. También ofrece los modelos music-2.6-free,
music-cover y music-cover-free.OpenRouter
OpenRouter
Usa la salida de audio de finalizaciones de chat de OpenRouter con la transmisión activada. El
proveedor incluido utiliza
google/lyria-3-pro-preview de forma predeterminada y también ofrece
openrouter/google/lyria-3-clip-preview.Elección de la ruta adecuada
- Con respaldo de proveedor compartido cuando se requiera selección de modelos, conmutación por error entre proveedores y el flujo asíncrono integrado de tareas y estados.
- Ruta del Plugin (ComfyUI) cuando se necesite un grafo de flujo de trabajo personalizado o un proveedor que no forme parte de la capacidad compartida incluida de generación de música.
Modos de capacidad de proveedores
El contrato compartido de generación de música admite declaraciones explícitas de modo:generatepara la generación basada únicamente en indicaciones.editcuando la solicitud incluye una o más imágenes de referencia.
maxInputImages, supportsLyrics y
supportsFormat, no bastan para anunciar la compatibilidad con la edición. Los proveedores
deben declarar generate y edit explícitamente para que las pruebas en vivo, las pruebas de
contrato y la herramienta compartida music_generate puedan validar la compatibilidad con los modos
de manera determinista.
Pruebas en vivo
Cobertura en vivo opcional para los proveedores compartidos incluidos (fal, Google, MiniMax, OpenRouter):generate como la de edit declarada cuando
el proveedor activa el modo de edición. Cobertura actual:
google:generatemáseditfal: sologenerateminimax: sologenerateopenrouter:generatemáseditcomfy: cobertura en vivo de Comfy independiente, no incluida en el barrido de proveedores compartidos
Temas relacionados
- Tareas en segundo plano — seguimiento de tareas para ejecuciones independientes de
music_generate - ComfyUI
- Referencia de configuración — configuración de
musicGenerationModel - Google (Gemini)
- MiniMax
- Modelos — configuración y conmutación por error de modelos
- Descripción general de las herramientas