video_generate. Sechzehn Provider-Backends werden
unterstützt; der Agent wählt anhand der Konfiguration und der verfügbaren
API-Schlüssel automatisch das passende aus.
video_generate wird nur angezeigt, wenn mindestens ein Provider für die
Videogenerierung verfügbar ist. Wenn es in Ihren Agenten-Tools fehlt, legen Sie
einen Provider-API-Schlüssel fest oder konfigurieren Sie agents.defaults.mediaModels.video.video_generate verfügt über drei Laufzeitmodi, die anhand der
Referenzeingaben im Aufruf bestimmt werden:
generate– keine Referenzmedien (Text-zu-Video).imageToVideo– ein oder mehrere Referenzbilder.videoToVideo– ein oder mehrere Referenzvideos.
action=list.
Schnellstart
1
Authentifizierung konfigurieren
Legen Sie einen API-Schlüssel für einen beliebigen unterstützten Provider fest:
2
Standardmodell auswählen (optional)
3
Agenten auffordern
Generieren Sie ein 5-sekündiges filmisches Video von einem freundlichen Lobster, der bei Sonnenuntergang surft.Der Agent ruft
video_generate automatisch auf. Eine Aufnahme des Tools
in eine Zulassungsliste ist nicht erforderlich.Funktionsweise der asynchronen Generierung
Die Videogenerierung erfolgt asynchron:- OpenClaw übermittelt die Anfrage an den Provider und gibt sofort eine Aufgaben-ID zurück.
- Der Provider verarbeitet den Auftrag im Hintergrund (je nach Provider und Auflösung normalerweise 30 Sekunden bis mehrere Minuten; langsame warteschlangenbasierte Provider können bis zum konfigurierten Timeout laufen).
- Sobald das Video bereit ist, aktiviert OpenClaw dieselbe Sitzung mit einem internen Abschlussereignis.
- Der Agent meldet es über den normalen Modus der Sitzung für sichtbare Antworten:
als automatische abschließende Antwort oder über
message(action="send"), wenn die Sitzung das Nachrichten-Tool erfordert. Wenn die anfragende Sitzung inaktiv ist oder ihre Aktivierung fehlschlägt und die generierten Medien weiterhin in der Abschlussantwort fehlen, sendet OpenClaw einen idempotenten direkten Fallback mit den Medien.
video_generate in derselben Sitzung den aktuellen Aufgabenstatus zurück,
anstatt eine weitere Generierung zu starten. Verwenden Sie action: "status",
um den Status zu prüfen, ohne eine neue Generierung auszulösen, oder
openclaw tasks list / openclaw tasks show <lookup> über die CLI (siehe
Hintergrundaufgaben).
Außerhalb sitzungsgebundener Agentenläufe (beispielsweise bei direkten
Tool-Aufrufen) wechselt das Tool zur Inline-Generierung und gibt den endgültigen
Medienpfad im selben Durchlauf zurück.
Generierte Videodateien werden im von OpenClaw verwalteten Medienspeicher
gespeichert, wenn der Provider Bytes zurückgibt. Die Standardobergrenze beträgt
16MB (das gemeinsame Medienlimit für Videos); agents.defaults.mediaMaxMb erhöht sie
für größere Renderings. Wenn ein Provider außerdem eine gehostete Ausgabe-URL
zurückgibt, stellt OpenClaw diese URL bereit, anstatt die Aufgabe fehlschlagen
zu lassen, falls die lokale Speicherung eine zu große Datei ablehnt.
Aufgabenlebenszyklus
Status über die CLI prüfen:
Unterstützte Provider
Einige Provider akzeptieren zusätzliche oder alternative Umgebungsvariablen
für API-Schlüssel. Einzelheiten finden Sie auf den jeweiligen
Provider-Seiten.
Führen Sie
video_generate action=list aus, um die zur Laufzeit verfügbaren Provider,
Modelle und Laufzeitmodi zu prüfen.
Funktionsmatrix
Der explizite Modusvertrag, der vonvideo_generate, Vertragstests und
dem gemeinsamen Live-Durchlauf verwendet wird:
Tool-Parameter
Erforderlich
string
erforderlich
Textbeschreibung des zu generierenden Videos. Erforderlich für
action: "generate".Inhaltseingaben
string
Einzelnes Referenzbild (Pfad oder URL).
string[]
Mehrere Referenzbilder (bis zu 9).
string[]
Optionale positionsbezogene Rollenhinweise parallel zur kombinierten Bilderliste.
Kanonische Werte:
first_frame, last_frame, reference_image.string
Einzelnes Referenzvideo (Pfad oder URL).
string[]
Mehrere Referenzvideos (bis zu 4).
string[]
Optionale positionsbezogene Rollenhinweise parallel zur kombinierten Videoliste.
Kanonischer Wert:
reference_video.string
Einzelne Referenzaudiodatei (Pfad oder URL). Wird für Hintergrundmusik oder als
Stimmreferenz verwendet, wenn der Provider Audioeingaben unterstützt.
string[]
Mehrere Referenzaudiodateien (bis zu 3).
string[]
Optionale positionsbezogene Rollenhinweise parallel zur kombinierten Audioliste.
Kanonischer Wert:
reference_audio.Rollenhinweise werden unverändert an den Provider weitergeleitet. Kanonische Werte
stammen aus der Union
VideoGenerationAssetRole, Provider können jedoch zusätzliche
Rollenzeichenfolgen akzeptieren. *Roles-Arrays dürfen nicht mehr Einträge
als die entsprechende Referenzliste enthalten; Abweichungen um eins führen zu einer
eindeutigen Fehlermeldung. Verwenden Sie eine leere Zeichenfolge, um einen Platz
nicht festzulegen. Legen Sie für xAI jede Bildrolle auf reference_image fest, um
dessen Generierungsmodus reference_images zu verwenden; lassen Sie die Rolle weg
oder verwenden Sie first_frame für die Bild-zu-Video-Generierung mit einem
einzelnen Bild.Stilsteuerung
string
Hinweis zum Seitenverhältnis wie
1:1, 16:9, 9:16, adaptive oder ein providerspezifischer Wert. OpenClaw normalisiert oder ignoriert nicht unterstützte Werte je nach Provider.string
Auflösungshinweis wie
360P, 480P, 540P, 720P, 768P, 1080P, 4K oder ein providerspezifischer Wert. OpenClaw normalisiert oder ignoriert nicht unterstützte Werte je nach Provider.number
Zieldauer in Sekunden (auf den nächsten vom Provider unterstützten Wert gerundet).
string
Größenhinweis, sofern vom Provider unterstützt.
boolean
Aktiviert generiertes Audio in der Ausgabe, sofern unterstützt. Nicht zu verwechseln mit
audioRef* (Eingaben).boolean
Aktiviert oder deaktiviert Wasserzeichen des Providers, sofern unterstützt.
adaptive ist ein providerspezifischer Sentinelwert: Er wird unverändert an
Provider weitergeleitet, die adaptive in ihren Fähigkeiten deklarieren
(z. B. verwendet BytePlus Seedance ihn, um das Seitenverhältnis automatisch anhand
der Abmessungen des Eingabebilds zu erkennen). Provider, die ihn nicht deklarieren,
weisen den Wert über details.ignoredOverrides im Werkzeugergebnis aus, sodass das Verwerfen
sichtbar ist.
Erweitert
"generate" | "status" | "list"
Standard:"generate"
"status" gibt die aktuelle Aufgabe der Sitzung zurück; "list" prüft Provider.string
Überschreibung von Provider/Modell (z. B.
runway/gen4.5).string
Hinweis zum Ausgabedateinamen.
number
Optionale Zeitüberschreitung für den Provider-Vorgang in Millisekunden. Wenn sie weggelassen wird, verwendet OpenClaw
agents.defaults.mediaModels.video.timeoutMs, sofern konfiguriert, andernfalls den vom Plugin festgelegten Standardwert des Providers, sofern vorhanden.object
Providerspezifische Optionen als JSON-Objekt (z. B.
{"seed": 42, "draft": true}).
Provider, die ein typisiertes Schema deklarieren, validieren Schlüssel und Typen;
unbekannte Schlüssel oder Abweichungen führen dazu, dass der Kandidat während des
Fallbacks übersprungen wird. Provider ohne deklariertes Schema erhalten die Optionen
unverändert. Führen Sie video_generate action=list aus, um zu sehen, was die einzelnen
Provider akzeptieren.Nicht alle Provider unterstützen alle Parameter. OpenClaw normalisiert die Dauer
auf den nächstgelegenen vom Provider unterstützten Wert und ordnet übersetzte
Geometriehinweise wie Größe-zu-Seitenverhältnis neu zu, wenn ein Fallback-Provider
eine andere Steuerungsoberfläche bereitstellt. Tatsächlich nicht unterstützte
Überschreibungen werden nach dem Best-Effort-Prinzip ignoriert und als Warnungen
im Werkzeugergebnis gemeldet. Harte Fähigkeitsgrenzen (etwa zu viele
Referenzeingaben) führen vor der Übermittlung zu einem Fehler. Werkzeugergebnisse
melden die angewendeten Einstellungen;
details.normalization erfasst jede Übersetzung
vom angeforderten zum angewendeten Wert.- Keine Referenzmedien ->
generate - Beliebige Bildreferenz ->
imageToVideo - Beliebige Videoreferenz ->
videoToVideo - Referenzaudioeingaben ändern den aufgelösten Modus nicht; sie werden
zusätzlich zu dem Modus angewendet, den die Bild-/Videoreferenzen bestimmen,
und funktionieren nur mit Providern, die
maxInputAudiosdeklarieren.
Fallback und typisierte Optionen
Einige Fähigkeitsprüfungen erfolgen auf der Fallback-Ebene statt an der Werkzeuggrenze. Daher kann eine Anfrage, welche die Grenzen des primären Providers überschreitet, weiterhin bei einem geeigneten Fallback ausgeführt werden:- Ein aktiver Kandidat, der kein
maxInputAudios(oder0) deklariert, wird übersprungen, wenn die Anfrage Audioreferenzen enthält; der nächste Kandidat wird versucht. Dieselbe Prüfung gilt für die Anzahl der Bild- und Videoreferenzen gegenübermaxInputImages/maxInputVideos. - Liegt
maxDurationSecondsdes aktiven Kandidaten unter dem angefordertendurationSecondsund ist keinesupportedDurationSeconds-Liste deklariert, wird er übersprungen. - Enthält die Anfrage
providerOptionsund deklariert der aktive Kandidat ausdrücklich ein typisiertesproviderOptions-Schema, wird er übersprungen, wenn die angegebenen Schlüssel nicht im Schema enthalten sind oder die Werttypen nicht übereinstimmen. Provider ohne deklariertes Schema erhalten die Optionen unverändert (abwärtskompatible Durchleitung). Ein Provider kann sämtliche Provideroptionen ablehnen, indem er ein leeres Schema (capabilities.providerOptions: {}) deklariert; dies führt zum gleichen Überspringen wie eine Typabweichung.
warn
protokolliert, damit Betreiber erkennen können, wann ihr primärer Provider übergangen
wurde; nachfolgende Gründe werden unter debug protokolliert, damit lange
Fallback-Ketten keine unnötigen Meldungen erzeugen. Wenn jeder Kandidat übersprungen
wird, enthält der zusammengefasste Fehler den jeweiligen Grund für jeden Kandidaten.
Aktionen
Modellauswahl
OpenClaw löst das Modell in dieser Reihenfolge auf:- Werkzeugparameter
model– falls der Agent einen im Aufruf angibt. videoGenerationModel.primaryaus der Konfiguration.videoGenerationModel.fallbacksder Reihe nach.- Automatische Erkennung – Provider mit gültiger Authentifizierung, beginnend mit dem aktuellen Standard-Provider, danach die übrigen Provider in alphabetischer Reihenfolge.
model bleibt maßgeblich.
Hinweise zu Providern
Alibaba
Alibaba
Verwendet den asynchronen Endpunkt von DashScope / Model Studio. Referenzbilder
und -videos müssen entfernte
http(s)-URLs sein.BytePlus (gebündelt)
BytePlus (gebündelt)
Provider-ID:
byteplus.Modelle: seedance-1-0-pro-250528 (Standard),
seedance-1-5-pro-251215.Verwendet die einheitliche content[]-API. Unterstützt bis zu 2
Eingabebilder (first_frame + last_frame). Übergeben Sie Bilder
positionsbezogen oder legen Sie role jedes Bilds ausdrücklich fest.Unterstützte providerOptions-Schlüssel: seed (Zahl),
draft (boolescher Wert – erzwingt 480p), camera_fixed
(boolescher Wert).BytePlus Seedance 1.5 plugin
BytePlus Seedance 1.5 plugin
Erfordert das Plugin
@openclaw/byteplus-modelark
(extern, nicht gebündelt). Provider-ID: byteplus-seedance15. Modell:
seedance-1-5-pro-251215.Verwendet die einheitliche content[]-API. Unterstützt höchstens 2
Eingabebilder (first_frame + last_frame). Alle Eingaben müssen
entfernte https://-URLs sein. Legen Sie role: "first_frame" /
"last_frame" für jedes Bild fest oder übergeben Sie Bilder positionsbezogen.aspectRatio: "adaptive" erkennt das Seitenverhältnis automatisch anhand des
Eingabebilds. audio: true wird generate_audio zugeordnet.
providerOptions.seed (Zahl) wird weitergeleitet.BytePlus Seedance 2.0
BytePlus Seedance 2.0
Erfordert das Plugin
@openclaw/byteplus-modelark
(extern, nicht gebündelt). Provider-ID: byteplus-seedance2. Modelle:
dreamina-seedance-2-0-260128,
dreamina-seedance-2-0-fast-260128.Verwendet die einheitliche content[]-API. Unterstützt bis zu 9
Referenzbilder, 3 Referenzvideos und 3 Referenzaudiodateien. Alle Eingaben
müssen entfernte https://-URLs sein. Legen Sie role
für jedes Asset fest – unterstützte Werte:
"first_frame", "last_frame", "reference_image",
"reference_video", "reference_audio".aspectRatio: "adaptive" erkennt das Seitenverhältnis automatisch anhand des
Eingabebilds. audio: true wird generate_audio zugeordnet.
providerOptions.seed (Zahl) wird weitergeleitet.ComfyUI
ComfyUI
Workflow-gesteuerte lokale oder Cloud-Ausführung. Unterstützt Text-zu-Video und
Bild-zu-Video über den konfigurierten Graphen.
fal
fal
Verwendet einen warteschlangengestützten Ablauf für lang laufende Aufträge. OpenClaw wartet standardmäßig bis zu 20
Minuten, bevor ein noch laufender fal-Warteschlangenauftrag als
Zeitüberschreitung behandelt wird. Die meisten fal-Videomodelle
akzeptieren eine einzelne Bildreferenz. Seedance-2.0-Referenz-zu-Video-
Modelle akzeptieren bis zu 9 Bilder, 3 Videos und 3 Audioreferenzen mit
insgesamt höchstens 12 Referenzdateien.
Google (Gemini / Veo)
Google (Gemini / Veo)
Unterstützt eine Bild- oder eine Videoreferenz. Anfragen für generiertes Audio werden
im Gemini-API-Pfad mit einer Warnung ignoriert, da diese API den Parameter
generateAudio für die aktuelle Veo-Videogenerierung ablehnt.MiniMax
MiniMax
Nur eine einzelne Bildreferenz. MiniMax akzeptiert die Auflösungen
768P und 1080P;
Anfragen wie 720P werden vor dem Senden auf den nächstgelegenen
unterstützten Wert normalisiert.OpenAI
OpenAI
Nur die Überschreibung
size wird weitergeleitet. Andere Stilüberschreibungen
(aspectRatio, resolution, audio, watermark) werden mit
einer Warnung ignoriert.OpenRouter
OpenRouter
Verwendet die asynchrone
/videos-API von OpenRouter. OpenClaw übermittelt den
Auftrag, fragt polling_url ab und lädt entweder unsigned_urls oder den
dokumentierten Inhaltsendpunkt des Auftrags herunter. Der gebündelte Standard google/veo-3.1-fast
weist Dauern von 4/6/8 Sekunden, die Auflösungen 720P/1080P und
die Seitenverhältnisse 16:9/9:16 aus.Qwen
Qwen
Dasselbe DashScope-Backend wie Alibaba. Referenzeingaben müssen entfernte
http(s)-URLs sein; lokale Dateien werden vorab abgelehnt.Runway
Runway
Unterstützt lokale Dateien über Daten-URIs. Video-zu-Video erfordert
runway/gen4_aleph. Reine Textausführungen bieten die Seitenverhältnisse 16:9 und 9:16
an.Together
Together
Nur eine einzelne Bildreferenz.
Vydra
Vydra
Verwendet
https://www.vydra.ai/api/v1 direkt, um Weiterleitungen zu vermeiden, bei denen
die Authentifizierung verloren geht. veo3 ist ausschließlich für Text-zu-Video gebündelt; kling erfordert
eine entfernte Bild-URL.xAI
xAI
Das Standardmodell
grok-imagine-video unterstützt Text-zu-Video,
Bild-zu-Video mit einem einzelnen ersten Frame, bis zu 7 reference_image-Eingaben über xAI
reference_images sowie Abläufe zum Bearbeiten und Erweitern entfernter Videos. Die Generierung verwendet standardmäßig
480P; Bild-zu-Video mit einem einzelnen Bild übernimmt das Seitenverhältnis der Quelle, wenn
aspectRatio ausgelassen wird. Videobearbeitung und -erweiterung übernehmen die Geometrie der Eingabe und
akzeptieren keine Überschreibungen für Seitenverhältnis oder Auflösung. Die Erweiterung akzeptiert 2-10
Sekunden.grok-imagine-video-1.5 unterstützt ausschließlich Bild-zu-Video: Geben Sie genau ein Bild an.
Es unterstützt 1-15 Sekunden und 480P, 720P oder 1080P, standardmäßig
480P; lassen Sie aspectRatio aus, um das Seitenverhältnis des Quellbilds zu übernehmen. Die Vorschau-
und datierten 1.5-Bezeichner werden derselben Validierung unterzogen und unverändert
weitergeleitet.Provider-Fähigkeitsmodi
Der gemeinsame Vertrag zur Videogenerierung unterstützt modusspezifische Fähigkeiten anstelle ausschließlich flacher Gesamtgrenzwerte. Neue Provider-Implementierungen sollten explizite Modusblöcke bevorzugen:maxInputImages und maxInputVideos reichen
nicht aus, um die Unterstützung von Transformationsmodi auszuweisen. Provider sollten
generate, imageToVideo und videoToVideo explizit deklarieren, damit Live-
Tests, Vertragstests und das gemeinsame Tool video_generate die
Modusunterstützung deterministisch validieren können.
Wenn ein Modell eines Providers eine breitere Unterstützung für Referenzeingaben als die
übrigen bietet, verwenden Sie maxInputImagesByModel, maxInputVideosByModel oder
maxInputAudiosByModel, anstatt den Grenzwert für den gesamten Modus anzuheben.
Live-Tests
Optional aktivierbare Live-Abdeckung für die gemeinsam gebündelten Provider:generatefür jeden Nicht-FAL-Provider im Durchlauf.- Einsekündiger Lobster-Prompt.
- Grenzwert für Vorgänge pro Provider aus
OPENCLAW_LIVE_VIDEO_GENERATION_TIMEOUT_MS(standardmäßig180000).
OPENCLAW_LIVE_VIDEO_GENERATION_FULL_MODES=1, um zusätzlich deklarierte
Transformationsmodi auszuführen, die der gemeinsame Durchlauf sicher mit lokalen Medien testen kann:
imageToVideo, wenncapabilities.imageToVideo.enabled.videoToVideo, wenncapabilities.videoToVideo.enabledund der Provider bzw. das Modell im gemeinsamen Durchlauf puffergestützte lokale Videoeingaben akzeptiert.
videoToVideo nur dann runway ab, wenn Sie
runway/gen4_aleph auswählen.
Konfiguration
Legen Sie das Standardmodell für die Videogenerierung in Ihrer OpenClaw-Konfiguration fest:Verwandte Themen
- Alibaba Model Studio
- Hintergrundaufgaben - Aufgabenverfolgung für asynchrone Videogenerierung
- BytePlus
- ComfyUI
- Konfigurationsreferenz
- fal
- Google (Gemini)
- MiniMax
- Modelle
- OpenAI
- Qwen
- Runway
- Together AI
- Tool-Übersicht
- Vydra
- xAI