Skip to main content
OpenClaw генерує зображення, відео й музику, розуміє вхідні медіафайли (зображення, аудіо, відео) та озвучує відповіді за допомогою синтезу мовлення. Усі медіаможливості керуються інструментами: агент вирішує, коли їх використовувати, залежно від розмови, а кожен інструмент з’являється лише тоді, коли налаштовано принаймні одного постачальника, що його підтримує. Для мовлення наживо використовується контракт сеансу Talk, а не шлях одноразового медіаінструмента. Talk має три режими: нативний для постачальника realtime, локальний або потоковий stt-tts і transcription для запису мовлення лише з метою спостереження. Ці режими спільно використовують каталоги постачальників, конверти подій і семантику скасування з телефонією, нарадами, браузерною взаємодією в реальному часі та нативними клієнтами з режимом «натисни й говори».

Можливості

Генерування зображень

Створюйте й редагуйте зображення за текстовими запитами або зображеннями-зразками через image_generate. У сеансах чату працює асинхронно — виконується у фоновому режимі й публікує результат, коли він готовий.

Генерування відео

Перетворення тексту на відео, зображення на відео та відео на відео через video_generate. Працює асинхронно — виконується у фоновому режимі й публікує результат, коли він готовий.

Генерування музики

Генеруйте музику або аудіодоріжки через music_generate. У сеансах чату працює асинхронно в межах спільного життєвого циклу завдань генерування медіа.

Синтез мовлення

Перетворюйте вихідні відповіді на озвучене аудіо за допомогою інструмента tts і конфігурації messages.tts. Працює синхронно.

Розуміння медіа

Узагальнюйте вхідні зображення, аудіо й відео за допомогою постачальників моделей із підтримкою комп’ютерного зору та спеціалізованих плагінів розуміння медіа.

Розпізнавання мовлення

Транскрибуйте вхідні голосові повідомлення через постачальників пакетного STT або потокового STT для голосових викликів.

Матриця можливостей постачальників

Ця таблиця охоплює спеціалізовані плагіни генерування медіа, TTS і STT. Багато постачальників моделей чату (Anthropic, Google, OpenAI та інші) також розуміють вхідні медіафайли за допомогою своєї моделі відповідей; повний перелік постачальників наведено в розділі «Розуміння медіа».
Мовлення в реальному часі тут означає нативну для постачальника двонапрямну взаємодію в реальному часі (режим Talk realtime, наприклад Gemini Live або OpenAI Realtime API) — наразі її реєструють лише Google і OpenAI. Deepgram, ElevenLabs, Mistral, OpenAI та xAI окремо реєструють потокове STT для голосових викликів (односпрямоване перетворення аудіо на текст); див. нижче «Розпізнавання мовлення та голосові виклики». Мовлення xAI у реальному часі є можливістю базового постачальника, але не реєструється в OpenClaw, доки спільний контракт мовлення в реальному часі не зможе її представляти.

Асинхронний і синхронний режими

Для асинхронних інструментів OpenClaw надсилає запит постачальнику, негайно повертає ідентифікатор завдання та відстежує роботу в реєстрі завдань. Поки робота виконується, агент продовжує відповідати на інші повідомлення. Коли постачальник завершує роботу, OpenClaw активує агента, передаючи шляхи до згенерованих медіафайлів, щоб той міг повідомити користувача через звичайний режим видимої відповіді сеансу: автоматичне доставлення фінальної відповіді, якщо його налаштовано, або message(action="send"), якщо сеанс вимагає інструмента повідомлень. Якщо сеанс запитувача неактивний або його активне пробудження завершується невдало, а у відповіді про завершення все ще відсутня частина згенерованих медіафайлів, OpenClaw надсилає ідемпотентну пряму резервну відповідь, що містить лише відсутні медіафайли. Медіафайли, уже доставлені у відповіді про завершення, повторно не публікуються.

Розпізнавання мовлення та голосові виклики

Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio та xAI можуть транскрибувати вхідне аудіо через шлях пакетної обробки tools.media.audio, якщо їх налаштовано. Плагіни каналів, які попередньо перевіряють голосову нотатку для фільтрації за згадками або розбору команд, позначають транскрибоване вкладення у вхідному контексті, щоб спільний етап розуміння медіа повторно використовував цю транскрипцію замість другого виклику STT для того самого аудіо. Deepgram, ElevenLabs, Mistral, OpenAI та xAI також реєструють постачальників потокового STT для голосових викликів, тому аудіо телефонної розмови наживо можна пересилати вибраному постачальнику, не чекаючи завершення запису. Для розмов із користувачами наживо віддавайте перевагу режиму Talk. Пакетні аудіовкладення залишаються в медіашляху; браузерна взаємодія в реальному часі, нативний режим «натисни й говори», телефонія та аудіо нарад мають використовувати події Talk і каталоги в межах сеансу, які повертає Gateway.

Відповідність постачальників (розподіл постачальників між поверхнями)

Поверхні зображень, відео, музики, пакетного TTS, пакетного STT, серверного мовлення в реальному часі та розуміння медіа.
Поверхні зображень, відео, пакетного TTS, пакетного STT, потокового STT для голосових викликів, серверного мовлення в реальному часі та векторних представлень пам’яті.
Поверхні маршрутизації чатів і моделей, генерування та редагування зображень, перетворення тексту на відео, пакетного TTS, пакетного STT, розуміння медіа зображень і векторних представлень пам’яті. DeepInfra також надає повторне ранжування, класифікацію, виявлення об’єктів та інші нативні типи моделей; OpenClaw поки не має контракту постачальника для цих категорій, тому цей плагін їх не реєструє.
Зображення, відео, пошук, виконання коду, пакетний TTS, пакетний STT і потоковий STT для голосових викликів. Мовлення xAI у реальному часі є можливістю базового постачальника, але не реєструється в OpenClaw, доки спільний контракт мовлення в реальному часі не зможе її представляти.

Пов’язані розділи