Skip to main content
OpenClaw генерирует изображения, видео и музыку, понимает входящие медиафайлы (изображения, аудио и видео) и озвучивает ответы с помощью синтеза речи. Все медиавозможности реализуются через инструменты: агент решает, когда их использовать, исходя из контекста разговора, а каждый инструмент появляется только при наличии хотя бы одного настроенного провайдера. Для живой речи используется контракт сеанса Talk, а не путь одноразового медиаинструмента. Talk поддерживает три режима: нативный для провайдера realtime, локальный или потоковый stt-tts и transcription для захвата речи только в режиме наблюдения. Эти режимы используют общие каталоги провайдеров, конверты событий и семантику отмены с телефонией, встречами, браузерным взаимодействием в реальном времени и нативными клиентами с функцией «нажми и говори».

Возможности

Генерация изображений

Создание и редактирование изображений по текстовым запросам или референсным изображениям через image_generate. Асинхронно в сеансах чата — выполняется в фоновом режиме и публикует результат по готовности.

Генерация видео

Преобразование текста в видео, изображения в видео и видео в видео через video_generate. Асинхронно — выполняется в фоновом режиме и публикует результат по готовности.

Генерация музыки

Генерация музыки или звуковых дорожек через music_generate. Асинхронно в сеансах чата, с использованием общего жизненного цикла задач генерации медиа.

Синтез речи

Преобразование исходящих ответов в озвученное аудио с помощью инструмента tts и конфигурации messages.tts. Синхронно.

Понимание медиа

Создание сводок по входящим изображениям, аудио и видео с помощью провайдеров моделей с поддержкой компьютерного зрения и специализированных плагинов понимания медиа.

Распознавание речи

Транскрибирование входящих голосовых сообщений с помощью пакетных провайдеров STT или провайдеров потокового STT для Voice Call.

Матрица возможностей провайдеров

Эта таблица охватывает специализированные плагины генерации медиа, TTS и STT. Многие провайдеры чат-моделей (Anthropic, Google, OpenAI и другие) также понимают входящие медиа с помощью своей модели ответов; полный список провайдеров приведён в разделе Понимание медиа.
Голос в реальном времени здесь означает нативное для провайдера двунаправленное взаимодействие в реальном времени (режим Talk realtime, например Gemini Live или OpenAI Realtime API) — в настоящее время его регистрируют только Google и OpenAI. Deepgram, ElevenLabs, Mistral, OpenAI и xAI отдельно регистрируют потоковое STT для Voice Call (однонаправленное преобразование аудио в текст); см. раздел Распознавание речи и Voice Call ниже. Голос xAI в реальном времени поддерживается вышестоящим сервисом, но не регистрируется в OpenClaw, пока общий контракт голоса в реальном времени не сможет его представить.

Асинхронный и синхронный режимы

Для асинхронных инструментов OpenClaw отправляет запрос провайдеру, немедленно возвращает идентификатор задачи и отслеживает задание в реестре задач. Агент продолжает отвечать на другие сообщения, пока выполняется задание. Когда провайдер завершает работу, OpenClaw активирует агент, передавая ему пути к созданным медиафайлам, чтобы он мог сообщить пользователю через обычный видимый режим ответа сеанса: автоматическую доставку итогового ответа, если она настроена, или message(action="send"), если сеанс требует использования инструмента сообщений. Если сеанс отправителя неактивен или его активное пробуждение завершается неудачей, а в ответе о завершении по-прежнему отсутствует часть созданных медиафайлов, OpenClaw отправляет идемпотентный прямой резервный ответ только с недостающими медиафайлами. Медиафайлы, уже доставленные в ответе о завершении, повторно не публикуются.

Распознавание речи и Voice Call

Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio и xAI могут транскрибировать входящее аудио через пакетный путь tools.media.audio, если он настроен. Плагины каналов, которые предварительно обрабатывают голосовое сообщение для фильтрации по упоминаниям или разбора команд, помечают транскрибированное вложение во входящем контексте, поэтому общий проход понимания медиа повторно использует эту транскрипцию вместо второго вызова STT для того же аудио. Deepgram, ElevenLabs, Mistral, OpenAI и xAI также регистрируют провайдеров потокового STT для Voice Call, поэтому звук телефонного разговора в реальном времени можно передавать выбранному поставщику, не дожидаясь завершения записи. Для живых разговоров с пользователем предпочтителен режим Talk. Пакетные аудиовложения остаются на медиапути; звук из браузерного взаимодействия в реальном времени, нативных клиентов с функцией «нажми и говори», телефонии и встреч должен использовать события Talk и каталоги в области сеанса, возвращаемые Gateway.

Сопоставление провайдеров с поверхностями

Поверхности изображений, видео, музыки, пакетного TTS, пакетного STT, серверной голосовой связи в реальном времени и понимания медиа.
Поверхности изображений, видео, пакетного TTS, пакетного STT, потокового STT для Voice Call, серверной голосовой связи в реальном времени и векторных представлений памяти.
Поверхности маршрутизации чатов и моделей, генерации и редактирования изображений, преобразования текста в видео, пакетного TTS, пакетного STT, понимания изображений и векторных представлений памяти. DeepInfra также предоставляет переранжирование, классификацию, обнаружение объектов и другие нативные типы моделей; в OpenClaw пока нет контракта провайдера для этих категорий, поэтому данный плагин их не регистрирует.
Изображения, видео, поиск, выполнение кода, пакетный TTS, пакетный STT и потоковый STT для Voice Call. Голос xAI в реальном времени поддерживается вышестоящим сервисом, но не регистрируется в OpenClaw, пока общий контракт голоса в реальном времени не сможет его представить.

Связанные разделы