realtime,
локальный или потоковый stt-tts и transcription для захвата речи
только в режиме наблюдения. Эти режимы используют общие каталоги провайдеров,
конверты событий и семантику отмены с телефонией, встречами, браузерным
взаимодействием в реальном времени и нативными клиентами с функцией «нажми и говори».
Возможности
Генерация изображений
Создание и редактирование изображений по текстовым запросам или референсным
изображениям через
image_generate. Асинхронно в сеансах чата — выполняется
в фоновом режиме и публикует результат по готовности.Генерация видео
Преобразование текста в видео, изображения в видео и видео в видео через
video_generate. Асинхронно — выполняется в фоновом режиме и публикует
результат по готовности.Генерация музыки
Генерация музыки или звуковых дорожек через
music_generate. Асинхронно
в сеансах чата, с использованием общего жизненного цикла задач генерации медиа.Синтез речи
Преобразование исходящих ответов в озвученное аудио с помощью инструмента
tts и конфигурации messages.tts. Синхронно.Понимание медиа
Создание сводок по входящим изображениям, аудио и видео с помощью провайдеров
моделей с поддержкой компьютерного зрения и специализированных плагинов
понимания медиа.
Распознавание речи
Транскрибирование входящих голосовых сообщений с помощью пакетных провайдеров
STT или провайдеров потокового STT для Voice Call.
Матрица возможностей провайдеров
Эта таблица охватывает специализированные плагины генерации медиа, TTS и STT.
Многие провайдеры чат-моделей (Anthropic, Google, OpenAI и другие) также понимают
входящие медиа с помощью своей модели ответов; полный список провайдеров приведён
в разделе Понимание медиа.
Голос в реальном времени здесь означает нативное для провайдера двунаправленное
взаимодействие в реальном времени (режим Talk
realtime, например Gemini Live
или OpenAI Realtime API) — в настоящее время его регистрируют только Google и OpenAI.
Deepgram, ElevenLabs, Mistral, OpenAI и xAI отдельно регистрируют потоковое STT для
Voice Call (однонаправленное преобразование аудио в текст); см. раздел
Распознавание речи и Voice Call ниже.
Голос xAI в реальном времени поддерживается вышестоящим сервисом, но не регистрируется
в OpenClaw, пока общий контракт голоса в реальном времени не сможет его представить.Асинхронный и синхронный режимы
Для асинхронных инструментов OpenClaw отправляет запрос провайдеру, немедленно
возвращает идентификатор задачи и отслеживает задание в реестре задач. Агент
продолжает отвечать на другие сообщения, пока выполняется задание. Когда провайдер
завершает работу, OpenClaw активирует агент, передавая ему пути к созданным
медиафайлам, чтобы он мог сообщить пользователю через обычный видимый режим ответа
сеанса: автоматическую доставку итогового ответа, если она настроена, или
message(action="send"), если сеанс требует использования инструмента сообщений.
Если сеанс отправителя неактивен или его активное пробуждение завершается неудачей,
а в ответе о завершении по-прежнему отсутствует часть созданных медиафайлов,
OpenClaw отправляет идемпотентный прямой резервный ответ только с недостающими
медиафайлами. Медиафайлы, уже доставленные в ответе о завершении, повторно
не публикуются.
Распознавание речи и Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio и xAI могут транскрибировать входящее аудио через пакетный путьtools.media.audio, если он настроен. Плагины каналов, которые предварительно
обрабатывают голосовое сообщение для фильтрации по упоминаниям или разбора команд,
помечают транскрибированное вложение во входящем контексте, поэтому общий проход
понимания медиа повторно использует эту транскрипцию вместо второго вызова STT
для того же аудио.
Deepgram, ElevenLabs, Mistral, OpenAI и xAI также регистрируют провайдеров
потокового STT для Voice Call, поэтому звук телефонного разговора в реальном
времени можно передавать выбранному поставщику, не дожидаясь завершения записи.
Для живых разговоров с пользователем предпочтителен режим Talk.
Пакетные аудиовложения остаются на медиапути; звук из браузерного взаимодействия
в реальном времени, нативных клиентов с функцией «нажми и говори», телефонии
и встреч должен использовать события Talk и каталоги в области сеанса,
возвращаемые Gateway.
Сопоставление провайдеров с поверхностями
Google
Поверхности изображений, видео, музыки, пакетного TTS, пакетного STT,
серверной голосовой связи в реальном времени и понимания медиа.
OpenAI
OpenAI
Поверхности изображений, видео, пакетного TTS, пакетного STT, потокового STT
для Voice Call, серверной голосовой связи в реальном времени и векторных
представлений памяти.
DeepInfra
DeepInfra
Поверхности маршрутизации чатов и моделей, генерации и редактирования
изображений, преобразования текста в видео, пакетного TTS, пакетного STT,
понимания изображений и векторных представлений памяти. DeepInfra также
предоставляет переранжирование, классификацию, обнаружение объектов и другие
нативные типы моделей; в OpenClaw пока нет контракта провайдера для этих
категорий, поэтому данный плагин их не регистрирует.
xAI
xAI
Изображения, видео, поиск, выполнение кода, пакетный TTS, пакетный STT
и потоковый STT для Voice Call. Голос xAI в реальном времени поддерживается
вышестоящим сервисом, но не регистрируется в OpenClaw, пока общий контракт
голоса в реальном времени не сможет его представить.