Skip to main content
openclaw infer — це канонічний безголовий інтерфейс для інференсу через провайдерів. Він надає сімейства можливостей (model, image, audio, tts, video, web, embedding), а не необроблені назви RPC Gateway чи ідентифікатори інструментів агента. openclaw capability ... — це псевдонім для того самого дерева команд. Чому варто віддати йому перевагу над одноразовою обгорткою провайдера:
  • Повторно використовує провайдерів і моделі, уже налаштовані в OpenClaw.
  • Стабільна оболонка --json для скриптів і керованої агентами автоматизації (див. Виведення JSON).
  • Для більшості підкоманд виконує звичайний локальний шлях без Gateway.
  • Для наскрізних перевірок провайдера він задіює випущений CLI, завантаження конфігурації, визначення типового агента, активацію вбудованих плагінів і спільне середовище виконання можливостей перед надсиланням запиту провайдеру.

Перетворення infer на Skills

Скопіюйте та вставте це агенту:
Якісні Skills на основі infer зіставляють типові наміри користувача з відповідною підкомандою, містять кілька канонічних прикладів для кожного робочого процесу, віддають перевагу openclaw infer ... над низькорівневими альтернативами та не документують повторно весь інтерфейс infer у тілі Skills.

Дерево команд

infer list / infer inspect --name <capability> показують це дерево як дані (ідентифікатор можливості, транспорти, опис).

Типові завдання

Поведінка

  • Використовуйте --json, коли виведення передається іншій команді чи скрипту; в інших випадках використовуйте текстове виведення.
  • Використовуйте --provider або --model provider/model, щоб зафіксувати конкретний бекенд.
  • Використовуйте model run --thinking <level> для одноразового перевизначення рівня обмірковування/міркування: off, minimal, low, medium, high, adaptive, xhigh або max.
  • Для image describe, audio transcribe і video describe параметр --model має використовувати формат <provider/model>.
  • Для image describe параметр --file приймає локальні шляхи й URL-адреси HTTP(S); віддалені URL-адреси проходять через звичайну політику SSRF для отримання медіафайлів.
  • Команди виконання без стану (model run, image *, audio *, video *, web *, embedding *) типово виконуються локально. Команди стану, керованого Gateway (tts status), типово виконуються через Gateway.
  • Локальний шлях ніколи не вимагає запущеного Gateway.
  • Локальний model run — це полегшене одноразове звернення до провайдера: він визначає налаштовану модель агента й дані автентифікації, але не запускає хід чат-агента, не завантажує інструменти й не відкриває вбудовані сервери MCP.
  • model run --file додає до запиту файли зображень (тип MIME визначається автоматично); повторіть --file для кількох зображень. Файли, що не є зображеннями, відхиляються — натомість використовуйте infer audio transcribe або infer video describe.
  • model run --gateway перевіряє маршрутизацію Gateway, збережені дані автентифікації, вибір провайдера та вбудоване середовище виконання, але залишається необробленою перевіркою моделі: без попереднього журналу сеансу, контексту початкового завантаження/AGENTS, інструментів чи вбудованих серверів MCP.
  • model run --gateway --model <provider/model> вимагає облікових даних Gateway довіреного оператора, оскільки просить Gateway виконати одноразове перевизначення провайдера/моделі.

Модель

Текстовий інференс і перевірка моделі/провайдера.
Використовуйте повні посилання <provider/model> із --local, щоб виконати базову перевірку одного провайдера без запуску Gateway чи завантаження інтерфейсу інструментів агента:
Примітки:
  • Локальний model run — це найвужча базова перевірка CLI для працездатності провайдера/моделі/автентифікації: для провайдерів, відмінних від ChatGPT-Codex, він надсилає лише вказаний запит.
  • Локальний model run --model <provider/model> може визначати точні рядки вбудованого статичного каталогу (ті самі рядки, які показує openclaw models list --all) до запису цього провайдера в конфігурацію. Автентифікація провайдера все одно потрібна; відсутні облікові дані спричиняють помилки автентифікації, а не Unknown model.
  • Для перевірок міркування Mistral Medium 3.5 залиште температуру невстановленою/типовою. Mistral відхиляє reasoning_effort="high" із temperature: 0; використовуйте типову температуру або ненульове значення, як-от 0.7.
  • Локальні перевірки OAuth OpenAI ChatGPT/Codex (API openai-chatgpt-responses) додають мінімальну системну інструкцію, щоб транспорт міг заповнити обов’язкове поле instructions — без повного контексту агента, інструментів, пам’яті чи журналу сеансу.
  • model run --file додає вміст зображення безпосередньо до єдиного повідомлення користувача. Поширені формати (PNG, JPEG, WebP) працюють, коли тип MIME визначено як image/*; непідтримувані або нерозпізнані файли спричиняють помилку до виклику провайдера. Натомість використовуйте infer image describe, якщо потрібні маршрутизація й резервні варіанти моделей зображень OpenClaw, а не безпосередня перевірка мультимодальної моделі.
  • Вибрана модель має підтримувати введення зображень; моделі лише для тексту можуть відхилити запит на рівні провайдера.
  • model run --prompt має містити текст, відмінний від пробільних символів; порожні запити відхиляються до будь-якого виклику провайдера чи Gateway.
  • Локальний model run завершується з ненульовим кодом, коли провайдер не повертає текстового виведення, тож недоступні провайдери й порожні завершення не виглядають як успішні перевірки.
  • Використовуйте model run --gateway, щоб перевірити маршрутизацію Gateway або налаштування середовища виконання агента, зберігаючи введення моделі необробленим. Використовуйте openclaw agent або інтерфейс чату для повного контексту агента, інструментів, пам’яті й журналу сеансу.
  • --thinking adaptive зіставляється з рівнем середовища виконання завершень medium; --thinking max зіставляється з max для моделей OpenAI, які підтримують власний максимальний рівень зусиль, а в інших випадках — із xhigh.
  • model auth login, model auth logout і model auth status керують збереженим станом автентифікації провайдера.

Зображення

Генерування, редагування й опис.
Примітки:
  • Використовуйте image edit, коли починаєте з наявних вхідних файлів; --size, --aspect-ratio або --resolution додають підказки щодо геометрії для провайдерів і моделей, які їх підтримують.
  • --output-format png --background transparent разом із --model openai/gpt-image-1.5 створює PNG-зображення OpenAI із прозорим тлом; --openai-background — специфічний для OpenAI псевдонім тієї самої підказки. Провайдери, які не заявляють про підтримку тла, повідомляють про неї як про проігнороване перевизначення (див. ignoredOverrides в оболонці JSON).
  • --quality low|medium|high|auto працює для провайдерів, які підтримують підказки щодо якості зображення, зокрема OpenAI. OpenAI також приймає --openai-moderation low|auto.
  • image providers --json перелічує, які вбудовані провайдери зображень доступні для виявлення, налаштовані й вибрані, а також які можливості генерування та редагування надає кожен із них.
  • image generate --model <provider/model> --json — найвужча оперативна димова перевірка змін у генеруванні зображень:
    Відповідь містить ok, provider, model, attempts і шляхи до записаних вихідних файлів. Коли задано --output, остаточне розширення може відповідати типу MIME, поверненому провайдером.
  • Для image describe та image describe-many використовуйте --prompt для інструкції, специфічної для завдання (OCR, порівняння, перевірка інтерфейсу, стислий опис).
  • Використовуйте --timeout-ms для повільних локальних моделей комп’ютерного зору або холодного запуску Ollama.
  • Для image describe явно задана модель через --model (має бути моделлю <provider/model> із підтримкою зображень) запускається першою, а якщо цей виклик завершується невдало, виконуються спроби з налаштованими agents.defaults.imageModel.fallbacks. Помилки підготовки вхідних даних (відсутній файл, непідтримувана URL-адреса) спричиняють збій до будь-якої резервної спроби, а модель має підтримувати зображення в каталозі моделей або конфігурації провайдера.
  • Для локальних моделей комп’ютерного зору Ollama спочатку завантажте модель і встановіть для OLLAMA_API_KEY будь-яке значення-заповнювач, наприклад ollama-local. Див. Ollama.

Аудіо

Транскрибування файлів (не керування сеансами в реальному часі).
--model має бути у форматі <provider/model>.

TTS

Синтез мовлення та стан провайдера й персони TTS.
Примітки:
  • tts status підтримує лише --gateway (команда відображає стан TTS, керований Gateway).
  • Використовуйте tts providers, tts voices, tts personas, tts set-provider і tts set-persona, щоб переглядати та налаштовувати поведінку TTS.

Відео

Генерування й опис.
Примітки:
  • video generate приймає --size, --aspect-ratio, --resolution, --duration, --audio, --watermark і --timeout-ms, які передаються середовищу виконання генерування відео.
  • Для video describe значення --model має бути у форматі <provider/model>.

Веб

Пошук і отримання даних.
web providers перелічує доступних, налаштованих і вибраних провайдерів для пошуку й отримання даних.

Вбудовування

Створення векторів і перегляд провайдерів вбудовувань.

Виведення JSON

Команди Infer нормалізують виведення JSON у спільній оболонці:
Стабільні поля верхнього рівня:
  • ok
  • capability
  • transport
  • provider
  • model
  • attempts
  • inputs (вкладення зображень, надіслані із запитом, якщо застосовно)
  • outputs
  • ignoredOverrides (ключі підказок, які провайдер не підтримує, якщо застосовно)
  • error
Для команд генерування медіафайлів outputs містить файли, записані OpenClaw. Для автоматизації використовуйте path, mimeType, size і всі специфічні для медіа розміри в цьому масиві замість аналізу зручного для читання виведення stdout.

Поширені помилки

Пов’язані матеріали