Skip to main content
image_generate ツールは、設定済みのプロバイダーを通じて画像を生成・編集します。チャットセッションでは非同期で実行されます。OpenClaw はバックグラウンドタスクを記録し、タスク ID を直ちに返し、プロバイダーの処理が完了するとエージェントを起動します。完了処理を行うエージェントは、セッションの通常の表示応答モードに従います。設定されている場合は最終応答を自動的に配信し、セッションでメッセージツールが必要な場合は message(action="send") を使用します。リクエスト元のセッションが非アクティブであるか、アクティブな起動に失敗した場合、結果が失われないよう、OpenClaw は生成された画像を含む冪等な直接フォールバックを送信します。
このツールは、画像生成プロバイダーが少なくとも 1 つ利用可能な場合にのみ表示されます。エージェントのツールに image_generate が表示されない場合は、agents.defaults.mediaModels.image を設定し、プロバイダーの API キーをセットアップするか、OpenAI ChatGPT/Codex OAuth でサインインしてください。

クイックスタート

1

認証を設定

少なくとも 1 つのプロバイダーの API キー(例: OPENAI_API_KEYGEMINI_API_KEYOPENROUTER_API_KEY)を設定するか、OpenAI Codex OAuth でサインインします。
2

デフォルトモデルを選択(任意)

ChatGPT/Codex OAuth は同じ openai/gpt-image-2 モデル参照を使用します。openai OAuth プロファイルが設定されている場合、OpenClaw は最初に OPENAI_API_KEY を試すのではなく、その OAuth プロファイルを通じて画像リクエストをルーティングします。models.providers.openai の明示的な設定(API キー、カスタム/Azure ベース URL)を行うと、OpenAI Images API の直接ルートに戻ります。
3

エージェントに依頼

「親しみやすいロボットのマスコット画像を生成してください。」エージェントは image_generate を自動的に呼び出します。ツールの許可リストへの追加は不要です。プロバイダーが利用可能な場合、デフォルトで有効になります。ツールはバックグラウンドタスク ID を返し、準備が完了すると、完了処理を行うエージェントが message ツールを通じて生成された添付ファイルを送信します。
LocalAI などの OpenAI 互換 LAN エンドポイントでは、カスタム models.providers.openai.baseUrl を維持し、browser.ssrfPolicy.dangerouslyAllowPrivateNetwork: true で明示的にオプトインしてください。プライベートおよび内部の画像エンドポイントは、デフォルトでは引き続きブロックされます。

一般的なルート

同じツールで、テキストからの画像生成と参照画像の編集を処理します。参照画像が 1 つの場合は image、複数の場合は images を使用します。fal の Krea 2 モデルでは、これらの参照画像は編集入力ではなくスタイル参照として送信されます。qualityoutputFormatbackground など、プロバイダーがサポートする出力ヒントは、利用可能な場合に転送されます。プロバイダーがサポートを宣言していない場合は、無視されたものとして報告されます。組み込みの背景透過サポートは OpenAI 固有です。他のプロバイダーでも、バックエンドが PNG アルファを出力する場合は維持されることがあります。

サポート対象プロバイダー

実行時に利用可能なプロバイダーとモデルを確認するには、action: "list" を使用します。
現在のセッションでアクティブな画像生成タスクを確認するには、action: "status" を使用します。

プロバイダーの機能

ツールパラメーター

string
必須
画像生成プロンプト。action: "generate" では必須です。
"generate" | "status" | "list"
デフォルト:"generate"
アクティブなセッションタスクを確認するには "status"、実行時に利用可能なプロバイダーとモデルを確認するには "list" を使用します。
string
プロバイダー/モデルの上書き(例: openai/gpt-image-2)。OpenAI の背景を透過するには openai/gpt-image-1.5 を使用します。
string
編集モード用の単一の参照画像パスまたは URL。
string[]
編集モードまたはスタイル参照モデル用の複数の参照画像(共有ツールでは最大 14、プロバイダー固有の制限も引き続き適用されます)。
string
サイズヒント: 1024x10241536x10241024x15362048x20483840x2160
string
アスペクト比: 1:12:120:919.5:92:33:22.35:13:44:34:55:49:169:19.59:2016:921:91:24:11:48:11:8。プロバイダーは、各モデル固有のサブセットを検証します。
"1K" | "2K" | "4K"
解像度ヒント。
"low" | "medium" | "high" | "auto"
プロバイダーがサポートしている場合の品質ヒント。
"png" | "jpeg" | "webp"
プロバイダーがサポートしている場合の出力形式ヒント。
"transparent" | "opaque" | "auto"
プロバイダーがサポートしている場合の背景ヒント。透過対応プロバイダーでは、transparentoutputFormat: "png" または "webp" と組み合わせて使用します。
number
生成する画像数(1-4)。
number
プロバイダーへのリクエストのタイムアウト(ミリ秒、省略可能)。Codex が動的ツールを通じて image_generate を呼び出す場合も、この呼び出しごとの値が設定済みのデフォルトを上書きし、上限は 600000 ms です。
string
出力ファイル名のヒント。
object
OpenAI 専用のヒント: backgroundmoderationoutputCompressionuser
"raw" | "low" | "medium" | "high"
fal Krea 2 の創造性制御。デフォルトは medium です。
すべてのプロバイダーがすべてのパラメーターをサポートしているわけではありません。フォールバックプロバイダーが、要求されたものと完全に一致するオプションではなく近いジオメトリオプションをサポートしている場合、OpenClaw は送信前に、最も近いサポート対象のサイズ、アスペクト比、または解像度に再マッピングします。サポートを宣言していないプロバイダーでは、サポートされていない出力ヒントは削除され、ツール結果で報告されます。ツール結果には適用された設定が表示され、details.normalization には要求値から適用値への変換が記録されます。

設定

モデルの選択

プロバイダーの選択順序

OpenClaw は次の順序でプロバイダーを試行します。
  1. ツール呼び出しの model パラメーター(エージェントが指定した場合)。
  2. 設定の imageGenerationModel.primary
  3. 順番に imageGenerationModel.fallbacks
  4. 自動検出 - 認証情報のあるプロバイダーのデフォルトのみ:
    • 現在のデフォルトプロバイダーを最初に試行;
    • 残りの登録済み画像生成プロバイダーをプロバイダー ID 順に試行。
プロバイダーが失敗した場合(認証エラー、レート制限など)、次に設定された 候補が自動的に試行されます。すべて失敗した場合、エラーには各試行の 詳細が含まれます。
呼び出しごとの model オーバーライドでは、そのプロバイダー/モデルのみが試行され、 設定されたプライマリ/フォールバックや自動検出されたプロバイダーには進みません。
OpenClaw が実際にプロバイダーを認証できる場合にのみ、そのプロバイダーのデフォルトが 候補リストに追加されます。認証済みプロバイダー間の自動フォールバックは 常に有効です。呼び出しごとの model が最優先されます。
低速な画像バックエンドには agents.defaults.mediaModels.image.timeoutMs を設定します。 呼び出しごとのツールパラメーター timeoutMs は設定済みのデフォルトを上書きし、 設定済みのデフォルトは Plugin が定義したプロバイダーのデフォルトを 上書きします。Google および OpenRouter がホストする画像プロバイダーのデフォルトは 180 秒です。 Microsoft Foundry MAI、xAI、Azure OpenAI の画像生成では 600 秒です。Codex の動的ツール呼び出しでは、ブリッジのデフォルト image_generate として 120 秒を使用し、設定されている場合は同じタイムアウト予算を尊重しますが、 OpenClaw の動的ツールブリッジの上限である 600000 ms に制限されます。
現在登録されているプロバイダー、そのデフォルトモデル、 および認証用環境変数のヒントを確認するには action: "list" を使用します。

画像編集

OpenAI、OpenRouter、Google、DeepInfra、fal、Microsoft Foundry、MiniMax、 ComfyUI、xAI は、参照画像の編集をサポートしています。fal の Krea 2 モデルでは、 編集入力ではなくスタイル参照として、同じ image / images フィールドを 使用します。参照画像のパスまたは URL を渡します。
OpenAI、OpenRouter、Google は images パラメーターを介して最大 5 枚の参照画像を サポートし、xAI は最大 3 枚をサポートします。fal は Flux の image-to-image では参照画像 1 枚、 GPT Image 2 の編集では最大 10 枚、Krea 2 のスタイル参照では最大 10 枚、 Nano Banana 2 の編集では最大 14 枚をサポートします。Microsoft Foundry、MiniMax、 ComfyUI は 1 枚をサポートします。

プロバイダーの詳細

OpenAI の画像生成では、デフォルトで openai/gpt-image-2 を使用します。 openai OAuth プロファイルが設定されている場合、OpenClaw は Codex サブスクリプションのチャットモデルで使用されるものと同じ OAuth プロファイルを再利用し、 Codex Responses バックエンドを介して画像リクエストを送信します。 https://chatgpt.com/backend-api などの従来の Codex ベース URL は、 画像リクエスト用に https://chatgpt.com/backend-api/codex へ正規化されます。OpenClaw は、 そのリクエストを暗黙に OPENAI_API_KEY へフォールバックしません。 OpenAI Images API へ直接ルーティングするには、API キー、カスタムベース URL、 または Azure エンドポイントを指定して models.providers.openai を明示的に設定してください。openai/gpt-image-1.5openai/gpt-image-1openai/gpt-image-1-mini の各モデルも、引き続き明示的に選択できます。 背景が透明な PNG/WebP 出力には gpt-image-1.5 を使用します。現在の gpt-image-2 API は background: "transparent" を拒否します。gpt-image-2 は、同じ image_generate ツールを介して、 テキストからの画像生成と参照画像の編集の両方をサポートします。 OpenClaw は、promptcountsizequalityoutputFormat、 および参照画像を OpenAI に転送します。OpenAI が aspectRatio または resolution を直接受け取ることはありません。 可能な場合、OpenClaw はそれらをサポートされている size にマッピングし、 それ以外の場合、ツールは無視されたオーバーライドとして報告します。OpenAI 固有のオプションは openai オブジェクト内にあります。
openai.backgroundtransparentopaqueauto のいずれかを受け付けます。 透明な出力には、outputFormat png または webp と、 透過に対応する OpenAI 画像モデルが必要です。OpenClaw は、デフォルトの gpt-image-2 透過背景リクエストを gpt-image-1.5 にルーティングします。 openai.outputCompression は JPEG/WebP 出力に適用され、PNG 出力では無視されます。トップレベルの background ヒントはプロバイダーに依存せず、現在は OpenAI プロバイダーが選択された場合に、同じ OpenAI の background リクエストフィールドへマッピングされます。背景サポートを宣言していないプロバイダーには、 サポートされていないパラメーターを渡す代わりに、ignoredOverrides 内で返します。OpenAI の画像生成を api.openai.com ではなく Azure OpenAI デプロイメント経由で ルーティングするには、Azure OpenAI エンドポイントを 参照してください。
Microsoft Foundry の画像生成では、microsoft-foundry/ プロバイダープレフィックスの下で、 デプロイ済みの MAI 画像デプロイメント名を使用します。MAI API は model フィールドにデプロイメント名が指定されることを想定するため、 プロバイダーレベルのデフォルトモデルはありません。
このプロバイダーは OpenAI Images API ではなく、Microsoft Foundry の MAI API を使用します。
  • 生成エンドポイント:/mai/v1/images/generations
  • 編集エンドポイント:/mai/v1/images/edits
  • 認証:AZURE_OPENAI_API_KEY / プロバイダー API キー、または az login を介した Entra ID
  • 出力:PNG 画像 1 枚
  • サイズ:デフォルトは 1024x1024。幅と高さはそれぞれ 768 px 以上、 総ピクセル数は 1,048,576 以下である必要があります
  • 編集:PNG または JPEG の参照画像 1 枚。MAI-Image-2.5-Flash および MAI-Image-2.5 デプロイメントのみがサポートします
プロンプトのみの生成では、Foundry エンドポイントだけを設定して カスタムデプロイメント名を使用できます。カスタムデプロイメント名による編集には、 そのデプロイメントが MAI-Image-2.5-Flash または MAI-Image-2.5 を基盤としていることを OpenClaw が検証できるよう、オンボーディング/モデルのメタデータが必要です。現在の MAI 画像モデルは MAI-Image-2.5-FlashMAI-Image-2.5MAI-Image-2eMAI-Image-2 です。セットアップと チャットモデルの動作については、Microsoft Foundry Pluginを 参照してください。
OpenRouter の画像生成では同じ OPENROUTER_API_KEY を使用し、 OpenRouter の Chat Completions 画像 API を介してルーティングします。 openrouter/ プレフィックスで OpenRouter 画像モデルを選択します。
OpenClaw は、promptcount、参照画像、および Gemini 互換の aspectRatio / resolution ヒントを OpenRouter に転送します。 現在組み込まれている OpenRouter 画像モデルのショートカットには、 google/gemini-3.1-flash-imagegoogle/gemini-3-pro-imageopenai/gpt-5.4-image-2 があります。設定済みの Plugin が公開する内容を 確認するには action: "list" を使用します。
fal の Krea 2 モデルでは、Flux が使用する汎用の image_size スキーマではなく、fal ネイティブの Krea スキーマを使用します。 OpenClaw は次の値を送信します。
  • アスペクト比のヒントには aspect_ratio
  • creativity。デフォルトは medium
  • image または images が指定された場合は image_style_references
より高速で表現力豊かなイラストには Krea 2 Medium を、 より低速で詳細な写実的表現や質感のある外観には Krea 2 Large を選択します。
Krea 2 は現在、リクエストごとに画像を 1 枚返します。Krea には aspectRatio の使用を 推奨します。OpenClaw は size を、サポートされる最も近い Krea アスペクト比にマッピングし、 Krea で resolution を破棄するのではなく拒否します。Krea ネイティブの創造性レベルを 使用する場合は fal.creativity を使用します。
MiniMax の画像生成は、同梱されている両方の MiniMax 認証経路で利用できます。
  • API キーによるセットアップには minimax/image-01
  • OAuth によるセットアップには minimax-portal/image-01
同梱の xAI プロバイダーは、プロンプトのみのリクエストには /v1/images/generations を使用し、 image または images が存在する場合は /v1/images/edits を使用します。
  • モデル:xai/grok-imagine-imagexai/grok-imagine-image-quality
  • 枚数:最大 4
  • 参照:image 1 枚、または images 最大 3 枚
  • アスペクト比:1:116:99:164:33:43:22:32:11:219.5:99:19.520:99:20
  • 解像度:1K2K
  • 出力:OpenClaw が管理する画像添付ファイルとして返されます
OpenClaw は、これらの制御がプロバイダー間で共有される image_generate コントラクトに存在するようになるまで、xAI ネイティブの qualitymaskuser、 および auto アスペクト比を意図的に公開しません。

同じ --output-format--background--quality、および --openai-moderation フラグを openclaw infer image edit でも使用できます。 --openai-background は OpenAI 固有のエイリアスとして引き続き使用できます。現在、 OpenAI 以外のバンドル済みプロバイダーは明示的な背景制御を宣言していないため、 それらでは background: "transparent" が無視されたものとして報告されます。

関連項目

  • ツールの概要 - 利用可能なすべてのエージェントツール
  • ComfyUI - ローカル ComfyUI および Comfy Cloud のワークフロー設定
  • fal - fal の画像および動画プロバイダーの設定
  • Google(Gemini) - Gemini 画像プロバイダーの設定
  • Microsoft Foundry Plugin - Microsoft Foundry のチャットおよび MAI 画像の設定
  • MiniMax - MiniMax 画像プロバイダーの設定
  • OpenAI - OpenAI Images プロバイダーの設定
  • Vydra - Vydra の画像、動画、音声の設定
  • xAI - Grok の画像、動画、検索、コード実行、TTS の設定
  • 設定リファレンス - imageGenerationModel の設定
  • モデル - モデルの設定とフェイルオーバー