Skip to main content
ds4 は、ローカルの Metal バックエンドから、OpenAI 互換の /v1 API を使用して DeepSeek V4 Flash を提供します。OpenClaw は汎用の openai-completions プロバイダーファミリーを通じて ds4 に接続します。 ds4 は OpenClaw に同梱されるプロバイダー Plugin ではありません。 models.providers.ds4 で設定してから、ds4/deepseek-v4-flash を選択します。

要件

  • Metal をサポートする macOS。
  • ds4-server と DeepSeek V4 Flash GGUF ファイルを含む、動作する ds4 チェックアウト。
  • 選択するコンテキストに十分なメモリ。--ctx の値を大きくすると、サーバー起動時に割り当てられる KV メモリが増加します。
OpenClaw のエージェントターンには、ツールスキーマとワークスペースコンテキストが含まれます。--ctx 4096 のような小さなコンテキストでは、 直接の curl テストには成功しても、完全なエージェント実行が 500 prompt exceeds context で失敗する可能性があります。エージェントとツールの スモークテストには少なくとも --ctx 32768 を使用してください。--ctx 393216 は、十分なメモリがあり、ds4 の Think Max を有効にする場合にのみ使用してください。

クイックスタート

1

ds4-server を起動する

<DS4_DIR> を ds4 チェックアウトのパスに置き換えます。
2

OpenAI 互換エンドポイントを確認する

レスポンスに deepseek-v4-flash が含まれている必要があります。
3

OpenClaw プロバイダー設定を追加する

完全な設定の設定を追加してから、1 回限りのモデルチェックを 実行します。

完全な設定

ds4 がすでに 127.0.0.1:18000 で実行されている場合は、この設定を使用します。
contextWindowds4-server --ctx と一致させてください。OpenClaw がサーバーのデフォルトよりも少ない出力を要求するよう意図している場合を除き、maxTokens--tokens と一致させてください。

オンデマンド起動

OpenClaw は、ds4/... モデルが選択された場合にのみ ds4 を起動できます。同じプロバイダーエントリに localService を追加します。
command は実行可能ファイルの絶対パスである必要があります。シェル検索と ~ 展開は 使用されません。すべての localService フィールドについては、ローカルモデルサービスを参照してください。

Think Max

ds4 は、次の両方が真の場合にのみ Think Max を適用します。
  • ds4-server--ctx 393216 以上で開始されている。
  • リクエストが reasoning_effort: "max"(または同等の ds4 effort フィールド)を使用している。
この大きなコンテキストを実行する場合は、サーバーフラグと OpenClaw のモデル メタデータの両方を更新します。

テスト

OpenClaw を経由しない直接 HTTP チェック:
OpenClaw モデルルーティング(クイックスタートのチェックと同じ):
少なくとも 32768 のコンテキストを使用した、完全なエージェントとツール呼び出しのスモークテスト:
期待される結果:
  • executionTrace.winnerProviderds4
  • executionTrace.winnerModeldeepseek-v4-flash
  • toolSummary.calls が少なくとも 1
  • finalAssistantVisibleTexttool-ok で始まる

トラブルシューティング

ds4 が実行されていないか、baseUrl のホスト/ポートにバインドされていません。 ds4-server を起動してから、再試行します。
設定された --ctx は、OpenClaw のターンには小さすぎます。 ds4-server --ctx を増やしてから、それに合わせて models.providers.ds4.models[].contextWindow を更新します。ツールを含む完全なエージェントターンには、1 メッセージだけの直接 curl リクエストよりも はるかに多くのコンテキストが必要です。
ds4 が Think Max を使用するのは、--ctx が少なくとも 393216 であり、リクエストが reasoning_effort: "max" を要求する場合のみです。より小さなコンテキストでは、高い 推論レベルにフォールバックします。
ds4 には、Metal への初回常駐処理とモデルのウォームアップフェーズがあります。OpenClaw がサーバーを オンデマンドで起動する場合は、localService.readyTimeoutMs: 300000 を設定します。

関連項目

ローカルモデルサービス

モデルリクエストの前に、ローカルモデルサーバーをオンデマンドで起動します。

ローカルモデル

ローカルモデルバックエンドを選択して運用します。

モデルプロバイダー

プロバイダー参照、認証、フェイルオーバーを設定します。

DeepSeek

ネイティブ DeepSeek プロバイダーの動作と thinking 制御。