Skip to main content
vLLM, açık kaynaklı (ve bazı özel) modelleri OpenAI uyumlu bir HTTP API aracılığıyla sunar. OpenClaw, openai-completions API’sini kullanarak bağlanır ve VLLM_API_KEY ile etkinleştirdiğinizde modelleri otomatik olarak keşfedebilir.

Başlarken

1

vLLM'yi OpenAI uyumlu bir sunucuyla başlatın

Temel URL’niz /v1 uç noktalarını (/v1/models, /v1/chat/completions) sunmalıdır. vLLM genellikle şu adreste çalışır:
2

API anahtarı ortam değişkenini ayarlayın

Sunucunuz kimlik doğrulamayı zorunlu kılmıyorsa boş olmayan herhangi bir değer kullanılabilir:
3

Bir model seçin

Aşağıdakini vLLM model kimliklerinizden biriyle değiştirin:
4

Modelin kullanılabilir olduğunu doğrulayın

Etkileşimsiz kurulumda (CI, betik çalıştırma) temel URL’yi, anahtarı ve modeli doğrudan iletin:

Model keşfi (örtük sağlayıcı)

VLLM_API_KEY ayarlandığında (veya bir kimlik doğrulama profili bulunduğunda) ve models.providers.vllm tanımlı olmadığında, OpenClaw GET http://127.0.0.1:8000/v1/models sorgusu yapar ve döndürülen kimlikleri model girdilerine dönüştürür.
models.providers.vllm değerini açıkça ayarlarsanız OpenClaw yalnızca bildirdiğiniz modelleri kullanır. OpenClaw’ın yapılandırılmış sağlayıcının /models uç noktasını da sorgulaması ve duyurulan tüm vLLM modellerini dahil etmesi için agents.defaults.models öğesine "vllm/*": {} ekleyin.

Açık yapılandırma

vLLM farklı bir ana makine veya bağlantı noktasında çalışıyorsa, contextWindow/maxTokens değerlerini sabitlemek istiyorsanız, sunucunuz gerçek bir API anahtarı gerektiriyorsa ya da güvenilir bir geri döngü, LAN veya Tailscale uç noktasına bağlanıyorsanız açıkça yapılandırın:
Her modeli listelemeden sağlayıcıyı dinamik tutmak için görünür model kataloğuna bir joker karakter ekleyin:

Gelişmiş yapılandırma

vLLM, yerel bir OpenAI uç noktası olarak değil, proxy tarzı OpenAI uyumlu bir /v1 arka ucu olarak ele alınır:
Qwen modellerinde, sunucu Qwen sohbet şablonu anahtar sözcük bağımsız değişkenlerini bekliyorsa model satırında compat.thinkingFormat: "qwen-chat-template" ayarlayın. Qwen sohbet şablonundaki düşünme özelliği OpenAI tarzı bir çaba kademesi değil, açık/kapalı bayrağı olduğundan bu modeller ikili bir /think profili (off, on) sunar.
OpenClaw, /think off değerini şuna eşler:
off dışındaki düşünme düzeyleri enable_thinking: true gönderir. Uç noktanız bunun yerine DashScope tarzı üst düzey bayraklar bekliyorsa istek kökünde enable_thinking göndermek için compat.thinkingFormat: "qwen" kullanın.
Düşünme kapalıyken vllm/nemotron-3-* modelleri için paketle gelen plugin şunu gönderir:
Bu değerleri özelleştirmek için model parametreleri altında chat_template_kwargs ayarlayın. params.extra_body.chat_template_kwargs değerini de ayarlarsanız extra_body son istek gövdesi geçersiz kılması olduğundan bu değer öncelikli olur.
Öncelikle vLLM’nin model için doğru araç çağrısı ayrıştırıcısı ve sohbet şablonuyla başlatıldığını doğrulayın. vLLM, Qwen2.5 modelleri için hermes, Qwen3-Coder modelleri için ise qwen3_xml kullanımını belgeler.Belirtiler: Skills/araçlar hiç çalışmaz, asistan {"name":"read","arguments":...} gibi ham JSON/XML yazdırır veya OpenClaw tool_choice: "auto" gönderdiğinde vLLM boş bir tool_calls dizisi döndürür.Bazı Qwen/vLLM birleşimleri yalnızca istek tool_choice: "required" kullandığında yapılandırılmış araç çağrıları döndürür. params.extra_body ile model başına zorunlu kılın:
Model kimliğini openclaw models list --provider vllm çıktısındaki tam kimlikle değiştirin veya aynı geçersiz kılmayı CLI üzerinden uygulayın:
Bu, isteğe bağlı bir geçici çözümdür: araçların bulunduğu her turu bir araç çağrısı yapmaya zorlar; bu nedenle yalnızca bunun kabul edilebilir olduğu özel bir model girdisinde kullanın. Bunu tüm vLLM modelleri için genel varsayılan olarak ayarlamayın ve rastgele asistan metnini yürütülebilir araç çağrılarına dönüştüren bir proxy ile birlikte kullanmayın.
vLLM sunucunuz varsayılan olmayan bir ana makine veya bağlantı noktasında çalışıyorsa açık sağlayıcı yapılandırmasında baseUrl ayarlayın:

Sorun giderme

Büyük yerel modeller, uzak LAN ana makineleri veya tailnet bağlantıları için sağlayıcı kapsamlı bir istek zaman aşımı ayarlayın:
timeoutSeconds yalnızca vLLM model HTTP isteklerine uygulanır: bağlantı kurulumu, yanıt üstbilgileri, gövde akışı ve korumalı getirme işleminin toplam iptali. Ayrıca LLM boşta kalma/akış gözetleyicisi üst sınırını bu sağlayıcı için örtük ~120s varsayılanının üzerine çıkarır. Tüm ajan çalışmasını denetleyen agents.defaults.timeoutSeconds değerini artırmak yerine bunu tercih edin.
vLLM sunucusunun çalıştığını ve erişilebilir olduğunu denetleyin:
Bağlantı hatası görürseniz ana makineyi, bağlantı noktasını ve vLLM’nin OpenAI uyumlu sunucu modunda başlatıldığını doğrulayın. OpenClaw, geri döngü, LAN ve Tailscale uç noktalarındaki korumalı model istekleri için tam olarak yapılandırılmış models.providers.vllm.baseUrl kaynağına güvenir. Meta veri/yerel bağlantı kaynakları açıkça etkinleştirilmedikçe engellenmeye devam eder. Yalnızca vLLM isteklerinin başka bir özel kaynağa ulaşması gerektiğinde models.providers.vllm.request.allowPrivateNetwork: true, tam kaynak güveninden vazgeçmek için ise false ayarlayın.
İstekler kimlik doğrulama hatalarıyla başarısız oluyorsa sunucu yapılandırmanızla eşleşen gerçek bir VLLM_API_KEY ayarlayın veya sağlayıcıyı models.providers.vllm altında açıkça yapılandırın.
vLLM sunucunuz kimlik doğrulamayı zorunlu kılmıyorsa VLLM_API_KEY için boş olmayan herhangi bir değer, OpenClaw açısından etkinleştirme sinyali olarak çalışır.
Otomatik keşif için VLLM_API_KEY ayarlanmış olmalıdır. models.providers.vllm tanımladıysanız agents.defaults.models içinde "vllm/*": {} bulunmadığı sürece OpenClaw yalnızca bildirdiğiniz modelleri kullanır.
Bir Qwen modeli Skill çalıştırmak yerine JSON/XML araç söz dizimini yazdırıyorsa:
  • vLLM’yi bu model için doğru ayrıştırıcı/şablonla başlatın.
  • Tam model kimliğini openclaw models list --provider vllm ile doğrulayın.
  • Yalnızca tool_choice: "auto" hâlâ boş veya yalnızca metin içeren araç çağrıları döndürüyorsa modele özel bir params.extra_body.tool_choice: "required" geçersiz kılması ekleyin.
Daha fazla yardım: Sorun giderme ve SSS.

İlgili

Model seçimi

Sağlayıcıları, model referanslarını ve yük devretme davranışını seçme.

OpenAI

Yerel OpenAI sağlayıcısı ve OpenAI uyumlu rota davranışı.

OAuth ve kimlik doğrulama

Kimlik doğrulama ayrıntıları ve kimlik bilgilerini yeniden kullanma kuralları.

Sorun giderme

Yaygın sorunlar ve bunların nasıl çözüleceği.