llama-cpp is de officiële externe providerplugin voor lokale GGUF-tekstinferentie
en embeddings binnen hetzelfde proces. Deze registreert tekstprovider llama-cpp,
embeddingprovider local en beheert de native runtime node-llama-cpp.
Installeer deze voordat je lokale inferentie of lokale geheugenembeddings gebruikt:
openclaw bevat node-llama-cpp niet. Door de
native afhankelijkheid in deze plugin te houden, wordt voorkomen dat normale npm-updates van OpenClaw
een handmatig geïnstalleerde runtime in de pakketmap van OpenClaw
verwijderen.
Lokale tekstinferentie
Kies Lokaal model (llama.cpp) tijdens de interactieve onboarding. OpenClaw vraagt om bevestiging voordat het standaardmodel wordt gedownload:hf:bartowski/Qwen_Qwen3-4B-Instruct-2507-GGUF/Qwen_Qwen3-4B-Instruct-2507-Q4_K_M.gguf
Het bestand Qwen3 4B Instruct 2507 Q4_K_M is ongeveer 2,5 GB groot. Reken op circa 3 GB
RAM voor de modelgewichten, plus de context en overhead van de OpenClaw-runtime. De standaardcontext
wordt automatisch ingesteld met een limiet van 8.192 tokens, zodat deze praktisch bruikbaar blijft
op machines met 8 GB. Configureer alleen een grotere context als de machine voldoende
geheugen heeft.
De detectiecontrole tijdens de onboarding is alleen-lezen. llama.cpp wordt alleen automatisch
aangeboden wanneer het standaard of geconfigureerde GGUF-bestand al in de modelcache staat; tijdens
de detectie wordt nooit iets gedownload. Ollama en LM Studio blijven afzonderlijke opties voor lokale
services en behouden hun eigen detectieflows. llama.cpp handmatig kiezen
is de manier om de vraag voor het downloaden van het standaardmodel te krijgen.
De provider gebruikt de ingebouwde chatsjabloon van het GGUF-model en native
functieaanroepen van node-llama-cpp. Tekst wordt token voor token gestreamd. Toolaanroepen worden
voor uitvoering teruggestuurd naar OpenClaw in plaats van binnen node-llama-cpp te worden uitgevoerd.
Een ander GGUF-model gebruiken
Voeg een model toe aanmodels.providers.llama-cpp. Plaats een lokaal pad of een volledige hf:-bestands-URI
in params.modelPath:
hf:-URI
eerst het GGUF-bestand naar modelCacheDir. Detectie gebruikt de
eigen alleen-lezen cache-resolver van node-llama-cpp, inclusief naamgeving voor repository’s, branches en gesplitste bestanden.
Configuratie van geheugenembeddings
Stelmemory.search.provider in op local:
local.modelPath gebruikt standaard de hierboven getoonde hf:-URI (embeddinggemma-300m-qat-Q8_0.gguf).
Verwijs naar een andere hf:-URI of een lokaal .gguf-bestand om een ander
model te gebruiken. local.modelCacheDir overschrijft waar gedownloade modellen in de cache worden opgeslagen
(standaard: ~/.node-llama-cpp/models) en local.contextSize accepteert een
geheel getal of "auto".
Wanneer local.contextSize numeriek is, geeft de provider die vereiste ook
door aan de automatische plaatsing van GPU-lagen door node-llama-cpp. Hierdoor kan node-llama-cpp
het model en de embeddingcontext samen inpassen, terwijl de controles voor
geheugenveiligheid behouden blijven. Met "auto" behoudt node-llama-cpp de normale automatische plaatsing.
Native runtime
Gebruik Node 24 voor het soepelste native installatieproces. Broncodecheck-outs die pnpm gebruiken, moeten mogelijk de native afhankelijkheid goedkeuren en opnieuw bouwen:Diagnostiek voor de geheugenruntime
Voeropenclaw memory status --deep uit nadat de provider is geladen om
de geselecteerde backend en build, apparaatnamen, naar de GPU overgehevelde lagen, aangevraagde
contextgrootte en de laatst waargenomen momentopname van VRAM of gedeeld geheugen te inspecteren. De VRAM-
waarden bevatten een tijdstempel van de waarneming, omdat passieve statusuitlezingen het model niet
opnieuw laden en het apparaat niet pollen.
Dezelfde laatst bekende gegevens kunnen in openclaw doctor verschijnen wanneer de actieve
Gateway de lokale provider al heeft gebruikt. Een normale status- of doctor-opdracht
laadt geen model alleen om diagnostische gegevens te verzamelen.
Probleemoplossing
Alsnode-llama-cpp ontbreekt of niet kan worden geladen, meldt OpenClaw de fout
met:
- Installeer de plugin:
openclaw plugins install @openclaw/llama-cpp-provider. - Gebruik Node 24 voor native installaties/updates.
- Vanuit een pnpm-broncodecheck-out:
pnpm approve-builds, daarnapnpm rebuild node-llama-cpp.
memory.search.provider in op een externe embeddingprovider zoals lmstudio,
ollama, openai of voyage.