Skip to main content
inferrs disponibiliza modelos locais por meio de uma API /v1 compatível com a OpenAI. O OpenClaw se comunica com ele por meio do adaptador genérico openai-completions.
O inferrs é um backend personalizado, auto-hospedado e compatível com a OpenAI, não um plugin de provedor dedicado do OpenClaw: você o configura em models.providers.inferrs em vez de escolher uma opção de autenticação durante a integração inicial. Para um plugin incluído com descoberta automática, consulte SGLang ou vLLM.

Primeiros passos

1

Inicie o inferrs com um modelo

2

Verifique se o servidor está acessível

3

Adicione uma entrada de provedor do OpenClaw

Adicione uma entrada explícita de provedor e aponte seu modelo padrão para ela. Consulte o exemplo de configuração abaixo.

Exemplo de configuração completa

Gemma 4 em um servidor inferrs local:

Inicialização sob demanda

O OpenClaw pode iniciar o próprio inferrs somente quando um modelo inferrs/... estiver selecionado. Adicione localService à mesma entrada de provedor:
command deve ser um caminho absoluto. Execute which inferrs no host do Gateway e use esse caminho. Referência completa dos campos: Serviços de modelos locais.

Configuração avançada

Algumas rotas de Chat Completions do inferrs aceitam apenas valores de string em messages[].content, e não matrizes estruturadas de partes de conteúdo.
Se as execuções do OpenClaw falharem com:
defina compat.requiresStringContent: true na entrada do modelo. O OpenClaw então converte partes de conteúdo compostas somente por texto em strings simples antes de enviar a solicitação.
Algumas combinações de inferrs + Gemma aceitam pequenas solicitações diretas para /v1/chat/completions, mas falham em turnos completos do runtime de agentes do OpenClaw. Primeiro, tente desabilitar a superfície do esquema de ferramentas:
Isso reduz a pressão do prompt sobre backends locais mais rigorosos. Se pequenas solicitações diretas ainda funcionarem, mas turnos normais de agentes do OpenClaw continuarem causando falhas no inferrs, considere isso uma limitação do modelo ou servidor upstream, e não um problema de transporte do OpenClaw.
Teste as duas camadas após a configuração:
Se o primeiro comando funcionar, mas o segundo falhar, consulte a seção Solução de problemas abaixo.
Como o inferrs usa o adaptador genérico openai-completions (e não openai-responses), a formatação de solicitações exclusiva da OpenAI nativa nunca é aplicada: nenhum service_tier, nenhum store da Responses, nenhuma dica de cache de prompt e nenhuma formatação de payload de compatibilidade de raciocínio da OpenAI são enviados.

Solução de problemas

O inferrs não está em execução, não está acessível ou não está vinculado ao host/porta que você configurou. Confirme se o servidor foi iniciado e está escutando nesse endereço.
Defina compat.requiresStringContent: true na entrada do modelo (consulte acima).
Defina compat.supportsTools: false para desabilitar a superfície do esquema de ferramentas (consulte a ressalva sobre o Gemma acima).
Se os erros de esquema desaparecerem, mas o inferrs ainda falhar em turnos maiores de agentes, considere isso uma limitação upstream do inferrs ou do modelo. Reduza a pressão do prompt ou troque de backend/modelo.
Para obter ajuda geral, consulte Solução de problemas e Perguntas frequentes.

Relacionados

Modelos locais

Execução do OpenClaw com servidores de modelos locais.

Serviços de modelos locais

Inicialização sob demanda de servidores de modelos locais para provedores configurados.

Solução de problemas do Gateway

Depuração de backends locais compatíveis com a OpenAI que passam nas verificações, mas falham nas execuções de agentes.

Seleção de modelos

Visão geral de todos os provedores, referências de modelos e comportamento de failover.