Providers

ds4

ds4 biedt DeepSeek V4 Flash aan vanuit een lokale Metal-backend met een OpenAI-compatibele /v1-API. OpenClaw maakt verbinding met ds4 via de generieke providerfamilie openai-completions.

ds4 is geen gebundelde OpenClaw-providerplugin. Configureer deze onder models.providers.ds4 en selecteer vervolgens ds4/deepseek-v4-flash.

Eigenschap Waarde
Provider-id ds4
Plugin geen (alleen configuratie)
API OpenAI-compatibele Chat Completions (openai-completions)
Basis-URL http://127.0.0.1:18000/v1 (aanbevolen)
Model-id deepseek-v4-flash
Toolaanroepen OpenAI-stijl tools / tool_calls
Redeneren DeepSeek-stijl thinking en reasoning_effort

Vereisten

  • macOS met Metal-ondersteuning.
  • Een werkende ds4-check-out met ds4-server en het GGUF-bestand van DeepSeek V4 Flash.
  • Voldoende geheugen voor de gekozen context; grotere waarden voor --ctx wijzen bij het opstarten van de server meer KV-geheugen toe.

Snelstart

  • Start ds4-server

    Vervang <DS4_DIR> door het pad naar je ds4-check-out.

    bash
    <DS4_DIR>/ds4-server \  --model <DS4_DIR>/ds4flash.gguf \  --host 127.0.0.1 \  --port 18000 \  --ctx 32768 \  --tokens 128
  • Controleer het OpenAI-compatibele eindpunt

    bash
    curl http://127.0.0.1:18000/v1/models

    Het antwoord moet deepseek-v4-flash bevatten.

  • Voeg de OpenClaw-providerconfiguratie toe

    Voeg de configuratie uit Volledige configuratie toe en voer vervolgens een eenmalige modelcontrole uit:

    bash
    openclaw infer model run \  --local \  --model ds4/deepseek-v4-flash \  --thinking off \  --prompt "Antwoord exact met: openclaw-ds4-ok" \  --json
  • Volledige configuratie

    Gebruik deze configuratie wanneer ds4 al op 127.0.0.1:18000 wordt uitgevoerd.

    json5
    {  agents: {    defaults: {      model: { primary: "ds4/deepseek-v4-flash" },      models: {        "ds4/deepseek-v4-flash": {          alias: "DS4 lokaal",        },      },    },  },  models: {    mode: "merge",    providers: {      ds4: {        baseUrl: "http://127.0.0.1:18000/v1",        apiKey: "ds4-local",        api: "openai-completions",        timeoutSeconds: 300,        models: [          {            id: "deepseek-v4-flash",            name: "DeepSeek V4 Flash (ds4)",            reasoning: true,            input: ["text"],            cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },            contextWindow: 32768,            maxTokens: 128,            compat: {              supportsUsageInStreaming: true,              supportsReasoningEffort: true,              maxTokensField: "max_tokens",              supportsStrictMode: false,              thinkingFormat: "deepseek",              supportedReasoningEfforts: ["low", "medium", "high", "xhigh"],            },          },        ],      },    },  },}

    Houd contextWindow afgestemd op ds4-server --ctx. Houd maxTokens afgestemd op --tokens, tenzij je bewust wilt dat OpenClaw minder uitvoer aanvraagt dan de standaardwaarde van de server.

    Op aanvraag starten

    OpenClaw kan ds4 alleen starten wanneer een ds4/...-model is geselecteerd. Voeg localService toe aan dezelfde providervermelding:

    json5
    {  models: {    providers: {      ds4: {        baseUrl: "http://127.0.0.1:18000/v1",        apiKey: "ds4-local",        api: "openai-completions",        timeoutSeconds: 300,        localService: {          command: "<DS4_DIR>/ds4-server",          args: [            "--model",            "<DS4_DIR>/ds4flash.gguf",            "--host",            "127.0.0.1",            "--port",            "18000",            "--ctx",            "32768",            "--tokens",            "128",          ],          cwd: "<DS4_DIR>",          healthUrl: "http://127.0.0.1:18000/v1/models",          readyTimeoutMs: 300000,          idleStopMs: 0,        },        models: [          {            id: "deepseek-v4-flash",            name: "DeepSeek V4 Flash (ds4)",            reasoning: true,            input: ["text"],            cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },            contextWindow: 32768,            maxTokens: 128,            compat: {              supportsUsageInStreaming: true,              supportsReasoningEffort: true,              maxTokensField: "max_tokens",              supportsStrictMode: false,              thinkingFormat: "deepseek",              supportedReasoningEfforts: ["low", "medium", "high", "xhigh"],            },          },        ],      },    },  },}

    command moet een absoluut pad naar een uitvoerbaar bestand zijn. Shellopzoeking en uitbreiding van ~ worden niet gebruikt. Zie Lokale modelservices voor elk localService-veld.

    Think Max

    ds4 past Think Max alleen toe wanneer aan beide voorwaarden wordt voldaan:

    • ds4-server start met --ctx 393216 of hoger.
    • De aanvraag gebruikt reasoning_effort: "max" (of het equivalente ds4-inspanningsveld).

    Als je die grote context gebruikt, werk dan zowel de servervlaggen als de OpenClaw-modelmetadata bij:

    json5
    {  contextWindow: 393216,  maxTokens: 384000,  compat: {    supportsUsageInStreaming: true,    supportsReasoningEffort: true,    maxTokensField: "max_tokens",    supportsStrictMode: false,    thinkingFormat: "deepseek",    supportedReasoningEfforts: ["low", "medium", "high", "xhigh", "max"],  },}

    Test

    Directe HTTP-controle, waarbij OpenClaw wordt omzeild:

    bash
    curl http://127.0.0.1:18000/v1/chat/completions \  -H 'content-type: application/json' \  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Antwoord exact met: ds4-ok"}],"max_tokens":16,"stream":false,"thinking":{"type":"disabled"}}'

    OpenClaw-modelroutering (hetzelfde als de controle in Snelstart):

    bash
    openclaw infer model run \  --local \  --model ds4/deepseek-v4-flash \  --thinking off \  --prompt "Antwoord exact met: openclaw-ds4-ok" \  --json

    Volledige rooktest voor agent- en toolaanroepen, met een context van ten minste 32768:

    bash
    openclaw agent \  --local \  --session-id ds4-tool-smoke \  --model ds4/deepseek-v4-flash \  --thinking off \  --message "Gebruik eenmaal de shellopdracht pwd en antwoord daarna exact met: tool-ok <output>" \  --json \  --timeout 240

    Verwacht resultaat:

    • executionTrace.winnerProvider is ds4
    • executionTrace.winnerModel is deepseek-v4-flash
    • toolSummary.calls is ten minste 1
    • finalAssistantVisibleText begint met tool-ok

    Problemen oplossen

    curl /v1/models kan geen verbinding maken

    ds4 wordt niet uitgevoerd of is niet gebonden aan de host/poort in baseUrl. Start ds4-server en probeer het opnieuw:

    bash
    curl http://127.0.0.1:18000/v1/models
    500 prompt overschrijdt context

    De geconfigureerde --ctx is te klein voor de OpenClaw-beurt. Verhoog ds4-server --ctx en werk vervolgens models.providers.ds4.models[].contextWindow bij zodat deze overeenkomt. Volledige agentbeurten met tools hebben aanzienlijk meer context nodig dan een directe curl-aanvraag met één bericht.

    Think Max wordt niet geactiveerd

    ds4 gebruikt Think Max alleen wanneer --ctx ten minste 393216 is en de aanvraag om reasoning_effort: "max" vraagt. Kleinere contexten vallen terug op een hoog redeneerniveau.

    De eerste aanvraag is traag

    ds4 heeft een koude Metal-residentie en een opwarmfase voor het model. Stel localService.readyTimeoutMs: 300000 in wanneer OpenClaw de server op aanvraag start.

    Gerelateerd

    Was this useful?
    On this page

    On this page