Providers
ds4
ds4 stellt DeepSeek V4 Flash über ein lokales
Metal-Backend mit einer OpenAI-kompatiblen /v1-API bereit. OpenClaw verbindet sich mit ds4
über die generische openai-completions-Provider-Familie.
ds4 ist kein mitgeliefertes OpenClaw-Provider-Plugin. Konfigurieren Sie es unter
models.providers.ds4 und wählen Sie anschließend ds4/deepseek-v4-flash aus.
| Eigenschaft | Wert |
|---|---|
| Provider-ID | ds4 |
| Plugin | keines (nur Konfiguration) |
| API | OpenAI-kompatible Chat Completions (openai-completions) |
| Basis-URL | http://127.0.0.1:18000/v1 (empfohlen) |
| Modell-ID | deepseek-v4-flash |
| Tool-Aufrufe | OpenAI-Stil tools / tool_calls |
| Reasoning | DeepSeek-Stil thinking und reasoning_effort |
Anforderungen
- macOS mit Metal-Unterstützung.
- Ein funktionsfähiger ds4-Checkout mit
ds4-serverund der GGUF-Datei für DeepSeek V4 Flash. - Ausreichend Arbeitsspeicher für den gewählten Kontext; größere
--ctx-Werte weisen beim Serverstart mehr KV-Speicher zu.
Schnellstart
ds4-server starten
Ersetzen Sie <DS4_DIR> durch den Pfad zu Ihrem ds4-Checkout.
<DS4_DIR>/ds4-server \ --model <DS4_DIR>/ds4flash.gguf \ --host 127.0.0.1 \ --port 18000 \ --ctx 32768 \ --tokens 128OpenAI-kompatiblen Endpunkt überprüfen
curl http://127.0.0.1:18000/v1/modelsDie Antwort sollte deepseek-v4-flash enthalten.
OpenClaw-Provider-Konfiguration hinzufügen
Fügen Sie die Konfiguration aus Vollständige Konfiguration hinzu und führen Sie anschließend eine einmalige Modellprüfung aus:
openclaw infer model run \ --local \ --model ds4/deepseek-v4-flash \ --thinking off \ --prompt "Antworten Sie exakt mit: openclaw-ds4-ok" \ --jsonVollständige Konfiguration
Verwenden Sie diese Konfiguration, wenn ds4 bereits unter 127.0.0.1:18000 ausgeführt wird.
{ agents: { defaults: { model: { primary: "ds4/deepseek-v4-flash" }, models: { "ds4/deepseek-v4-flash": { alias: "DS4 lokal", }, }, }, }, models: { mode: "merge", providers: { ds4: { baseUrl: "http://127.0.0.1:18000/v1", apiKey: "ds4-local", api: "openai-completions", timeoutSeconds: 300, models: [ { id: "deepseek-v4-flash", name: "DeepSeek V4 Flash (ds4)", reasoning: true, input: ["text"], cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 }, contextWindow: 32768, maxTokens: 128, compat: { supportsUsageInStreaming: true, supportsReasoningEffort: true, maxTokensField: "max_tokens", supportsStrictMode: false, thinkingFormat: "deepseek", supportedReasoningEfforts: ["low", "medium", "high", "xhigh"], }, }, ], }, }, },}Halten Sie contextWindow mit ds4-server --ctx synchron. Halten Sie maxTokens
mit --tokens synchron, sofern OpenClaw nicht absichtlich weniger Ausgabe
als den Serverstandard anfordern soll.
Bedarfsgesteuerter Start
OpenClaw kann ds4 nur starten, wenn ein ds4/...-Modell ausgewählt ist. Fügen Sie
localService demselben Provider-Eintrag hinzu:
{ models: { providers: { ds4: { baseUrl: "http://127.0.0.1:18000/v1", apiKey: "ds4-local", api: "openai-completions", timeoutSeconds: 300, localService: { command: "<DS4_DIR>/ds4-server", args: [ "--model", "<DS4_DIR>/ds4flash.gguf", "--host", "127.0.0.1", "--port", "18000", "--ctx", "32768", "--tokens", "128", ], cwd: "<DS4_DIR>", healthUrl: "http://127.0.0.1:18000/v1/models", readyTimeoutMs: 300000, idleStopMs: 0, }, models: [ { id: "deepseek-v4-flash", name: "DeepSeek V4 Flash (ds4)", reasoning: true, input: ["text"], cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 }, contextWindow: 32768, maxTokens: 128, compat: { supportsUsageInStreaming: true, supportsReasoningEffort: true, maxTokensField: "max_tokens", supportsStrictMode: false, thinkingFormat: "deepseek", supportedReasoningEfforts: ["low", "medium", "high", "xhigh"], }, }, ], }, }, },}command muss ein absoluter Pfad zu einer ausführbaren Datei sein. Shell-Suche und
~-Erweiterung werden nicht verwendet. Unter Lokale Modelldienste
finden Sie alle localService-Felder.
Think Max
ds4 wendet Think Max nur an, wenn beides zutrifft:
ds4-serverbeginnt mit--ctx 393216oder höher.- Die Anfrage verwendet
reasoning_effort: "max"(oder das entsprechende ds4-Aufwandsfeld).
Wenn Sie diesen großen Kontext verwenden, aktualisieren Sie sowohl die Server-Flags als auch die OpenClaw-Modellmetadaten:
{ contextWindow: 393216, maxTokens: 384000, compat: { supportsUsageInStreaming: true, supportsReasoningEffort: true, maxTokensField: "max_tokens", supportsStrictMode: false, thinkingFormat: "deepseek", supportedReasoningEfforts: ["low", "medium", "high", "xhigh", "max"], },}Test
Direkte HTTP-Prüfung unter Umgehung von OpenClaw:
curl http://127.0.0.1:18000/v1/chat/completions \ -H 'content-type: application/json' \ -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Antworten Sie exakt mit: ds4-ok"}],"max_tokens":16,"stream":false,"thinking":{"type":"disabled"}}'OpenClaw-Modellrouting (wie bei der Schnellstartprüfung):
openclaw infer model run \ --local \ --model ds4/deepseek-v4-flash \ --thinking off \ --prompt "Antworten Sie exakt mit: openclaw-ds4-ok" \ --jsonVollständiger Smoke-Test für Agent und Tool-Aufrufe mit einem Kontext von mindestens 32768:
openclaw agent \ --local \ --session-id ds4-tool-smoke \ --model ds4/deepseek-v4-flash \ --thinking off \ --message "Verwenden Sie den Shell-Befehl pwd einmal und antworten Sie anschließend exakt mit: tool-ok <output>" \ --json \ --timeout 240Erwartetes Ergebnis:
executionTrace.winnerProvideristds4executionTrace.winnerModelistdeepseek-v4-flashtoolSummary.callsist mindestens1finalAssistantVisibleTextbeginnt mittool-ok
Fehlerbehebung
curl /v1/models kann keine Verbindung herstellen
ds4 wird nicht ausgeführt oder ist nicht an den Host/Port in baseUrl gebunden. Starten Sie
ds4-server und versuchen Sie es anschließend erneut:
curl http://127.0.0.1:18000/v1/models500 – Prompt überschreitet den Kontext
Der konfigurierte Wert --ctx ist für den OpenClaw-Durchlauf zu klein. Erhöhen Sie
ds4-server --ctx und aktualisieren Sie anschließend models.providers.ds4.models[].contextWindow
entsprechend. Vollständige Agent-Durchläufe mit Tools benötigen erheblich mehr Kontext als
eine direkte curl-Anfrage mit einer einzelnen Nachricht.
Think Max wird nicht aktiviert
ds4 verwendet Think Max nur, wenn --ctx mindestens 393216 beträgt und die Anfrage
reasoning_effort: "max" anfordert. Bei kleineren Kontexten wird auf hohes
Reasoning zurückgegriffen.
Die erste Anfrage ist langsam
ds4 durchläuft eine kalte Metal-Residenz- und Modellaufwärmphase. Legen Sie
localService.readyTimeoutMs: 300000 fest, wenn OpenClaw den Server bei
Bedarf startet.
Verwandte Themen
Starten Sie lokale Modellserver bei Bedarf vor Modellanfragen.
Wählen und betreiben Sie lokale Modell-Backends.
Konfigurieren Sie Provider-Referenzen, Authentifizierung und Failover.
Natives Verhalten des DeepSeek-Providers und Steuerung des Denkprozesses.