Providers
ds4
ds4 स्थानीय Metal बैकएंड से DeepSeek V4 Flash को
OpenAI-संगत /v1 API के माध्यम से उपलब्ध कराता है। OpenClaw सामान्य
openai-completions प्रदाता परिवार के माध्यम से ds4 से कनेक्ट होता है।
ds4 कोई बंडल किया गया OpenClaw प्रदाता Plugin नहीं है। इसे
models.providers.ds4 के अंतर्गत कॉन्फ़िगर करें, फिर ds4/deepseek-v4-flash चुनें।
| गुण | मान |
|---|---|
| प्रदाता आईडी | ds4 |
| Plugin | कोई नहीं (केवल कॉन्फ़िगरेशन) |
| API | OpenAI-संगत Chat Completions (openai-completions) |
| आधार URL | http://127.0.0.1:18000/v1 (सुझाया गया) |
| मॉडल आईडी | deepseek-v4-flash |
| टूल कॉल | OpenAI-शैली के tools / tool_calls |
| रीजनिंग | DeepSeek-शैली के thinking और reasoning_effort |
आवश्यकताएँ
- Metal समर्थन वाला macOS।
ds4-serverऔर DeepSeek V4 Flash GGUF फ़ाइल वाला कार्यशील ds4 चेकआउट।- आपके चुने हुए कॉन्टेक्स्ट के लिए पर्याप्त मेमोरी; बड़े
--ctxमान सर्वर स्टार्टअप पर अधिक KV मेमोरी आवंटित करते हैं।
त्वरित शुरुआत
ds4-server शुरू करें
<DS4_DIR> को अपने ds4 चेकआउट पथ से बदलें।
<DS4_DIR>/ds4-server \ --model <DS4_DIR>/ds4flash.gguf \ --host 127.0.0.1 \ --port 18000 \ --ctx 32768 \ --tokens 128OpenAI-संगत एंडपॉइंट सत्यापित करें
curl http://127.0.0.1:18000/v1/modelsप्रतिक्रिया में deepseek-v4-flash शामिल होना चाहिए।
OpenClaw प्रदाता कॉन्फ़िगरेशन जोड़ें
पूर्ण कॉन्फ़िगरेशन से कॉन्फ़िगरेशन जोड़ें, फिर एकबारगी मॉडल जाँच चलाएँ:
openclaw infer model run \ --local \ --model ds4/deepseek-v4-flash \ --thinking off \ --prompt "Reply with exactly: openclaw-ds4-ok" \ --jsonपूर्ण कॉन्फ़िगरेशन
इस कॉन्फ़िगरेशन का उपयोग तब करें, जब ds4 पहले से 127.0.0.1:18000 पर चल रहा हो।
{ agents: { defaults: { model: { primary: "ds4/deepseek-v4-flash" }, models: { "ds4/deepseek-v4-flash": { alias: "DS4 local", }, }, }, }, models: { mode: "merge", providers: { ds4: { baseUrl: "http://127.0.0.1:18000/v1", apiKey: "ds4-local", api: "openai-completions", timeoutSeconds: 300, models: [ { id: "deepseek-v4-flash", name: "DeepSeek V4 Flash (ds4)", reasoning: true, input: ["text"], cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 }, contextWindow: 32768, maxTokens: 128, compat: { supportsUsageInStreaming: true, supportsReasoningEffort: true, maxTokensField: "max_tokens", supportsStrictMode: false, thinkingFormat: "deepseek", supportedReasoningEfforts: ["low", "medium", "high", "xhigh"], }, }, ], }, }, },}contextWindow को ds4-server --ctx के अनुरूप रखें। maxTokens को
--tokens के अनुरूप रखें, जब तक कि आप जानबूझकर यह न चाहें कि OpenClaw सर्वर के डिफ़ॉल्ट से कम आउटपुट
का अनुरोध करे।
माँग पर स्टार्टअप
OpenClaw केवल तब ds4 शुरू कर सकता है, जब कोई ds4/... मॉडल चुना गया हो। उसी प्रदाता प्रविष्टि में
localService जोड़ें:
{ models: { providers: { ds4: { baseUrl: "http://127.0.0.1:18000/v1", apiKey: "ds4-local", api: "openai-completions", timeoutSeconds: 300, localService: { command: "<DS4_DIR>/ds4-server", args: [ "--model", "<DS4_DIR>/ds4flash.gguf", "--host", "127.0.0.1", "--port", "18000", "--ctx", "32768", "--tokens", "128", ], cwd: "<DS4_DIR>", healthUrl: "http://127.0.0.1:18000/v1/models", readyTimeoutMs: 300000, idleStopMs: 0, }, models: [ { id: "deepseek-v4-flash", name: "DeepSeek V4 Flash (ds4)", reasoning: true, input: ["text"], cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 }, contextWindow: 32768, maxTokens: 128, compat: { supportsUsageInStreaming: true, supportsReasoningEffort: true, maxTokensField: "max_tokens", supportsStrictMode: false, thinkingFormat: "deepseek", supportedReasoningEfforts: ["low", "medium", "high", "xhigh"], }, }, ], }, }, },}command एक निरपेक्ष निष्पादन योग्य पथ होना चाहिए। शेल लुकअप और ~ विस्तार
का उपयोग नहीं किया जाता। प्रत्येक localService फ़ील्ड के लिए स्थानीय मॉडल सेवाएँ देखें।
Think Max
ds4 Think Max केवल तभी लागू करता है, जब ये दोनों सत्य हों:
ds4-serverकी शुरुआत--ctx 393216या उससे अधिक से होती है।- अनुरोध
reasoning_effort: "max"(या समतुल्य ds4 प्रयास फ़ील्ड) का उपयोग करता है।
यदि आप इतना बड़ा कॉन्टेक्स्ट चलाते हैं, तो सर्वर फ़्लैग और OpenClaw मॉडल मेटाडेटा दोनों अपडेट करें:
{ contextWindow: 393216, maxTokens: 384000, compat: { supportsUsageInStreaming: true, supportsReasoningEffort: true, maxTokensField: "max_tokens", supportsStrictMode: false, thinkingFormat: "deepseek", supportedReasoningEfforts: ["low", "medium", "high", "xhigh", "max"], },}परीक्षण
OpenClaw को बायपास करते हुए सीधी HTTP जाँच:
curl http://127.0.0.1:18000/v1/chat/completions \ -H 'content-type: application/json' \ -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Reply with exactly: ds4-ok"}],"max_tokens":16,"stream":false,"thinking":{"type":"disabled"}}'OpenClaw मॉडल रूटिंग (त्वरित शुरुआत की जाँच के समान):
openclaw infer model run \ --local \ --model ds4/deepseek-v4-flash \ --thinking off \ --prompt "Reply with exactly: openclaw-ds4-ok" \ --jsonकम-से-कम 32768 कॉन्टेक्स्ट के साथ पूर्ण एजेंट और टूल-कॉल स्मोक परीक्षण:
openclaw agent \ --local \ --session-id ds4-tool-smoke \ --model ds4/deepseek-v4-flash \ --thinking off \ --message "Use the shell command pwd once, then reply exactly: tool-ok <output>" \ --json \ --timeout 240अपेक्षित परिणाम:
executionTrace.winnerProvider,ds4हैexecutionTrace.winnerModel,deepseek-v4-flashहैtoolSummary.calls, कम-से-कम1हैfinalAssistantVisibleText,tool-okसे शुरू होता है
समस्या निवारण
curl /v1/models कनेक्ट नहीं कर सकता
ds4 चल नहीं रहा है या baseUrl में दिए गए होस्ट/पोर्ट से बाउंड नहीं है।
ds4-server शुरू करें, फिर पुनः प्रयास करें:
curl http://127.0.0.1:18000/v1/models500 प्रॉम्प्ट कॉन्टेक्स्ट से अधिक है
कॉन्फ़िगर किया गया --ctx OpenClaw टर्न के लिए बहुत छोटा है।
ds4-server --ctx बढ़ाएँ, फिर उससे मेल खाने के लिए models.providers.ds4.models[].contextWindow
अपडेट करें। टूल वाले पूर्ण एजेंट टर्न को सीधे एक-संदेश वाले curl अनुरोध की तुलना में काफ़ी अधिक कॉन्टेक्स्ट चाहिए।
Think Max सक्रिय नहीं होता
ds4 Think Max का उपयोग केवल तब करता है, जब --ctx कम-से-कम 393216 हो और अनुरोध
reasoning_effort: "max" माँगे। छोटे कॉन्टेक्स्ट उच्च
रीजनिंग पर वापस चले जाते हैं।
पहला अनुरोध धीमा है
ds4 में कोल्ड Metal रेज़िडेंसी और मॉडल वार्मअप चरण होता है। जब OpenClaw सर्वर को
माँग पर शुरू करता है, तब localService.readyTimeoutMs: 300000 सेट करें।