Providers

ds4

ds4 स्थानीय Metal बैकएंड से DeepSeek V4 Flash को OpenAI-संगत /v1 API के माध्यम से उपलब्ध कराता है। OpenClaw सामान्य openai-completions प्रदाता परिवार के माध्यम से ds4 से कनेक्ट होता है।

ds4 कोई बंडल किया गया OpenClaw प्रदाता Plugin नहीं है। इसे models.providers.ds4 के अंतर्गत कॉन्फ़िगर करें, फिर ds4/deepseek-v4-flash चुनें।

गुण मान
प्रदाता आईडी ds4
Plugin कोई नहीं (केवल कॉन्फ़िगरेशन)
API OpenAI-संगत Chat Completions (openai-completions)
आधार URL http://127.0.0.1:18000/v1 (सुझाया गया)
मॉडल आईडी deepseek-v4-flash
टूल कॉल OpenAI-शैली के tools / tool_calls
रीजनिंग DeepSeek-शैली के thinking और reasoning_effort

आवश्यकताएँ

  • Metal समर्थन वाला macOS।
  • ds4-server और DeepSeek V4 Flash GGUF फ़ाइल वाला कार्यशील ds4 चेकआउट।
  • आपके चुने हुए कॉन्टेक्स्ट के लिए पर्याप्त मेमोरी; बड़े --ctx मान सर्वर स्टार्टअप पर अधिक KV मेमोरी आवंटित करते हैं।

त्वरित शुरुआत

  • ds4-server शुरू करें

    <DS4_DIR> को अपने ds4 चेकआउट पथ से बदलें।

    bash
    <DS4_DIR>/ds4-server \  --model <DS4_DIR>/ds4flash.gguf \  --host 127.0.0.1 \  --port 18000 \  --ctx 32768 \  --tokens 128
  • OpenAI-संगत एंडपॉइंट सत्यापित करें

    bash
    curl http://127.0.0.1:18000/v1/models

    प्रतिक्रिया में deepseek-v4-flash शामिल होना चाहिए।

  • OpenClaw प्रदाता कॉन्फ़िगरेशन जोड़ें

    पूर्ण कॉन्फ़िगरेशन से कॉन्फ़िगरेशन जोड़ें, फिर एकबारगी मॉडल जाँच चलाएँ:

    bash
    openclaw infer model run \  --local \  --model ds4/deepseek-v4-flash \  --thinking off \  --prompt "Reply with exactly: openclaw-ds4-ok" \  --json
  • पूर्ण कॉन्फ़िगरेशन

    इस कॉन्फ़िगरेशन का उपयोग तब करें, जब ds4 पहले से 127.0.0.1:18000 पर चल रहा हो।

    json5
    {  agents: {    defaults: {      model: { primary: "ds4/deepseek-v4-flash" },      models: {        "ds4/deepseek-v4-flash": {          alias: "DS4 local",        },      },    },  },  models: {    mode: "merge",    providers: {      ds4: {        baseUrl: "http://127.0.0.1:18000/v1",        apiKey: "ds4-local",        api: "openai-completions",        timeoutSeconds: 300,        models: [          {            id: "deepseek-v4-flash",            name: "DeepSeek V4 Flash (ds4)",            reasoning: true,            input: ["text"],            cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },            contextWindow: 32768,            maxTokens: 128,            compat: {              supportsUsageInStreaming: true,              supportsReasoningEffort: true,              maxTokensField: "max_tokens",              supportsStrictMode: false,              thinkingFormat: "deepseek",              supportedReasoningEfforts: ["low", "medium", "high", "xhigh"],            },          },        ],      },    },  },}

    contextWindow को ds4-server --ctx के अनुरूप रखें। maxTokens को --tokens के अनुरूप रखें, जब तक कि आप जानबूझकर यह न चाहें कि OpenClaw सर्वर के डिफ़ॉल्ट से कम आउटपुट का अनुरोध करे।

    माँग पर स्टार्टअप

    OpenClaw केवल तब ds4 शुरू कर सकता है, जब कोई ds4/... मॉडल चुना गया हो। उसी प्रदाता प्रविष्टि में localService जोड़ें:

    json5
    {  models: {    providers: {      ds4: {        baseUrl: "http://127.0.0.1:18000/v1",        apiKey: "ds4-local",        api: "openai-completions",        timeoutSeconds: 300,        localService: {          command: "<DS4_DIR>/ds4-server",          args: [            "--model",            "<DS4_DIR>/ds4flash.gguf",            "--host",            "127.0.0.1",            "--port",            "18000",            "--ctx",            "32768",            "--tokens",            "128",          ],          cwd: "<DS4_DIR>",          healthUrl: "http://127.0.0.1:18000/v1/models",          readyTimeoutMs: 300000,          idleStopMs: 0,        },        models: [          {            id: "deepseek-v4-flash",            name: "DeepSeek V4 Flash (ds4)",            reasoning: true,            input: ["text"],            cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },            contextWindow: 32768,            maxTokens: 128,            compat: {              supportsUsageInStreaming: true,              supportsReasoningEffort: true,              maxTokensField: "max_tokens",              supportsStrictMode: false,              thinkingFormat: "deepseek",              supportedReasoningEfforts: ["low", "medium", "high", "xhigh"],            },          },        ],      },    },  },}

    command एक निरपेक्ष निष्पादन योग्य पथ होना चाहिए। शेल लुकअप और ~ विस्तार का उपयोग नहीं किया जाता। प्रत्येक localService फ़ील्ड के लिए स्थानीय मॉडल सेवाएँ देखें।

    Think Max

    ds4 Think Max केवल तभी लागू करता है, जब ये दोनों सत्य हों:

    • ds4-server की शुरुआत --ctx 393216 या उससे अधिक से होती है।
    • अनुरोध reasoning_effort: "max" (या समतुल्य ds4 प्रयास फ़ील्ड) का उपयोग करता है।

    यदि आप इतना बड़ा कॉन्टेक्स्ट चलाते हैं, तो सर्वर फ़्लैग और OpenClaw मॉडल मेटाडेटा दोनों अपडेट करें:

    json5
    {  contextWindow: 393216,  maxTokens: 384000,  compat: {    supportsUsageInStreaming: true,    supportsReasoningEffort: true,    maxTokensField: "max_tokens",    supportsStrictMode: false,    thinkingFormat: "deepseek",    supportedReasoningEfforts: ["low", "medium", "high", "xhigh", "max"],  },}

    परीक्षण

    OpenClaw को बायपास करते हुए सीधी HTTP जाँच:

    bash
    curl http://127.0.0.1:18000/v1/chat/completions \  -H 'content-type: application/json' \  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Reply with exactly: ds4-ok"}],"max_tokens":16,"stream":false,"thinking":{"type":"disabled"}}'

    OpenClaw मॉडल रूटिंग (त्वरित शुरुआत की जाँच के समान):

    bash
    openclaw infer model run \  --local \  --model ds4/deepseek-v4-flash \  --thinking off \  --prompt "Reply with exactly: openclaw-ds4-ok" \  --json

    कम-से-कम 32768 कॉन्टेक्स्ट के साथ पूर्ण एजेंट और टूल-कॉल स्मोक परीक्षण:

    bash
    openclaw agent \  --local \  --session-id ds4-tool-smoke \  --model ds4/deepseek-v4-flash \  --thinking off \  --message "Use the shell command pwd once, then reply exactly: tool-ok <output>" \  --json \  --timeout 240

    अपेक्षित परिणाम:

    • executionTrace.winnerProvider, ds4 है
    • executionTrace.winnerModel, deepseek-v4-flash है
    • toolSummary.calls, कम-से-कम 1 है
    • finalAssistantVisibleText, tool-ok से शुरू होता है

    समस्या निवारण

    curl /v1/models कनेक्ट नहीं कर सकता

    ds4 चल नहीं रहा है या baseUrl में दिए गए होस्ट/पोर्ट से बाउंड नहीं है। ds4-server शुरू करें, फिर पुनः प्रयास करें:

    bash
    curl http://127.0.0.1:18000/v1/models
    500 प्रॉम्प्ट कॉन्टेक्स्ट से अधिक है

    कॉन्फ़िगर किया गया --ctx OpenClaw टर्न के लिए बहुत छोटा है। ds4-server --ctx बढ़ाएँ, फिर उससे मेल खाने के लिए models.providers.ds4.models[].contextWindow अपडेट करें। टूल वाले पूर्ण एजेंट टर्न को सीधे एक-संदेश वाले curl अनुरोध की तुलना में काफ़ी अधिक कॉन्टेक्स्ट चाहिए।

    Think Max सक्रिय नहीं होता

    ds4 Think Max का उपयोग केवल तब करता है, जब --ctx कम-से-कम 393216 हो और अनुरोध reasoning_effort: "max" माँगे। छोटे कॉन्टेक्स्ट उच्च रीजनिंग पर वापस चले जाते हैं।

    पहला अनुरोध धीमा है

    ds4 में कोल्ड Metal रेज़िडेंसी और मॉडल वार्मअप चरण होता है। जब OpenClaw सर्वर को माँग पर शुरू करता है, तब localService.readyTimeoutMs: 300000 सेट करें।

    संबंधित

    Was this useful?
    On this page

    On this page