Providers

Google (Gemini)

Google Plugin, Google AI Studio के माध्यम से Gemini मॉडल तक पहुँच प्रदान करता है, साथ ही इमेज जनरेशन, मीडिया समझ (इमेज/ऑडियो/वीडियो), टेक्स्ट-टू-स्पीच और Gemini Grounding के माध्यम से वेब खोज भी उपलब्ध कराता है।

  • प्रदाता: google
  • प्रमाणीकरण: GEMINI_API_KEY या GOOGLE_API_KEY
  • API: Google Gemini API
  • रनटाइम विकल्प: agentRuntime.id: "google-gemini-cli" मॉडल संदर्भों को google/* के रूप में मानक बनाए रखते हुए Gemini CLI OAuth का पुनः उपयोग करता है।

आरंभ करना

अपनी पसंदीदा प्रमाणीकरण विधि चुनें और सेटअप चरणों का पालन करें।

API कुंजी

इनके लिए सर्वोत्तम: Google AI Studio के माध्यम से मानक Gemini API पहुँच।

  • API कुंजी प्राप्त करें

    Google AI Studio में एक निःशुल्क कुंजी बनाएँ।

  • ऑनबोर्डिंग चलाएँ

    bash
    openclaw onboard --auth-choice gemini-api-key

    या कुंजी सीधे प्रदान करें:

    bash
    openclaw onboard --non-interactive \  --mode local \  --auth-choice gemini-api-key \  --gemini-api-key "$GEMINI_API_KEY"
  • डिफ़ॉल्ट मॉडल सेट करें

    json5
    {  agents: {    defaults: {      model: { primary: "google/gemini-3.1-pro-preview" },    },  },}
  • सत्यापित करें कि मॉडल उपलब्ध है

    bash
    openclaw models list --provider google
  • कॉन्फ़िगर की गई API कुंजी के साथ, OpenClaw Gemini models.list API से Google AI Studio की टेक्स्ट-मॉडल सूची को रीफ़्रेश करता है। इसलिए नए जारी किए गए Gemini 3 Pro, Flash और Flash-Lite प्रकार OpenClaw रिलीज़ की प्रतीक्षा किए बिना openclaw models list --provider google में दिखाई देते हैं। यदि खोज उपलब्ध नहीं है, तो OpenClaw बंडल की गई फ़ॉलबैक सूची बनाए रखता है।

    Gemini CLI (OAuth)

    इनके लिए सर्वोत्तम: अलग API कुंजी का उपयोग करने के बजाय Gemini CLI OAuth के माध्यम से अपने Google खाते से साइन इन करना।

  • Gemini CLI इंस्टॉल करें

    स्थानीय gemini कमांड PATH पर उपलब्ध होना चाहिए।

    bash
    # Homebrewbrew install gemini-cli # या npmnpm install -g @google/gemini-cli

    OpenClaw Homebrew इंस्टॉलेशन और ग्लोबल npm इंस्टॉलेशन, दोनों का समर्थन करता है, जिनमें सामान्य Windows/npm लेआउट भी शामिल हैं।

  • OAuth के माध्यम से लॉग इन करें

    bash
    openclaw models auth login --provider google-gemini-cli --set-default
  • सत्यापित करें कि मॉडल उपलब्ध है

    bash
    openclaw models list --provider google
    • डिफ़ॉल्ट मॉडल: google/gemini-3.1-pro-preview
    • रनटाइम: google-gemini-cli
    • उपनाम: gemini-cli

    Gemini 3.1 Pro का Gemini API मॉडल ID gemini-3.1-pro-preview है। OpenClaw सुविधा के लिए छोटे google/gemini-3.1-pro को उपनाम के रूप में स्वीकार करता है और प्रदाता कॉल से पहले इसे सामान्यीकृत करता है।

    पर्यावरण चर:

    • OPENCLAW_GEMINI_OAUTH_CLIENT_ID / GEMINI_CLI_OAUTH_CLIENT_ID
    • OPENCLAW_GEMINI_OAUTH_CLIENT_SECRET / GEMINI_CLI_OAUTH_CLIENT_SECRET

    ऑनबोर्डिंग का स्वचालित पता लगाना मौजूदा Gemini CLI लॉगिन को सूचीबद्ध करता है, लेकिन कभी भी उसका स्वतः परीक्षण नहीं करता, क्योंकि Gemini CLI में टूल-मुक्त जाँच उपलब्ध नहीं है। जारी रखने के लिए Gemini CLI OAuth या Gemini API कुंजी चुनें।

    google-gemini-cli/* मॉडल संदर्भ पुराने संगतता उपनाम हैं। नए कॉन्फ़िगरेशन को स्थानीय Gemini CLI निष्पादन चाहिए तो उन्हें google/* मॉडल संदर्भों के साथ google-gemini-cli रनटाइम का उपयोग करना चाहिए।

    क्षमताएँ

    क्षमता समर्थित
    चैट पूर्णताएँ हाँ
    इमेज जनरेशन हाँ
    संगीत जनरेशन हाँ
    टेक्स्ट-टू-स्पीच हाँ
    रीयलटाइम वॉइस हाँ (Google Live API)
    इमेज की समझ हाँ
    ऑडियो ट्रांसक्रिप्शन हाँ
    वीडियो की समझ हाँ
    वेब खोज (Grounding) हाँ
    चिंतन/तर्क हाँ (Gemini 2.5+ / Gemini 3+)
    Gemma 4 मॉडल हाँ

    वेब खोज

    बंडल किया गया gemini वेब-खोज प्रदाता Gemini Google Search Grounding का उपयोग करता है। plugins.entries.google.config.webSearch के अंतर्गत एक समर्पित खोज कुंजी कॉन्फ़िगर करें, या GEMINI_API_KEY के बाद इसे models.providers.google.apiKey का पुनः उपयोग करने दें:

    json5
    {  plugins: {    entries: {      google: {        config: {          webSearch: {            apiKey: "AIza...", // वैकल्पिक, यदि GEMINI_API_KEY या models.providers.google.apiKey सेट है            baseUrl: "https://generativelanguage.googleapis.com/v1beta", // उपलब्ध न होने पर models.providers.google.baseUrl का उपयोग करता है            model: "gemini-2.5-flash",          },        },      },    },  },}

    क्रेडेंशियल प्राथमिकता में पहले समर्पित webSearch.apiKey, फिर GEMINI_API_KEY, और फिर models.providers.google.apiKey आता है। webSearch.baseUrl वैकल्पिक है और ऑपरेटर प्रॉक्सी या संगत Gemini API एंडपॉइंट के लिए उपलब्ध है; इसे न देने पर Gemini वेब खोज models.providers.google.baseUrl का पुनः उपयोग करती है। प्रदाता-विशिष्ट टूल व्यवहार के लिए Gemini खोज देखें।

    इमेज जनरेशन

    बंडल किया गया google इमेज-जनरेशन प्रदाता डिफ़ॉल्ट रूप से google/gemini-3.1-flash-image का उपयोग करता है।

    • google/gemini-3-pro-image का भी समर्थन करता है
    • जनरेट करें: प्रत्येक अनुरोध में अधिकतम 4 इमेज
    • संपादन मोड: सक्षम, अधिकतम 5 इनपुट इमेज
    • ज्यामिति नियंत्रण: size, aspectRatio और resolution

    Google को डिफ़ॉल्ट इमेज प्रदाता के रूप में उपयोग करने के लिए:

    json5
    {  agents: {    defaults: {      imageGenerationModel: {        primary: "google/gemini-3.1-flash-image",      },    },  },}

    वीडियो जनरेशन

    बंडल किया गया google Plugin साझा video_generate टूल के माध्यम से वीडियो जनरेशन भी पंजीकृत करता है।

    • डिफ़ॉल्ट वीडियो मॉडल: google/veo-3.1-fast-generate-preview
    • मोड: टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और एकल-वीडियो संदर्भ प्रवाह
    • aspectRatio (16:9, 9:16) और resolution (720P, 1080P) का समर्थन करता है; वर्तमान में Veo ऑडियो आउटपुट का समर्थन नहीं करता
    • समर्थित अवधियाँ: 4, 6 या 8 सेकंड (अन्य मान निकटतम अनुमत मान पर समायोजित होते हैं)

    Google को डिफ़ॉल्ट वीडियो प्रदाता के रूप में उपयोग करने के लिए:

    json5
    {  agents: {    defaults: {      videoGenerationModel: {        primary: "google/veo-3.1-fast-generate-preview",      },    },  },}

    संगीत जनरेशन

    बंडल किया गया google Plugin साझा music_generate टूल के माध्यम से संगीत जनरेशन भी पंजीकृत करता है।

    • डिफ़ॉल्ट संगीत मॉडल: google/lyria-3-clip-preview
    • google/lyria-3-pro-preview का भी समर्थन करता है
    • प्रॉम्प्ट नियंत्रण: lyrics और instrumental
    • आउटपुट प्रारूप: डिफ़ॉल्ट रूप से mp3, साथ ही google/lyria-3-pro-preview पर wav
    • संदर्भ इनपुट: अधिकतम 10 इमेज
    • सत्र-समर्थित रन साझा कार्य/स्थिति प्रवाह के माध्यम से अलग हो जाते हैं, जिसमें action: "status" भी शामिल है

    Google को डिफ़ॉल्ट संगीत प्रदाता के रूप में उपयोग करने के लिए:

    json5
    {  agents: {    defaults: {      musicGenerationModel: {        primary: "google/lyria-3-clip-preview",      },    },  },}

    टेक्स्ट-टू-स्पीच

    बंडल किया गया google वाक् प्रदाता gemini-3.1-flash-tts-preview के साथ Gemini API TTS पथ का उपयोग करता है।

    • डिफ़ॉल्ट आवाज़: Kore
    • प्रमाणीकरण: tts.providers.google.apiKey, models.providers.google.apiKey, GEMINI_API_KEY या GOOGLE_API_KEY
    • आउटपुट: नियमित TTS अटैचमेंट के लिए WAV, वॉइस-नोट लक्ष्यों के लिए Opus, Talk/टेलीफ़ोनी के लिए PCM
    • वॉइस-नोट आउटपुट: Google PCM को WAV के रूप में रैप करके ffmpeg से 48 kHz Opus में ट्रांसकोड किया जाता है

    Google का बैच Gemini TTS पथ पूर्ण generateContent प्रतिक्रिया में जनरेट किया गया ऑडियो लौटाता है। न्यूनतम-विलंबता वाली मौखिक बातचीत के लिए बैच TTS के बजाय Gemini Live API द्वारा समर्थित Google रीयलटाइम वॉइस प्रदाता का उपयोग करें।

    Google को डिफ़ॉल्ट TTS प्रदाता के रूप में उपयोग करने के लिए:

    json5
    {  tts: {    auto: "always",    provider: "google",    providers: {      google: {        model: "gemini-3.1-flash-tts-preview",        speakerVoice: "Kore",        audioProfile: "शांत स्वर में पेशेवर ढंग से बोलें।",      },    },  },}

    Gemini API TTS शैली नियंत्रण के लिए प्राकृतिक-भाषा प्रॉम्प्टिंग का उपयोग करता है। बोले जाने वाले टेक्स्ट से पहले पुनः उपयोग योग्य शैली प्रॉम्प्ट जोड़ने के लिए audioProfile सेट करें। जब आपके प्रॉम्प्ट टेक्स्ट में किसी नामित वक्ता का उल्लेख हो, तो speakerName सेट करें।

    Gemini API TTS टेक्स्ट में अभिव्यंजक वर्ग-कोष्ठक वाले ऑडियो टैग भी स्वीकार करता है, जैसे [whispers] या [laughs]। टैग को दृश्यमान चैट उत्तर से बाहर रखते हुए उन्हें TTS में भेजने के लिए, उन्हें [[tts:text]]...[[/tts:text]] ब्लॉक के अंदर रखें:

    text
    यह साफ़ उत्तर टेक्स्ट है। [[tts:text]][whispers] यह बोला जाने वाला संस्करण है।[[/tts:text]]

    रीयलटाइम वॉइस

    बंडल किया गया google Plugin, Voice Call और Google Meet जैसे बैकएंड ऑडियो ब्रिज के लिए Gemini Live API द्वारा समर्थित रीयलटाइम वॉइस प्रदाता पंजीकृत करता है।

    सेटिंग कॉन्फ़िगरेशन पथ डिफ़ॉल्ट
    मॉडल plugins.entries.voice-call.config.realtime.providers.google.model gemini-3.1-flash-live-preview
    वॉइस ...google.voice Kore
    तापमान ...google.temperature (सेट नहीं)
    VAD आरंभ संवेदनशीलता ...google.startSensitivity (सेट नहीं)
    VAD समाप्ति संवेदनशीलता ...google.endSensitivity (सेट नहीं)
    मौन अवधि ...google.silenceDurationMs (सेट नहीं)
    गतिविधि प्रबंधन ...google.activityHandling Google डिफ़ॉल्ट, start-of-activity-interrupts
    टर्न कवरेज ...google.turnCoverage Google डिफ़ॉल्ट, audio-activity-and-all-video
    स्वचालित VAD अक्षम करें ...google.automaticActivityDetectionDisabled false
    सत्र पुनरारंभ ...google.sessionResumption true
    संदर्भ संपीड़न ...google.contextWindowCompression true
    API कुंजी ...google.apiKey उपलब्ध न होने पर models.providers.google.apiKey, GEMINI_API_KEY, या GOOGLE_API_KEY का उपयोग होता है

    Voice Call रीयलटाइम कॉन्फ़िगरेशन का उदाहरण:

    json5
    {  plugins: {    entries: {      "voice-call": {        enabled: true,        config: {          realtime: {            enabled: true,            provider: "google",            providers: {              google: {                model: "gemini-3.1-flash-live-preview",                speakerVoice: "Kore",                activityHandling: "start-of-activity-interrupts",                turnCoverage: "audio-activity-and-all-video",              },            },          },        },      },    },  },}

    मेंटेनर द्वारा लाइव सत्यापन के लिए, OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts चलाएँ। स्मोक परीक्षण OpenAI बैकएंड/WebRTC पथों को भी कवर करता है; Google चरण उसी सीमित Live API टोकन स्वरूप को जारी करता है जिसका उपयोग Control UI Talk करता है, ब्राउज़र WebSocket एंडपॉइंट खोलता है, प्रारंभिक सेटअप पेलोड के साथ एक JPEG फ़्रेम भेजता है, और टेक्स्ट प्रतिक्रिया तथा describe_view फ़ंक्शन राउंडट्रिप को सत्यापित करता है।

    उन्नत कॉन्फ़िगरेशन

    प्रत्यक्ष Gemini कैश का पुनः उपयोग

    प्रत्यक्ष Gemini API रन (api: "google-generative-ai") के लिए, OpenClaw कॉन्फ़िगर किए गए cachedContent हैंडल को Gemini अनुरोधों में भेजता है।

    • प्रति-मॉडल या वैश्विक पैरामीटर को cachedContent या पुराने cached_content में से किसी एक के साथ कॉन्फ़िगर करें
    • अधिक विशिष्ट दायरे के पैरामीटर (वैश्विक के ऊपर मॉडल-स्तर) हमेशा प्रभावी होते हैं। एक ही दायरे में, यदि दोनों कुंजियाँ सेट हैं, तो cached_content प्रभावी होता है। अप्रत्याशित परिणामों से बचने के लिए प्रति दायरा केवल एक कुंजी का उपयोग करें।
    • उदाहरण मान: cachedContents/prebuilt-context
    • Gemini कैश-हिट उपयोग को अपस्ट्रीम cachedContentTokenCount से OpenClaw cacheRead में सामान्यीकृत किया जाता है
    json5
    {  agents: {    defaults: {      models: {        "google/gemini-2.5-pro": {          params: {            cachedContent: "cachedContents/prebuilt-context",          },        },      },    },  },}
    Gemini CLI उपयोग संबंधी टिप्पणियाँ

    google-gemini-cli OAuth प्रदाता का उपयोग करते समय, OpenClaw डिफ़ॉल्ट रूप से Gemini CLI stream-json आउटपुट का उपयोग करता है और अंतिम stats पेलोड से उपयोग को सामान्यीकृत करता है। पुराने --output-format json ओवरराइड अब भी JSON पार्सर का उपयोग करते हैं।

    • स्ट्रीम किए गए उत्तर का टेक्स्ट सहायक message इवेंट से आता है।
    • पुराने JSON आउटपुट के लिए, उत्तर का टेक्स्ट CLI JSON response फ़ील्ड से आता है।
    • जब CLI usage को खाली छोड़ता है, तो उपयोग के लिए stats का उपयोग किया जाता है।
    • stats.cached को OpenClaw cacheRead में सामान्यीकृत किया जाता है।
    • यदि stats.input अनुपस्थित है, तो OpenClaw stats.input_tokens - stats.cached से इनपुट टोकन प्राप्त करता है।
    परिवेश और डेमन सेटअप

    यदि Gateway डेमन (launchd/systemd) के रूप में चलता है, तो सुनिश्चित करें कि GEMINI_API_KEY उस प्रक्रिया के लिए उपलब्ध हो (उदाहरण के लिए, ~/.openclaw/.env में या env.shellEnv के माध्यम से)।

    संबंधित

    Was this useful?
    On this page

    On this page