Providers

Google (Gemini)

Das Google-Plugin bietet Zugriff auf Gemini-Modelle über Google AI Studio sowie Bilderzeugung, Medienverständnis (Bild/Audio/Video), Text-to-Speech und Websuche über Gemini Grounding.

  • Provider: google
  • Authentifizierung: GEMINI_API_KEY oder GOOGLE_API_KEY
  • API: Google Gemini API
  • Laufzeitoption: agentRuntime.id: "google-gemini-cli" verwendet Gemini CLI OAuth wieder, während Modellreferenzen weiterhin kanonisch als google/* angegeben werden.

Erste Schritte

Wählen Sie Ihre bevorzugte Authentifizierungsmethode und führen Sie die Einrichtungsschritte aus.

API-Schlüssel

Am besten geeignet für: standardmäßigen Zugriff auf die Gemini API über Google AI Studio.

  • API-Schlüssel abrufen

    Erstellen Sie in Google AI Studio einen kostenlosen Schlüssel.

  • Onboarding ausführen

    bash
    openclaw onboard --auth-choice gemini-api-key

    Alternativ können Sie den Schlüssel direkt übergeben:

    bash
    openclaw onboard --non-interactive \  --mode local \  --auth-choice gemini-api-key \  --gemini-api-key "$GEMINI_API_KEY"
  • Standardmodell festlegen

    json5
    {  agents: {    defaults: {      model: { primary: "google/gemini-3.1-pro-preview" },    },  },}
  • Verfügbarkeit des Modells überprüfen

    bash
    openclaw models list --provider google
  • Mit einem konfigurierten API-Schlüssel aktualisiert OpenClaw den Textmodellkatalog von Google AI Studio über die Gemini-API models.list. Neu veröffentlichte Varianten von Gemini 3 Pro, Flash und Flash-Lite erscheinen daher in openclaw models list --provider google, ohne dass auf eine OpenClaw-Version gewartet werden muss. Wenn die Erkennung nicht verfügbar ist, behält OpenClaw den mitgelieferten Ausweichkatalog bei.

    Gemini CLI (OAuth)

    Am besten geeignet für: die Anmeldung mit Ihrem Google-Konto über Gemini CLI OAuth, anstatt einen separaten API-Schlüssel zu verwenden.

  • Gemini CLI installieren

    Der lokale Befehl gemini muss unter PATH verfügbar sein.

    bash
    # Homebrewbrew install gemini-cli # or npmnpm install -g @google/gemini-cli

    OpenClaw unterstützt sowohl Homebrew-Installationen als auch globale npm-Installationen, einschließlich gängiger Windows-/npm-Verzeichnisstrukturen.

  • Über OAuth anmelden

    bash
    openclaw models auth login --provider google-gemini-cli --set-default
  • Verfügbarkeit des Modells überprüfen

    bash
    openclaw models list --provider google
    • Standardmodell: google/gemini-3.1-pro-preview
    • Laufzeit: google-gemini-cli
    • Alias: gemini-cli

    Die Gemini-API-Modell-ID von Gemini 3.1 Pro lautet gemini-3.1-pro-preview. OpenClaw akzeptiert die kürzere Form google/gemini-3.1-pro als praktischen Alias und normalisiert sie vor Provider-Aufrufen.

    Umgebungsvariablen:

    • OPENCLAW_GEMINI_OAUTH_CLIENT_ID / GEMINI_CLI_OAUTH_CLIENT_ID
    • OPENCLAW_GEMINI_OAUTH_CLIENT_SECRET / GEMINI_CLI_OAUTH_CLIENT_SECRET

    Die automatische Onboarding-Erkennung führt eine vorhandene Gemini-CLI-Anmeldung auf, testet sie jedoch nie automatisch, da Gemini CLI keine werkzeugfreie Prüfung bietet. Wählen Sie Gemini CLI OAuth oder einen Gemini-API-Schlüssel aus, um fortzufahren.

    Modellreferenzen vom Typ google-gemini-cli/* sind Aliasse für die Abwärtskompatibilität. Neue Konfigurationen sollten Modellreferenzen vom Typ google/* zusammen mit der Laufzeit google-gemini-cli verwenden, wenn sie Gemini CLI lokal ausführen möchten.

    Funktionen

    Funktion Unterstützt
    Chat-Vervollständigungen Ja
    Bilderzeugung Ja
    Musikerzeugung Ja
    Text-to-Speech Ja
    Echtzeit-Sprache Ja (Google Live API)
    Bildverständnis Ja
    Audiotranskription Ja
    Videoverständnis Ja
    Websuche (Grounding) Ja
    Denken/Schlussfolgern Ja (Gemini 2.5+ / Gemini 3+)
    Gemma-4-Modelle Ja

    Websuche

    Der mitgelieferte Websuch-Provider gemini verwendet Gemini Google Search Grounding. Konfigurieren Sie unter plugins.entries.google.config.webSearch einen eigenen Suchschlüssel, oder lassen Sie ihn nach GEMINI_API_KEY den Wert models.providers.google.apiKey wiederverwenden:

    json5
    {  plugins: {    entries: {      google: {        config: {          webSearch: {            apiKey: "AIza...", // optional if GEMINI_API_KEY or models.providers.google.apiKey is set            baseUrl: "https://generativelanguage.googleapis.com/v1beta", // falls back to models.providers.google.baseUrl            model: "gemini-2.5-flash",          },        },      },    },  },}

    Bei den Anmeldedaten hat zunächst der dedizierte Wert webSearch.apiKey Vorrang, gefolgt von GEMINI_API_KEY und anschließend models.providers.google.apiKey. webSearch.baseUrl ist optional und für Betreiber-Proxys oder kompatible Gemini-API-Endpunkte vorgesehen; wenn der Wert nicht angegeben wird, verwendet die Gemini-Websuche models.providers.google.baseUrl wieder. Informationen zum providerspezifischen Werkzeugverhalten finden Sie unter Gemini-Suche.

    Bilderzeugung

    Der mitgelieferte Bilderzeugungs-Provider google verwendet standardmäßig google/gemini-3.1-flash-image.

    • Unterstützt außerdem google/gemini-3-pro-image
    • Erzeugung: bis zu 4 Bilder pro Anfrage
    • Bearbeitungsmodus: aktiviert, bis zu 5 Eingabebilder
    • Geometriesteuerung: size, aspectRatio und resolution

    So verwenden Sie Google als standardmäßigen Bilderzeugungs-Provider:

    json5
    {  agents: {    defaults: {      imageGenerationModel: {        primary: "google/gemini-3.1-flash-image",      },    },  },}

    Videoerzeugung

    Das mitgelieferte Plugin google registriert außerdem die Videoerzeugung über das gemeinsame Werkzeug video_generate.

    • Standard-Videomodell: google/veo-3.1-fast-generate-preview
    • Modi: Text-zu-Video, Bild-zu-Video und Abläufe mit einer einzelnen Videoreferenz
    • Unterstützt aspectRatio (16:9, 9:16) und resolution (720P, 1080P); die Audioausgabe wird derzeit von Veo nicht unterstützt
    • Unterstützte Dauern: 4, 6 oder 8 Sekunden (andere Werte werden auf den nächstgelegenen zulässigen Wert gesetzt)

    So verwenden Sie Google als standardmäßigen Video-Provider:

    json5
    {  agents: {    defaults: {      videoGenerationModel: {        primary: "google/veo-3.1-fast-generate-preview",      },    },  },}

    Musikerzeugung

    Das mitgelieferte Plugin google registriert außerdem die Musikerzeugung über das gemeinsame Werkzeug music_generate.

    • Standard-Musikmodell: google/lyria-3-clip-preview
    • Unterstützt außerdem google/lyria-3-pro-preview
    • Prompt-Steuerung: lyrics und instrumental
    • Ausgabeformat: standardmäßig mp3, zusätzlich wav unter google/lyria-3-pro-preview
    • Referenzeingaben: bis zu 10 Bilder
    • Sitzungsgestützte Ausführungen werden über den gemeinsamen Aufgaben-/Statusablauf abgekoppelt, einschließlich action: "status"

    So verwenden Sie Google als standardmäßigen Musik-Provider:

    json5
    {  agents: {    defaults: {      musicGenerationModel: {        primary: "google/lyria-3-clip-preview",      },    },  },}

    Text-to-Speech

    Der mitgelieferte Sprach-Provider google verwendet den TTS-Pfad der Gemini API mit gemini-3.1-flash-tts-preview.

    • Standardstimme: Kore
    • Authentifizierung: tts.providers.google.apiKey, models.providers.google.apiKey, GEMINI_API_KEY oder GOOGLE_API_KEY
    • Ausgabe: WAV für reguläre TTS-Anhänge, Opus für Sprachnachrichtenziele, PCM für Talk/Telefonie
    • Sprachnachrichtenausgabe: Google PCM wird als WAV verpackt und mit ffmpeg in Opus mit 48 kHz transkodiert

    Googles Batch-Pfad für Gemini TTS gibt das erzeugte Audio in der abgeschlossenen Antwort generateContent zurück. Verwenden Sie für gesprochene Unterhaltungen mit niedrigster Latenz den Echtzeit-Sprach-Provider von Google auf Basis der Gemini Live API anstelle von Batch- TTS.

    So verwenden Sie Google als standardmäßigen TTS-Provider:

    json5
    {  tts: {    auto: "always",    provider: "google",    providers: {      google: {        model: "gemini-3.1-flash-tts-preview",        speakerVoice: "Kore",        audioProfile: "Speak professionally with a calm tone.",      },    },  },}

    Gemini API TTS verwendet natürlichsprachliche Prompts zur Stilsteuerung. Legen Sie audioProfile fest, um dem gesprochenen Text einen wiederverwendbaren Stil-Prompt voranzustellen. Legen Sie speakerName fest, wenn sich Ihr Prompt-Text auf einen benannten Sprecher bezieht.

    Gemini API TTS akzeptiert im Text außerdem ausdrucksbezogene, in eckige Klammern gesetzte Audio-Tags, beispielsweise [whispers] oder [laughs]. Um Tags aus der sichtbaren Chat-Antwort herauszuhalten und dennoch an TTS zu senden, platzieren Sie sie in einem Block vom Typ [[tts:text]]...[[/tts:text]]:

    text
    Hier ist der bereinigte Antworttext. [[tts:text]][whispers] Hier ist die gesprochene Version.[[/tts:text]]

    Echtzeit-Sprache

    Das mitgelieferte Plugin google registriert einen Echtzeit-Sprach-Provider auf Basis der Gemini Live API für backendseitige Audiobrücken wie Voice Call und Google Meet.

    Einstellung Konfigurationspfad Standardwert
    Modell plugins.entries.voice-call.config.realtime.providers.google.model gemini-3.1-flash-live-preview
    Stimme ...google.voice Kore
    Temperatur ...google.temperature (nicht festgelegt)
    VAD-Startempfindlichkeit ...google.startSensitivity (nicht festgelegt)
    VAD-Endempfindlichkeit ...google.endSensitivity (nicht festgelegt)
    Stilledauer ...google.silenceDurationMs (nicht festgelegt)
    Aktivitätsverarbeitung ...google.activityHandling Google-Standardwert, start-of-activity-interrupts
    Turn-Abdeckung ...google.turnCoverage Google-Standardwert, audio-activity-and-all-video
    Automatische VAD deaktivieren ...google.automaticActivityDetectionDisabled false
    Sitzungsfortsetzung ...google.sessionResumption true
    Kontextkomprimierung ...google.contextWindowCompression true
    API-Schlüssel ...google.apiKey Fällt auf models.providers.google.apiKey, GEMINI_API_KEY oder GOOGLE_API_KEY zurück

    Beispielkonfiguration für Voice Call in Echtzeit:

    json5
    {  plugins: {    entries: {      "voice-call": {        enabled: true,        config: {          realtime: {            enabled: true,            provider: "google",            providers: {              google: {                model: "gemini-3.1-flash-live-preview",                speakerVoice: "Kore",                activityHandling: "start-of-activity-interrupts",                turnCoverage: "audio-activity-and-all-video",              },            },          },        },      },    },  },}

    Führen Sie für die Live-Verifizierung durch Maintainer OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts aus. Der Smoke-Test deckt außerdem die OpenAI-Backend-/WebRTC-Pfade ab; der Google-Teil stellt denselben eingeschränkten Live-API-Token-Typ aus, den Control UI Talk verwendet, öffnet den Browser- WebSocket-Endpunkt, sendet die anfängliche Setup-Nutzlast zusammen mit einem JPEG-Frame und überprüft eine Textantwort sowie den Funktions-Roundtrip von describe_view.

    Erweiterte Konfiguration

    Direkte Wiederverwendung des Gemini-Caches

    Bei direkten Gemini-API-Ausführungen (api: "google-generative-ai") übergibt OpenClaw ein konfiguriertes cachedContent-Handle an Gemini-Anfragen.

    • Konfigurieren Sie modellspezifische oder globale Parameter entweder mit cachedContent oder dem veralteten cached_content
    • Parameter aus einem spezifischeren Gültigkeitsbereich (Modellebene vor globaler Ebene) haben stets Vorrang. Wenn beide Schlüssel innerhalb desselben Gültigkeitsbereichs festgelegt sind, hat cached_content Vorrang. Verwenden Sie nur einen Schlüssel pro Gültigkeitsbereich, um Überraschungen zu vermeiden.
    • Beispielwert: cachedContents/prebuilt-context
    • Die Nutzung bei einem Gemini-Cache-Treffer wird aus dem vorgelagerten cachedContentTokenCount in OpenClaw cacheRead normalisiert
    json5
    {  agents: {    defaults: {      models: {        "google/gemini-2.5-pro": {          params: {            cachedContent: "cachedContents/prebuilt-context",          },        },      },    },  },}
    Hinweise zur Verwendung der Gemini CLI

    Bei Verwendung des OAuth-Providers google-gemini-cli verwendet OpenClaw standardmäßig die Ausgabe stream-json der Gemini CLI und normalisiert die Nutzung aus der abschließenden stats-Nutzlast. Veraltete Überschreibungen von --output-format json verwenden weiterhin den JSON-Parser.

    • Der gestreamte Antworttext stammt aus den message-Ereignissen des Assistenten.
    • Bei veralteter JSON-Ausgabe stammt der Antworttext aus dem Feld response des CLI-JSON.
    • Die Nutzung fällt auf stats zurück, wenn die CLI usage leer lässt.
    • stats.cached wird in OpenClaw cacheRead normalisiert.
    • Wenn stats.input fehlt, leitet OpenClaw die Eingabe-Tokens aus stats.input_tokens - stats.cached ab.
    Einrichtung von Umgebung und Daemon

    Wenn der Gateway als Daemon (launchd/systemd) ausgeführt wird, stellen Sie sicher, dass GEMINI_API_KEY für diesen Prozess verfügbar ist (beispielsweise in ~/.openclaw/.env oder über env.shellEnv).

    Verwandte Themen

    Was this useful?
    On this page

    On this page