Providers
Google (Gemini)
Das Google-Plugin bietet Zugriff auf Gemini-Modelle über Google AI Studio sowie Bilderzeugung, Medienverständnis (Bild/Audio/Video), Text-to-Speech und Websuche über Gemini Grounding.
- Provider:
google - Authentifizierung:
GEMINI_API_KEYoderGOOGLE_API_KEY - API: Google Gemini API
- Laufzeitoption:
agentRuntime.id: "google-gemini-cli"verwendet Gemini CLI OAuth wieder, während Modellreferenzen weiterhin kanonisch alsgoogle/*angegeben werden.
Erste Schritte
Wählen Sie Ihre bevorzugte Authentifizierungsmethode und führen Sie die Einrichtungsschritte aus.
API-Schlüssel
Am besten geeignet für: standardmäßigen Zugriff auf die Gemini API über Google AI Studio.
API-Schlüssel abrufen
Erstellen Sie in Google AI Studio einen kostenlosen Schlüssel.
Onboarding ausführen
openclaw onboard --auth-choice gemini-api-keyAlternativ können Sie den Schlüssel direkt übergeben:
openclaw onboard --non-interactive \ --mode local \ --auth-choice gemini-api-key \ --gemini-api-key "$GEMINI_API_KEY"Standardmodell festlegen
{ agents: { defaults: { model: { primary: "google/gemini-3.1-pro-preview" }, }, },}Verfügbarkeit des Modells überprüfen
openclaw models list --provider googleMit einem konfigurierten API-Schlüssel aktualisiert OpenClaw den Textmodellkatalog
von Google AI Studio über die Gemini-API models.list. Neu veröffentlichte Varianten von Gemini 3 Pro, Flash
und Flash-Lite erscheinen daher in
openclaw models list --provider google, ohne dass auf eine OpenClaw-Version
gewartet werden muss. Wenn die Erkennung nicht verfügbar ist, behält OpenClaw den mitgelieferten Ausweichkatalog
bei.
Gemini CLI (OAuth)
Am besten geeignet für: die Anmeldung mit Ihrem Google-Konto über Gemini CLI OAuth, anstatt einen separaten API-Schlüssel zu verwenden.
Gemini CLI installieren
Der lokale Befehl gemini muss unter PATH verfügbar sein.
# Homebrewbrew install gemini-cli # or npmnpm install -g @google/gemini-cliOpenClaw unterstützt sowohl Homebrew-Installationen als auch globale npm-Installationen, einschließlich gängiger Windows-/npm-Verzeichnisstrukturen.
Über OAuth anmelden
openclaw models auth login --provider google-gemini-cli --set-defaultVerfügbarkeit des Modells überprüfen
openclaw models list --provider google- Standardmodell:
google/gemini-3.1-pro-preview - Laufzeit:
google-gemini-cli - Alias:
gemini-cli
Die Gemini-API-Modell-ID von Gemini 3.1 Pro lautet gemini-3.1-pro-preview. OpenClaw akzeptiert die kürzere Form google/gemini-3.1-pro als praktischen Alias und normalisiert sie vor Provider-Aufrufen.
Umgebungsvariablen:
OPENCLAW_GEMINI_OAUTH_CLIENT_ID/GEMINI_CLI_OAUTH_CLIENT_IDOPENCLAW_GEMINI_OAUTH_CLIENT_SECRET/GEMINI_CLI_OAUTH_CLIENT_SECRET
Die automatische Onboarding-Erkennung führt eine vorhandene Gemini-CLI-Anmeldung auf, testet sie jedoch nie automatisch, da Gemini CLI keine werkzeugfreie Prüfung bietet. Wählen Sie Gemini CLI OAuth oder einen Gemini-API-Schlüssel aus, um fortzufahren.
Modellreferenzen vom Typ google-gemini-cli/* sind Aliasse für die Abwärtskompatibilität. Neue
Konfigurationen sollten Modellreferenzen vom Typ google/* zusammen mit der Laufzeit google-gemini-cli
verwenden, wenn sie Gemini CLI lokal ausführen möchten.
Funktionen
| Funktion | Unterstützt |
|---|---|
| Chat-Vervollständigungen | Ja |
| Bilderzeugung | Ja |
| Musikerzeugung | Ja |
| Text-to-Speech | Ja |
| Echtzeit-Sprache | Ja (Google Live API) |
| Bildverständnis | Ja |
| Audiotranskription | Ja |
| Videoverständnis | Ja |
| Websuche (Grounding) | Ja |
| Denken/Schlussfolgern | Ja (Gemini 2.5+ / Gemini 3+) |
| Gemma-4-Modelle | Ja |
Websuche
Der mitgelieferte Websuch-Provider gemini verwendet Gemini Google Search Grounding.
Konfigurieren Sie unter plugins.entries.google.config.webSearch einen eigenen Suchschlüssel,
oder lassen Sie ihn nach GEMINI_API_KEY den Wert models.providers.google.apiKey wiederverwenden:
{ plugins: { entries: { google: { config: { webSearch: { apiKey: "AIza...", // optional if GEMINI_API_KEY or models.providers.google.apiKey is set baseUrl: "https://generativelanguage.googleapis.com/v1beta", // falls back to models.providers.google.baseUrl model: "gemini-2.5-flash", }, }, }, }, },}Bei den Anmeldedaten hat zunächst der dedizierte Wert webSearch.apiKey Vorrang, gefolgt von GEMINI_API_KEY
und anschließend models.providers.google.apiKey. webSearch.baseUrl ist optional und
für Betreiber-Proxys oder kompatible Gemini-API-Endpunkte vorgesehen; wenn der Wert nicht angegeben wird,
verwendet die Gemini-Websuche models.providers.google.baseUrl wieder. Informationen zum providerspezifischen Werkzeugverhalten finden Sie unter
Gemini-Suche.
Bilderzeugung
Der mitgelieferte Bilderzeugungs-Provider google verwendet standardmäßig
google/gemini-3.1-flash-image.
- Unterstützt außerdem
google/gemini-3-pro-image - Erzeugung: bis zu 4 Bilder pro Anfrage
- Bearbeitungsmodus: aktiviert, bis zu 5 Eingabebilder
- Geometriesteuerung:
size,aspectRatioundresolution
So verwenden Sie Google als standardmäßigen Bilderzeugungs-Provider:
{ agents: { defaults: { imageGenerationModel: { primary: "google/gemini-3.1-flash-image", }, }, },}Videoerzeugung
Das mitgelieferte Plugin google registriert außerdem die Videoerzeugung über das gemeinsame
Werkzeug video_generate.
- Standard-Videomodell:
google/veo-3.1-fast-generate-preview - Modi: Text-zu-Video, Bild-zu-Video und Abläufe mit einer einzelnen Videoreferenz
- Unterstützt
aspectRatio(16:9,9:16) undresolution(720P,1080P); die Audioausgabe wird derzeit von Veo nicht unterstützt - Unterstützte Dauern: 4, 6 oder 8 Sekunden (andere Werte werden auf den nächstgelegenen zulässigen Wert gesetzt)
So verwenden Sie Google als standardmäßigen Video-Provider:
{ agents: { defaults: { videoGenerationModel: { primary: "google/veo-3.1-fast-generate-preview", }, }, },}Musikerzeugung
Das mitgelieferte Plugin google registriert außerdem die Musikerzeugung über das gemeinsame
Werkzeug music_generate.
- Standard-Musikmodell:
google/lyria-3-clip-preview - Unterstützt außerdem
google/lyria-3-pro-preview - Prompt-Steuerung:
lyricsundinstrumental - Ausgabeformat: standardmäßig
mp3, zusätzlichwavuntergoogle/lyria-3-pro-preview - Referenzeingaben: bis zu 10 Bilder
- Sitzungsgestützte Ausführungen werden über den gemeinsamen Aufgaben-/Statusablauf abgekoppelt, einschließlich
action: "status"
So verwenden Sie Google als standardmäßigen Musik-Provider:
{ agents: { defaults: { musicGenerationModel: { primary: "google/lyria-3-clip-preview", }, }, },}Text-to-Speech
Der mitgelieferte Sprach-Provider google verwendet den TTS-Pfad der Gemini API mit
gemini-3.1-flash-tts-preview.
- Standardstimme:
Kore - Authentifizierung:
tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEYoderGOOGLE_API_KEY - Ausgabe: WAV für reguläre TTS-Anhänge, Opus für Sprachnachrichtenziele, PCM für Talk/Telefonie
- Sprachnachrichtenausgabe: Google PCM wird als WAV verpackt und mit
ffmpegin Opus mit 48 kHz transkodiert
Googles Batch-Pfad für Gemini TTS gibt das erzeugte Audio in der abgeschlossenen
Antwort generateContent zurück. Verwenden Sie für gesprochene Unterhaltungen mit niedrigster Latenz den
Echtzeit-Sprach-Provider von Google auf Basis der Gemini Live API anstelle von Batch-
TTS.
So verwenden Sie Google als standardmäßigen TTS-Provider:
{ tts: { auto: "always", provider: "google", providers: { google: { model: "gemini-3.1-flash-tts-preview", speakerVoice: "Kore", audioProfile: "Speak professionally with a calm tone.", }, }, },}Gemini API TTS verwendet natürlichsprachliche Prompts zur Stilsteuerung. Legen Sie
audioProfile fest, um dem gesprochenen Text einen wiederverwendbaren Stil-Prompt voranzustellen. Legen Sie
speakerName fest, wenn sich Ihr Prompt-Text auf einen benannten Sprecher bezieht.
Gemini API TTS akzeptiert im Text außerdem ausdrucksbezogene, in eckige Klammern gesetzte Audio-Tags,
beispielsweise [whispers] oder [laughs]. Um Tags aus der sichtbaren Chat-Antwort
herauszuhalten und dennoch an TTS zu senden, platzieren Sie sie in einem
Block vom Typ [[tts:text]]...[[/tts:text]]:
Hier ist der bereinigte Antworttext. [[tts:text]][whispers] Hier ist die gesprochene Version.[[/tts:text]]Echtzeit-Sprache
Das mitgelieferte Plugin google registriert einen Echtzeit-Sprach-Provider auf Basis der
Gemini Live API für backendseitige Audiobrücken wie Voice Call und Google Meet.
| Einstellung | Konfigurationspfad | Standardwert |
|---|---|---|
| Modell | plugins.entries.voice-call.config.realtime.providers.google.model |
gemini-3.1-flash-live-preview |
| Stimme | ...google.voice |
Kore |
| Temperatur | ...google.temperature |
(nicht festgelegt) |
| VAD-Startempfindlichkeit | ...google.startSensitivity |
(nicht festgelegt) |
| VAD-Endempfindlichkeit | ...google.endSensitivity |
(nicht festgelegt) |
| Stilledauer | ...google.silenceDurationMs |
(nicht festgelegt) |
| Aktivitätsverarbeitung | ...google.activityHandling |
Google-Standardwert, start-of-activity-interrupts |
| Turn-Abdeckung | ...google.turnCoverage |
Google-Standardwert, audio-activity-and-all-video |
| Automatische VAD deaktivieren | ...google.automaticActivityDetectionDisabled |
false |
| Sitzungsfortsetzung | ...google.sessionResumption |
true |
| Kontextkomprimierung | ...google.contextWindowCompression |
true |
| API-Schlüssel | ...google.apiKey |
Fällt auf models.providers.google.apiKey, GEMINI_API_KEY oder GOOGLE_API_KEY zurück |
Beispielkonfiguration für Voice Call in Echtzeit:
{ plugins: { entries: { "voice-call": { enabled: true, config: { realtime: { enabled: true, provider: "google", providers: { google: { model: "gemini-3.1-flash-live-preview", speakerVoice: "Kore", activityHandling: "start-of-activity-interrupts", turnCoverage: "audio-activity-and-all-video", }, }, }, }, }, }, },}Führen Sie für die Live-Verifizierung durch Maintainer
OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts aus.
Der Smoke-Test deckt außerdem die OpenAI-Backend-/WebRTC-Pfade ab; der Google-Teil stellt denselben
eingeschränkten Live-API-Token-Typ aus, den Control UI Talk verwendet, öffnet den Browser-
WebSocket-Endpunkt, sendet die anfängliche Setup-Nutzlast zusammen mit einem JPEG-Frame und
überprüft eine Textantwort sowie den Funktions-Roundtrip von describe_view.
Erweiterte Konfiguration
Direkte Wiederverwendung des Gemini-Caches
Bei direkten Gemini-API-Ausführungen (api: "google-generative-ai") übergibt OpenClaw
ein konfiguriertes cachedContent-Handle an Gemini-Anfragen.
- Konfigurieren Sie modellspezifische oder globale Parameter entweder mit
cachedContentoder dem veraltetencached_content - Parameter aus einem spezifischeren Gültigkeitsbereich (Modellebene vor globaler Ebene) haben stets Vorrang.
Wenn beide Schlüssel innerhalb desselben Gültigkeitsbereichs festgelegt sind, hat
cached_contentVorrang. Verwenden Sie nur einen Schlüssel pro Gültigkeitsbereich, um Überraschungen zu vermeiden. - Beispielwert:
cachedContents/prebuilt-context - Die Nutzung bei einem Gemini-Cache-Treffer wird aus dem vorgelagerten
cachedContentTokenCountin OpenClawcacheReadnormalisiert
{ agents: { defaults: { models: { "google/gemini-2.5-pro": { params: { cachedContent: "cachedContents/prebuilt-context", }, }, }, }, },}Hinweise zur Verwendung der Gemini CLI
Bei Verwendung des OAuth-Providers google-gemini-cli verwendet OpenClaw standardmäßig die
Ausgabe stream-json der Gemini CLI und normalisiert die Nutzung aus der abschließenden
stats-Nutzlast. Veraltete Überschreibungen von --output-format json verwenden weiterhin den
JSON-Parser.
- Der gestreamte Antworttext stammt aus den
message-Ereignissen des Assistenten. - Bei veralteter JSON-Ausgabe stammt der Antworttext aus dem Feld
responsedes CLI-JSON. - Die Nutzung fällt auf
statszurück, wenn die CLIusageleer lässt. stats.cachedwird in OpenClawcacheReadnormalisiert.- Wenn
stats.inputfehlt, leitet OpenClaw die Eingabe-Tokens ausstats.input_tokens - stats.cachedab.
Einrichtung von Umgebung und Daemon
Wenn der Gateway als Daemon (launchd/systemd) ausgeführt wird, stellen Sie sicher, dass GEMINI_API_KEY
für diesen Prozess verfügbar ist (beispielsweise in ~/.openclaw/.env oder über
env.shellEnv).