Tools
Medienübersicht
OpenClaw generiert Bilder, Videos und Musik, versteht eingehende Medien (Bilder, Audio, Video) und spricht Antworten mithilfe von Text-to-Speech laut aus. Alle Medienfunktionen werden durch Tools gesteuert: Der Agent entscheidet anhand der Konversation, wann sie verwendet werden, und jedes Tool wird nur angezeigt, wenn mindestens ein unterstützender Provider konfiguriert ist.
Live-Sprache verwendet den Talk-Sitzungsvertrag anstelle des Medien-Tool-Pfads
für Einzelvorgänge. Talk verfügt über drei Modi: Provider-natives realtime, lokales oder streamendes
stt-tts und transcription für die reine Beobachtung der Spracherfassung. Diese Modi
verwenden dieselben Provider-Kataloge, Ereignis-Umschläge und Abbruchsemantiken wie
Telefonie, Besprechungen, Browser-Echtzeitkommunikation und native Push-to-Talk-Clients.
Funktionen
Erstellen und bearbeiten Sie Bilder anhand von Text-Prompts oder Referenzbildern über
image_generate. In Chatsitzungen asynchron — wird im Hintergrund ausgeführt und
veröffentlicht das Ergebnis, sobald es bereit ist.
Text-zu-Video, Bild-zu-Video und Video-zu-Video über video_generate.
Asynchron — wird im Hintergrund ausgeführt und veröffentlicht das Ergebnis, sobald es bereit ist.
Generieren Sie Musik oder Audiospuren über music_generate. In
Chatsitzungen asynchron im gemeinsamen Task-Lebenszyklus für die Medienerzeugung.
Wandeln Sie ausgehende Antworten über das Tool tts und die
Konfiguration tts in gesprochene Audiodaten um. Synchron.
Fassen Sie eingehende Bilder, Audio- und Videodaten mithilfe visionsfähiger Modell-Provider und spezieller Plugins für das Medienverständnis zusammen.
Transkribieren Sie eingehende Sprachnachrichten über Batch-STT oder Streaming-STT-Provider für Voice Call.
Provider-Funktionsmatrix
| Provider | Bild | Video | Musik | TTS | STT | Echtzeit-Sprache | Medienverständnis |
|---|---|---|---|---|---|---|---|
| Alibaba | ✓ | ||||||
| Azure Speech | ✓ | ||||||
| BytePlus | ✓ | ||||||
| ComfyUI | ✓ | ✓ | ✓ | ||||
| Deepgram | ✓ | ||||||
| DeepInfra | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| ElevenLabs | ✓ | ✓ | |||||
| fal | ✓ | ✓ | ✓ | ||||
| ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| Gradium | ✓ | ||||||
| Inworld | ✓ | ||||||
| LiteLLM | ✓ | ||||||
| Lokale CLI | ✓ | ||||||
| Microsoft | ✓ | ||||||
| Microsoft Foundry | ✓ | ||||||
| MiniMax | ✓ | ✓ | ✓ | ✓ | |||
| Mistral | ✓ | ||||||
| OpenAI | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| OpenRouter | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| PixVerse | ✓ | ||||||
| Qwen | ✓ | ✓ | |||||
| Runway | ✓ | ||||||
| SenseAudio | ✓ | ||||||
| Together | ✓ | ||||||
| Volcengine | ✓ | ||||||
| Vydra | ✓ | ✓ | ✓ | ||||
| xAI | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| Xiaomi MiMo | ✓ |
Asynchron im Vergleich zu synchron
| Funktion | Modus | Grund |
|---|---|---|
| Bild | Asynchron | Die Verarbeitung durch den Provider kann länger als ein Chat-Durchlauf dauern; generierte Anhänge verwenden den gemeinsamen Abschlusspfad. |
| Text-to-Speech | Synchron | Provider-Antworten werden innerhalb von Sekunden zurückgegeben und an das Antwort-Audio angehängt. |
| Video | Asynchron | Die Verarbeitung durch den Provider dauert 30 s bis mehrere Minuten; langsame Warteschlangen können bis zum konfigurierten Timeout laufen. |
| Musik | Asynchron | Weist dieselben Eigenschaften der Provider-Verarbeitung wie Video auf. |
Bei asynchronen Tools übermittelt OpenClaw die Anfrage an den Provider, gibt sofort eine
Task-ID zurück und verfolgt den Auftrag im Task-Verzeichnis. Der Agent beantwortet
weiterhin andere Nachrichten, während der Auftrag ausgeführt wird. Sobald der Provider fertig ist,
weckt OpenClaw den Agenten mit den Pfaden der generierten Medien auf, damit er den
Benutzer über den normalen sichtbaren Antwortmodus der Sitzung informieren kann: automatische Zustellung
der abschließenden Antwort, sofern konfiguriert, oder message(action="send"), wenn die Sitzung
das Nachrichten-Tool erfordert. Wenn die anfordernde Sitzung inaktiv ist oder ihr aktiver
Weckvorgang fehlschlägt und einige generierte Medien noch in der Abschlussantwort fehlen,
sendet OpenClaw einen idempotenten direkten Fallback, der nur die fehlenden Medien enthält. Medien,
die bereits durch die Abschlussantwort zugestellt wurden, werden nicht erneut veröffentlicht.
Speech-to-Text und Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter,
SenseAudio und xAI können bei entsprechender Konfiguration eingehende Audiodaten über den Batch-
Pfad tools.media.audio transkribieren. Channel-Plugins, die eine
Sprachnachricht vorab auf Erwähnungsfilterung oder Befehlsanalyse prüfen, markieren den transkribierten
Anhang im eingehenden Kontext, sodass der gemeinsame Durchlauf für das Medienverständnis
dieses Transkript wiederverwendet, anstatt für dieselben Audiodaten einen zweiten STT-Aufruf
durchzuführen.
Deepgram, ElevenLabs, Mistral, OpenAI und xAI registrieren außerdem Streaming-STT-Provider für Voice Call, sodass Live-Telefonaudio an den ausgewählten Provider weitergeleitet werden kann, ohne auf eine abgeschlossene Aufnahme zu warten.
Für Live-Unterhaltungen mit Benutzern sollte der Talk-Modus bevorzugt werden. Batch-Audioanhänge bleiben auf dem Medienpfad; Browser-Echtzeitkommunikation, natives Push-to-Talk, Telefonie und Besprechungsaudio sollten Talk-Ereignisse und die vom Gateway zurückgegebenen sitzungsbezogenen Kataloge verwenden.
Provider-Zuordnungen (Aufteilung der Anbieter auf die Oberflächen)
Oberflächen für Bild, Video, Musik, Batch-TTS, Batch-STT, Backend-Echtzeit-Sprache und Medienverständnis.
OpenAI
Oberflächen für Bild, Video, Batch-TTS, Batch-STT, Voice-Call-Streaming-STT, Backend- Echtzeit-Sprache und Speicher-Embeddings.
DeepInfra
Oberflächen für Chat-/Modell-Routing, Bilderzeugung/-bearbeitung, Text-zu-Video, Batch-TTS, Batch-STT, Medienverständnis für Bilder und Speicher-Embeddings. DeepInfra stellt außerdem Re-Ranking, Klassifizierung, Objekterkennung und andere native Modelltypen bereit; OpenClaw verfügt noch über keinen Provider-Vertrag für diese Kategorien, daher registriert dieses Plugin sie nicht.
xAI
Bild, Video, Suche, Codeausführung, Batch-TTS, Batch-STT und Voice- Call-Streaming-STT. Echtzeit-Sprache von xAI ist eine Upstream-Funktion, wird jedoch erst in OpenClaw registriert, wenn der gemeinsame Vertrag für Echtzeit-Sprache sie abbilden kann.