Tools

Medienübersicht

OpenClaw generiert Bilder, Videos und Musik, versteht eingehende Medien (Bilder, Audio, Video) und spricht Antworten mithilfe von Text-to-Speech laut aus. Alle Medienfunktionen werden durch Tools gesteuert: Der Agent entscheidet anhand der Konversation, wann sie verwendet werden, und jedes Tool wird nur angezeigt, wenn mindestens ein unterstützender Provider konfiguriert ist.

Live-Sprache verwendet den Talk-Sitzungsvertrag anstelle des Medien-Tool-Pfads für Einzelvorgänge. Talk verfügt über drei Modi: Provider-natives realtime, lokales oder streamendes stt-tts und transcription für die reine Beobachtung der Spracherfassung. Diese Modi verwenden dieselben Provider-Kataloge, Ereignis-Umschläge und Abbruchsemantiken wie Telefonie, Besprechungen, Browser-Echtzeitkommunikation und native Push-to-Talk-Clients.

Funktionen

Provider-Funktionsmatrix

Provider Bild Video Musik TTS STT Echtzeit-Sprache Medienverständnis
Alibaba
Azure Speech
BytePlus
ComfyUI
Deepgram
DeepInfra
ElevenLabs
fal
Google
Gradium
Inworld
LiteLLM
Lokale CLI
Microsoft
Microsoft Foundry
MiniMax
Mistral
OpenAI
OpenRouter
PixVerse
Qwen
Runway
SenseAudio
Together
Volcengine
Vydra
xAI
Xiaomi MiMo

Asynchron im Vergleich zu synchron

Funktion Modus Grund
Bild Asynchron Die Verarbeitung durch den Provider kann länger als ein Chat-Durchlauf dauern; generierte Anhänge verwenden den gemeinsamen Abschlusspfad.
Text-to-Speech Synchron Provider-Antworten werden innerhalb von Sekunden zurückgegeben und an das Antwort-Audio angehängt.
Video Asynchron Die Verarbeitung durch den Provider dauert 30 s bis mehrere Minuten; langsame Warteschlangen können bis zum konfigurierten Timeout laufen.
Musik Asynchron Weist dieselben Eigenschaften der Provider-Verarbeitung wie Video auf.

Bei asynchronen Tools übermittelt OpenClaw die Anfrage an den Provider, gibt sofort eine Task-ID zurück und verfolgt den Auftrag im Task-Verzeichnis. Der Agent beantwortet weiterhin andere Nachrichten, während der Auftrag ausgeführt wird. Sobald der Provider fertig ist, weckt OpenClaw den Agenten mit den Pfaden der generierten Medien auf, damit er den Benutzer über den normalen sichtbaren Antwortmodus der Sitzung informieren kann: automatische Zustellung der abschließenden Antwort, sofern konfiguriert, oder message(action="send"), wenn die Sitzung das Nachrichten-Tool erfordert. Wenn die anfordernde Sitzung inaktiv ist oder ihr aktiver Weckvorgang fehlschlägt und einige generierte Medien noch in der Abschlussantwort fehlen, sendet OpenClaw einen idempotenten direkten Fallback, der nur die fehlenden Medien enthält. Medien, die bereits durch die Abschlussantwort zugestellt wurden, werden nicht erneut veröffentlicht.

Speech-to-Text und Voice Call

Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio und xAI können bei entsprechender Konfiguration eingehende Audiodaten über den Batch- Pfad tools.media.audio transkribieren. Channel-Plugins, die eine Sprachnachricht vorab auf Erwähnungsfilterung oder Befehlsanalyse prüfen, markieren den transkribierten Anhang im eingehenden Kontext, sodass der gemeinsame Durchlauf für das Medienverständnis dieses Transkript wiederverwendet, anstatt für dieselben Audiodaten einen zweiten STT-Aufruf durchzuführen.

Deepgram, ElevenLabs, Mistral, OpenAI und xAI registrieren außerdem Streaming-STT-Provider für Voice Call, sodass Live-Telefonaudio an den ausgewählten Provider weitergeleitet werden kann, ohne auf eine abgeschlossene Aufnahme zu warten.

Für Live-Unterhaltungen mit Benutzern sollte der Talk-Modus bevorzugt werden. Batch-Audioanhänge bleiben auf dem Medienpfad; Browser-Echtzeitkommunikation, natives Push-to-Talk, Telefonie und Besprechungsaudio sollten Talk-Ereignisse und die vom Gateway zurückgegebenen sitzungsbezogenen Kataloge verwenden.

Provider-Zuordnungen (Aufteilung der Anbieter auf die Oberflächen)

Google

Oberflächen für Bild, Video, Musik, Batch-TTS, Batch-STT, Backend-Echtzeit-Sprache und Medienverständnis.

OpenAI

Oberflächen für Bild, Video, Batch-TTS, Batch-STT, Voice-Call-Streaming-STT, Backend- Echtzeit-Sprache und Speicher-Embeddings.

DeepInfra

Oberflächen für Chat-/Modell-Routing, Bilderzeugung/-bearbeitung, Text-zu-Video, Batch-TTS, Batch-STT, Medienverständnis für Bilder und Speicher-Embeddings. DeepInfra stellt außerdem Re-Ranking, Klassifizierung, Objekterkennung und andere native Modelltypen bereit; OpenClaw verfügt noch über keinen Provider-Vertrag für diese Kategorien, daher registriert dieses Plugin sie nicht.

xAI

Bild, Video, Suche, Codeausführung, Batch-TTS, Batch-STT und Voice- Call-Streaming-STT. Echtzeit-Sprache von xAI ist eine Upstream-Funktion, wird jedoch erst in OpenClaw registriert, wenn der gemeinsame Vertrag für Echtzeit-Sprache sie abbilden kann.

Verwandte Themen

Was this useful?
On this page

On this page