Tools
मीडिया का अवलोकन
OpenClaw छवियाँ, वीडियो और संगीत जनरेट करता है, आने वाले मीडिया (छवियाँ, ऑडियो, वीडियो) को समझता है और टेक्स्ट-टू-स्पीच से उत्तरों को बोलकर सुनाता है। सभी मीडिया क्षमताएँ टूल-संचालित हैं: एजेंट बातचीत के आधार पर तय करता है कि उनका उपयोग कब करना है, और प्रत्येक टूल केवल तभी दिखाई देता है जब कम-से-कम एक सहायक प्रदाता कॉन्फ़िगर हो।
लाइव वाणी वन-शॉट मीडिया टूल
पथ के बजाय Talk सत्र अनुबंध का उपयोग करती है। Talk के तीन मोड हैं: प्रदाता-नेटिव realtime, स्थानीय या स्ट्रीमिंग
stt-tts, और केवल-अवलोकन वाणी कैप्चर के लिए transcription। ये मोड
टेलीफ़ोनी, मीटिंग, ब्राउज़र रियलटाइम और नेटिव पुश-टू-टॉक क्लाइंट के साथ
प्रदाता कैटलॉग, इवेंट एनवेलप और रद्दीकरण सिमैंटिक्स साझा करते हैं।
क्षमताएँ
image_generate के माध्यम से टेक्स्ट प्रॉम्प्ट या संदर्भ छवियों से
छवियाँ बनाएँ और संपादित करें। चैट सत्रों में एसिंक्रोनस — पृष्ठभूमि में चलता है और
तैयार होने पर परिणाम पोस्ट करता है।
video_generate के माध्यम से टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और वीडियो-टू-वीडियो।
एसिंक्रोनस — पृष्ठभूमि में चलता है और तैयार होने पर परिणाम पोस्ट करता है।
music_generate के माध्यम से संगीत या ऑडियो ट्रैक जनरेट करें। साझा मीडिया-जनरेशन
कार्य जीवनचक्र पर चैट सत्रों में एसिंक्रोनस।
tts टूल और tts कॉन्फ़िगरेशन के माध्यम से
आउटबाउंड उत्तरों को बोले गए ऑडियो में बदलें। सिंक्रोनस।
विज़न-सक्षम मॉडल प्रदाताओं और समर्पित मीडिया-समझ Plugin का उपयोग करके आने वाली छवियों, ऑडियो और वीडियो का सारांश बनाएँ।
बैच STT या Voice Call स्ट्रीमिंग STT प्रदाताओं के माध्यम से आने वाले वॉइस संदेशों को ट्रांसक्राइब करें।
प्रदाता क्षमता मैट्रिक्स
| प्रदाता | छवि | वीडियो | संगीत | TTS | STT | रियलटाइम वॉइस | मीडिया समझ |
|---|---|---|---|---|---|---|---|
| Alibaba | ✓ | ||||||
| Azure Speech | ✓ | ||||||
| BytePlus | ✓ | ||||||
| ComfyUI | ✓ | ✓ | ✓ | ||||
| Deepgram | ✓ | ||||||
| DeepInfra | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| ElevenLabs | ✓ | ✓ | |||||
| fal | ✓ | ✓ | ✓ | ||||
| ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| Gradium | ✓ | ||||||
| Inworld | ✓ | ||||||
| LiteLLM | ✓ | ||||||
| स्थानीय CLI | ✓ | ||||||
| Microsoft | ✓ | ||||||
| Microsoft Foundry | ✓ | ||||||
| MiniMax | ✓ | ✓ | ✓ | ✓ | |||
| Mistral | ✓ | ||||||
| OpenAI | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| OpenRouter | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| PixVerse | ✓ | ||||||
| Qwen | ✓ | ✓ | |||||
| Runway | ✓ | ||||||
| SenseAudio | ✓ | ||||||
| Together | ✓ | ||||||
| Volcengine | ✓ | ||||||
| Vydra | ✓ | ✓ | ✓ | ||||
| xAI | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| Xiaomi MiMo | ✓ |
एसिंक्रोनस बनाम सिंक्रोनस
| क्षमता | मोड | कारण |
|---|---|---|
| छवि | एसिंक्रोनस | प्रदाता प्रोसेसिंग चैट टर्न से अधिक समय तक चल सकती है; जनरेट किए गए अटैचमेंट साझा पूर्णता पथ का उपयोग करते हैं। |
| टेक्स्ट-टू-स्पीच | सिंक्रोनस | प्रदाता के उत्तर कुछ सेकंड में लौटते हैं; उत्तर ऑडियो से संलग्न किए जाते हैं। |
| वीडियो | एसिंक्रोनस | प्रदाता प्रोसेसिंग में 30 s से लेकर कई मिनट लगते हैं; धीमी कतारें कॉन्फ़िगर किए गए टाइमआउट तक चल सकती हैं। |
| संगीत | एसिंक्रोनस | वीडियो के समान प्रदाता-प्रोसेसिंग विशेषता। |
एसिंक्रोनस टूल के लिए, OpenClaw अनुरोध को प्रदाता के पास सबमिट करता है, तुरंत एक कार्य
आईडी लौटाता है और कार्य लेज़र में जॉब को ट्रैक करता है। जॉब चलने के दौरान एजेंट
अन्य संदेशों का उत्तर देना जारी रखता है। प्रदाता का काम पूरा होने पर,
OpenClaw जनरेट किए गए मीडिया पथों के साथ एजेंट को जगाता है, ताकि वह सत्र के सामान्य
दृश्य-उत्तर मोड के माध्यम से उपयोगकर्ता को बता सके: कॉन्फ़िगर होने पर स्वचालित अंतिम उत्तर
डिलीवरी, या जब सत्र को संदेश टूल की आवश्यकता हो तब message(action="send")।
यदि अनुरोधकर्ता सत्र निष्क्रिय है या उसका सक्रिय वेक विफल हो जाता है,
और कुछ जनरेट किया गया मीडिया अभी भी पूर्णता उत्तर से अनुपस्थित है, तो
OpenClaw केवल अनुपस्थित मीडिया के साथ एक आइडेम्पोटेंट प्रत्यक्ष फ़ॉलबैक भेजता है। पूर्णता
उत्तर द्वारा पहले ही डिलीवर किया गया मीडिया दोबारा पोस्ट नहीं किया जाता।
स्पीच-टू-टेक्स्ट और Voice Call
कॉन्फ़िगर होने पर Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter,
SenseAudio और xAI सभी बैच tools.media.audio पथ के माध्यम से आने वाले ऑडियो को
ट्रांसक्राइब कर सकते हैं। मेंशन गेटिंग या कमांड पार्सिंग के लिए किसी
वॉइस नोट की पूर्व-जाँच करने वाले चैनल Plugin आने वाले संदर्भ पर ट्रांसक्राइब किए गए
अटैचमेंट को चिह्नित करते हैं, ताकि साझा मीडिया-समझ चरण उसी ऑडियो के लिए
दूसरी STT कॉल करने के बजाय उस ट्रांसक्रिप्ट का पुनः उपयोग करे।
Deepgram, ElevenLabs, Mistral, OpenAI और xAI Voice Call स्ट्रीमिंग STT प्रदाताओं को भी पंजीकृत करते हैं, ताकि पूर्ण रिकॉर्डिंग की प्रतीक्षा किए बिना लाइव फ़ोन ऑडियो को चयनित विक्रेता को अग्रेषित किया जा सके।
लाइव उपयोगकर्ता वार्तालापों के लिए, Talk मोड को प्राथमिकता दें। बैच ऑडियो अटैचमेंट मीडिया पथ पर बने रहते हैं; ब्राउज़र रियलटाइम, नेटिव पुश-टू-टॉक, टेलीफ़ोनी और मीटिंग ऑडियो को Talk इवेंट तथा Gateway द्वारा लौटाए गए सत्र-स्कोप्ड कैटलॉग का उपयोग करना चाहिए।
प्रदाता मैपिंग (विक्रेता विभिन्न सतहों में कैसे विभाजित होते हैं)
छवि, वीडियो, संगीत, बैच TTS, बैच STT, बैकएंड रियलटाइम वॉइस और मीडिया-समझ सतहें।
OpenAI
छवि, वीडियो, बैच TTS, बैच STT, Voice Call स्ट्रीमिंग STT, बैकएंड रियलटाइम वॉइस और मेमोरी-एम्बेडिंग सतहें।
DeepInfra
चैट/मॉडल रूटिंग, छवि जनरेशन/संपादन, टेक्स्ट-टू-वीडियो, बैच TTS, बैच STT, छवि मीडिया समझ और मेमोरी-एम्बेडिंग सतहें। DeepInfra पुनःरैंकिंग, वर्गीकरण, ऑब्जेक्ट-डिटेक्शन और अन्य नेटिव मॉडल प्रकार भी उपलब्ध कराता है; OpenClaw के पास अभी उन श्रेणियों के लिए कोई प्रदाता अनुबंध नहीं है, इसलिए यह Plugin उन्हें पंजीकृत नहीं करता।
xAI
छवि, वीडियो, खोज, कोड-निष्पादन, बैच TTS, बैच STT और Voice Call स्ट्रीमिंग STT। xAI Realtime वॉइस एक अपस्ट्रीम क्षमता है, लेकिन जब तक साझा रियलटाइम-वॉइस अनुबंध इसे निरूपित नहीं कर सकता, तब तक यह OpenClaw में पंजीकृत नहीं होती।