Tools

मीडिया का अवलोकन

OpenClaw छवियाँ, वीडियो और संगीत जनरेट करता है, आने वाले मीडिया (छवियाँ, ऑडियो, वीडियो) को समझता है और टेक्स्ट-टू-स्पीच से उत्तरों को बोलकर सुनाता है। सभी मीडिया क्षमताएँ टूल-संचालित हैं: एजेंट बातचीत के आधार पर तय करता है कि उनका उपयोग कब करना है, और प्रत्येक टूल केवल तभी दिखाई देता है जब कम-से-कम एक सहायक प्रदाता कॉन्फ़िगर हो।

लाइव वाणी वन-शॉट मीडिया टूल पथ के बजाय Talk सत्र अनुबंध का उपयोग करती है। Talk के तीन मोड हैं: प्रदाता-नेटिव realtime, स्थानीय या स्ट्रीमिंग stt-tts, और केवल-अवलोकन वाणी कैप्चर के लिए transcription। ये मोड टेलीफ़ोनी, मीटिंग, ब्राउज़र रियलटाइम और नेटिव पुश-टू-टॉक क्लाइंट के साथ प्रदाता कैटलॉग, इवेंट एनवेलप और रद्दीकरण सिमैंटिक्स साझा करते हैं।

क्षमताएँ

छवि जनरेशन

image_generate के माध्यम से टेक्स्ट प्रॉम्प्ट या संदर्भ छवियों से छवियाँ बनाएँ और संपादित करें। चैट सत्रों में एसिंक्रोनस — पृष्ठभूमि में चलता है और तैयार होने पर परिणाम पोस्ट करता है।

वीडियो जनरेशन

video_generate के माध्यम से टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और वीडियो-टू-वीडियो। एसिंक्रोनस — पृष्ठभूमि में चलता है और तैयार होने पर परिणाम पोस्ट करता है।

संगीत जनरेशन

music_generate के माध्यम से संगीत या ऑडियो ट्रैक जनरेट करें। साझा मीडिया-जनरेशन कार्य जीवनचक्र पर चैट सत्रों में एसिंक्रोनस।

टेक्स्ट-टू-स्पीच

tts टूल और tts कॉन्फ़िगरेशन के माध्यम से आउटबाउंड उत्तरों को बोले गए ऑडियो में बदलें। सिंक्रोनस।

मीडिया समझ

विज़न-सक्षम मॉडल प्रदाताओं और समर्पित मीडिया-समझ Plugin का उपयोग करके आने वाली छवियों, ऑडियो और वीडियो का सारांश बनाएँ।

स्पीच-टू-टेक्स्ट

बैच STT या Voice Call स्ट्रीमिंग STT प्रदाताओं के माध्यम से आने वाले वॉइस संदेशों को ट्रांसक्राइब करें।

प्रदाता क्षमता मैट्रिक्स

प्रदाता छवि वीडियो संगीत TTS STT रियलटाइम वॉइस मीडिया समझ
Alibaba
Azure Speech
BytePlus
ComfyUI
Deepgram
DeepInfra
ElevenLabs
fal
Google
Gradium
Inworld
LiteLLM
स्थानीय CLI
Microsoft
Microsoft Foundry
MiniMax
Mistral
OpenAI
OpenRouter
PixVerse
Qwen
Runway
SenseAudio
Together
Volcengine
Vydra
xAI
Xiaomi MiMo

एसिंक्रोनस बनाम सिंक्रोनस

क्षमता मोड कारण
छवि एसिंक्रोनस प्रदाता प्रोसेसिंग चैट टर्न से अधिक समय तक चल सकती है; जनरेट किए गए अटैचमेंट साझा पूर्णता पथ का उपयोग करते हैं।
टेक्स्ट-टू-स्पीच सिंक्रोनस प्रदाता के उत्तर कुछ सेकंड में लौटते हैं; उत्तर ऑडियो से संलग्न किए जाते हैं।
वीडियो एसिंक्रोनस प्रदाता प्रोसेसिंग में 30 s से लेकर कई मिनट लगते हैं; धीमी कतारें कॉन्फ़िगर किए गए टाइमआउट तक चल सकती हैं।
संगीत एसिंक्रोनस वीडियो के समान प्रदाता-प्रोसेसिंग विशेषता।

एसिंक्रोनस टूल के लिए, OpenClaw अनुरोध को प्रदाता के पास सबमिट करता है, तुरंत एक कार्य आईडी लौटाता है और कार्य लेज़र में जॉब को ट्रैक करता है। जॉब चलने के दौरान एजेंट अन्य संदेशों का उत्तर देना जारी रखता है। प्रदाता का काम पूरा होने पर, OpenClaw जनरेट किए गए मीडिया पथों के साथ एजेंट को जगाता है, ताकि वह सत्र के सामान्य दृश्य-उत्तर मोड के माध्यम से उपयोगकर्ता को बता सके: कॉन्फ़िगर होने पर स्वचालित अंतिम उत्तर डिलीवरी, या जब सत्र को संदेश टूल की आवश्यकता हो तब message(action="send")। यदि अनुरोधकर्ता सत्र निष्क्रिय है या उसका सक्रिय वेक विफल हो जाता है, और कुछ जनरेट किया गया मीडिया अभी भी पूर्णता उत्तर से अनुपस्थित है, तो OpenClaw केवल अनुपस्थित मीडिया के साथ एक आइडेम्पोटेंट प्रत्यक्ष फ़ॉलबैक भेजता है। पूर्णता उत्तर द्वारा पहले ही डिलीवर किया गया मीडिया दोबारा पोस्ट नहीं किया जाता।

स्पीच-टू-टेक्स्ट और Voice Call

कॉन्फ़िगर होने पर Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio और xAI सभी बैच tools.media.audio पथ के माध्यम से आने वाले ऑडियो को ट्रांसक्राइब कर सकते हैं। मेंशन गेटिंग या कमांड पार्सिंग के लिए किसी वॉइस नोट की पूर्व-जाँच करने वाले चैनल Plugin आने वाले संदर्भ पर ट्रांसक्राइब किए गए अटैचमेंट को चिह्नित करते हैं, ताकि साझा मीडिया-समझ चरण उसी ऑडियो के लिए दूसरी STT कॉल करने के बजाय उस ट्रांसक्रिप्ट का पुनः उपयोग करे।

Deepgram, ElevenLabs, Mistral, OpenAI और xAI Voice Call स्ट्रीमिंग STT प्रदाताओं को भी पंजीकृत करते हैं, ताकि पूर्ण रिकॉर्डिंग की प्रतीक्षा किए बिना लाइव फ़ोन ऑडियो को चयनित विक्रेता को अग्रेषित किया जा सके।

लाइव उपयोगकर्ता वार्तालापों के लिए, Talk मोड को प्राथमिकता दें। बैच ऑडियो अटैचमेंट मीडिया पथ पर बने रहते हैं; ब्राउज़र रियलटाइम, नेटिव पुश-टू-टॉक, टेलीफ़ोनी और मीटिंग ऑडियो को Talk इवेंट तथा Gateway द्वारा लौटाए गए सत्र-स्कोप्ड कैटलॉग का उपयोग करना चाहिए।

प्रदाता मैपिंग (विक्रेता विभिन्न सतहों में कैसे विभाजित होते हैं)

Google

छवि, वीडियो, संगीत, बैच TTS, बैच STT, बैकएंड रियलटाइम वॉइस और मीडिया-समझ सतहें।

OpenAI

छवि, वीडियो, बैच TTS, बैच STT, Voice Call स्ट्रीमिंग STT, बैकएंड रियलटाइम वॉइस और मेमोरी-एम्बेडिंग सतहें।

DeepInfra

चैट/मॉडल रूटिंग, छवि जनरेशन/संपादन, टेक्स्ट-टू-वीडियो, बैच TTS, बैच STT, छवि मीडिया समझ और मेमोरी-एम्बेडिंग सतहें। DeepInfra पुनःरैंकिंग, वर्गीकरण, ऑब्जेक्ट-डिटेक्शन और अन्य नेटिव मॉडल प्रकार भी उपलब्ध कराता है; OpenClaw के पास अभी उन श्रेणियों के लिए कोई प्रदाता अनुबंध नहीं है, इसलिए यह Plugin उन्हें पंजीकृत नहीं करता।

xAI

छवि, वीडियो, खोज, कोड-निष्पादन, बैच TTS, बैच STT और Voice Call स्ट्रीमिंग STT। xAI Realtime वॉइस एक अपस्ट्रीम क्षमता है, लेकिन जब तक साझा रियलटाइम-वॉइस अनुबंध इसे निरूपित नहीं कर सकता, तब तक यह OpenClaw में पंजीकृत नहीं होती।

संबंधित

Was this useful?
On this page

On this page