इस पेज पर

इस पेज पर

Tools

मीडिया का अवलोकन

OpenClaw छवियाँ, वीडियो और संगीत जनरेट करता है, आने वाले मीडिया (छवियाँ, ऑडियो, वीडियो) को समझता है और टेक्स्ट-टू-स्पीच से उत्तरों को बोलकर सुनाता है। सभी मीडिया क्षमताएँ टूल-संचालित हैं: एजेंट बातचीत के आधार पर तय करता है कि उनका उपयोग कब करना है, और प्रत्येक टूल केवल तभी दिखाई देता है जब कम-से-कम एक सहायक प्रदाता कॉन्फ़िगर हो।

लाइव वाणी वन-शॉट मीडिया टूल पथ के बजाय Talk सत्र अनुबंध का उपयोग करती है। Talk के तीन मोड हैं: प्रदाता-नेटिव realtime, स्थानीय या स्ट्रीमिंग stt-tts, और केवल-अवलोकन वाणी कैप्चर के लिए transcription। ये मोड टेलीफ़ोनी, मीटिंग, ब्राउज़र रियलटाइम और नेटिव पुश-टू-टॉक क्लाइंट के साथ प्रदाता कैटलॉग, इवेंट एनवेलप और रद्दीकरण सिमैंटिक्स साझा करते हैं।

क्षमताएँ

छवि जनरेशन

image_generate के माध्यम से टेक्स्ट प्रॉम्प्ट या संदर्भ छवियों से छवियाँ बनाएँ और संपादित करें। चैट सत्रों में एसिंक्रोनस — पृष्ठभूमि में चलता है और तैयार होने पर परिणाम पोस्ट करता है।

वीडियो जनरेशन

video_generate के माध्यम से टेक्स्ट-टू-वीडियो, इमेज-टू-वीडियो और वीडियो-टू-वीडियो। एसिंक्रोनस — पृष्ठभूमि में चलता है और तैयार होने पर परिणाम पोस्ट करता है।

संगीत जनरेशन

music_generate के माध्यम से संगीत या ऑडियो ट्रैक जनरेट करें। साझा मीडिया-जनरेशन कार्य जीवनचक्र पर चैट सत्रों में एसिंक्रोनस।

टेक्स्ट-टू-स्पीच

tts टूल और tts कॉन्फ़िगरेशन के माध्यम से आउटबाउंड उत्तरों को बोले गए ऑडियो में बदलें। सिंक्रोनस।

मीडिया समझ

विज़न-सक्षम मॉडल प्रदाताओं और समर्पित मीडिया-समझ Plugin का उपयोग करके आने वाली छवियों, ऑडियो और वीडियो का सारांश बनाएँ।

स्पीच-टू-टेक्स्ट

बैच STT या Voice Call स्ट्रीमिंग STT प्रदाताओं के माध्यम से आने वाले वॉइस संदेशों को ट्रांसक्राइब करें।

प्रदाता क्षमता मैट्रिक्स

प्रदाता छवि वीडियो संगीत TTS STT रियलटाइम वॉइस मीडिया समझ
Alibaba ✓
Azure Speech ✓
BytePlus ✓
ComfyUI ✓ ✓ ✓
Deepgram ✓
DeepInfra ✓ ✓ ✓ ✓ ✓
ElevenLabs ✓ ✓
fal ✓ ✓ ✓
Google ✓ ✓ ✓ ✓ ✓ ✓ ✓
Gradium ✓
Inworld ✓
LiteLLM ✓
स्थानीय CLI ✓
Microsoft ✓
Microsoft Foundry ✓
MiniMax ✓ ✓ ✓ ✓
Mistral ✓
OpenAI ✓ ✓ ✓ ✓ ✓ ✓
OpenRouter ✓ ✓ ✓ ✓ ✓ ✓
PixVerse ✓
Qwen ✓ ✓
Runway ✓
SenseAudio ✓
Together ✓
Volcengine ✓
Vydra ✓ ✓ ✓
xAI ✓ ✓ ✓ ✓ ✓
Xiaomi MiMo ✓

एसिंक्रोनस बनाम सिंक्रोनस

क्षमता मोड कारण
छवि एसिंक्रोनस प्रदाता प्रोसेसिंग चैट टर्न से अधिक समय तक चल सकती है; जनरेट किए गए अटैचमेंट साझा पूर्णता पथ का उपयोग करते हैं।
टेक्स्ट-टू-स्पीच सिंक्रोनस प्रदाता के उत्तर कुछ सेकंड में लौटते हैं; उत्तर ऑडियो से संलग्न किए जाते हैं।
वीडियो एसिंक्रोनस प्रदाता प्रोसेसिंग में 30 s से लेकर कई मिनट लगते हैं; धीमी कतारें कॉन्फ़िगर किए गए टाइमआउट तक चल सकती हैं।
संगीत एसिंक्रोनस वीडियो के समान प्रदाता-प्रोसेसिंग विशेषता।

एसिंक्रोनस टूल के लिए, OpenClaw अनुरोध को प्रदाता के पास सबमिट करता है, तुरंत एक कार्य आईडी लौटाता है और कार्य लेज़र में जॉब को ट्रैक करता है। जॉब चलने के दौरान एजेंट अन्य संदेशों का उत्तर देना जारी रखता है। प्रदाता का काम पूरा होने पर, OpenClaw जनरेट किए गए मीडिया पथों के साथ एजेंट को जगाता है, ताकि वह सत्र के सामान्य दृश्य-उत्तर मोड के माध्यम से उपयोगकर्ता को बता सके: कॉन्फ़िगर होने पर स्वचालित अंतिम उत्तर डिलीवरी, या जब सत्र को संदेश टूल की आवश्यकता हो तब message(action="send")। यदि अनुरोधकर्ता सत्र निष्क्रिय है या उसका सक्रिय वेक विफल हो जाता है, और कुछ जनरेट किया गया मीडिया अभी भी पूर्णता उत्तर से अनुपस्थित है, तो OpenClaw केवल अनुपस्थित मीडिया के साथ एक आइडेम्पोटेंट प्रत्यक्ष फ़ॉलबैक भेजता है। पूर्णता उत्तर द्वारा पहले ही डिलीवर किया गया मीडिया दोबारा पोस्ट नहीं किया जाता।

स्पीच-टू-टेक्स्ट और Voice Call

कॉन्फ़िगर होने पर Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter, SenseAudio और xAI सभी बैच tools.media.audio पथ के माध्यम से आने वाले ऑडियो को ट्रांसक्राइब कर सकते हैं। मेंशन गेटिंग या कमांड पार्सिंग के लिए किसी वॉइस नोट की पूर्व-जाँच करने वाले चैनल Plugin आने वाले संदर्भ पर ट्रांसक्राइब किए गए अटैचमेंट को चिह्नित करते हैं, ताकि साझा मीडिया-समझ चरण उसी ऑडियो के लिए दूसरी STT कॉल करने के बजाय उस ट्रांसक्रिप्ट का पुनः उपयोग करे।

Deepgram, ElevenLabs, Mistral, OpenAI और xAI Voice Call स्ट्रीमिंग STT प्रदाताओं को भी पंजीकृत करते हैं, ताकि पूर्ण रिकॉर्डिंग की प्रतीक्षा किए बिना लाइव फ़ोन ऑडियो को चयनित विक्रेता को अग्रेषित किया जा सके।

लाइव उपयोगकर्ता वार्तालापों के लिए, Talk मोड को प्राथमिकता दें। बैच ऑडियो अटैचमेंट मीडिया पथ पर बने रहते हैं; ब्राउज़र रियलटाइम, नेटिव पुश-टू-टॉक, टेलीफ़ोनी और मीटिंग ऑडियो को Talk इवेंट तथा Gateway द्वारा लौटाए गए सत्र-स्कोप्ड कैटलॉग का उपयोग करना चाहिए।

प्रदाता मैपिंग (विक्रेता विभिन्न सतहों में कैसे विभाजित होते हैं)

Google

छवि, वीडियो, संगीत, बैच TTS, बैच STT, बैकएंड रियलटाइम वॉइस और मीडिया-समझ सतहें।

OpenAI

छवि, वीडियो, बैच TTS, बैच STT, Voice Call स्ट्रीमिंग STT, बैकएंड रियलटाइम वॉइस और मेमोरी-एम्बेडिंग सतहें।

DeepInfra

चैट/मॉडल रूटिंग, छवि जनरेशन/संपादन, टेक्स्ट-टू-वीडियो, बैच TTS, बैच STT, छवि मीडिया समझ और मेमोरी-एम्बेडिंग सतहें। DeepInfra पुनःरैंकिंग, वर्गीकरण, ऑब्जेक्ट-डिटेक्शन और अन्य नेटिव मॉडल प्रकार भी उपलब्ध कराता है; OpenClaw के पास अभी उन श्रेणियों के लिए कोई प्रदाता अनुबंध नहीं है, इसलिए यह Plugin उन्हें पंजीकृत नहीं करता।

xAI

छवि, वीडियो, खोज, कोड-निष्पादन, बैच TTS, बैच STT और Voice Call स्ट्रीमिंग STT। xAI Realtime वॉइस एक अपस्ट्रीम क्षमता है, लेकिन जब तक साझा रियलटाइम-वॉइस अनुबंध इसे निरूपित नहीं कर सकता, तब तक यह OpenClaw में पंजीकृत नहीं होती।

संबंधित

Was this useful?