Tools
نمای کلی رسانهها
OpenClaw تصویر، ویدئو و موسیقی تولید میکند، رسانههای ورودی (تصویر، صدا، ویدئو) را درک میکند و پاسخها را با تبدیل متن به گفتار بلند میخواند. همهٔ قابلیتهای رسانهای ابزارمحور هستند: عامل بر اساس مکالمه تصمیم میگیرد چه زمانی از آنها استفاده کند و هر ابزار فقط زمانی ظاهر میشود که دستکم یک ارائهدهندهٔ پشتیبان پیکربندی شده باشد.
گفتار زنده بهجای مسیر ابزار رسانهای تکمرحلهای، از قرارداد نشست Talk استفاده
میکند. Talk سه حالت دارد: realtime بومی ارائهدهنده، stt-tts
محلی یا جریانی، و transcription برای ضبط گفتار صرفاً جهت مشاهده. این حالتها
کاتالوگهای ارائهدهنده، پوشهای رویداد و معناشناسی لغو را با
تلفن، جلسهها، بلادرنگ مرورگر و کلاینتهای بومی فشار برای صحبت بهاشتراک میگذارند.
قابلیتها
تصویرها را از اعلانهای متنی یا تصویرهای مرجع، از طریق
image_generate ایجاد و ویرایش کنید. در نشستهای گفتوگو ناهمگام است — در پسزمینه
اجرا میشود و پس از آمادهشدن، نتیجه را ارسال میکند.
تبدیل متن به ویدئو، تصویر به ویدئو و ویدئو به ویدئو از طریق video_generate.
ناهمگام است — در پسزمینه اجرا میشود و پس از آمادهشدن، نتیجه را ارسال میکند.
موسیقی یا قطعههای صوتی را از طریق music_generate تولید کنید. در نشستهای
گفتوگو و در چرخهٔ عمر مشترک وظیفهٔ تولید رسانه، ناهمگام است.
پاسخهای خروجی را از طریق ابزار tts بههمراه
پیکربندی tts به صدای گفتاری تبدیل کنید. همگام است.
تصویرها، صداها و ویدئوهای ورودی را با استفاده از ارائهدهندگان مدل دارای قابلیت بینایی و Pluginهای اختصاصی درک رسانه خلاصه کنید.
پیامهای صوتی ورودی را از طریق ارائهدهندگان STT دستهای یا STT جریانی Voice Call رونویسی کنید.
ماتریس قابلیت ارائهدهندگان
| ارائهدهنده | تصویر | ویدئو | موسیقی | TTS | STT | صدای بلادرنگ | درک رسانه |
|---|---|---|---|---|---|---|---|
| Alibaba | ✓ | ||||||
| Azure Speech | ✓ | ||||||
| BytePlus | ✓ | ||||||
| ComfyUI | ✓ | ✓ | ✓ | ||||
| Deepgram | ✓ | ||||||
| DeepInfra | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| ElevenLabs | ✓ | ✓ | |||||
| fal | ✓ | ✓ | ✓ | ||||
| ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| Gradium | ✓ | ||||||
| Inworld | ✓ | ||||||
| LiteLLM | ✓ | ||||||
| CLI محلی | ✓ | ||||||
| Microsoft | ✓ | ||||||
| Microsoft Foundry | ✓ | ||||||
| MiniMax | ✓ | ✓ | ✓ | ✓ | |||
| Mistral | ✓ | ||||||
| OpenAI | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| OpenRouter | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| PixVerse | ✓ | ||||||
| Qwen | ✓ | ✓ | |||||
| Runway | ✓ | ||||||
| SenseAudio | ✓ | ||||||
| Together | ✓ | ||||||
| Volcengine | ✓ | ||||||
| Vydra | ✓ | ✓ | ✓ | ||||
| xAI | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| Xiaomi MiMo | ✓ |
ناهمگام در برابر همگام
| قابلیت | حالت | دلیل |
|---|---|---|
| تصویر | ناهمگام | پردازش ارائهدهنده میتواند از یک نوبت گفتوگو طولانیتر شود؛ پیوستهای تولیدشده از مسیر تکمیل مشترک استفاده میکنند. |
| تبدیل متن به گفتار | همگام | پاسخهای ارائهدهنده ظرف چند ثانیه بازمیگردند؛ به صدای پاسخ پیوست میشوند. |
| ویدئو | ناهمگام | پردازش ارائهدهنده از 30 s تا چند دقیقه زمان میبرد؛ صفهای کند میتوانند تا مهلت زمانی پیکربندیشده اجرا شوند. |
| موسیقی | ناهمگام | ویژگی پردازش ارائهدهنده همانند ویدئو است. |
برای ابزارهای ناهمگام، OpenClaw درخواست را به ارائهدهنده ارسال میکند، بلافاصله
یک شناسهٔ وظیفه بازمیگرداند و کار را در دفتر وظایف پیگیری میکند. عامل در زمان
اجرای کار به پاسخگویی به پیامهای دیگر ادامه میدهد. هنگامی که ارائهدهنده کار را
به پایان میرساند، OpenClaw عامل را با مسیرهای رسانهٔ تولیدشده بیدار میکند تا بتواند
از طریق حالت عادی پاسخ قابلمشاهدهٔ نشست به کاربر اطلاع دهد: تحویل خودکار پاسخ نهایی
در صورت پیکربندی، یا message(action="send") هنگامی که نشست به ابزار پیام نیاز دارد.
اگر نشست درخواستکننده غیرفعال باشد یا بیدارسازی فعال آن ناموفق شود و هنوز بخشی از
رسانهٔ تولیدشده در پاسخ تکمیل وجود نداشته باشد، OpenClaw یک جایگزین مستقیم و
ایدِمپوتنت را فقط با رسانههای مفقود ارسال میکند. رسانهای که پاسخ تکمیل پیشتر
تحویل داده است، دوباره ارسال نمیشود.
تبدیل گفتار به متن و Voice Call
Deepgram، DeepInfra، ElevenLabs، Google، Groq، Mistral، OpenAI، OpenRouter،
SenseAudio و xAI همگی در صورت پیکربندی میتوانند صدای ورودی را از طریق مسیر دستهای
tools.media.audio رونویسی کنند. Pluginهای کانالی که برای کنترل اشاره یا تجزیهٔ فرمان،
یک یادداشت صوتی را پیشآزمایی میکنند، پیوست رونویسیشده را در زمینهٔ ورودی علامت
میزنند؛ در نتیجه، گذر مشترک درک رسانه بهجای انجام فراخوانی دوم STT برای همان
صدا، از همان رونویسی دوباره استفاده میکند.
Deepgram، ElevenLabs، Mistral، OpenAI و xAI همچنین ارائهدهندگان STT جریانی Voice Call را ثبت میکنند؛ بنابراین صدای زندهٔ تلفن میتواند بدون انتظار برای تکمیل ضبط، به فروشندهٔ انتخابشده هدایت شود.
برای مکالمههای زندهٔ کاربران، حالت Talk را ترجیح دهید. پیوستهای صوتی دستهای در مسیر رسانه باقی میمانند؛ صدای بلادرنگ مرورگر، فشار برای صحبت بومی، تلفن و جلسه باید از رویدادهای Talk و کاتالوگهای محدود به نشست که Gateway بازمیگرداند استفاده کنند.
نگاشت ارائهدهندگان (نحوهٔ تقسیم فروشندگان میان سطوح)
سطوح تصویر، ویدئو، موسیقی، TTS دستهای، STT دستهای، صدای بلادرنگ سمت پشتیبان و درک رسانه.
OpenAI
سطوح تصویر، ویدئو، TTS دستهای، STT دستهای، STT جریانی Voice Call، صدای بلادرنگ سمت پشتیبان و جاسازی حافظه.
DeepInfra
سطوح مسیریابی گفتوگو/مدل، تولید/ویرایش تصویر، تبدیل متن به ویدئو، TTS دستهای، STT دستهای، درک رسانهٔ تصویری و جاسازی حافظه. DeepInfra همچنین بازرتبهبندی، طبقهبندی، تشخیص شیء و انواع دیگر مدلهای بومی را ارائه میدهد؛ OpenClaw هنوز برای این دستهها قرارداد ارائهدهندهای ندارد، بنابراین این Plugin آنها را ثبت نمیکند.
xAI
تصویر، ویدئو، جستوجو، اجرای کد، TTS دستهای، STT دستهای و STT جریانی Voice Call. صدای بلادرنگ xAI قابلیتی بالادستی است، اما تا زمانی که قرارداد مشترک صدای بلادرنگ بتواند آن را بازنمایی کند، در OpenClaw ثبت نمیشود.