Tools

نمای کلی رسانه‌ها

OpenClaw تصویر، ویدئو و موسیقی تولید می‌کند، رسانه‌های ورودی (تصویر، صدا، ویدئو) را درک می‌کند و پاسخ‌ها را با تبدیل متن به گفتار بلند می‌خواند. همهٔ قابلیت‌های رسانه‌ای ابزارمحور هستند: عامل بر اساس مکالمه تصمیم می‌گیرد چه زمانی از آن‌ها استفاده کند و هر ابزار فقط زمانی ظاهر می‌شود که دست‌کم یک ارائه‌دهندهٔ پشتیبان پیکربندی شده باشد.

گفتار زنده به‌جای مسیر ابزار رسانه‌ای تک‌مرحله‌ای، از قرارداد نشست Talk استفاده می‌کند. Talk سه حالت دارد: realtime بومی ارائه‌دهنده، stt-tts محلی یا جریانی، و transcription برای ضبط گفتار صرفاً جهت مشاهده. این حالت‌ها کاتالوگ‌های ارائه‌دهنده، پوش‌های رویداد و معناشناسی لغو را با تلفن، جلسه‌ها، بلادرنگ مرورگر و کلاینت‌های بومی فشار برای صحبت به‌اشتراک می‌گذارند.

قابلیت‌ها

تولید تصویر

تصویرها را از اعلان‌های متنی یا تصویرهای مرجع، از طریق image_generate ایجاد و ویرایش کنید. در نشست‌های گفت‌وگو ناهمگام است — در پس‌زمینه اجرا می‌شود و پس از آماده‌شدن، نتیجه را ارسال می‌کند.

تولید ویدئو

تبدیل متن به ویدئو، تصویر به ویدئو و ویدئو به ویدئو از طریق video_generate. ناهمگام است — در پس‌زمینه اجرا می‌شود و پس از آماده‌شدن، نتیجه را ارسال می‌کند.

تولید موسیقی

موسیقی یا قطعه‌های صوتی را از طریق music_generate تولید کنید. در نشست‌های گفت‌وگو و در چرخهٔ عمر مشترک وظیفهٔ تولید رسانه، ناهمگام است.

تبدیل متن به گفتار

پاسخ‌های خروجی را از طریق ابزار tts به‌همراه پیکربندی tts به صدای گفتاری تبدیل کنید. همگام است.

درک رسانه

تصویرها، صداها و ویدئوهای ورودی را با استفاده از ارائه‌دهندگان مدل دارای قابلیت بینایی و Pluginهای اختصاصی درک رسانه خلاصه کنید.

تبدیل گفتار به متن

پیام‌های صوتی ورودی را از طریق ارائه‌دهندگان STT دسته‌ای یا STT جریانی Voice Call رونویسی کنید.

ماتریس قابلیت ارائه‌دهندگان

ارائه‌دهنده تصویر ویدئو موسیقی TTS STT صدای بلادرنگ درک رسانه
Alibaba
Azure Speech
BytePlus
ComfyUI
Deepgram
DeepInfra
ElevenLabs
fal
Google
Gradium
Inworld
LiteLLM
CLI محلی
Microsoft
Microsoft Foundry
MiniMax
Mistral
OpenAI
OpenRouter
PixVerse
Qwen
Runway
SenseAudio
Together
Volcengine
Vydra
xAI
Xiaomi MiMo

ناهمگام در برابر همگام

قابلیت حالت دلیل
تصویر ناهمگام پردازش ارائه‌دهنده می‌تواند از یک نوبت گفت‌وگو طولانی‌تر شود؛ پیوست‌های تولیدشده از مسیر تکمیل مشترک استفاده می‌کنند.
تبدیل متن به گفتار همگام پاسخ‌های ارائه‌دهنده ظرف چند ثانیه بازمی‌گردند؛ به صدای پاسخ پیوست می‌شوند.
ویدئو ناهمگام پردازش ارائه‌دهنده از 30 s تا چند دقیقه زمان می‌برد؛ صف‌های کند می‌توانند تا مهلت زمانی پیکربندی‌شده اجرا شوند.
موسیقی ناهمگام ویژگی پردازش ارائه‌دهنده همانند ویدئو است.

برای ابزارهای ناهمگام، OpenClaw درخواست را به ارائه‌دهنده ارسال می‌کند، بلافاصله یک شناسهٔ وظیفه بازمی‌گرداند و کار را در دفتر وظایف پیگیری می‌کند. عامل در زمان اجرای کار به پاسخ‌گویی به پیام‌های دیگر ادامه می‌دهد. هنگامی که ارائه‌دهنده کار را به پایان می‌رساند، OpenClaw عامل را با مسیرهای رسانهٔ تولیدشده بیدار می‌کند تا بتواند از طریق حالت عادی پاسخ قابل‌مشاهدهٔ نشست به کاربر اطلاع دهد: تحویل خودکار پاسخ نهایی در صورت پیکربندی، یا message(action="send") هنگامی که نشست به ابزار پیام نیاز دارد. اگر نشست درخواست‌کننده غیرفعال باشد یا بیدارسازی فعال آن ناموفق شود و هنوز بخشی از رسانهٔ تولیدشده در پاسخ تکمیل وجود نداشته باشد، OpenClaw یک جایگزین مستقیم و ایدِمپوتنت را فقط با رسانه‌های مفقود ارسال می‌کند. رسانه‌ای که پاسخ تکمیل پیش‌تر تحویل داده است، دوباره ارسال نمی‌شود.

تبدیل گفتار به متن و Voice Call

Deepgram، DeepInfra، ElevenLabs، Google، Groq، Mistral، OpenAI، OpenRouter، SenseAudio و xAI همگی در صورت پیکربندی می‌توانند صدای ورودی را از طریق مسیر دسته‌ای tools.media.audio رونویسی کنند. Pluginهای کانالی که برای کنترل اشاره یا تجزیهٔ فرمان، یک یادداشت صوتی را پیش‌آزمایی می‌کنند، پیوست رونویسی‌شده را در زمینهٔ ورودی علامت می‌زنند؛ در نتیجه، گذر مشترک درک رسانه به‌جای انجام فراخوانی دوم STT برای همان صدا، از همان رونویسی دوباره استفاده می‌کند.

Deepgram، ElevenLabs، Mistral، OpenAI و xAI همچنین ارائه‌دهندگان STT جریانی Voice Call را ثبت می‌کنند؛ بنابراین صدای زندهٔ تلفن می‌تواند بدون انتظار برای تکمیل ضبط، به فروشندهٔ انتخاب‌شده هدایت شود.

برای مکالمه‌های زندهٔ کاربران، حالت Talk را ترجیح دهید. پیوست‌های صوتی دسته‌ای در مسیر رسانه باقی می‌مانند؛ صدای بلادرنگ مرورگر، فشار برای صحبت بومی، تلفن و جلسه باید از رویدادهای Talk و کاتالوگ‌های محدود به نشست که Gateway بازمی‌گرداند استفاده کنند.

نگاشت ارائه‌دهندگان (نحوهٔ تقسیم فروشندگان میان سطوح)

Google

سطوح تصویر، ویدئو، موسیقی، TTS دسته‌ای، STT دسته‌ای، صدای بلادرنگ سمت پشتیبان و درک رسانه.

OpenAI

سطوح تصویر، ویدئو، TTS دسته‌ای، STT دسته‌ای، STT جریانی Voice Call، صدای بلادرنگ سمت پشتیبان و جاسازی حافظه.

DeepInfra

سطوح مسیریابی گفت‌وگو/مدل، تولید/ویرایش تصویر، تبدیل متن به ویدئو، TTS دسته‌ای، STT دسته‌ای، درک رسانهٔ تصویری و جاسازی حافظه. DeepInfra همچنین بازرتبه‌بندی، طبقه‌بندی، تشخیص شیء و انواع دیگر مدل‌های بومی را ارائه می‌دهد؛ OpenClaw هنوز برای این دسته‌ها قرارداد ارائه‌دهنده‌ای ندارد، بنابراین این Plugin آن‌ها را ثبت نمی‌کند.

xAI

تصویر، ویدئو، جست‌وجو، اجرای کد، TTS دسته‌ای، STT دسته‌ای و STT جریانی Voice Call. صدای بلادرنگ xAI قابلیتی بالادستی است، اما تا زمانی که قرارداد مشترک صدای بلادرنگ بتواند آن را بازنمایی کند، در OpenClaw ثبت نمی‌شود.

مرتبط

Was this useful?
On this page

On this page