---
read_when:
    - در جست‌وجوی نمایی کلی از قابلیت‌های رسانه‌ای OpenClaw هستید
    - تصمیم‌گیری درباره اینکه کدام ارائه‌دهندهٔ رسانه پیکربندی شود
    - آشنایی با نحوهٔ عملکرد تولید ناهمگام رسانه
sidebarTitle: Media overview
summary: مروری سریع بر قابلیت‌های تصویر، ویدئو، موسیقی، گفتار و درک رسانه‌ای
title: نمای کلی رسانه‌ها
x-i18n:
    generated_at: "2026-07-27T17:12:31Z"
    model: gpt-5.6
    postprocess_version: locale-links-v1
    prompt_version: 32
    provider: openai
    source_hash: 18eb79e6915c5dc8d705bf5cadfcdddecaf7d21a037f102696d4f2bcd41e5bea
    source_path: tools/media-overview.md
    workflow: 16
---

OpenClaw تصویر، ویدئو و موسیقی تولید می‌کند، رسانه‌های ورودی
(تصویر، صدا، ویدئو) را درک می‌کند و پاسخ‌ها را با تبدیل متن به گفتار بلند می‌خواند. همهٔ
قابلیت‌های رسانه‌ای ابزارمحور هستند: عامل بر اساس مکالمه تصمیم می‌گیرد چه زمانی از آن‌ها
استفاده کند و هر ابزار فقط زمانی ظاهر می‌شود که دست‌کم یک ارائه‌دهندهٔ پشتیبان
پیکربندی شده باشد.

گفتار زنده به‌جای مسیر ابزار رسانه‌ای تک‌مرحله‌ای، از قرارداد نشست Talk استفاده
می‌کند. Talk سه حالت دارد: `realtime` بومی ارائه‌دهنده، `stt-tts`
محلی یا جریانی، و `transcription` برای ضبط گفتار صرفاً جهت مشاهده. این حالت‌ها
کاتالوگ‌های ارائه‌دهنده، پوش‌های رویداد و معناشناسی لغو را با
تلفن، جلسه‌ها، بلادرنگ مرورگر و کلاینت‌های بومی فشار برای صحبت به‌اشتراک می‌گذارند.

## قابلیت‌ها

<CardGroup cols={2}>
  <Card title="تولید تصویر" href="/fa/tools/image-generation" icon="image">
    تصویرها را از اعلان‌های متنی یا تصویرهای مرجع، از طریق
    `image_generate` ایجاد و ویرایش کنید. در نشست‌های گفت‌وگو ناهمگام است — در پس‌زمینه
    اجرا می‌شود و پس از آماده‌شدن، نتیجه را ارسال می‌کند.
  </Card>
  <Card title="تولید ویدئو" href="/fa/tools/video-generation" icon="video">
    تبدیل متن به ویدئو، تصویر به ویدئو و ویدئو به ویدئو از طریق `video_generate`.
    ناهمگام است — در پس‌زمینه اجرا می‌شود و پس از آماده‌شدن، نتیجه را ارسال می‌کند.
  </Card>
  <Card title="تولید موسیقی" href="/fa/tools/music-generation" icon="music">
    موسیقی یا قطعه‌های صوتی را از طریق `music_generate` تولید کنید. در نشست‌های
    گفت‌وگو و در چرخهٔ عمر مشترک وظیفهٔ تولید رسانه، ناهمگام است.
  </Card>
  <Card title="تبدیل متن به گفتار" href="/fa/tools/tts" icon="microphone">
    پاسخ‌های خروجی را از طریق ابزار `tts` به‌همراه
    پیکربندی `tts` به صدای گفتاری تبدیل کنید. همگام است.
  </Card>
  <Card title="درک رسانه" href="/fa/nodes/media-understanding" icon="eye">
    تصویرها، صداها و ویدئوهای ورودی را با استفاده از ارائه‌دهندگان مدل
    دارای قابلیت بینایی و Pluginهای اختصاصی درک رسانه خلاصه کنید.
  </Card>
  <Card title="تبدیل گفتار به متن" href="/fa/nodes/audio" icon="ear-listen">
    پیام‌های صوتی ورودی را از طریق ارائه‌دهندگان STT دسته‌ای یا STT جریانی
    Voice Call رونویسی کنید.
  </Card>
</CardGroup>

## ماتریس قابلیت ارائه‌دهندگان

<Note>
این جدول Pluginهای اختصاصی تولید رسانه، TTS و STT را پوشش می‌دهد. بسیاری از
ارائه‌دهندگان مدل گفت‌وگو (Anthropic، Google، OpenAI و دیگران) نیز رسانهٔ ورودی
را از طریق مدل پاسخ خود درک می‌کنند؛ فهرست کامل ارائه‌دهندگان را در
[درک رسانه](/fa/nodes/media-understanding#provider-support-matrix) ببینید.
</Note>

| ارائه‌دهنده      | تصویر | ویدئو | موسیقی | TTS | STT | صدای بلادرنگ | درک رسانه |
| ----------------- | :---: | :---: | :---: | :-: | :-: | :------------: | :-----------------: |
| Alibaba           |       |   ✓   |       |     |     |                |                     |
| Azure Speech      |       |       |       |  ✓  |     |                |                     |
| BytePlus          |       |   ✓   |       |     |     |                |                     |
| ComfyUI           |   ✓   |   ✓   |   ✓   |     |     |                |                     |
| Deepgram          |       |       |       |     |  ✓  |                |                     |
| DeepInfra         |   ✓   |   ✓   |       |  ✓  |  ✓  |                |          ✓          |
| ElevenLabs        |       |       |       |  ✓  |  ✓  |                |                     |
| fal               |   ✓   |   ✓   |   ✓   |     |     |                |                     |
| Google            |   ✓   |   ✓   |   ✓   |  ✓  |  ✓  |       ✓        |          ✓          |
| Gradium           |       |       |       |  ✓  |     |                |                     |
| Inworld           |       |       |       |  ✓  |     |                |                     |
| LiteLLM           |   ✓   |       |       |     |     |                |                     |
| CLI محلی          |       |       |       |  ✓  |     |                |                     |
| Microsoft         |       |       |       |  ✓  |     |                |                     |
| Microsoft Foundry |   ✓   |       |       |     |     |                |                     |
| MiniMax           |   ✓   |   ✓   |   ✓   |  ✓  |     |                |                     |
| Mistral           |       |       |       |     |  ✓  |                |                     |
| OpenAI            |   ✓   |   ✓   |       |  ✓  |  ✓  |       ✓        |          ✓          |
| OpenRouter        |   ✓   |   ✓   |   ✓   |  ✓  |  ✓  |                |          ✓          |
| PixVerse          |       |   ✓   |       |     |     |                |                     |
| Qwen              |       |   ✓   |       |     |     |                |          ✓          |
| Runway            |       |   ✓   |       |     |     |                |                     |
| SenseAudio        |       |       |       |     |  ✓  |                |                     |
| Together          |       |   ✓   |       |     |     |                |                     |
| Volcengine        |       |       |       |  ✓  |     |                |                     |
| Vydra             |   ✓   |   ✓   |       |  ✓  |     |                |                     |
| xAI               |   ✓   |   ✓   |       |  ✓  |  ✓  |                |          ✓          |
| Xiaomi MiMo       |       |       |       |  ✓  |     |                |                     |

<Note>
**صدای بلادرنگ** در اینجا به‌معنای بلادرنگ دوسویهٔ بومی ارائه‌دهنده است (حالت
`realtime` در Talk، برای مثال Gemini Live یا OpenAI Realtime API) — در حال حاضر
فقط Google و OpenAI آن را ثبت می‌کنند. Deepgram، ElevenLabs، Mistral، OpenAI و xAI
به‌طور جداگانه STT جریانی Voice Call (صدای یک‌طرفه به متن) را ثبت می‌کنند؛
[تبدیل گفتار به متن و Voice Call](#speech-to-text-and-voice-call) را در ادامه ببینید.
صدای بلادرنگ xAI قابلیتی بالادستی است، اما تا زمانی که قرارداد مشترک صدای بلادرنگ
بتواند آن را بازنمایی کند، در OpenClaw ثبت نمی‌شود.
</Note>

## ناهمگام در برابر همگام

| قابلیت          | حالت     | دلیل                                                                                                  |
| --------------- | -------- | ---------------------------------------------------------------------------------------------------- |
| تصویر           | ناهمگام  | پردازش ارائه‌دهنده می‌تواند از یک نوبت گفت‌وگو طولانی‌تر شود؛ پیوست‌های تولیدشده از مسیر تکمیل مشترک استفاده می‌کنند. |
| تبدیل متن به گفتار | همگام | پاسخ‌های ارائه‌دهنده ظرف چند ثانیه بازمی‌گردند؛ به صدای پاسخ پیوست می‌شوند.                           |
| ویدئو           | ناهمگام  | پردازش ارائه‌دهنده از 30 s تا چند دقیقه زمان می‌برد؛ صف‌های کند می‌توانند تا مهلت زمانی پیکربندی‌شده اجرا شوند. |
| موسیقی          | ناهمگام  | ویژگی پردازش ارائه‌دهنده همانند ویدئو است.                                                            |

برای ابزارهای ناهمگام، OpenClaw درخواست را به ارائه‌دهنده ارسال می‌کند، بلافاصله
یک شناسهٔ وظیفه بازمی‌گرداند و کار را در دفتر وظایف پیگیری می‌کند. عامل در زمان
اجرای کار به پاسخ‌گویی به پیام‌های دیگر ادامه می‌دهد. هنگامی که ارائه‌دهنده کار را
به پایان می‌رساند، OpenClaw عامل را با مسیرهای رسانهٔ تولیدشده بیدار می‌کند تا بتواند
از طریق حالت عادی پاسخ قابل‌مشاهدهٔ نشست به کاربر اطلاع دهد: تحویل خودکار پاسخ نهایی
در صورت پیکربندی، یا `message(action="send")` هنگامی که نشست به ابزار پیام نیاز دارد.
اگر نشست درخواست‌کننده غیرفعال باشد یا بیدارسازی فعال آن ناموفق شود و هنوز بخشی از
رسانهٔ تولیدشده در پاسخ تکمیل وجود نداشته باشد، OpenClaw یک جایگزین مستقیم و
ایدِمپوتنت را فقط با رسانه‌های مفقود ارسال می‌کند. رسانه‌ای که پاسخ تکمیل پیش‌تر
تحویل داده است، دوباره ارسال نمی‌شود.

## تبدیل گفتار به متن و Voice Call

Deepgram، DeepInfra، ElevenLabs، Google، Groq، Mistral، OpenAI، OpenRouter،
SenseAudio و xAI همگی در صورت پیکربندی می‌توانند صدای ورودی را از طریق مسیر دسته‌ای
`tools.media.audio` رونویسی کنند. Pluginهای کانالی که برای کنترل اشاره یا تجزیهٔ فرمان،
یک یادداشت صوتی را پیش‌آزمایی می‌کنند، پیوست رونویسی‌شده را در زمینهٔ ورودی علامت
می‌زنند؛ در نتیجه، گذر مشترک درک رسانه به‌جای انجام فراخوانی دوم STT برای همان
صدا، از همان رونویسی دوباره استفاده می‌کند.

Deepgram، ElevenLabs، Mistral، OpenAI و xAI همچنین ارائه‌دهندگان STT جریانی
Voice Call را ثبت می‌کنند؛ بنابراین صدای زندهٔ تلفن می‌تواند بدون انتظار برای
تکمیل ضبط، به فروشندهٔ انتخاب‌شده هدایت شود.

برای مکالمه‌های زندهٔ کاربران، [حالت Talk](/fa/nodes/talk) را ترجیح دهید. پیوست‌های
صوتی دسته‌ای در مسیر رسانه باقی می‌مانند؛ صدای بلادرنگ مرورگر، فشار برای صحبت بومی،
تلفن و جلسه باید از رویدادهای Talk و کاتالوگ‌های محدود به نشست که Gateway
بازمی‌گرداند استفاده کنند.

## نگاشت ارائه‌دهندگان (نحوهٔ تقسیم فروشندگان میان سطوح)

<AccordionGroup>
  <Accordion title="Google">
    سطوح تصویر، ویدئو، موسیقی، TTS دسته‌ای، STT دسته‌ای، صدای بلادرنگ سمت پشتیبان
    و درک رسانه.
  </Accordion>
  <Accordion title="OpenAI">
    سطوح تصویر، ویدئو، TTS دسته‌ای، STT دسته‌ای، STT جریانی Voice Call، صدای
    بلادرنگ سمت پشتیبان و جاسازی حافظه.
  </Accordion>
  <Accordion title="DeepInfra">
    سطوح مسیریابی گفت‌وگو/مدل، تولید/ویرایش تصویر، تبدیل متن به ویدئو، TTS دسته‌ای،
    STT دسته‌ای، درک رسانهٔ تصویری و جاسازی حافظه.
    DeepInfra همچنین بازرتبه‌بندی، طبقه‌بندی، تشخیص شیء و انواع دیگر مدل‌های بومی
    را ارائه می‌دهد؛ OpenClaw هنوز برای این دسته‌ها قرارداد ارائه‌دهنده‌ای ندارد،
    بنابراین این Plugin آن‌ها را ثبت نمی‌کند.
  </Accordion>
  <Accordion title="xAI">
    تصویر، ویدئو، جست‌وجو، اجرای کد، TTS دسته‌ای، STT دسته‌ای و STT جریانی Voice
    Call. صدای بلادرنگ xAI قابلیتی بالادستی است، اما تا زمانی که قرارداد مشترک
    صدای بلادرنگ بتواند آن را بازنمایی کند، در OpenClaw ثبت نمی‌شود.
  </Accordion>
</AccordionGroup>

## مرتبط

- [تولید تصویر](/fa/tools/image-generation)
- [تولید ویدئو](/fa/tools/video-generation)
- [تولید موسیقی](/fa/tools/music-generation)
- [تبدیل متن به گفتار](/fa/tools/tts)
- [درک رسانه](/fa/nodes/media-understanding)
- [Nodeهای صوتی](/fa/nodes/audio)
- [حالت Talk](/fa/nodes/talk)
