Providers
Deepgram
Deepgram یک API تبدیل گفتار به متن است. OpenClaw از آن برای رونویسی صوت ورودی/یادداشت صوتی
از طریق tools.media.audio و برای STT جریانی Voice Call
از طریق plugins.entries.voice-call.config.streaming استفاده میکند.
رونویسی دستهای، فایل صوتی کامل را در Deepgram بارگذاری میکند و
رونوشت را به پایپلاین پاسخ تزریق میکند (بلوک {{Transcript}} + [Audio]).
جریان Voice Call فریمهای زنده G.711 u-law را از طریق نقطه پایانی
WebSocket listen در Deepgram ارسال میکند و همزمان با بازگرداندن آنها توسط Deepgram،
رونوشتهای جزئی/نهایی را منتشر میکند.
| جزئیات | مقدار |
|---|---|
| وبسایت | deepgram.com |
| مستندات | developers.deepgram.com |
| احراز هویت | DEEPGRAM_API_KEY |
| مدل پیشفرض | nova-3 |
شروع به کار
کلید API خود را تنظیم کنید
DEEPGRAM_API_KEY=dg_...ارائهدهنده صوت را فعال کنید
{ tools: { media: { audio: { enabled: true, models: [{ provider: "deepgram", model: "nova-3" }], }, }, },}یک یادداشت صوتی ارسال کنید
یک پیام صوتی را از طریق هر کانال متصل ارسال کنید. OpenClaw آن را با Deepgram رونویسی میکند و رونوشت را به پایپلاین پاسخ تزریق میکند.
گزینههای پیکربندی
| گزینه | مسیر | توضیحات |
|---|---|---|
model |
tools.media.models[].model |
شناسه مدل Deepgram (پیشفرض: nova-3) |
language |
tools.media.models[].language |
راهنمای زبان (اختیاری) |
providerOptions.deepgram پارامترهای اضافی پرسوجو را مستقیماً با درخواست
/listen در Deepgram ادغام میکند؛ بنابراین هر نام پارامتری که Deepgram پشتیبانی کند، قابل استفاده است
(برای نمونه detect_language، punctuate، smart_format):
با راهنمای زبان
{ tools: { media: { audio: { enabled: true, models: [{ provider: "deepgram", model: "nova-3", language: "en" }], }, }, },}با گزینههای Deepgram
{ tools: { media: { audio: { enabled: true, providerOptions: { deepgram: { detect_language: true, punctuate: true, smart_format: true, }, }, models: [{ provider: "deepgram", model: "nova-3" }], }, }, },}STT جریانی Voice Call
Plugin همراه deepgram همچنین یک ارائهدهنده رونویسی بلادرنگ
برای Plugin مربوط به Voice Call ثبت میکند.
| تنظیم | مسیر پیکربندی | پیشفرض |
|---|---|---|
| کلید API | plugins.entries.voice-call.config.streaming.providers.deepgram.apiKey |
در صورت نبود، از DEEPGRAM_API_KEY استفاده میکند |
| URL پایه | ...deepgram.baseUrl |
DEEPGRAM_BASE_URL یا API عمومی Deepgram |
| مدل | ...deepgram.model |
nova-3 |
| زبان | ...deepgram.language |
(تنظیمنشده) |
| کدگذاری | ...deepgram.encoding |
mulaw |
| نرخ نمونهبرداری | ...deepgram.sampleRate |
8000 |
| تشخیص پایان گفتار | ...deepgram.endpointingMs |
800 |
| نتایج میانی | ...deepgram.interimResults |
true |
{ plugins: { entries: { "voice-call": { config: { streaming: { enabled: true, provider: "deepgram", providers: { deepgram: { apiKey: "${DEEPGRAM_API_KEY}", model: "nova-3", endpointingMs: 800, language: "en-US", }, }, }, }, }, }, },}برای یک نقطه پایانی سفارشی Deepgram،
baseUrl را روی ریشه نقطه پایانی، شامل هر مسیر پایه اما بدون /listen، تنظیم کنید.
نقاط پایانی بلادرنگ http://، https://، ws:// و wss:// را میپذیرند. HTTP
به WS و HTTPS به WSS نگاشت میشود و طرحوارههای صریح WebSocket بدون تغییر باقی میمانند.
URLهای بدساخت و طرحوارههای دیگر هنگام راهاندازی نشست با خطا مواجه میشوند.
نکات
احراز هویت
احراز هویت از ترتیب استاندارد احراز هویت ارائهدهنده پیروی میکند. DEEPGRAM_API_KEY
سادهترین مسیر است.
پروکسی و نقاط پایانی سفارشی
هنگام استفاده از پروکسی، نقاط پایانی یا سرآیندها را در ورودی tools.media.models[] مربوط به Deepgram بازنویسی کنید.
رفتار خروجی
خروجی از همان قواعد صوتی سایر ارائهدهندگان پیروی میکند (محدودیت اندازه، مهلتهای زمانی، تزریق رونوشت).