در این صفحه

در این صفحه

Providers

Deepgram

Deepgram یک API تبدیل گفتار به متن است. OpenClaw از آن برای رونویسی صوت ورودی/یادداشت صوتی از طریق tools.media.audio و برای STT جریانی Voice Call از طریق plugins.entries.voice-call.config.streaming استفاده می‌کند.

رونویسی دسته‌ای، فایل صوتی کامل را در Deepgram بارگذاری می‌کند و رونوشت را به پایپ‌لاین پاسخ تزریق می‌کند (بلوک {{Transcript}} + [Audio]). جریان Voice Call فریم‌های زنده G.711 u-law را از طریق نقطه پایانی WebSocket listen در Deepgram ارسال می‌کند و هم‌زمان با بازگرداندن آن‌ها توسط Deepgram، رونوشت‌های جزئی/نهایی را منتشر می‌کند.

جزئیات مقدار
وب‌سایت deepgram.com
مستندات developers.deepgram.com
احراز هویت DEEPGRAM_API_KEY
مدل پیش‌فرض nova-3

شروع به کار

  • کلید API خود را تنظیم کنید

    bash
    DEEPGRAM_API_KEY=dg_...
  • ارائه‌دهنده صوت را فعال کنید

    json5
    {  tools: {    media: {      audio: {        enabled: true,        models: [{ provider: "deepgram", model: "nova-3" }],      },    },  },}
  • یک یادداشت صوتی ارسال کنید

    یک پیام صوتی را از طریق هر کانال متصل ارسال کنید. OpenClaw آن را با Deepgram رونویسی می‌کند و رونوشت را به پایپ‌لاین پاسخ تزریق می‌کند.

  • گزینه‌های پیکربندی

    گزینه مسیر توضیحات
    model tools.media.models[].model شناسه مدل Deepgram (پیش‌فرض: nova-3)
    language tools.media.models[].language راهنمای زبان (اختیاری)

    providerOptions.deepgram پارامترهای اضافی پرس‌وجو را مستقیماً با درخواست /listen در Deepgram ادغام می‌کند؛ بنابراین هر نام پارامتری که Deepgram پشتیبانی کند، قابل استفاده است (برای نمونه detect_language، punctuate، smart_format):

    با راهنمای زبان

    json5
    {  tools: {    media: {      audio: {        enabled: true,        models: [{ provider: "deepgram", model: "nova-3", language: "en" }],      },    },  },}

    با گزینه‌های Deepgram

    json5
    {  tools: {    media: {      audio: {        enabled: true,        providerOptions: {          deepgram: {            detect_language: true,            punctuate: true,            smart_format: true,          },        },        models: [{ provider: "deepgram", model: "nova-3" }],      },    },  },}

    STT جریانی Voice Call

    Plugin همراه deepgram همچنین یک ارائه‌دهنده رونویسی بلادرنگ برای Plugin مربوط به Voice Call ثبت می‌کند.

    تنظیم مسیر پیکربندی پیش‌فرض
    کلید API plugins.entries.voice-call.config.streaming.providers.deepgram.apiKey در صورت نبود، از DEEPGRAM_API_KEY استفاده می‌کند
    URL پایه ...deepgram.baseUrl DEEPGRAM_BASE_URL یا API عمومی Deepgram
    مدل ...deepgram.model nova-3
    زبان ...deepgram.language (تنظیم‌نشده)
    کدگذاری ...deepgram.encoding mulaw
    نرخ نمونه‌برداری ...deepgram.sampleRate 8000
    تشخیص پایان گفتار ...deepgram.endpointingMs 800
    نتایج میانی ...deepgram.interimResults true
    json5
    {  plugins: {    entries: {      "voice-call": {        config: {          streaming: {            enabled: true,            provider: "deepgram",            providers: {              deepgram: {                apiKey: "${DEEPGRAM_API_KEY}",                model: "nova-3",                endpointingMs: 800,                language: "en-US",              },            },          },        },      },    },  },}

    برای یک نقطه پایانی سفارشی Deepgram، baseUrl را روی ریشه نقطه پایانی، شامل هر مسیر پایه اما بدون /listen، تنظیم کنید. نقاط پایانی بلادرنگ http://، https://، ws:// و wss:// را می‌پذیرند. HTTP به WS و HTTPS به WSS نگاشت می‌شود و طرح‌واره‌های صریح WebSocket بدون تغییر باقی می‌مانند. URLهای بدساخت و طرح‌واره‌های دیگر هنگام راه‌اندازی نشست با خطا مواجه می‌شوند.

    نکات

    احراز هویت

    احراز هویت از ترتیب استاندارد احراز هویت ارائه‌دهنده پیروی می‌کند. DEEPGRAM_API_KEY ساده‌ترین مسیر است.

    پروکسی و نقاط پایانی سفارشی

    هنگام استفاده از پروکسی، نقاط پایانی یا سرآیندها را در ورودی tools.media.models[] مربوط به Deepgram بازنویسی کنید.

    رفتار خروجی

    خروجی از همان قواعد صوتی سایر ارائه‌دهندگان پیروی می‌کند (محدودیت اندازه، مهلت‌های زمانی، تزریق رونوشت).

    مرتبط

    Was this useful?