Providers

Deepgram

Deepgram — це API перетворення мовлення на текст. OpenClaw використовує його для транскрибування вхідних аудіо та голосових нотаток через tools.media.audio, а також для потокового STT голосових викликів через plugins.entries.voice-call.config.streaming.

Під час пакетного транскрибування повний аудіофайл завантажується до Deepgram, а транскрипт додається до конвеєра відповідей (блок {{Transcript}} + [Audio]). Потокова обробка голосових викликів передає наживо кадри G.711 u-law через кінцеву точку WebSocket listen Deepgram і видає проміжні та остаточні транскрипти в міру їх повернення Deepgram.

Відомості Значення
Вебсайт deepgram.com
Документація developers.deepgram.com
Автентифікація DEEPGRAM_API_KEY
Типова модель nova-3

Початок роботи

  • Задайте ключ API

    bash
    DEEPGRAM_API_KEY=dg_...
  • Увімкніть постачальника аудіо

    json5
    {  tools: {    media: {      audio: {        enabled: true,        models: [{ provider: "deepgram", model: "nova-3" }],      },    },  },}
  • Надішліть голосову нотатку

    Надішліть аудіоповідомлення через будь-який підключений канал. OpenClaw транскрибує його за допомогою Deepgram і додає транскрипт до конвеєра відповідей.

  • Параметри конфігурації

    Параметр Шлях Опис
    model tools.media.audio.models[].model Ідентифікатор моделі Deepgram (типово: nova-3)
    language tools.media.audio.models[].language Підказка щодо мови (необов’язково)

    providerOptions.deepgram безпосередньо додає додаткові параметри запиту до запиту Deepgram /listen, тому можна використовувати будь-які назви параметрів, які підтримує Deepgram (наприклад, detect_language, punctuate, smart_format):

    З підказкою щодо мови

    json5
    {  tools: {    media: {      audio: {        enabled: true,        models: [{ provider: "deepgram", model: "nova-3", language: "en" }],      },    },  },}

    З параметрами Deepgram

    json5
    {  tools: {    media: {      audio: {        enabled: true,        providerOptions: {          deepgram: {            detect_language: true,            punctuate: true,            smart_format: true,          },        },        models: [{ provider: "deepgram", model: "nova-3" }],      },    },  },}

    Потокове STT голосових викликів

    Вбудований plugin deepgram також реєструє постачальника транскрибування в реальному часі для plugin голосових викликів.

    Налаштування Шлях конфігурації Типове значення
    Ключ API plugins.entries.voice-call.config.streaming.providers.deepgram.apiKey Якщо не задано, використовується DEEPGRAM_API_KEY
    Базова URL-адреса ...deepgram.baseUrl DEEPGRAM_BASE_URL або публічний API Deepgram
    Модель ...deepgram.model nova-3
    Мова ...deepgram.language (не задано)
    Кодування ...deepgram.encoding mulaw
    Частота дискретизації ...deepgram.sampleRate 8000
    Визначення завершення ...deepgram.endpointingMs 800
    Проміжні результати ...deepgram.interimResults true
    json5
    {  plugins: {    entries: {      "voice-call": {        config: {          streaming: {            enabled: true,            provider: "deepgram",            providers: {              deepgram: {                apiKey: "${DEEPGRAM_API_KEY}",                model: "nova-3",                endpointingMs: 800,                language: "en-US",              },            },          },        },      },    },  },}

    Для власної кінцевої точки Deepgram задайте для baseUrl кореневу адресу кінцевої точки, включно з будь-яким базовим шляхом, але без /listen. Кінцеві точки реального часу приймають http://, https://, ws:// та wss://. HTTP зіставляється з WS, HTTPS — із WSS, а явно вказані схеми WebSocket залишаються без змін. Неправильно сформовані URL-адреси та інші схеми спричиняють помилку під час налаштування сеансу.

    Примітки

    Автентифікація

    Автентифікація виконується у стандартному порядку автентифікації постачальника. DEEPGRAM_API_KEY — найпростіший спосіб.

    Проксі та власні кінцеві точки

    Під час використання проксі перевизначте кінцеві точки або заголовки за допомогою tools.media.audio.baseUrl і tools.media.audio.headers.

    Поведінка виведення

    Виведення підпорядковується тим самим правилам обробки аудіо, що й для інших постачальників (обмеження розміру, час очікування, додавання транскрипту).

    Пов’язані матеріали

    Was this useful?
    On this page

    On this page