Providers
Deepgram
Deepgram — це API перетворення мовлення на текст. OpenClaw використовує його для транскрибування вхідних аудіо та голосових нотаток через tools.media.audio, а також для потокового STT голосових викликів через plugins.entries.voice-call.config.streaming.
Під час пакетного транскрибування повний аудіофайл завантажується до Deepgram, а транскрипт додається до конвеєра відповідей (блок {{Transcript}} + [Audio]). Потокова обробка голосових викликів передає наживо кадри G.711 u-law через кінцеву точку WebSocket listen Deepgram і видає проміжні та остаточні транскрипти в міру їх повернення Deepgram.
| Відомості | Значення |
|---|---|
| Вебсайт | deepgram.com |
| Документація | developers.deepgram.com |
| Автентифікація | DEEPGRAM_API_KEY |
| Типова модель | nova-3 |
Початок роботи
Задайте ключ API
DEEPGRAM_API_KEY=dg_...Увімкніть постачальника аудіо
{ tools: { media: { audio: { enabled: true, models: [{ provider: "deepgram", model: "nova-3" }], }, }, },}Надішліть голосову нотатку
Надішліть аудіоповідомлення через будь-який підключений канал. OpenClaw транскрибує його за допомогою Deepgram і додає транскрипт до конвеєра відповідей.
Параметри конфігурації
| Параметр | Шлях | Опис |
|---|---|---|
model |
tools.media.audio.models[].model |
Ідентифікатор моделі Deepgram (типово: nova-3) |
language |
tools.media.audio.models[].language |
Підказка щодо мови (необов’язково) |
providerOptions.deepgram безпосередньо додає додаткові параметри запиту до запиту Deepgram /listen, тому можна використовувати будь-які назви параметрів, які підтримує Deepgram (наприклад, detect_language, punctuate, smart_format):
З підказкою щодо мови
{ tools: { media: { audio: { enabled: true, models: [{ provider: "deepgram", model: "nova-3", language: "en" }], }, }, },}З параметрами Deepgram
{ tools: { media: { audio: { enabled: true, providerOptions: { deepgram: { detect_language: true, punctuate: true, smart_format: true, }, }, models: [{ provider: "deepgram", model: "nova-3" }], }, }, },}Потокове STT голосових викликів
Вбудований plugin deepgram також реєструє постачальника транскрибування в реальному часі для plugin голосових викликів.
| Налаштування | Шлях конфігурації | Типове значення |
|---|---|---|
| Ключ API | plugins.entries.voice-call.config.streaming.providers.deepgram.apiKey |
Якщо не задано, використовується DEEPGRAM_API_KEY |
| Базова URL-адреса | ...deepgram.baseUrl |
DEEPGRAM_BASE_URL або публічний API Deepgram |
| Модель | ...deepgram.model |
nova-3 |
| Мова | ...deepgram.language |
(не задано) |
| Кодування | ...deepgram.encoding |
mulaw |
| Частота дискретизації | ...deepgram.sampleRate |
8000 |
| Визначення завершення | ...deepgram.endpointingMs |
800 |
| Проміжні результати | ...deepgram.interimResults |
true |
{ plugins: { entries: { "voice-call": { config: { streaming: { enabled: true, provider: "deepgram", providers: { deepgram: { apiKey: "${DEEPGRAM_API_KEY}", model: "nova-3", endpointingMs: 800, language: "en-US", }, }, }, }, }, }, },}Для власної кінцевої точки Deepgram задайте для baseUrl кореневу адресу кінцевої точки, включно з будь-яким базовим шляхом, але без /listen. Кінцеві точки реального часу приймають http://, https://, ws:// та wss://. HTTP зіставляється з WS, HTTPS — із WSS, а явно вказані схеми WebSocket залишаються без змін. Неправильно сформовані URL-адреси та інші схеми спричиняють помилку під час налаштування сеансу.
Примітки
Автентифікація
Автентифікація виконується у стандартному порядку автентифікації постачальника. DEEPGRAM_API_KEY — найпростіший спосіб.
Проксі та власні кінцеві точки
Під час використання проксі перевизначте кінцеві точки або заголовки за допомогою tools.media.audio.baseUrl і tools.media.audio.headers.
Поведінка виведення
Виведення підпорядковується тим самим правилам обробки аудіо, що й для інших постачальників (обмеження розміру, час очікування, додавання транскрипту).