このページの内容
このページの内容
Providers
Deepgram
Deepgram は音声テキスト変換 API です。OpenClaw は、tools.media.audio を介した受信音声/ボイスノートの
文字起こしと、plugins.entries.voice-call.config.streaming を介した Voice Call のストリーミング STT
に使用します。
バッチ文字起こしでは、音声ファイル全体を Deepgram にアップロードし、
文字起こしを応答パイプライン({{Transcript}} + [Audio] ブロック)に挿入します。
Voice Call ストリーミングでは、ライブの G.711 u-law フレームを Deepgram の
WebSocket listen エンドポイント経由で転送し、Deepgram から返される
途中および最終の文字起こしを出力します。
| 詳細 | 値 |
|---|---|
| Web サイト | deepgram.com |
| ドキュメント | developers.deepgram.com |
| 認証 | DEEPGRAM_API_KEY |
| デフォルトモデル | nova-3 |
はじめに
API キーを設定する
音声プロバイダーを有効にする
ボイスノートを送信する
接続済みの任意のチャネルから音声メッセージを送信します。OpenClaw は Deepgram 経由で文字起こしし、その結果を応答パイプラインに挿入します。
設定オプション
| オプション | パス | 説明 |
|---|---|---|
model |
tools.media.models[].model |
Deepgram モデル ID(デフォルト:nova-3) |
language |
tools.media.models[].language |
言語ヒント(任意) |
providerOptions.deepgram は追加のクエリパラメーターを Deepgram の
/listen リクエストに直接マージするため、Deepgram がサポートする任意のパラメーター名を使用できます
(例:detect_language、punctuate、smart_format)。
言語ヒントを使用
Deepgram オプションを使用
Voice Call ストリーミング STT
同梱の deepgram Plugin は、Voice Call Plugin 用の
リアルタイム文字起こしプロバイダーも登録します。
| 設定 | 設定パス | デフォルト |
|---|---|---|
| API キー | plugins.entries.voice-call.config.streaming.providers.deepgram.apiKey |
DEEPGRAM_API_KEY にフォールバック |
| ベース URL | ...deepgram.baseUrl |
DEEPGRAM_BASE_URL または Deepgram の公開 API |
| モデル | ...deepgram.model |
nova-3 |
| 言語 | ...deepgram.language |
(未設定) |
| エンコーディング | ...deepgram.encoding |
mulaw |
| サンプルレート | ...deepgram.sampleRate |
8000 |
| エンドポイント判定 | ...deepgram.endpointingMs |
800 |
| 中間結果 | ...deepgram.interimResults |
true |
Deepgram カスタムエンドポイントを使用するには、
baseUrl を、/listen を含めず、ベースパスを含むエンドポイントルートに設定します。
リアルタイムエンドポイントでは、http://、https://、ws://、wss:// を使用できます。HTTP
は WS に、HTTPS は WSS にマッピングされ、明示的な WebSocket スキームは変更されません。
不正な形式の URL やその他のスキームは、セッション設定中に失敗します。
注記
認証
認証は標準のプロバイダー認証順序に従います。DEEPGRAM_API_KEY が
最も簡単な方法です。
プロキシとカスタムエンドポイント
プロキシを使用する場合は、Deepgram の tools.media.models[] エントリでエンドポイントまたはヘッダーを上書きします。
出力動作
出力は、他のプロバイダーと同じ音声ルール(サイズ上限、タイムアウト、 文字起こしの挿入)に従います。