Providers

Deepgram

Deepgram ist eine Speech-to-Text-API. OpenClaw verwendet sie für die Transkription eingehender Audio- und Sprachnachrichten über tools.media.audio sowie für das Streaming-STT von Voice Call über plugins.entries.voice-call.config.streaming.

Bei der Batch-Transkription wird die vollständige Audiodatei zu Deepgram hochgeladen und das Transkript in die Antwort-Pipeline eingefügt ({{Transcript}}- und [Audio]-Block). Das Voice-Call-Streaming leitet G.711-u-law-Frames in Echtzeit über den WebSocket-Endpunkt listen von Deepgram weiter und gibt vorläufige sowie endgültige Transkripte aus, sobald Deepgram sie zurückgibt.

Detail Wert
Website deepgram.com
Dokumentation developers.deepgram.com
Authentifizierung DEEPGRAM_API_KEY
Standardmodell nova-3

Erste Schritte

  • API-Schlüssel festlegen

    bash
    DEEPGRAM_API_KEY=dg_...
  • Audio-Provider aktivieren

    json5
    {  tools: {    media: {      audio: {        enabled: true,        models: [{ provider: "deepgram", model: "nova-3" }],      },    },  },}
  • Sprachnachricht senden

    Senden Sie eine Audionachricht über einen beliebigen verbundenen Kanal. OpenClaw transkribiert sie über Deepgram und fügt das Transkript in die Antwort-Pipeline ein.

  • Konfigurationsoptionen

    Option Pfad Beschreibung
    model tools.media.models[].model Deepgram-Modell-ID (Standard: nova-3)
    language tools.media.models[].language Sprachhinweis (optional)

    providerOptions.deepgram führt zusätzliche Abfrageparameter direkt mit der Deepgram-Anfrage /listen zusammen, sodass jeder von Deepgram unterstützte Parametername funktioniert (zum Beispiel detect_language, punctuate, smart_format):

    Mit Sprachhinweis

    json5
    {  tools: {    media: {      audio: {        enabled: true,        models: [{ provider: "deepgram", model: "nova-3", language: "en" }],      },    },  },}

    Mit Deepgram-Optionen

    json5
    {  tools: {    media: {      audio: {        enabled: true,        providerOptions: {          deepgram: {            detect_language: true,            punctuate: true,            smart_format: true,          },        },        models: [{ provider: "deepgram", model: "nova-3" }],      },    },  },}

    Voice-Call-Streaming-STT

    Das mitgelieferte Plugin deepgram registriert außerdem einen Provider für Echtzeittranskription für das Voice-Call-Plugin.

    Einstellung Konfigurationspfad Standard
    API-Schlüssel plugins.entries.voice-call.config.streaming.providers.deepgram.apiKey Fällt auf DEEPGRAM_API_KEY zurück
    Basis-URL ...deepgram.baseUrl DEEPGRAM_BASE_URL oder die öffentliche API von Deepgram
    Modell ...deepgram.model nova-3
    Sprache ...deepgram.language (nicht festgelegt)
    Codierung ...deepgram.encoding mulaw
    Abtastrate ...deepgram.sampleRate 8000
    Endpunkterkennung ...deepgram.endpointingMs 800
    Zwischenergebnisse ...deepgram.interimResults true
    json5
    {  plugins: {    entries: {      "voice-call": {        config: {          streaming: {            enabled: true,            provider: "deepgram",            providers: {              deepgram: {                apiKey: "${DEEPGRAM_API_KEY}",                model: "nova-3",                endpointingMs: 800,                language: "en-US",              },            },          },        },      },    },  },}

    Legen Sie für einen benutzerdefinierten Deepgram-Endpunkt baseUrl auf den Endpunktstamm einschließlich eines etwaigen Basispfads, jedoch ohne /listen, fest. Echtzeitendpunkte akzeptieren http://, https://, ws:// und wss://. HTTP wird WS zugeordnet, HTTPS wird WSS zugeordnet, und explizite WebSocket-Schemata bleiben unverändert. Fehlerhafte URLs und andere Schemata führen während der Sitzungseinrichtung zu einem Fehler.

    Hinweise

    Authentifizierung

    Die Authentifizierung folgt der standardmäßigen Authentifizierungsreihenfolge für Provider. DEEPGRAM_API_KEY ist der einfachste Weg.

    Proxy und benutzerdefinierte Endpunkte

    Überschreiben Sie bei Verwendung eines Proxys die Endpunkte oder Header im Deepgram-Eintrag tools.media.models[].

    Ausgabeverhalten

    Die Ausgabe folgt denselben Audioregeln wie bei anderen Providern (Größenbeschränkungen, Zeitüberschreitungen, Einfügen des Transkripts).

    Verwandte Themen

    Was this useful?
    On this page

    On this page