Providers

Deepgram

Deepgram est une API de conversion de la parole en texte. OpenClaw l’utilise pour la transcription des fichiers audio et des notes vocales entrants via tools.media.audio, ainsi que pour la STT en streaming de Voice Call via plugins.entries.voice-call.config.streaming.

La transcription par lots téléverse le fichier audio complet vers Deepgram et injecte la transcription dans le pipeline de réponse (bloc {{Transcript}} + [Audio]). Le streaming de Voice Call transmet en direct les trames G.711 u-law via le point de terminaison WebSocket listen de Deepgram et émet les transcriptions partielles et finales à mesure que Deepgram les renvoie.

Détail Valeur
Site web deepgram.com
Documentation developers.deepgram.com
Authentification DEEPGRAM_API_KEY
Modèle par défaut nova-3

Prise en main

  • Définir votre clé API

    bash
    DEEPGRAM_API_KEY=dg_...
  • Activer le fournisseur audio

    json5
    {  tools: {    media: {      audio: {        enabled: true,        models: [{ provider: "deepgram", model: "nova-3" }],      },    },  },}
  • Envoyer une note vocale

    Envoyez un message audio par l’intermédiaire de n’importe quel canal connecté. OpenClaw le transcrit via Deepgram et injecte la transcription dans le pipeline de réponse.

  • Options de configuration

    Option Chemin Description
    model tools.media.audio.models[].model Identifiant du modèle Deepgram (valeur par défaut : nova-3)
    language tools.media.audio.models[].language Indication de langue (facultative)

    providerOptions.deepgram fusionne les paramètres de requête supplémentaires directement dans la requête Deepgram /listen. Tout nom de paramètre pris en charge par Deepgram fonctionne donc (par exemple detect_language, punctuate, smart_format) :

    Avec une indication de langue

    json5
    {  tools: {    media: {      audio: {        enabled: true,        models: [{ provider: "deepgram", model: "nova-3", language: "en" }],      },    },  },}

    Avec des options Deepgram

    json5
    {  tools: {    media: {      audio: {        enabled: true,        providerOptions: {          deepgram: {            detect_language: true,            punctuate: true,            smart_format: true,          },        },        models: [{ provider: "deepgram", model: "nova-3" }],      },    },  },}

    STT en streaming de Voice Call

    Le plugin deepgram intégré enregistre également un fournisseur de transcription en temps réel pour le plugin Voice Call.

    Paramètre Chemin de configuration Valeur par défaut
    Clé API plugins.entries.voice-call.config.streaming.providers.deepgram.apiKey Se rabat sur DEEPGRAM_API_KEY
    URL de base ...deepgram.baseUrl DEEPGRAM_BASE_URL ou l’API publique de Deepgram
    Modèle ...deepgram.model nova-3
    Langue ...deepgram.language (non définie)
    Encodage ...deepgram.encoding mulaw
    Fréquence d’échantillonnage ...deepgram.sampleRate 8000
    Détection de fin d’énoncé ...deepgram.endpointingMs 800
    Résultats intermédiaires ...deepgram.interimResults true
    json5
    {  plugins: {    entries: {      "voice-call": {        config: {          streaming: {            enabled: true,            provider: "deepgram",            providers: {              deepgram: {                apiKey: "${DEEPGRAM_API_KEY}",                model: "nova-3",                endpointingMs: 800,                language: "en-US",              },            },          },        },      },    },  },}

    Pour utiliser un point de terminaison Deepgram personnalisé, définissez baseUrl sur la racine du point de terminaison, en incluant tout chemin de base, mais pas /listen. Les points de terminaison en temps réel acceptent http://, https://, ws:// et wss://. HTTP est converti en WS, HTTPS en WSS, et les schémas WebSocket explicites restent inchangés. Les URL mal formées et les autres schémas provoquent un échec lors de la configuration de la session.

    Remarques

    Authentification

    L’authentification suit l’ordre d’authentification standard des fournisseurs. DEEPGRAM_API_KEY est la méthode la plus simple.

    Proxy et points de terminaison personnalisés

    Remplacez les points de terminaison ou les en-têtes avec tools.media.audio.baseUrl et tools.media.audio.headers lors de l’utilisation d’un proxy.

    Comportement de la sortie

    La sortie suit les mêmes règles audio que les autres fournisseurs (limites de taille, délais d’expiration, injection de la transcription).

    Voir aussi

    Was this useful?
    On this page

    On this page