En esta página
En esta página
Providers
Deepgram
Deepgram es una API de conversión de voz a texto. OpenClaw la utiliza para la
transcripción de audio y notas de voz entrantes mediante tools.media.audio y para
la conversión de voz a texto (STT) en streaming de Voice Call mediante
plugins.entries.voice-call.config.streaming.
La transcripción por lotes carga el archivo de audio completo en Deepgram e inserta
la transcripción en el pipeline de respuestas (bloque {{Transcript}} + [Audio]).
El streaming de Voice Call reenvía en tiempo real tramas G.711 u-law mediante el endpoint
WebSocket listen de Deepgram y emite transcripciones parciales y finales a
medida que Deepgram las devuelve.
| Detalle | Valor |
|---|---|
| Sitio web | deepgram.com |
| Documentación | developers.deepgram.com |
| Autenticación | DEEPGRAM_API_KEY |
| Modelo predeterminado | nova-3 |
Primeros pasos
Establecer la clave de API
Habilitar el proveedor de audio
Enviar una nota de voz
Envíe un mensaje de audio mediante cualquier canal conectado. OpenClaw lo transcribe mediante Deepgram e inserta la transcripción en el pipeline de respuestas.
Opciones de configuración
| Opción | Ruta | Descripción |
|---|---|---|
model |
tools.media.models[].model |
ID del modelo de Deepgram (predeterminado: nova-3) |
language |
tools.media.models[].language |
Indicación de idioma (opcional) |
providerOptions.deepgram combina parámetros de consulta adicionales directamente con la
solicitud /listen de Deepgram, por lo que funciona cualquier nombre de
parámetro compatible con Deepgram (por ejemplo, detect_language,
punctuate, smart_format):
Con indicación de idioma
Con opciones de Deepgram
STT en streaming de Voice Call
El plugin deepgram incluido también registra un proveedor de transcripción
en tiempo real para el plugin Voice Call.
| Ajuste | Ruta de configuración | Valor predeterminado |
|---|---|---|
| Clave de API | plugins.entries.voice-call.config.streaming.providers.deepgram.apiKey |
Recurre a DEEPGRAM_API_KEY |
| URL base | ...deepgram.baseUrl |
DEEPGRAM_BASE_URL o la API pública de Deepgram |
| Modelo | ...deepgram.model |
nova-3 |
| Idioma | ...deepgram.language |
(sin establecer) |
| Codificación | ...deepgram.encoding |
mulaw |
| Frecuencia de muestreo | ...deepgram.sampleRate |
8000 |
| Detección de fin | ...deepgram.endpointingMs |
800 |
| Resultados provisionales | ...deepgram.interimResults |
true |
Para usar un endpoint personalizado de Deepgram,
establezca baseUrl en la raíz del endpoint, incluida cualquier ruta base,
pero no /listen. Los endpoints en tiempo real aceptan
http://, https://, ws:// y wss://.
HTTP se asigna a WS, HTTPS se asigna a WSS y los esquemas WebSocket explícitos
permanecen sin cambios. Las URL con formato incorrecto y otros esquemas provocan
un fallo durante la configuración de la sesión.
Notas
Autenticación
La autenticación sigue el orden estándar de autenticación de proveedores.
DEEPGRAM_API_KEY es la opción más sencilla.
Proxy y endpoints personalizados
Sobrescriba los endpoints o encabezados en la entrada tools.media.models[] de
Deepgram cuando utilice un proxy.
Comportamiento de la salida
La salida sigue las mismas reglas de audio que los demás proveedores (límites de tamaño, tiempos de espera e inserción de la transcripción).
Contenido relacionado
Descripción general del pipeline de procesamiento de audio, imágenes y vídeo.
Referencia completa de configuración, incluidos los ajustes de las herramientas multimedia.
Problemas habituales y pasos de depuración.
Preguntas frecuentes sobre la configuración de OpenClaw.