Tools
Descripción general de los medios
OpenClaw genera imágenes, vídeos y música, comprende contenido multimedia entrante (imágenes, audio y vídeo) y reproduce las respuestas en voz alta mediante texto a voz. Todas las capacidades multimedia se controlan mediante herramientas: el agente decide cuándo usarlas según la conversación, y cada herramienta solo aparece cuando hay al menos un proveedor subyacente configurado.
La voz en directo utiliza el contrato de sesión de Talk en lugar de la ruta de la herramienta
multimedia de una sola ejecución. Talk tiene tres modos: realtime nativo del proveedor,
stt-tts local o por streaming y transcription para capturar voz únicamente
con fines de observación. Esos modos comparten catálogos de proveedores, envoltorios de eventos
y semántica de cancelación con la telefonía, las reuniones, el tiempo real del navegador
y los clientes nativos de pulsar para hablar.
Capacidades
Crea y edita imágenes a partir de instrucciones de texto o imágenes de referencia mediante
image_generate. Asíncrona en las sesiones de chat: se ejecuta en segundo plano y
publica el resultado cuando está listo.
Generación de texto a vídeo, de imagen a vídeo y de vídeo a vídeo mediante video_generate.
Asíncrona: se ejecuta en segundo plano y publica el resultado cuando está listo.
Genera música o pistas de audio mediante music_generate. Asíncrona en las sesiones
de chat, con el ciclo de vida compartido de las tareas de generación multimedia.
Convierte las respuestas salientes en audio hablado mediante la herramienta
tts y la configuración tts. Síncrona.
Resume imágenes, audio y vídeo entrantes mediante proveedores de modelos con capacidad de visión y plugins específicos de comprensión multimedia.
Transcribe mensajes de voz entrantes mediante STT por lotes o proveedores de STT por streaming de Voice Call.
Matriz de capacidades de proveedores
| Proveedor | Imagen | Vídeo | Música | TTS | STT | Voz en tiempo real | Comprensión multimedia |
|---|---|---|---|---|---|---|---|
| Alibaba | ✓ | ||||||
| Azure Speech | ✓ | ||||||
| BytePlus | ✓ | ||||||
| ComfyUI | ✓ | ✓ | ✓ | ||||
| Deepgram | ✓ | ||||||
| DeepInfra | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| ElevenLabs | ✓ | ✓ | |||||
| fal | ✓ | ✓ | ✓ | ||||
| ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| Gradium | ✓ | ||||||
| Inworld | ✓ | ||||||
| LiteLLM | ✓ | ||||||
| CLI local | ✓ | ||||||
| Microsoft | ✓ | ||||||
| Microsoft Foundry | ✓ | ||||||
| MiniMax | ✓ | ✓ | ✓ | ✓ | |||
| Mistral | ✓ | ||||||
| OpenAI | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| OpenRouter | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| PixVerse | ✓ | ||||||
| Qwen | ✓ | ✓ | |||||
| Runway | ✓ | ||||||
| SenseAudio | ✓ | ||||||
| Together | ✓ | ||||||
| Volcengine | ✓ | ||||||
| Vydra | ✓ | ✓ | ✓ | ||||
| xAI | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| Xiaomi MiMo | ✓ |
Asíncrono frente a síncrono
| Capacidad | Modo | Motivo |
|---|---|---|
| Imagen | Asíncrono | El procesamiento del proveedor puede prolongarse más que un turno de chat; los archivos adjuntos generados utilizan la ruta de finalización compartida. |
| Texto a voz | Síncrono | Las respuestas del proveedor se reciben en segundos y se adjuntan al audio de la respuesta. |
| Vídeo | Asíncrono | El procesamiento del proveedor tarda entre 30 s y varios minutos; las colas lentas pueden ejecutarse hasta alcanzar el tiempo de espera configurado. |
| Música | Asíncrono | Presenta las mismas características de procesamiento del proveedor que el vídeo. |
Para las herramientas asíncronas, OpenClaw envía la solicitud al proveedor, devuelve
inmediatamente un identificador de tarea y realiza el seguimiento del trabajo en el registro de tareas. El agente continúa
respondiendo a otros mensajes mientras se ejecuta el trabajo. Cuando el proveedor finaliza,
OpenClaw activa al agente con las rutas del contenido multimedia generado para que pueda informar al
usuario mediante el modo normal de respuesta visible de la sesión: entrega automática de la respuesta final
cuando está configurada, o message(action="send") cuando la sesión requiere
la herramienta de mensajes. Si la sesión solicitante está inactiva o falla su activación,
y todavía falta contenido multimedia generado en la respuesta de finalización,
OpenClaw envía una alternativa directa idempotente que contiene únicamente el contenido multimedia faltante. El contenido multimedia
ya entregado mediante la respuesta de finalización no se vuelve a publicar.
Voz a texto y Voice Call
Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter,
SenseAudio y xAI pueden transcribir audio entrante mediante la ruta por lotes
tools.media.audio cuando están configurados. Los plugins de canales que comprueban previamente una
nota de voz para el filtrado de menciones o el análisis de comandos marcan el archivo adjunto
transcrito en el contexto entrante, de modo que el paso compartido de comprensión multimedia
reutilice esa transcripción en lugar de realizar una segunda llamada STT para el mismo
audio.
Deepgram, ElevenLabs, Mistral, OpenAI y xAI también registran proveedores de STT por streaming de Voice Call, por lo que el audio telefónico en directo puede reenviarse al proveedor seleccionado sin esperar a que se complete una grabación.
Para conversaciones en directo con usuarios, se recomienda el modo Talk. Los archivos adjuntos de audio por lotes permanecen en la ruta multimedia; el tiempo real del navegador, la función nativa de pulsar para hablar, la telefonía y el audio de reuniones deben utilizar eventos de Talk y los catálogos con ámbito de sesión devueltos por el Gateway.
Asignaciones de proveedores (cómo se distribuyen entre las superficies)
Superficies de imagen, vídeo, música, TTS por lotes, STT por lotes, voz en tiempo real del backend y comprensión multimedia.
OpenAI
Superficies de imagen, vídeo, TTS por lotes, STT por lotes, STT por streaming de Voice Call, voz en tiempo real del backend e incrustaciones de memoria.
DeepInfra
Superficies de enrutamiento de chat/modelos, generación y edición de imágenes, texto a vídeo, TTS por lotes, STT por lotes, comprensión multimedia de imágenes e incrustaciones de memoria. DeepInfra también ofrece reclasificación, clasificación, detección de objetos y otros tipos de modelos nativos; OpenClaw aún no dispone de un contrato de proveedor para esas categorías, por lo que este plugin no las registra.
xAI
Imagen, vídeo, búsqueda, ejecución de código, TTS por lotes, STT por lotes y STT por streaming de Voice Call. La voz en tiempo real de xAI es una capacidad del servicio de origen, pero no se registra en OpenClaw hasta que el contrato compartido de voz en tiempo real pueda representarla.