Providers
Sintesi vocale di Azure
Azure Speech è un provider di sintesi vocale di Azure AI Speech incluso nel pacchetto. OpenClaw
chiama direttamente l'API REST di Azure Speech con SSML, sintetizzando MP3 per
le risposte standard, Ogg/Opus nativo per i messaggi vocali e mulaw a 8 kHz per
i canali di telefonia come Voice Call. La richiesta invia il formato di output
gestito dal provider tramite l'header X-Microsoft-OutputFormat.
| Dettaglio | Valore |
|---|---|
| ID provider | azure-speech (alias: azure) |
| Sito web | Azure AI Speech |
| Documentazione | Sintesi vocale tramite REST di Speech |
| Autenticazione | AZURE_SPEECH_KEY più AZURE_SPEECH_REGION |
| Voce predefinita | en-US-JennyNeural |
| Output file predefinito | audio-24khz-48kbitrate-mono-mp3 |
| File predefinito per messaggi vocali | ogg-24khz-16bit-mono-opus |
Per iniziare
Creare una risorsa Azure Speech
Nel portale di Azure, creare una risorsa Speech. Copiare KEY 1 da
Resource Management > Keys and Endpoint e copiare la posizione della risorsa,
ad esempio eastus.
AZURE_SPEECH_KEY=<speech-resource-key>AZURE_SPEECH_REGION=eastusSelezionare Azure Speech in messages.tts
{ messages: { tts: { auto: "always", provider: "azure-speech", providers: { "azure-speech": { voice: "en-US-JennyNeural", lang: "en-US", }, }, }, },}Inviare un messaggio
Inviare una risposta tramite qualsiasi canale connesso. OpenClaw sintetizza l'audio con Azure Speech e fornisce un MP3 per l'audio standard oppure Ogg/Opus quando il canale prevede un messaggio vocale.
Opzioni di configurazione
Tutte le opzioni si trovano in messages.tts.providers["azure-speech"].
| Opzione | Descrizione |
|---|---|
apiKey |
Chiave della risorsa Azure Speech. In alternativa usa AZURE_SPEECH_KEY, AZURE_SPEECH_API_KEY o SPEECH_KEY. |
region |
Area geografica della risorsa Azure Speech. In alternativa usa AZURE_SPEECH_REGION o SPEECH_REGION. |
endpoint |
Override facoltativo dell'endpoint Azure Speech. In alternativa usa il valore attendibile AZURE_SPEECH_ENDPOINT. |
baseUrl |
Override facoltativo dell'URL di base di Azure Speech. |
voice |
ShortName della voce Azure (valore predefinito en-US-JennyNeural). Alias precedente: voiceId. |
lang |
Codice lingua SSML (valore predefinito en-US). |
outputFormat |
Formato di output del file audio (valore predefinito audio-24khz-48kbitrate-mono-mp3). |
voiceNoteOutputFormat |
Formato di output del messaggio vocale (valore predefinito ogg-24khz-16bit-mono-opus). |
timeoutMs |
Override del timeout della richiesta in millisecondi. In alternativa usa il valore globale messages.tts.timeoutMs. |
Il provider è considerato configurato quando è impostato apiKey insieme a uno tra
region, endpoint o baseUrl. Le variabili di ambiente vengono controllate solo come alternativa
per le chiavi di configurazione non impostate. I file .env dell'area di lavoro non possono impostare
AZURE_SPEECH_ENDPOINT; per l'instradamento degli endpoint, usare l'ambiente del processo, il dotenv globale del runtime
o una configurazione esplicita.
Note
Autenticazione
Azure Speech usa una chiave della risorsa Speech, non una chiave di Azure OpenAI. La chiave
viene inviata come Ocp-Apim-Subscription-Key; OpenClaw deriva
https://<region>.tts.speech.microsoft.com da region, a meno che non venga
fornito endpoint o baseUrl.
Nomi delle voci
Usare il valore ShortName della voce Azure Speech, ad esempio
en-US-JennyNeural. Il provider incluso può elencare le voci tramite la
stessa risorsa Speech e filtra quelle contrassegnate come deprecate, ritirate
o disabilitate.
Output audio
Azure accetta formati di output come audio-24khz-48kbitrate-mono-mp3,
ogg-24khz-16bit-mono-opus e riff-24khz-16bit-mono-pcm. OpenClaw
richiede Ogg/Opus per le destinazioni voice-note, affinché i canali possano inviare
messaggi vocali nativi senza un'ulteriore conversione in MP3, e impone
raw-8khz-8bit-mono-mulaw per le destinazioni di telefonia.
Alias
azure è accettato come alias del provider per la configurazione esistente, ma la nuova
configurazione dovrebbe usare azure-speech per evitare confusione con i provider
di modelli Azure OpenAI.