Providers
گفتار Azure
Azure Speech یک ارائهدهندهٔ تبدیل متن به گفتار Azure AI Speech است که بهصورت داخلی ارائه میشود. OpenClaw
با استفاده از SSML مستقیماً API REST سرویس Azure Speech را فراخوانی میکند و برای
پاسخهای استاندارد MP3، برای پیامهای صوتی Ogg/Opus بومی و برای
کانالهای تلفنی مانند تماس صوتی، mulaw با نرخ 8 kHz تولید میکند. درخواست، قالب خروجی متعلق به
ارائهدهنده را از طریق هدر X-Microsoft-OutputFormat ارسال میکند.
| جزئیات | مقدار |
|---|---|
| شناسهٔ ارائهدهنده | azure-speech (نام مستعار: azure) |
| وبسایت | Azure AI Speech |
| مستندات | تبدیل متن به گفتار با REST سرویس Speech |
| احراز هویت | AZURE_SPEECH_KEY بههمراه AZURE_SPEECH_REGION |
| صدای پیشفرض | en-US-JennyNeural |
| خروجی پیشفرض فایل | audio-24khz-48kbitrate-mono-mp3 |
| فایل پیشفرض پیام صوتی | ogg-24khz-16bit-mono-opus |
شروع به کار
ایجاد یک منبع Azure Speech
در پورتال Azure، یک منبع Speech ایجاد کنید. KEY 1 را از
Resource Management > Keys and Endpoint کپی کنید و موقعیت منبع
مانند eastus را نیز کپی کنید.
AZURE_SPEECH_KEY=<speech-resource-key>AZURE_SPEECH_REGION=eastusانتخاب Azure Speech در tts
{ tts: { auto: "always", provider: "azure-speech", providers: { "azure-speech": { voice: "en-US-JennyNeural", lang: "en-US", }, }, },}ارسال پیام
پاسخی را از طریق هر کانال متصل ارسال کنید. OpenClaw صدا را با Azure Speech تولید میکند و برای صدای استاندارد MP3، یا هنگامی که کانال انتظار پیام صوتی دارد Ogg/Opus تحویل میدهد.
گزینههای پیکربندی
همهٔ گزینهها زیر tts.providers["azure-speech"] قرار دارند.
| گزینه | توضیحات |
|---|---|
apiKey |
کلید منبع Azure Speech. به AZURE_SPEECH_KEY، AZURE_SPEECH_API_KEY یا SPEECH_KEY بازمیگردد. |
region |
منطقهٔ منبع Azure Speech. به AZURE_SPEECH_REGION یا SPEECH_REGION بازمیگردد. |
endpoint |
جایگزین اختیاری نقطهٔ پایانی Azure Speech. به AZURE_SPEECH_ENDPOINT مورداعتماد بازمیگردد. |
baseUrl |
جایگزین اختیاری URL پایهٔ Azure Speech. |
voice |
ShortName صدای Azure (پیشفرض en-US-JennyNeural). نام مستعار قدیمی: voiceId. |
lang |
کد زبان SSML (پیشفرض en-US). |
outputFormat |
قالب خروجی فایل صوتی (پیشفرض audio-24khz-48kbitrate-mono-mp3). |
voiceNoteOutputFormat |
قالب خروجی پیام صوتی (پیشفرض ogg-24khz-16bit-mono-opus). |
timeoutMs |
جایگزین مهلت زمانی درخواست بر حسب میلیثانیه. به tts.timeoutMs سراسری بازمیگردد. |
پس از تنظیم apiKey بههمراه یکی از
region، endpoint یا baseUrl، ارائهدهنده پیکربندیشده در نظر گرفته میشود. متغیرهای محیطی فقط بهعنوان گزینهٔ بازگشتی
برای کلیدهای پیکربندی تنظیمنشده بررسی میشوند. فایلهای .env فضای کاری نمیتوانند
AZURE_SPEECH_ENDPOINT را تنظیم کنند؛ برای مسیریابی نقطهٔ پایانی از محیط فرایند، dotenv زمان اجرای سراسری
یا پیکربندی صریح استفاده کنید.
نکات
احراز هویت
Azure Speech از کلید منبع Speech استفاده میکند، نه کلید Azure OpenAI. کلید
بهصورت Ocp-Apim-Subscription-Key ارسال میشود؛ مگر اینکه
endpoint یا baseUrl را ارائه دهید، OpenClaw مقدار
https://<region>.tts.speech.microsoft.com را از region به دست میآورد.
نامهای صدا
از مقدار ShortName صدای Azure Speech استفاده کنید، برای نمونه
en-US-JennyNeural. ارائهدهندهٔ داخلی میتواند صداها را از طریق
همان منبع Speech فهرست کند و صداهایی را که منسوخ، بازنشسته
یا غیرفعال علامتگذاری شدهاند، حذف میکند.
خروجیهای صوتی
Azure قالبهای خروجی مانند audio-24khz-48kbitrate-mono-mp3،
ogg-24khz-16bit-mono-opus و riff-24khz-16bit-mono-pcm را میپذیرد. OpenClaw
برای مقصدهای voice-note، Ogg/Opus درخواست میکند تا کانالها بتوانند حبابهای صوتی بومی را
بدون تبدیل اضافی MP3 ارسال کنند و برای مقصدهای تلفنی
raw-8khz-8bit-mono-mulaw را اجباری میکند.
نام مستعار
azure بهعنوان نام مستعار ارائهدهنده برای پیکربندی موجود پذیرفته میشود، اما پیکربندی
جدید باید برای جلوگیری از اشتباه با ارائهدهندگان مدل Azure OpenAI از
azure-speech استفاده کند.