Providers

گفتار Azure

Azure Speech یک ارائه‌دهندهٔ تبدیل متن به گفتار Azure AI Speech است که به‌صورت داخلی ارائه می‌شود. OpenClaw با استفاده از SSML مستقیماً API ‏REST سرویس Azure Speech را فراخوانی می‌کند و برای پاسخ‌های استاندارد MP3، برای پیام‌های صوتی Ogg/Opus بومی و برای کانال‌های تلفنی مانند تماس صوتی، mulaw با نرخ 8 kHz تولید می‌کند. درخواست، قالب خروجی متعلق به ارائه‌دهنده را از طریق هدر X-Microsoft-OutputFormat ارسال می‌کند.

جزئیات مقدار
شناسهٔ ارائه‌دهنده azure-speech (نام مستعار: azure)
وب‌سایت Azure AI Speech
مستندات تبدیل متن به گفتار با REST سرویس Speech
احراز هویت AZURE_SPEECH_KEY به‌همراه AZURE_SPEECH_REGION
صدای پیش‌فرض en-US-JennyNeural
خروجی پیش‌فرض فایل audio-24khz-48kbitrate-mono-mp3
فایل پیش‌فرض پیام صوتی ogg-24khz-16bit-mono-opus

شروع به کار

  • ایجاد یک منبع Azure Speech

    در پورتال Azure، یک منبع Speech ایجاد کنید. KEY 1 را از Resource Management > Keys and Endpoint کپی کنید و موقعیت منبع مانند eastus را نیز کپی کنید.

    Code
    AZURE_SPEECH_KEY=<speech-resource-key>AZURE_SPEECH_REGION=eastus
  • انتخاب Azure Speech در tts

    json5
    {  tts: {    auto: "always",    provider: "azure-speech",    providers: {      "azure-speech": {        voice: "en-US-JennyNeural",        lang: "en-US",      },    },  },}
  • ارسال پیام

    پاسخی را از طریق هر کانال متصل ارسال کنید. OpenClaw صدا را با Azure Speech تولید می‌کند و برای صدای استاندارد MP3، یا هنگامی که کانال انتظار پیام صوتی دارد Ogg/Opus تحویل می‌دهد.

  • گزینه‌های پیکربندی

    همهٔ گزینه‌ها زیر tts.providers["azure-speech"] قرار دارند.

    گزینه توضیحات
    apiKey کلید منبع Azure Speech. به AZURE_SPEECH_KEY، AZURE_SPEECH_API_KEY یا SPEECH_KEY بازمی‌گردد.
    region منطقهٔ منبع Azure Speech. به AZURE_SPEECH_REGION یا SPEECH_REGION بازمی‌گردد.
    endpoint جایگزین اختیاری نقطهٔ پایانی Azure Speech. به AZURE_SPEECH_ENDPOINT مورداعتماد بازمی‌گردد.
    baseUrl جایگزین اختیاری URL پایهٔ Azure Speech.
    voice ShortName صدای Azure (پیش‌فرض en-US-JennyNeural). نام مستعار قدیمی: voiceId.
    lang کد زبان SSML (پیش‌فرض en-US).
    outputFormat قالب خروجی فایل صوتی (پیش‌فرض audio-24khz-48kbitrate-mono-mp3).
    voiceNoteOutputFormat قالب خروجی پیام صوتی (پیش‌فرض ogg-24khz-16bit-mono-opus).
    timeoutMs جایگزین مهلت زمانی درخواست بر حسب میلی‌ثانیه. به tts.timeoutMs سراسری بازمی‌گردد.

    پس از تنظیم apiKey به‌همراه یکی از region، endpoint یا baseUrl، ارائه‌دهنده پیکربندی‌شده در نظر گرفته می‌شود. متغیرهای محیطی فقط به‌عنوان گزینهٔ بازگشتی برای کلیدهای پیکربندی تنظیم‌نشده بررسی می‌شوند. فایل‌های .env فضای کاری نمی‌توانند AZURE_SPEECH_ENDPOINT را تنظیم کنند؛ برای مسیریابی نقطهٔ پایانی از محیط فرایند، dotenv زمان اجرای سراسری یا پیکربندی صریح استفاده کنید.

    نکات

    احراز هویت

    Azure Speech از کلید منبع Speech استفاده می‌کند، نه کلید Azure OpenAI. کلید به‌صورت Ocp-Apim-Subscription-Key ارسال می‌شود؛ مگر اینکه endpoint یا baseUrl را ارائه دهید، OpenClaw مقدار https://<region>.tts.speech.microsoft.com را از region به دست می‌آورد.

    نام‌های صدا

    از مقدار ShortName صدای Azure Speech استفاده کنید، برای نمونه en-US-JennyNeural. ارائه‌دهندهٔ داخلی می‌تواند صداها را از طریق همان منبع Speech فهرست کند و صداهایی را که منسوخ، بازنشسته یا غیرفعال علامت‌گذاری شده‌اند، حذف می‌کند.

    خروجی‌های صوتی

    Azure قالب‌های خروجی مانند audio-24khz-48kbitrate-mono-mp3، ogg-24khz-16bit-mono-opus و riff-24khz-16bit-mono-pcm را می‌پذیرد. OpenClaw برای مقصدهای voice-note، Ogg/Opus درخواست می‌کند تا کانال‌ها بتوانند حباب‌های صوتی بومی را بدون تبدیل اضافی MP3 ارسال کنند و برای مقصدهای تلفنی raw-8khz-8bit-mono-mulaw را اجباری می‌کند.

    نام مستعار

    azure به‌عنوان نام مستعار ارائه‌دهنده برای پیکربندی موجود پذیرفته می‌شود، اما پیکربندی جدید باید برای جلوگیری از اشتباه با ارائه‌دهندگان مدل Azure OpenAI از azure-speech استفاده کند.

    مرتبط

    Was this useful?
    On this page

    On this page