Azure Speech
Azure Speech 是一个内置的 Azure AI Speech 文本转语音提供商。OpenClaw
直接使用 SSML 调用 Azure Speech REST API,为标准回复合成 MP3,为语音消息合成原生 Ogg/Opus,并为 Voice Call 等电话通道合成 8 kHz mulaw。请求通过 X-Microsoft-OutputFormat 头发送提供商拥有的输出格式。
| 详情 | 值 |
|---|---|
| 提供商 ID | azure-speech(别名:azure) |
| 网站 | Azure AI Speech |
| 文档 | 语音 REST 文本转语音 |
| 身份验证 | AZURE_SPEECH_KEY 和 AZURE_SPEECH_REGION |
| 默认语音 | en-US-JennyNeural |
| 默认文件输出 | audio-24khz-48kbitrate-mono-mp3 |
| 默认语音消息文件 | ogg-24khz-16bit-mono-opus |
快速入门¶
1. 创建 Azure Speech 资源
在 Azure 门户中,创建一个 Speech 资源。从资源管理 > 密钥和端点复制 KEY 1,并复制资源位置,例如 eastus。
2. 在 tts 中选择 Azure Speech
{
tts: {
auto: "always",
provider: "azure-speech",
providers: {
"azure-speech": {
voice: "en-US-JennyNeural",
lang: "en-US",
},
},
},
}
3. 发送消息
通过任意已连接通道发送回复。OpenClaw 使用 Azure Speech 合成音频,并为标准音频提供 MP3;当通道期望语音消息时,则提供 Ogg/Opus。
配置选项¶
所有选项都位于 tts.providers["azure-speech"] 下。
| 选项 | 说明 |
|---|---|
apiKey |
Azure Speech 资源密钥。回退到 AZURE_SPEECH_KEY、AZURE_SPEECH_API_KEY 或 SPEECH_KEY。 |
region |
Azure Speech 资源区域。回退到 AZURE_SPEECH_REGION 或 SPEECH_REGION。 |
endpoint |
可选的 Azure Speech 端点覆盖。回退到受信任的 AZURE_SPEECH_ENDPOINT。 |
baseUrl |
可选的 Azure Speech 基础 URL 覆盖。 |
voice |
Azure 语音 ShortName(默认 en-US-JennyNeural)。旧版别名:voiceId。 |
lang |
SSML 语言代码(默认 en-US)。 |
outputFormat |
音频文件输出格式(默认 audio-24khz-48kbitrate-mono-mp3)。 |
voiceNoteOutputFormat |
语音消息输出格式(默认 ogg-24khz-16bit-mono-opus)。 |
timeoutMs |
以毫秒为单位的请求超时覆盖。回退到全局 tts.timeoutMs。 |
当设置 apiKey 以及 region、endpoint 或 baseUrl 之一后,即视为已配置该提供商。环境变量仅作为未设置配置项的回退进行检查。工作区 .env 文件无法设置 AZURE_SPEECH_ENDPOINT;请使用进程环境变量、全局运行时 dotenv 或显式配置来进行端点路由。
备注¶
身份验证
Azure Speech 使用 Speech 资源密钥,而不是 Azure OpenAI 密钥。该密钥作为 Ocp-Apim-Subscription-Key 发送;除非提供 endpoint 或 baseUrl,否则 OpenClaw 会从 region 派生 https://<region>.tts.speech.microsoft.com。
语音名称
使用 Azure Speech 语音的 ShortName 值,例如 en-US-JennyNeural。内置提供商可以通过同一 Speech 资源列出语音,并过滤掉标记为已弃用、已退役或已禁用的语音。
音频输出
Azure 接受诸如 audio-24khz-48kbitrate-mono-mp3、ogg-24khz-16bit-mono-opus 和 riff-24khz-16bit-mono-pcm 等输出格式。对于 voice-note 目标,OpenClaw 请求 Ogg/Opus,以便通道可以发送原生语音气泡,而无需额外的 MP3 转换;对于电话目标,则强制使用 raw-8khz-8bit-mono-mulaw。
别名
现有配置接受 azure 作为提供商别名,但新配置应使用 azure-speech,以避免与 Azure OpenAI 模型提供商混淆。
相关¶
TTS 概览、提供商和 tts 配置。
包括 tts 设置的完整配置参考。
所有内置 OpenClaw 提供商。
常见问题和调试步骤。
本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw