跳转至

Azure Speech

Azure Speech 是一个内置的 Azure AI Speech 文本转语音提供商。OpenClaw 直接使用 SSML 调用 Azure Speech REST API,为标准回复合成 MP3,为语音消息合成原生 Ogg/Opus,并为 Voice Call 等电话通道合成 8 kHz mulaw。请求通过 X-Microsoft-OutputFormat 头发送提供商拥有的输出格式。

详情 值
提供商 ID azure-speech(别名:azure)
网站 Azure AI Speech
文档 语音 REST 文本转语音
身份验证 AZURE_SPEECH_KEY 和 AZURE_SPEECH_REGION
默认语音 en-US-JennyNeural
默认文件输出 audio-24khz-48kbitrate-mono-mp3
默认语音消息文件 ogg-24khz-16bit-mono-opus

快速入门

1. 创建 Azure Speech 资源

在 Azure 门户中,创建一个 Speech 资源。从资源管理 > 密钥和端点复制 KEY 1,并复制资源位置,例如 eastus。

AZURE_SPEECH_KEY=<speech-resource-key>
AZURE_SPEECH_REGION=eastus

2. 在 tts 中选择 Azure Speech

{
  tts: {
    auto: "always",
    provider: "azure-speech",
    providers: {
      "azure-speech": {
        voice: "en-US-JennyNeural",
        lang: "en-US",
      },
    },
  },
}

3. 发送消息

通过任意已连接通道发送回复。OpenClaw 使用 Azure Speech 合成音频,并为标准音频提供 MP3;当通道期望语音消息时,则提供 Ogg/Opus。

配置选项

所有选项都位于 tts.providers["azure-speech"] 下。

选项 说明
apiKey Azure Speech 资源密钥。回退到 AZURE_SPEECH_KEY、AZURE_SPEECH_API_KEY 或 SPEECH_KEY。
region Azure Speech 资源区域。回退到 AZURE_SPEECH_REGION 或 SPEECH_REGION。
endpoint 可选的 Azure Speech 端点覆盖。回退到受信任的 AZURE_SPEECH_ENDPOINT。
baseUrl 可选的 Azure Speech 基础 URL 覆盖。
voice Azure 语音 ShortName(默认 en-US-JennyNeural)。旧版别名:voiceId。
lang SSML 语言代码(默认 en-US)。
outputFormat 音频文件输出格式(默认 audio-24khz-48kbitrate-mono-mp3)。
voiceNoteOutputFormat 语音消息输出格式(默认 ogg-24khz-16bit-mono-opus)。
timeoutMs 以毫秒为单位的请求超时覆盖。回退到全局 tts.timeoutMs。

当设置 apiKey 以及 region、endpoint 或 baseUrl 之一后,即视为已配置该提供商。环境变量仅作为未设置配置项的回退进行检查。工作区 .env 文件无法设置 AZURE_SPEECH_ENDPOINT;请使用进程环境变量、全局运行时 dotenv 或显式配置来进行端点路由。

备注

身份验证

Azure Speech 使用 Speech 资源密钥,而不是 Azure OpenAI 密钥。该密钥作为 Ocp-Apim-Subscription-Key 发送;除非提供 endpoint 或 baseUrl,否则 OpenClaw 会从 region 派生 https://<region>.tts.speech.microsoft.com。

语音名称

使用 Azure Speech 语音的 ShortName 值,例如 en-US-JennyNeural。内置提供商可以通过同一 Speech 资源列出语音,并过滤掉标记为已弃用、已退役或已禁用的语音。

音频输出

Azure 接受诸如 audio-24khz-48kbitrate-mono-mp3、ogg-24khz-16bit-mono-opus 和 riff-24khz-16bit-mono-pcm 等输出格式。对于 voice-note 目标,OpenClaw 请求 Ogg/Opus,以便通道可以发送原生语音气泡,而无需额外的 MP3 转换;对于电话目标,则强制使用 raw-8khz-8bit-mono-mulaw。

别名

现有配置接受 azure 作为提供商别名,但新配置应使用 azure-speech,以避免与 Azure OpenAI 模型提供商混淆。

文本转语音

TTS 概览、提供商和 tts 配置。

配置

包括 tts 设置的完整配置参考。

提供商

所有内置 OpenClaw 提供商。

故障排除

常见问题和调试步骤。

本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw