文本转语音 (TTS)
OpenClaw 会将出站回复转换为飞书、Matrix、Telegram 和 WhatsApp 上的原生语音消息。所有其他渠道会收到音频附件。Telephony 和 Talk 接收 PCM 或 Ulaw 流。
TTS 是 Talk 的 stt-tts 模式中语音输出的一半(talk.speak 调用的是同一合成路径)。提供商原生的 realtime Talk 会话改为在实时提供商内部合成语音。transcription 会话永远不会合成助手的语音回复。
本页是一个索引。文本转语音(Text-to-speech)文档分为七个页面,每个页面对应一项阅读任务。请打开与你的任务匹配的页面。
| 页面 | 适用场景 |
|---|---|
| 文本转语音快速入门 | 当你需要开启 TTS、选择提供商并从聊天中测试时。 |
| 文本转语音配置 | 当你需要 tts 配置块、提供商代码片段、本地引擎或覆盖优先级时。 |
| 文本转语音人设 | 当你想要一个稳定的语音身份、其提供商绑定及回退策略时。 |
| 命令与指令 | 当你需要 [[tts:...]] 指令、/tts 命令,或了解本地偏好设置的位置时。 |
| 输出与自动 TTS 行为 | 当你需要各渠道的音频格式、转码规则,或了解 Auto-TTS 何时进行摘要时。 |
| 文本转语音字段参考 | 当你需要某个 TTS 字段的类型、默认值、环境变量或旧版别名时。 |
| Agent 工具与 Gateway RPC | 当你通过 agent 工具调用或 Gateway RPC 方法调用 TTS 时。 |
各章节迁移位置¶
上一版单页文档中的每个章节标题都在此处保留其锚点,因此诸如 /tools/tts#per-agent-voice-overrides 的既有链接仍可解析。每个条目指向当前包含对应内容的页面。
- 快速入门
- 支持的提供商
- 配置
- Local Speech Swift 和 speech-core
- 按 Agent 的语音覆盖
- 人设
- 最小人设
- 完整人设(提供商特定塑形)
- 人设解析
- 自定义人设塑形
- 回退策略
- 模型驱动指令
- 斜杠命令
- 按用户偏好
- 输出格式
- Auto-TTS 行为
- 字段参考
- Inworld primary
- Agent 工具
- Gateway RPC
- 完整人设(提供商特定塑形)
组件锚点¶
上一版单页文档还为每个步骤、标签页、折叠面板和字段生成了锚点。这些锚点在此处保留,以便指向旧页面的任何深层链接仍可解析。当共享同一 slug 的标签页移至其他页面时,九个折叠面板锚点丢失了 -1 后缀。下面的存根保留旧 id 并指向新锚点。
快速入门
配置
- Azure Speech
- ElevenLabs
- Fish Audio
- Google Gemini
- Gradium
- Inworld
- 本地 CLI
- Microsoft(无需密钥)
- MiniMax
- OpenAI + ElevenLabs
- OpenRouter
- Volcengine
- xAI
- Xiaomi MiMo
- macOS HTTP
- macOS CLI
- Linux CLI
- Windows CLI
字段参考
- 顶层 tts.*
- 顶层 tts.* →
auto - 顶层 tts.* →
enabled - 顶层 tts.* →
mode - 顶层 tts.* →
provider - 顶层 tts.* →
persona - 顶层 tts.* →
personas.<id> - 顶层 tts.* →
summaryModel - 顶层 tts.* →
modelOverrides - 顶层 tts.* →
providers.<id> - 顶层 tts.* →
maxTextLength - 顶层 tts.* →
timeoutMs - Azure Speech
- Azure Speech →
apiKey - Azure Speech →
region - Azure Speech →
endpoint - Azure Speech →
speakerVoice - Azure Speech →
lang - Azure Speech →
outputFormat - Azure Speech →
voiceNoteOutputFormat - ElevenLabs
- ElevenLabs →
apiKey - ElevenLabs →
model - ElevenLabs →
speakerVoiceId - ElevenLabs →
voiceSettings - ElevenLabs →
applyTextNormalization - ElevenLabs →
languageCode - ElevenLabs →
seed - ElevenLabs →
baseUrl - Google Gemini
- Google Gemini →
apiKey - Google Gemini →
model - Google Gemini →
speakerVoice - Google Gemini →
audioProfile - Google Gemini →
speakerName - Google Gemini →
promptTemplate - Google Gemini →
personaPrompt - Google Gemini →
baseUrl - Gradium
- Gradium →
apiKey - Gradium →
baseUrl - Gradium →
speakerVoiceId - Inworld
- Inworld →
apiKey - Inworld →
baseUrl - Inworld →
modelId - Inworld →
speakerVoiceId - Inworld →
temperature - Local CLI (tts-local-cli)
- Local CLI (tts-local-cli) →
command - Local CLI (tts-local-cli) →
args - Local CLI (tts-local-cli) →
outputFormat - Local CLI (tts-local-cli) →
timeoutMs - Local CLI (tts-local-cli) →
cwd - Local CLI (tts-local-cli) →
env - Microsoft(无需 API 密钥)
- Microsoft(无需 API 密钥) →
enabled - Microsoft(无需 API 密钥) →
speakerVoice - Microsoft(无需 API 密钥) →
lang - Microsoft(无需 API 密钥) →
outputFormat - Microsoft(无需 API 密钥) →
rate / pitch / volume - Microsoft(无需 API 密钥) →
saveSubtitles - Microsoft(无需 API 密钥) →
proxy - Microsoft(无需 API 密钥) →
timeoutMs - Microsoft(无需 API 密钥) →
edge.* - MiniMax
- MiniMax →
apiKey - MiniMax →
baseUrl - MiniMax →
model - MiniMax →
speakerVoiceId - MiniMax →
speed - MiniMax →
vol - MiniMax →
pitch - OpenAI
- OpenAI →
apiKey - OpenAI →
model - OpenAI →
speakerVoice - OpenAI →
instructions - OpenAI →
responseFormat - OpenAI →
extraBody / extra_body - OpenAI →
baseUrl - OpenRouter
- OpenRouter →
apiKey - OpenRouter →
baseUrl - OpenRouter →
model - OpenRouter →
speakerVoice - OpenRouter →
responseFormat - OpenRouter →
speed - Volcengine (BytePlus Seed Speech)
- Volcengine (BytePlus Seed Speech) →
apiKey - Volcengine (BytePlus Seed Speech) →
resourceId - Volcengine (BytePlus Seed Speech) →
appKey - Volcengine (BytePlus Seed Speech) →
baseUrl - Volcengine (BytePlus Seed Speech) →
speakerVoice - Volcengine (BytePlus Seed Speech) →
speedRatio - Volcengine (BytePlus Seed Speech) →
emotion - Volcengine (BytePlus Seed Speech) →
appId / token / cluster - xAI
- xAI →
apiKey - xAI →
baseUrl - xAI →
speakerVoiceId - xAI →
language - xAI →
responseFormat - xAI →
speed - Xiaomi MiMo
- Xiaomi MiMo →
apiKey - Xiaomi MiMo →
baseUrl - Xiaomi MiMo →
model - Xiaomi MiMo →
speakerVoice - Xiaomi MiMo →
format - Xiaomi MiMo →
style
服务链接¶
- Azure Speech 提供商
- Azure Speech REST 文本转语音
- ElevenLabs 提供商
- ElevenLabs 身份验证
- ElevenLabs 文本转语音
- Fish Audio 提供商
- Gradium
- Inworld 提供商
- Inworld TTS API
- Microsoft Speech 输出格式
- MiniMax 提供商
- MiniMax T2A v2 API
- node-edge-tts
- OpenAI 提供商
- OpenAI Audio API 参考
- OpenAI 文本转语音指南
- speech-core
- Speech Swift
- Volcengine TTS HTTP API
- xAI 提供商
- xAI 文本转语音
- Xiaomi MiMo 语音合成
相关¶
本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw