媒体概览
OpenClaw 可生成图像、视频和音乐,理解传入媒体(图像、音频、视频),并使用文本转语音朗读回复。所有媒体能力均由工具驱动:智能体根据对话决定何时使用它们,并且每个工具只有在至少配置了一个后端提供商时才会出现。
实时语音使用 Talk 会话契约,而不是一次性媒体工具路径。Talk 有三种模式:提供商原生的 realtime、本地或流式 stt-tts,以及用于仅观察语音捕获的 transcription。这些模式与电话、会议、浏览器实时和原生按键说话客户端共享提供商目录、事件信封和取消语义。
功能¶
通过 image_generate 从文本提示或参考图像创建和编辑图像。在聊天会话中为异步——在后台运行,并在就绪时发布结果。
通过 video_generate 实现文本转视频、图像转视频和视频转视频。异步——在后台运行,并在就绪时发布结果。
通过 music_generate 生成音乐或音频轨道。在聊天会话中基于共享媒体生成任务生命周期异步运行。
通过 tts 工具加上 tts 配置,将出站回复转换为语音音频。同步。
使用具备视觉能力的模型提供商和专用媒体理解插件,总结传入的图像、音频和视频。
通过批量 STT 或 Voice Call 流式 STT 提供商,转录传入的语音消息。
在 Control UI 和原生应用中内联播放助手音频和视频,支持受管访问和可移植播放版本。
本地媒体文件¶
view_image、pdf,以及 image_generate、music_generate 和 video_generate 的参考输入,对相对路径使用任务的工作目录。在 Git worktree 中运行的任务可以从该 worktree 读取媒体,即使智能体的默认工作区在其他位置。
仅限工作区的访问遵循会话已批准的文件系统根目录,该根目录可以包含当前工作目录的父目录。逃逸出该根目录的路径和符号链接会被拒绝。沙箱化工具通过沙箱文件系统读取;选择主机 worktree 不会授予沙箱外的访问权限。OpenClaw 管理的传入附件保留其现有访问规则。
提供商功能矩阵¶
Note
此表涵盖专用的媒体生成、TTS 和 STT 插件。许多聊天模型提供商(Anthropic、Google、OpenAI 等)也通过其回复模型理解传入媒体;完整提供商列表见 媒体理解。
| 提供商 | 图像 | 视频 | 音乐 | TTS | STT | 实时语音 | 媒体理解 |
|---|---|---|---|---|---|---|---|
| Alibaba | ✓ | ||||||
| Azure Speech | ✓ | ||||||
| BytePlus | ✓ | ||||||
| ComfyUI | ✓ | ✓ | ✓ | ||||
| Deepgram | ✓ | ||||||
| DeepInfra | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| ElevenLabs | ✓ | ✓ | |||||
| fal | ✓ | ✓ | ✓ | ||||
| ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| Gradium | ✓ | ||||||
| Inworld | ✓ | ||||||
| LiteLLM | ✓ | ||||||
| Local CLI | ✓ | ||||||
| Microsoft | ✓ | ||||||
| Microsoft Foundry | ✓ | ||||||
| MiniMax | ✓ | ✓ | ✓ | ✓ | |||
| Mistral | ✓ | ||||||
| OpenAI | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| OpenRouter | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | |
| PixVerse | ✓ | ||||||
| Qwen | ✓ | ✓ | |||||
| Runway | ✓ | ||||||
| SenseAudio | ✓ | ||||||
| Together | ✓ | ||||||
| Volcengine | ✓ | ||||||
| Vydra | ✓ | ✓ | ✓ | ||||
| xAI | ✓ | ✓ | ✓ | ✓ | ✓ | ||
| Xiaomi MiMo | ✓ |
Note
此处的 实时语音 指提供商原生的双向实时(Talk realtime 模式,例如 Gemini Live 或 OpenAI Realtime API)——目前只有 Google 和 OpenAI 注册了它。Deepgram、ElevenLabs、Mistral、OpenAI 和 xAI 分别注册了 Voice Call 流式 STT(单向音频转文本);见下文 语音转文本和 Voice Call。
xAI 实时语音是上游能力,但在共享实时语音契约能够表示它之前,尚未在 OpenClaw 中注册。
异步与同步¶
| 能力 | 模式 | 原因 |
|---|---|---|
| 图像 | 异步 | 提供商处理可能持续超过一轮聊天;生成的附件使用共享完成路径。 |
| 文本转语音 | 同步 | 提供商响应在几秒内返回;附加到回复音频。 |
| 视频 | 异步 | 提供商处理需要 30 秒到几分钟;慢速队列可能运行到配置的超时。 |
| 音乐 | 异步 | 与视频相同的提供商处理特性。 |
对于异步工具,OpenClaw 将请求提交给提供商,立即返回任务 ID,并在媒体运行时中跟踪该任务。任务运行期间,代理会继续响应其他消息。当提供商完成时,OpenClaw 会使用生成的媒体路径唤醒代理,以便它通过会话的正常可见回复模式告知用户:如果已配置,则自动投递最终回复;或者当会话需要消息工具时,使用 message(action="send")。如果请求方会话处于非活动状态,或其活动唤醒失败,并且完成回复中仍缺少一些生成的媒体,OpenClaw 会发送一个仅包含缺失媒体的幂等直接回退。已由完成回复投递的媒体不会再次发布。
如果无法确认完成投递,且原始会话仍然存在,OpenClaw 会尝试在该会话的历史中保留生成的媒体引用。完成投递始终绑定到原始会话和存储位置;替换会话永远不会收到它。瞬态队列准入失败会使用有界重试。如果队列准入和历史存储都不可用,完成投递将以诊断信息和进程本地媒体引用结束;不保证持久恢复。本地历史通知不会将媒体重新发送到通道。
语音转文本与 Voice Call¶
配置后,Deepgram、DeepInfra、ElevenLabs、Google、Groq、Mistral、OpenAI、OpenRouter、SenseAudio 和 xAI 都可以通过批量 tools.media.audio 路径转录传入音频。为语音留言执行预检以进行提及门控或命令解析的通道插件会在传入上下文中标记已转录的附件,因此共享媒体理解流程会复用该转录文本,而不是为同一音频发起第二次 STT 调用。
Deepgram、ElevenLabs、Mistral、OpenAI 和 xAI 还注册了 Voice Call 流式 STT 提供商,因此实时电话音频可以转发到所选供应商,而无需等待完整录音。
对于实时用户对话,请优先使用 Talk 模式。批量音频附件仍走媒体路径;浏览器实时、原生按住说话、电话和会议音频应使用 Talk 事件以及 Gateway 返回的会话范围目录。
提供商映射(供应商如何跨功能面划分)¶
图像、视频、音乐、批量 TTS、批量 STT、后端实时语音以及媒体理解功能面。
OpenAI
图像、视频、批量 TTS、批量 STT、Voice Call 流式 STT、后端实时语音以及记忆嵌入功能面。
DeepInfra
聊天/模型路由、图像生成/编辑、文本转视频、批量 TTS、批量 STT、图像媒体理解以及记忆嵌入功能面。 DeepInfra 还提供重排序、分类、目标检测和其他原生模型类型;OpenClaw 目前尚无这些类别的提供商契约,因此此插件不会注册它们。
xAI
图像、视频、搜索、代码执行、批量 TTS、批量 STT 以及 Voice Call 流式 STT。xAI 实时语音是一项上游能力,但在共享实时语音契约能够表示它之前,不会在 OpenClaw 中注册。
相关¶
本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw