ds4
ds4 通过本地 Metal 后端提供 DeepSeek V4 Flash,并带有 OpenAI 兼容的 /v1 API。OpenClaw 通过通用的 openai-completions 提供商系列连接 ds4。
ds4 不是 OpenClaw 捆绑的提供商插件。请在 models.providers.ds4 下配置它,然后选择 ds4/deepseek-v4-flash。
| 属性 | 值 |
|---|---|
| 提供商 ID | ds4 |
| 插件 | 无(仅配置) |
| API | OpenAI 兼容 Chat Completions(openai-completions) |
| Base URL | http://127.0.0.1:18000/v1(建议) |
| 模型 ID | deepseek-v4-flash |
| 工具调用 | OpenAI 风格的 tools / tool_calls |
| 推理 | DeepSeek 风格的 thinking 和 reasoning_effort |
需求¶
- 支持 Metal 的 macOS。
- 一个可用的 ds4 检出目录,其中包含
ds4-server和 DeepSeek V4 Flash GGUF 文件。 - 足够的内存以容纳你选择的上下文;更大的
--ctx值会在服务器启动时分配更多 KV 内存。
Warning
OpenClaw 代理轮次包含工具架构和工作区上下文。极小的上下文(例如 --ctx 4096)可能通过直接 curl 测试,但在完整代理运行中会因
500 prompt exceeds context 而失败。对于代理和工具冒烟测试,至少使用 --ctx 32768。仅在内存充足且需要启用 ds4
Think Max 时使用 --ctx 393216。
快速开始¶
1. 启动 ds4-server
将 <DS4_DIR> 替换为你的 ds4 检出路径。
<DS4_DIR>/ds4-server \
--model <DS4_DIR>/ds4flash.gguf \
--host 127.0.0.1 \
--port 18000 \
--ctx 32768 \
--tokens 128
2. 验证 OpenAI 兼容端点
响应应包含 deepseek-v4-flash。
3. 添加 OpenClaw 提供商配置
添加来自 完整配置 的配置,然后运行一次性模型检查:
openclaw infer model run \
--local \
--model ds4/deepseek-v4-flash \
--thinking off \
--prompt "Reply with exactly: openclaw-ds4-ok" \
--json
完整配置¶
当 ds4 已在 127.0.0.1:18000 上运行时,使用此配置。
{
agents: {
defaults: {
model: { primary: "ds4/deepseek-v4-flash" },
models: {
"ds4/deepseek-v4-flash": {
alias: "DS4 local",
},
},
},
},
models: {
mode: "merge",
providers: {
ds4: {
baseUrl: "http://127.0.0.1:18000/v1",
apiKey: "ds4-local",
api: "openai-completions",
timeoutSeconds: 300,
models: [
{
id: "deepseek-v4-flash",
name: "DeepSeek V4 Flash (ds4)",
reasoning: true,
input: ["text"],
cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
contextWindow: 32768,
maxTokens: 128,
compat: {
supportsUsageInStreaming: true,
supportsReasoningEffort: true,
maxTokensField: "max_tokens",
supportsStrictMode: false,
thinkingFormat: "deepseek",
supportedReasoningEfforts: ["low", "medium", "high", "xhigh"],
},
},
],
},
},
},
}
保持 contextWindow 与 ds4-server --ctx 一致。除非你有意让 OpenClaw 请求比服务器默认值更少的输出,否则保持 maxTokens 与
--tokens 一致。
按需启动¶
OpenClaw 可以在选择 ds4/... 模型时启动 ds4。在同一提供商条目中添加 localService:
{
models: {
providers: {
ds4: {
baseUrl: "http://127.0.0.1:18000/v1",
apiKey: "ds4-local",
api: "openai-completions",
timeoutSeconds: 300,
localService: {
command: "<DS4_DIR>/ds4-server",
args: [
"--model",
"<DS4_DIR>/ds4flash.gguf",
"--host",
"127.0.0.1",
"--port",
"18000",
"--ctx",
"32768",
"--tokens",
"128",
],
cwd: "<DS4_DIR>",
healthUrl: "http://127.0.0.1:18000/v1/models",
readyTimeoutMs: 300000,
idleStopMs: 0,
},
models: [
{
id: "deepseek-v4-flash",
name: "DeepSeek V4 Flash (ds4)",
reasoning: true,
input: ["text"],
cost: { input: 0, output: 0, cacheRead: 0, cacheWrite: 0 },
contextWindow: 32768,
maxTokens: 128,
compat: {
supportsUsageInStreaming: true,
supportsReasoningEffort: true,
maxTokensField: "max_tokens",
supportsStrictMode: false,
thinkingFormat: "deepseek",
supportedReasoningEfforts: ["low", "medium", "high", "xhigh"],
},
},
],
},
},
},
}
command 必须是可执行文件的绝对路径。不会使用 Shell 查找和 ~ 展开。有关每个 localService 字段,请参阅 本地模型服务。
Think Max¶
ds4 仅在以下两个条件都为真时应用 Think Max:
ds4-server以--ctx 393216或更高值启动。- 请求使用
reasoning_effort: "max"(或等效的 ds4 effort 字段)。
如果你运行该大上下文,请同时更新服务器标志和 OpenClaw 模型元数据:
{
contextWindow: 393216,
maxTokens: 384000,
compat: {
supportsUsageInStreaming: true,
supportsReasoningEffort: true,
maxTokensField: "max_tokens",
supportsStrictMode: false,
thinkingFormat: "deepseek",
supportedReasoningEfforts: ["low", "medium", "high", "xhigh", "max"],
},
}
测试¶
直接 HTTP 检查,绕过 OpenClaw:
curl http://127.0.0.1:18000/v1/chat/completions \
-H 'content-type: application/json' \
-d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"Reply with exactly: ds4-ok"}],"max_tokens":16,"stream":false,"thinking":{"type":"disabled"}}'
OpenClaw 模型路由(与快速入门检查相同):
openclaw infer model run \
--local \
--model ds4/deepseek-v4-flash \
--thinking off \
--prompt "Reply with exactly: openclaw-ds4-ok" \
--json
完整的智能体和工具调用冒烟测试,上下文至少为 32768:
openclaw agent \
--local \
--session-id ds4-tool-smoke \
--model ds4/deepseek-v4-flash \
--thinking off \
--message "Use the shell command pwd once, then reply exactly: tool-ok <output>" \
--json \
--timeout 240
预期结果:
executionTrace.winnerProvider为ds4executionTrace.winnerModel为deepseek-v4-flashtoolSummary.calls至少为1finalAssistantVisibleText以tool-ok开头
故障排查¶
curl /v1/models 无法连接
ds4 未运行,或未绑定到 baseUrl 中的主机/端口。启动
ds4-server,然后重试:
500 提示词超出上下文
配置的 --ctx 对于 OpenClaw 回合来说太小。提高
ds4-server --ctx,然后更新 models.providers.ds4.models[].contextWindow
以匹配。带有工具的完整智能体回合所需的上下文远大于直接单条消息 curl 请求。
Think Max 未激活
仅当 --ctx 至少为 393216 且请求要求
reasoning_effort: "max" 时,ds4 才会使用 Think Max。较小的上下文会回退到高推理。
首次请求较慢
ds4 存在冷 Metal 驻留和模型预热阶段。当 OpenClaw 按需启动服务器时,设置
localService.readyTimeoutMs: 300000。
相关¶
在模型请求前按需启动本地模型服务器。
选择并操作本地模型后端。
配置提供商引用、身份验证和故障转移。
原生 DeepSeek 提供商行为和思考控制。
本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw