节点本地推理
节点本地推理¶
智能体可以将一个短任务委托给配对桌面或服务器节点上的 Ollama 模型。prompt 和响应通过现有的已认证 Gateway/节点连接传输;请求在节点自身的回环 Ollama 端点(http://127.0.0.1:11434)上运行。
1. 在节点上启动 Ollama
2. 连接节点主机
在 Gateway 主机上批准该设备及其节点命令,然后验证:
openclaw devices list
openclaw devices approve <deviceRequestId>
openclaw nodes pending
openclaw nodes approve <nodeRequestId>
openclaw nodes status --connected
首次连接,或添加 Ollama 命令的升级,可能会触发节点命令批准。如果节点连接时未通告 ollama.models 和 ollama.chat,请再次检查 openclaw nodes pending。
3. 从智能体中使用它
内置的 Ollama 插件公开了 node_inference 工具。智能体先调用 action: "discover",然后使用来自该结果的节点和模型调用 action: "run"(当恰好连接了一个具备能力的节点时,run 可以省略节点)。例如:“发现我节点上的 Ollama 模型,然后使用加载最快的模型来总结这段文本。”
发现会读取 /api/tags,检查 /api/show 能力,并在可用时使用 /api/ps 将已加载模型排在前面。它只返回 Ollama 报告为支持聊天(completion 能力)的本地模型——Ollama Cloud 条目和仅嵌入模型会被排除。每次运行都会禁用模型思考,并将输出默认限制为 512 个 token(硬上限 8192),除非工具调用请求了不同的 maxTokens;某些模型(例如 GPT-OSS)不支持禁用思考,并且可能仍会输出推理 token。
要在节点上保持 Ollama 运行而不向智能体暴露它:
重启节点(openclaw node restart,或对于前台会话停止/重新运行 openclaw node run)。节点将停止通告 ollama.models 和 ollama.chat;Ollama 本身和 Gateway 的 Ollama 提供者不受影响。将值改回 true 并重启以重新启用;重新连接后,更改的命令面可能再次需要 openclaw nodes pending 批准。
直接验证节点命令,无需智能体轮次:
openclaw nodes invoke \
--node "Local inference" \
--command ollama.models \
--params '{}' \
--invoke-timeout 90000 \
--timeout 100000
openclaw nodes invoke \
--node "Local inference" \
--command ollama.chat \
--params '{"model":"qwen3:0.6b","prompt":"Reply with exactly: pong","maxTokens":32,"timeoutMs":120000}' \
--invoke-timeout 130000 \
--timeout 140000
--invoke-timeout 限定节点运行命令的最长时间;--timeout 限定整体 Gateway 调用,并且应该更大。
节点本地推理始终使用节点自身的回环端点——它不会复用已配置的远程/云端 models.providers.ollama.baseUrl。节点命令在 macOS、Linux 和 Windows 节点主机上默认可用,并且仍受正常节点配对/命令策略约束。
本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw