跳转至

NVIDIA

NVIDIA 通过兼容 OpenAI 的 API 免费提供开放模型,地址为 https://integrate.api.nvidia.com/v1,使用来自 build.nvidia.com 的 API 密钥进行身份验证。OpenClaw 默认将 NVIDIA 提供者设置为 Nemotron 3 Ultra,这是 NVIDIA 总参数量 550B / 激活参数量 55B 的推理模型,专为长上下文 agentic 工作设计。

开始入门

1. 获取你的 API 密钥

在 build.nvidia.com 创建一个 API 密钥。

2. 导出密钥并运行引导流程

export NVIDIA_API_KEY="nvapi-..."
openclaw onboard --auth-choice nvidia-api-key

3. 设置一个 NVIDIA 模型

openclaw models set nvidia/nvidia/nemotron-3-ultra-550b-a55b

对于非交互式设置,可直接传入密钥:

openclaw onboard --auth-choice nvidia-api-key --nvidia-api-key "nvapi-..."

Warning

--nvidia-api-key 会将密钥写入 shell 历史记录和 ps 输出中。尽可能优先使用 NVIDIA_API_KEY 环境变量。

配置示例

{
  env: { vars: { NVIDIA_API_KEY: "nvapi-..." } },
  models: {
    providers: {
      nvidia: {
        baseUrl: "https://integrate.api.nvidia.com/v1",
        api: "openai-completions",
      },
    },
  },
  agents: {
    defaults: {
      model: { primary: "nvidia/nvidia/nemotron-3-ultra-550b-a55b" },
    },
  },
}

实时模型目录

当配置了 NVIDIA API 密钥时,设置和模型选择流程会检查 https://integrate.api.nvidia.com/v1/models 以获取可用的模型 ID,结果缓存 30 秒。NVIDIA 公开的 https://assets.ngc.nvidia.com/products/api-catalog/featured-models.json 数据源提供排名和 token 限制,缓存 24 小时。特色模型仅在推理清单仍列出它们时才会优先显示;其他可用的捆绑聊天模型随后显示。新的清单可以恢复 NVIDIA 已重新发布的先前被隐藏的模型。

该清单还包含 embeddings 和其他非聊天端点,但没有任何能力元数据。因此,OpenClaw 只提供带有捆绑聊天元数据或有效特色模型元数据的精确模型;它不会根据模型名称猜测能力。未知 ID 仍然可以显式配置;仅凭清单列表并不能证明聊天兼容性。这并不是 NVIDIA 所有模型的完整自动目录。

这两次公开请求都使用固定的 HTTPS 主机,且不发送任何凭据。失败的清单或特色请求会将发现机制标记为不可用,并保留相同提供者配置和凭据下最后一次成功的目录。失败的特性元数据不会悄悄移除先前发现的模型。成功的空清单会清除已发现的模型,即使特色数据源请求失败。在没有 NVIDIA 认证的情况下,浏览会使用捆绑目录而不进行拉取。

Nemotron 3.5 Lightning

nvidia/nemotron-3.5-lightning-30b-a3b 是 NVIDIA 面向 agentic 工作的较小规模 30B 总参数量 / 3B 激活参数量的推理模型。捆绑行记录了其 1M 上下文和 16,384-token 输出预算,与 NVIDIA 托管示例一致。可通过以下命令选择它:

openclaw models set nvidia/nvidia/nemotron-3.5-lightning-30b-a3b

只要实时清单中列出了 Lightning,即使特色数据源中没有它,也可以选择。Nemotron 3 Ultra 仍是默认模型。

Nemotron 3 Ultra

Nemotron 3 Ultra 是 OpenClaw 中默认的 NVIDIA 模型。NVIDIA 的构建页面 nvidia/nemotron-3-ultra-550b-a55b 将其列为可用的免费端点,并带有 1M-token 上下文规格。

捆绑的 Ultra 行默认发送 chat_template_kwargs: { enable_thinking: false, force_nonempty_content: true },以便正常的聊天输出保留在可见答案中,而不是暴露推理文本。

如需 NVIDIA 默认模型中最高能力,请使用 Ultra。当你想要更小的 Nemotron 选项时,可选择 Nemotron 3.5 Lightning 或 Nemotron 3 Super;或者,当 NVIDIA 目录中托管的第三方模型的上下文、延迟或行为更合适时,也可选择其中一个。

捆绑的备用目录

捆绑行提供已知的聊天元数据和离线备用方案。已弃用的兼容性行保留现有精确模型引用以便识别,但不会出现在模型选择器中。

Model ref 名称 上下文 最大输出
nvidia/nvidia/nemotron-3-ultra-550b-a55b Nemotron 3 Ultra 550B 1,048,576 8,192
nvidia/nvidia/nemotron-3.5-lightning-30b-a3b Nemotron 3.5 Lightning 30B 1,048,576 16,384
nvidia/nvidia/nemotron-3-super-120b-a12b Nemotron 3 Super 120B 1,000,000 8,192
nvidia/z-ai/glm-5.2 GLM 5.2 202,752 8,192
nvidia/moonshotai/kimi-k2.6 Kimi K2.6 262,144 65,536
nvidia/minimaxai/minimax-m3 Minimax M3 196,608 8,192
nvidia/deepseek-ai/deepseek-v4-pro DeepSeek V4 Pro 262,144 16,384

完整的兼容性目录还保留了这些随附引用,供现有配置和迁移使用:nvidia/qwen/qwen3.5-397b-a17b、nvidia/moonshotai/kimi-k2.5、nvidia/z-ai/glm-5.1、nvidia/z-ai/glm5 和 nvidia/minimaxai/minimax-m2.7。除非 NVIDIA 在其推理清单中重新发布,否则这些引用将保持隐藏在捆绑和离线模型选择器中。NVIDIA 已退役 Qwen 端点,因此使用其模型引用的请求不再有效。请将现有的 Qwen 配置迁移到活跃模型。

高级配置

自动启用行为

当设置了 NVIDIA_API_KEY 环境变量,或在引导过程中存储了密钥时,提供者会自动启用。 除了密钥之外,无需显式提供者配置。

目录与定价

OpenClaw 使用 NVIDIA 的推理清单来确定可用性,并使用其 featured feed 进行排序。精确的捆绑元数据会保留 featured feed 中省略的推理和图像能力。已弃用的精确引用兼容性行在离线回退中保持隐藏;新的清单可以恢复 NVIDIA 已重新发布的模型。由于 NVIDIA 目前为所列模型提供免费 API 访问,源中的成本默认为 0。

OpenAI 兼容端点

OpenClaw 使用 openai-completions 适配器,针对标准 /v1 聊天补全路由与 NVIDIA 通信。任何 OpenAI 兼容工具都应能直接使用 NVIDIA 基础 URL 开箱即用。

Nemotron 3 Ultra 推理参数

NVIDIA 的 Ultra 示例请求使用 chat_template_kwargs.enable_thinking 和 reasoning_budget 用于推理输出。OpenClaw 捆绑的 Ultra 行默认禁用模板思考,适用于普通聊天场景。如果需要启用 NVIDIA 推理输出或强制设置其他 NVIDIA 特定请求字段,请设置按模型参数,并将提供商特定覆盖限定到 NVIDIA 模型:

{
  agents: {
    defaults: {
      models: {
        "nvidia/nvidia/nemotron-3-ultra-550b-a55b": {
          params: {
            chat_template_kwargs: { enable_thinking: true },
            extra_body: { reasoning_budget: 16384 },
          },
        },
      },
    },
  },
}

params.chat_template_kwargs 会合并到请求中已有的任何 chat_template_kwargs,而不是替换整个对象。 params.extra_body 是最终的 OpenAI 兼容请求体覆盖,会覆盖冲突的 payload 键,因此仅用于 NVIDIA 为所选端点记录的字段。

自定义提供商响应缓慢

某些 NVIDIA 托管的自定义模型在发出第一个响应块之前,可能需要超过默认约 120 秒的模型空闲看门狗时间。对于自定义 NVIDIA 提供商条目,请提高提供商超时,而不是整个代理运行时超时;timeoutSeconds 覆盖提供商 HTTP 请求,并提高该提供商的空闲/流式看门狗上限。下面的提供商 id(custom-integrate-api-nvidia-com)是你选择的一个名称,而不是保留值;只要模型引用使用相同的前缀,任何 id 都可以:

{
  models: {
    providers: {
      "custom-integrate-api-nvidia-com": {
        baseUrl: "https://integrate.api.nvidia.com/v1",
        api: "openai-completions",
        apiKey: "NVIDIA_API_KEY",
        timeoutSeconds: 300,
      },
    },
  },
  agents: {
    defaults: {
      models: {
        "custom-integrate-api-nvidia-com/meta/llama-3.1-70b-instruct": {
          params: { thinking: "off" },
        },
      },
    },
  },
}

Tip

NVIDIA 模型目前可免费使用。请查看 build.nvidia.com 了解最新可用性和速率限制详情。

模型选择

选择提供商、模型引用和故障转移行为。

配置参考

代理、模型和提供商的完整配置参考。

本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw