跳转至

OpenAI 长上下文和实时模型矩阵

实时:OpenAI 长上下文

  • 目标:验证在进程自有的隔离 Gateway 中执行精确模型的嵌入式 OpenClaw;跨越长上下文定价边界;观察一个一等 OpenAI Responses 压缩条目;并在下一个请求中证明不透明回放与前缀裁剪。
  • 测试:src/gateway/gateway-openai-long-context.live.test.ts
  • 启用:OPENCLAW_LIVE_OPENAI_LONG_CONTEXT=1
  • 配置档:OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_PROFILE=full 选择精确的 openai/gpt-5.6-luna,总窗口为 1050000,安全活动输入为 922000,最大输出为 128000,压缩阈值为 700000。reduced 以较小的预算走相同的传输和持久化路径。
  • 指标:OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_METRICS=1 输出各阶段计时和 token 观测数据。这些测量结果仅供参考,不构成通过/失败的延迟目标。
  • 长输出:OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_OUTPUT=1 要求一个介于 4000 到 8000 个输出 token 之间的确定性响应。
  • 可选的原始读取工具压力测试: OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_TOOL_OUTPUT=1。它不属于默认配方,因为实际生效的工具面可能会使用 Code Mode,而不是暴露原始读取工具。

完整的 922000 输入预算配方:

OPENCLAW_LIVE_OPENAI_LONG_CONTEXT=1 \
  OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_PROFILE=full \
  OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_METRICS=1 \
  OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_OUTPUT=1 \
  node --import tsx scripts/test-live.mts --quiet src/gateway/gateway-openai-long-context.live.test.ts

缩减预算配方:

OPENCLAW_LIVE_OPENAI_LONG_CONTEXT=1 \
  OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_PROFILE=reduced \
  OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_METRICS=1 \
  OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_OUTPUT=1 \
  node --import tsx scripts/test-live.mts --quiet src/gateway/gateway-openai-long-context.live.test.ts

长上下文硬性验证条件

完整的嵌入式与原生配方是验证性运行,不是吞吐基准。除非以下运行时契约成立,否则它们将失败:

  • 运行时和模型身份必须精确匹配:按请求使用嵌入式 OpenClaw 或原生 Codex,且两者都运行在 openai/gpt-5.6-luna 上。
  • 至少一个 provider 请求的输入 token 数超过 272000,并且每次调用都报告 priority 服务。
  • 嵌入式 OpenClaw 必须接收并持久化一个一等加密的 Responses compaction 条目,在下一个请求中原样回放该不透明条目,并裁剪较早的输入前缀。加密内容绝不得出现在显示或诊断信息中。
  • 原生 Codex 报告有效窗口为 875900,在未手动压缩的情况下超过 700000 的总范围阈值,并在下一轮自动压缩。
  • 每个运行时都会生成一个介于 4000 到 8000 个输出 token 之间的确定性长响应,并在压缩和 Gateway 重启后保留一个持久标记。

压缩耗时、重启延迟、单轮延迟和整个测试套件总时长仅作为信息性指标输出。

有界压缩回放

有界回放用例仅在合成工具输出中放置一个验证标记,重新打开 SQLite 会话,并要求模型回忆起该标记。在运行任一用例之前,请配置相应的 provider API 密钥;明确的 provider 失败将被视为测试失败。

Anthropic 用例演练流式原生压缩,以及下一个请求的回放。其原生阈值最低为 50,000 个 token:

OPENCLAW_LIVE_TEST=1 ANTHROPIC_LIVE_TEST=1 \
  node scripts/run-vitest.mjs --config test/vitest/vitest.live.config.ts \
  src/agents/anthropic-transport-stream.live.test.ts \
  -t 'replays streamed native compaction from SQLite'

OpenAI 用例通过受管 runner 以较小的配置上下文预算演练自动客户端摘要,然后回放其持久化的摘要:

OPENCLAW_LIVE_TEST=1 OPENCLAW_LIVE_OPENAI_COMPACTION=1 \
  node scripts/run-vitest.mjs --config test/vitest/vitest.live.config.ts \
  src/agents/sessions/agent-session.openai-compaction.live.test.ts \
  -t 'automatically compacts tool history and resumes from its SQLite checkpoint'

Warning

完整模式会刻意跨越 OpenAI 的长上下文定价边界,并发出多次大型 API 调用。当输入 token 数超过 272000 时,整个请求的输入/缓存按 2× 计费,输出按 1.5× 计费;Fast/Priority 会再将该档位翻倍。只有在明确批准花费后才能使用完整模式。

全新 OpenAI API 密钥默认配方:

OPENCLAW_LIVE_GATEWAY_OPENAI_API_DEFAULT=1 \
  OPENCLAW_LIVE_GATEWAY_PROVIDERS=openai \
  OPENCLAW_LIVE_GATEWAY_THINKING=off \
  pnpm test:live -- src/gateway/gateway-models.profiles.live.test.ts

此验证运行不设置 OPENCLAW_LIVE_GATEWAY_MODELS,通过新用户引导中的推理选择接缝解析模型,断言为 openai/gpt-6-astra,然后使用该解析出的模型执行一次真实的 gateway 回合。

GPT-5.6 嵌入式 OpenClaw 矩阵:

OPENCLAW_LIVE_GATEWAY_THINKING=ultra \
  OPENCLAW_LIVE_GATEWAY_PROVIDERS=openai \
  OPENCLAW_LIVE_GATEWAY_MODELS='openai/gpt-5.6-terra,openai/gpt-5.6-luna' \
  pnpm test:live -- src/gateway/gateway-models.profiles.live.test.ts

Docker 说明:

  • Docker 运行脚本位于 scripts/test-live-codex-harness-docker.sh。
  • 它传递 OPENAI_API_KEY,如果存在则复制 Codex CLI 认证文件,将 @openai/codex 安装到可写的挂载 npm 前缀目录中,暂存源码树,然后仅运行 Codex-harness 实时测试。
  • Docker 默认启用镜像、MCP/tool 和 Guardian 探测。当你需要更聚焦的调试运行时,请设置 OPENCLAW_LIVE_CODEX_HARNESS_IMAGE_PROBE=0、OPENCLAW_LIVE_CODEX_HARNESS_MCP_PROBE=0 或 OPENCLAW_LIVE_CODEX_HARNESS_GUARDIAN_PROBE=0。
  • Docker 使用相同的显式 Codex 运行时配置,因此旧别名或 OpenClaw 回退无法掩盖 Codex harness 的回归。
  • 矩阵目标在同一容器中按顺序运行。Docker 脚本会根据目标数量调整其默认的 35 分钟超时;任何外部 shell 或 CI 超时设置都必须允许相同的总时长。标准 CI 会将每个 GPT-5.6 目标放在独立的分片(shard)中运行。

窄而明确的允许列表最快且最不容易出现不稳定:

  • 单模型,直连(无网关):
  • OPENCLAW_LIVE_MODELS="openai/gpt-5.6-luna" pnpm test:live src/agents/models.profiles.live.test.ts

  • 小模型直连配置:

  • OPENCLAW_LIVE_MODELS=small pnpm test:live src/agents/models.profiles.live.test.ts

  • 小模型网关配置:

  • OPENCLAW_LIVE_GATEWAY_MODELS=small pnpm test:live src/gateway/gateway-models.profiles.live.test.ts

  • Ollama Cloud API 冒烟测试:

  • OPENCLAW_LIVE_TEST=1 OPENCLAW_LIVE_OLLAMA=1 OPENCLAW_LIVE_OLLAMA_BASE_URL=https://ollama.com OPENCLAW_LIVE_OLLAMA_MODEL=glm-5.1:cloud OPENCLAW_LIVE_OLLAMA_WEB_SEARCH=0 pnpm test:live -- extensions/ollama/ollama.live.test.ts

  • 单模型,网关冒烟测试:

  • OPENCLAW_LIVE_GATEWAY_MODELS="openai/gpt-5.6-luna" pnpm test:live src/gateway/gateway-models.profiles.live.test.ts

  • 跨多个提供商的工具调用:

  • OPENCLAW_LIVE_GATEWAY_MODELS="openai/gpt-5.6-luna,anthropic/claude-opus-4-6,google/gemini-3.5-flash,deepseek/deepseek-v4-flash,zai/glm-5.1,minimax/MiniMax-M3" pnpm test:live src/gateway/gateway-models.profiles.live.test.ts

  • Z.AI Coding Plan GLM-5.3 直连冒烟测试:

  • ZAI_CODING_LIVE_TEST=1 pnpm test:live src/agents/zai.live.test.ts

  • Google 专项:

  • Gemini(API 密钥):OPENCLAW_LIVE_GATEWAY_MODELS="google/gemini-3.5-flash" pnpm test:live src/gateway/gateway-models.profiles.live.test.ts

  • Google 自适应思考冒烟测试(来自私有 QA CLI 的 qa manual - 需要 OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 和源码检出;参见 QA 概览):

  • Gemini 3 动态默认:OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 pnpm openclaw qa manual --provider-mode live-frontier --model google/gemini-3.1-pro-preview --alt-model google/gemini-3.1-pro-preview --message '/think adaptive Reply exactly: GEMINI_ADAPTIVE_OK' --timeout-ms 180000
  • Gemini 2.5 动态预算:OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 pnpm openclaw qa manual --provider-mode live-frontier --model google/gemini-2.5-flash --alt-model google/gemini-2.5-flash --message '/think adaptive Reply exactly: GEMINI25_ADAPTIVE_OK' --timeout-ms 180000

说明:

  • google/... 使用 Gemini API(API 密钥)。
  • google-gemini-cli/... 使用你机器上的本地 Gemini CLI(独立认证 + 工具链差异)。
  • google-antigravity/... 不是已注册的提供商或受支持的配置路径。请勿将其添加到实时测试允许列表中。
  • Gemini API 与 Gemini CLI:
  • API:OpenClaw 通过 HTTP 调用 Google 托管的 Gemini API(API 密钥 / 配置文件认证);这是大多数用户所说的“Gemini”。
  • CLI:OpenClaw 会调用本地 gemini 二进制文件;它有独立的认证,行为可能不同(流式/工具支持/版本偏差)。

实时测试:模型矩阵(覆盖范围)

实时测试是可选启用的,因此没有固定的“CI 模型列表”。OPENCLAW_LIVE_MODELS=modern / OPENCLAW_LIVE_GATEWAY_MODELS=modern(及其 all 别名)会运行 src/agents/test-helpers/live-model-dynamic-candidates.ts 中 HIGH_SIGNAL_LIVE_MODEL_PRIORITY 的精选优先级列表,优先级顺序如下:

提供商/模型 备注
anthropic/claude-opus-5-5
anthropic/claude-opus-5
anthropic/claude-opus-4-8
anthropic/claude-sonnet-5
anthropic/claude-sonnet-4-6
anthropic/claude-opus-4-7
google/gemini-3.1-pro-preview Gemini API
google/gemini-3.5-flash Gemini API
cohere/command-a-plus-05-2026
moonshot/kimi-k3
anthropic/claude-opus-4-6
deepseek/deepseek-v4-flash
deepseek/deepseek-v4-pro
minimax/MiniMax-M3
openai/gpt-5.6
openrouter/openai/gpt-5.2-chat
openrouter/minimax/minimax-m2.7
opencode-go/glm-5
openrouter/ai21/jamba-large-1.7
xai/grok-4.7
xai/grok-4.6
xai/grok-4.5
xai/grok-4.20-0309-reasoning
zai/glm-5.1
fireworks/accounts/fireworks/routers/glm-5p3-fast
minimax-portal/minimax-m3

精选的 小模型 列表(OPENCLAW_LIVE_MODELS=small / OPENCLAW_LIVE_GATEWAY_MODELS=small),来自 SMALL_LIVE_MODEL_PRIORITY:

提供商/模型
lmstudio/qwen/qwen3.5-9b
vllm/qwen/qwen3-8b
sglang/qwen/qwen3-8b
ollama/gemma3:4b
openrouter/qwen/qwen3.5-9b
openrouter/z-ai/glm-5.1
openrouter/z-ai/glm-5
zai/glm-5.1

关于 modern 列表的说明:

  • codex 和 codex-cli 提供商被排除在默认 modern 扫描之外(它们覆盖 CLI 后端/ACP 行为,分别在 CLI 后端和 APNs 通道 和 ACP 绑定和 Codex app-server 通道 中单独测试)。openai/gpt-5.6 本身默认通过 Codex app-server 测试框架路由;参见 实时:Codex app-server 测试框架冒烟测试。
  • fireworks、google、openrouter 和 xai 在 modern 扫描中仅运行其明确精选的模型 ID(不会自动扩展为“该提供商的所有模型”)。
  • 在 OPENCLAW_LIVE_GATEWAY_MODELS 中至少包含一个支持图像处理的模型(Claude/Gemini/OpenAI 系列视觉变体等),以验证图像探测。

在手工挑选的跨提供商模型集合上运行带工具 + 图像能力的网关冒烟测试:

OPENCLAW_LIVE_GATEWAY_MODELS="openai/gpt-5.6-luna,anthropic/claude-opus-4-6,google/gemini-3.1-pro-preview,google/gemini-3.5-flash,deepseek/deepseek-v4-flash,zai/glm-5.1,minimax/MiniMax-M3" pnpm test:live src/gateway/gateway-models.profiles.live.test.ts

精选列表之外的可选额外覆盖范围(锦上添花,请选择一个你已启用的支持 “tools” 的模型):

  • Mistral:mistral/...
  • Cerebras:cerebras/...(如果你有权访问)
  • LM Studio:lmstudio/...(本地;工具调用取决于 API 模式)

聚合器 / 备用网关

如果你已启用密钥,也可以通过以下方式测试:

  • OpenRouter:openrouter/...(数百个模型;使用 openclaw models scan 查找支持工具 + 图像的候选模型)
  • OpenCode:Zen 使用 opencode/...,Go 使用 opencode-go/...(通过 OPENCODE_API_KEY / OPENCODE_ZEN_API_KEY 进行身份验证)

如果你拥有凭据/配置,还可以将以下提供商纳入实时矩阵:

  • 第一方提供商插件:anthropic、cerebras、github-copilot、google、google-gemini-cli、google-vertex、groq、mistral、openai、openrouter、opencode、opencode-go、xai、zai
  • 通过 models.providers(自定义端点):minimax(云/API),以及任何兼容 OpenAI/Anthropic 的代理(LM Studio、vLLM、LiteLLM 等)

Tip

不要在文档中硬编码“所有模型”。权威列表是你机器上 discoverModels(...) 返回的内容,加上可用的密钥。

本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw