OpenAI 长上下文和实时模型矩阵
实时:OpenAI 长上下文¶
- 目标:验证在进程自有的隔离 Gateway 中执行精确模型的嵌入式 OpenClaw;跨越长上下文定价边界;观察一个一等 OpenAI Responses 压缩条目;并在下一个请求中证明不透明回放与前缀裁剪。
- 测试:
src/gateway/gateway-openai-long-context.live.test.ts - 启用:
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT=1 - 配置档:
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_PROFILE=full选择精确的openai/gpt-5.6-luna,总窗口为1050000,安全活动输入为922000,最大输出为128000,压缩阈值为700000。reduced以较小的预算走相同的传输和持久化路径。 - 指标:
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_METRICS=1输出各阶段计时和 token 观测数据。这些测量结果仅供参考,不构成通过/失败的延迟目标。 - 长输出:
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_OUTPUT=1要求一个介于 4000 到 8000 个输出 token 之间的确定性响应。 - 可选的原始读取工具压力测试:
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_TOOL_OUTPUT=1。它不属于默认配方,因为实际生效的工具面可能会使用 Code Mode,而不是暴露原始读取工具。
完整的 922000 输入预算配方:
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT=1 \
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_PROFILE=full \
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_METRICS=1 \
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_OUTPUT=1 \
node --import tsx scripts/test-live.mts --quiet src/gateway/gateway-openai-long-context.live.test.ts
缩减预算配方:
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT=1 \
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_PROFILE=reduced \
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_METRICS=1 \
OPENCLAW_LIVE_OPENAI_LONG_CONTEXT_OUTPUT=1 \
node --import tsx scripts/test-live.mts --quiet src/gateway/gateway-openai-long-context.live.test.ts
长上下文硬性验证条件¶
完整的嵌入式与原生配方是验证性运行,不是吞吐基准。除非以下运行时契约成立,否则它们将失败:
- 运行时和模型身份必须精确匹配:按请求使用嵌入式 OpenClaw 或原生 Codex,且两者都运行在
openai/gpt-5.6-luna上。 - 至少一个 provider 请求的输入 token 数超过
272000,并且每次调用都报告 priority 服务。 - 嵌入式 OpenClaw 必须接收并持久化一个一等加密的 Responses
compaction条目,在下一个请求中原样回放该不透明条目,并裁剪较早的输入前缀。加密内容绝不得出现在显示或诊断信息中。 - 原生 Codex 报告有效窗口为
875900,在未手动压缩的情况下超过700000的总范围阈值,并在下一轮自动压缩。 - 每个运行时都会生成一个介于 4000 到 8000 个输出 token 之间的确定性长响应,并在压缩和 Gateway 重启后保留一个持久标记。
压缩耗时、重启延迟、单轮延迟和整个测试套件总时长仅作为信息性指标输出。
有界压缩回放¶
有界回放用例仅在合成工具输出中放置一个验证标记,重新打开 SQLite 会话,并要求模型回忆起该标记。在运行任一用例之前,请配置相应的 provider API 密钥;明确的 provider 失败将被视为测试失败。
Anthropic 用例演练流式原生压缩,以及下一个请求的回放。其原生阈值最低为 50,000 个 token:
OPENCLAW_LIVE_TEST=1 ANTHROPIC_LIVE_TEST=1 \
node scripts/run-vitest.mjs --config test/vitest/vitest.live.config.ts \
src/agents/anthropic-transport-stream.live.test.ts \
-t 'replays streamed native compaction from SQLite'
OpenAI 用例通过受管 runner 以较小的配置上下文预算演练自动客户端摘要,然后回放其持久化的摘要:
OPENCLAW_LIVE_TEST=1 OPENCLAW_LIVE_OPENAI_COMPACTION=1 \
node scripts/run-vitest.mjs --config test/vitest/vitest.live.config.ts \
src/agents/sessions/agent-session.openai-compaction.live.test.ts \
-t 'automatically compacts tool history and resumes from its SQLite checkpoint'
Warning
完整模式会刻意跨越 OpenAI 的长上下文定价边界,并发出多次大型 API 调用。当输入 token 数超过 272000 时,整个请求的输入/缓存按 2× 计费,输出按 1.5× 计费;Fast/Priority 会再将该档位翻倍。只有在明确批准花费后才能使用完整模式。
全新 OpenAI API 密钥默认配方:
OPENCLAW_LIVE_GATEWAY_OPENAI_API_DEFAULT=1 \
OPENCLAW_LIVE_GATEWAY_PROVIDERS=openai \
OPENCLAW_LIVE_GATEWAY_THINKING=off \
pnpm test:live -- src/gateway/gateway-models.profiles.live.test.ts
此验证运行不设置 OPENCLAW_LIVE_GATEWAY_MODELS,通过新用户引导中的推理选择接缝解析模型,断言为 openai/gpt-6-astra,然后使用该解析出的模型执行一次真实的 gateway 回合。
GPT-5.6 嵌入式 OpenClaw 矩阵:
OPENCLAW_LIVE_GATEWAY_THINKING=ultra \
OPENCLAW_LIVE_GATEWAY_PROVIDERS=openai \
OPENCLAW_LIVE_GATEWAY_MODELS='openai/gpt-5.6-terra,openai/gpt-5.6-luna' \
pnpm test:live -- src/gateway/gateway-models.profiles.live.test.ts
Docker 说明:
- Docker 运行脚本位于
scripts/test-live-codex-harness-docker.sh。 - 它传递
OPENAI_API_KEY,如果存在则复制 Codex CLI 认证文件,将@openai/codex安装到可写的挂载 npm 前缀目录中,暂存源码树,然后仅运行 Codex-harness 实时测试。 - Docker 默认启用镜像、MCP/tool 和 Guardian 探测。当你需要更聚焦的调试运行时,请设置
OPENCLAW_LIVE_CODEX_HARNESS_IMAGE_PROBE=0、OPENCLAW_LIVE_CODEX_HARNESS_MCP_PROBE=0或OPENCLAW_LIVE_CODEX_HARNESS_GUARDIAN_PROBE=0。 - Docker 使用相同的显式 Codex 运行时配置,因此旧别名或 OpenClaw 回退无法掩盖 Codex harness 的回归。
- 矩阵目标在同一容器中按顺序运行。Docker 脚本会根据目标数量调整其默认的 35 分钟超时;任何外部 shell 或 CI 超时设置都必须允许相同的总时长。标准 CI 会将每个 GPT-5.6 目标放在独立的分片(shard)中运行。
推荐的实时测试配方¶
窄而明确的允许列表最快且最不容易出现不稳定:
- 单模型,直连(无网关):
-
OPENCLAW_LIVE_MODELS="openai/gpt-5.6-luna" pnpm test:live src/agents/models.profiles.live.test.ts -
小模型直连配置:
-
OPENCLAW_LIVE_MODELS=small pnpm test:live src/agents/models.profiles.live.test.ts -
小模型网关配置:
-
OPENCLAW_LIVE_GATEWAY_MODELS=small pnpm test:live src/gateway/gateway-models.profiles.live.test.ts -
Ollama Cloud API 冒烟测试:
-
OPENCLAW_LIVE_TEST=1 OPENCLAW_LIVE_OLLAMA=1 OPENCLAW_LIVE_OLLAMA_BASE_URL=https://ollama.com OPENCLAW_LIVE_OLLAMA_MODEL=glm-5.1:cloud OPENCLAW_LIVE_OLLAMA_WEB_SEARCH=0 pnpm test:live -- extensions/ollama/ollama.live.test.ts -
单模型,网关冒烟测试:
-
OPENCLAW_LIVE_GATEWAY_MODELS="openai/gpt-5.6-luna" pnpm test:live src/gateway/gateway-models.profiles.live.test.ts -
跨多个提供商的工具调用:
-
OPENCLAW_LIVE_GATEWAY_MODELS="openai/gpt-5.6-luna,anthropic/claude-opus-4-6,google/gemini-3.5-flash,deepseek/deepseek-v4-flash,zai/glm-5.1,minimax/MiniMax-M3" pnpm test:live src/gateway/gateway-models.profiles.live.test.ts -
Z.AI Coding Plan GLM-5.3 直连冒烟测试:
-
ZAI_CODING_LIVE_TEST=1 pnpm test:live src/agents/zai.live.test.ts -
Google 专项:
-
Gemini(API 密钥):
OPENCLAW_LIVE_GATEWAY_MODELS="google/gemini-3.5-flash" pnpm test:live src/gateway/gateway-models.profiles.live.test.ts -
Google 自适应思考冒烟测试(来自私有 QA CLI 的
qa manual- 需要OPENCLAW_ENABLE_PRIVATE_QA_CLI=1和源码检出;参见 QA 概览): - Gemini 3 动态默认:
OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 pnpm openclaw qa manual --provider-mode live-frontier --model google/gemini-3.1-pro-preview --alt-model google/gemini-3.1-pro-preview --message '/think adaptive Reply exactly: GEMINI_ADAPTIVE_OK' --timeout-ms 180000 - Gemini 2.5 动态预算:
OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 pnpm openclaw qa manual --provider-mode live-frontier --model google/gemini-2.5-flash --alt-model google/gemini-2.5-flash --message '/think adaptive Reply exactly: GEMINI25_ADAPTIVE_OK' --timeout-ms 180000
说明:
google/...使用 Gemini API(API 密钥)。google-gemini-cli/...使用你机器上的本地 Gemini CLI(独立认证 + 工具链差异)。google-antigravity/...不是已注册的提供商或受支持的配置路径。请勿将其添加到实时测试允许列表中。- Gemini API 与 Gemini CLI:
- API:OpenClaw 通过 HTTP 调用 Google 托管的 Gemini API(API 密钥 / 配置文件认证);这是大多数用户所说的“Gemini”。
- CLI:OpenClaw 会调用本地
gemini二进制文件;它有独立的认证,行为可能不同(流式/工具支持/版本偏差)。
实时测试:模型矩阵(覆盖范围)¶
实时测试是可选启用的,因此没有固定的“CI 模型列表”。OPENCLAW_LIVE_MODELS=modern / OPENCLAW_LIVE_GATEWAY_MODELS=modern(及其 all 别名)会运行 src/agents/test-helpers/live-model-dynamic-candidates.ts 中 HIGH_SIGNAL_LIVE_MODEL_PRIORITY 的精选优先级列表,优先级顺序如下:
| 提供商/模型 | 备注 |
|---|---|
anthropic/claude-opus-5-5 |
|
anthropic/claude-opus-5 |
|
anthropic/claude-opus-4-8 |
|
anthropic/claude-sonnet-5 |
|
anthropic/claude-sonnet-4-6 |
|
anthropic/claude-opus-4-7 |
|
google/gemini-3.1-pro-preview |
Gemini API |
google/gemini-3.5-flash |
Gemini API |
cohere/command-a-plus-05-2026 |
|
moonshot/kimi-k3 |
|
anthropic/claude-opus-4-6 |
|
deepseek/deepseek-v4-flash |
|
deepseek/deepseek-v4-pro |
|
minimax/MiniMax-M3 |
|
openai/gpt-5.6 |
|
openrouter/openai/gpt-5.2-chat |
|
openrouter/minimax/minimax-m2.7 |
|
opencode-go/glm-5 |
|
openrouter/ai21/jamba-large-1.7 |
|
xai/grok-4.7 |
|
xai/grok-4.6 |
|
xai/grok-4.5 |
|
xai/grok-4.20-0309-reasoning |
|
zai/glm-5.1 |
|
fireworks/accounts/fireworks/routers/glm-5p3-fast |
|
minimax-portal/minimax-m3 |
精选的 小模型 列表(OPENCLAW_LIVE_MODELS=small / OPENCLAW_LIVE_GATEWAY_MODELS=small),来自 SMALL_LIVE_MODEL_PRIORITY:
| 提供商/模型 |
|---|
lmstudio/qwen/qwen3.5-9b |
vllm/qwen/qwen3-8b |
sglang/qwen/qwen3-8b |
ollama/gemma3:4b |
openrouter/qwen/qwen3.5-9b |
openrouter/z-ai/glm-5.1 |
openrouter/z-ai/glm-5 |
zai/glm-5.1 |
关于 modern 列表的说明:
codex和codex-cli提供商被排除在默认 modern 扫描之外(它们覆盖 CLI 后端/ACP 行为,分别在 CLI 后端和 APNs 通道 和 ACP 绑定和 Codex app-server 通道 中单独测试)。openai/gpt-5.6本身默认通过 Codex app-server 测试框架路由;参见 实时:Codex app-server 测试框架冒烟测试。fireworks、google、openrouter和xai在 modern 扫描中仅运行其明确精选的模型 ID(不会自动扩展为“该提供商的所有模型”)。- 在
OPENCLAW_LIVE_GATEWAY_MODELS中至少包含一个支持图像处理的模型(Claude/Gemini/OpenAI 系列视觉变体等),以验证图像探测。
在手工挑选的跨提供商模型集合上运行带工具 + 图像能力的网关冒烟测试:
OPENCLAW_LIVE_GATEWAY_MODELS="openai/gpt-5.6-luna,anthropic/claude-opus-4-6,google/gemini-3.1-pro-preview,google/gemini-3.5-flash,deepseek/deepseek-v4-flash,zai/glm-5.1,minimax/MiniMax-M3" pnpm test:live src/gateway/gateway-models.profiles.live.test.ts
精选列表之外的可选额外覆盖范围(锦上添花,请选择一个你已启用的支持 “tools” 的模型):
- Mistral:
mistral/... - Cerebras:
cerebras/...(如果你有权访问) - LM Studio:
lmstudio/...(本地;工具调用取决于 API 模式)
聚合器 / 备用网关¶
如果你已启用密钥,也可以通过以下方式测试:
- OpenRouter:
openrouter/...(数百个模型;使用openclaw models scan查找支持工具 + 图像的候选模型) - OpenCode:Zen 使用
opencode/...,Go 使用opencode-go/...(通过OPENCODE_API_KEY/OPENCODE_ZEN_API_KEY进行身份验证)
如果你拥有凭据/配置,还可以将以下提供商纳入实时矩阵:
- 第一方提供商插件:
anthropic、cerebras、github-copilot、google、google-gemini-cli、google-vertex、groq、mistral、openai、openrouter、opencode、opencode-go、xai、zai - 通过
models.providers(自定义端点):minimax(云/API),以及任何兼容 OpenAI/Anthropic 的代理(LM Studio、vLLM、LiteLLM 等)
Tip
不要在文档中硬编码“所有模型”。权威列表是你机器上 discoverModels(...) 返回的内容,加上可用的密钥。
本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw