查询模式、提示词和模型
Query modes¶
config.queryMode 控制阻塞式子代理能看到多少对话内容。选择仍能良好回答后续问题的最小模式;随着上下文规模增大,将 timeoutMs 从 message 到 recent 再到 full 逐步调大。
仅发送最新的用户消息。
当你想要最快的行为、对稳定偏好召回有最强偏向,并且后续轮次不需要对话上下文时使用。config.timeoutMs 从约 3000-5000 ms 开始。
最新的用户消息加上一小段最近的对话尾部。
在速度与对话支撑之间取得平衡时使用,适用于后续问题通常依赖最近几轮对话的情况。从约 15000 ms 开始。
Prompt styles¶
config.promptStyle 控制子代理在返回记忆时的积极或严格程度:
| Style | Behavior |
|---|---|
balanced |
通用默认,适用于 recent 模式 |
strict |
最不积极;尽量减少邻近上下文的渗入 |
contextual |
最有利于连续性;对话历史更重要 |
recall-heavy |
在较模糊但仍合理匹配时也会返回记忆 |
precision-heavy |
除非匹配明显,否则强烈倾向于返回 NONE |
preference-only |
针对收藏、习惯、日常流程、品味、重复性个人事实进行优化 |
当 config.promptStyle 未设置时的默认映射:
显式设置 config.promptStyle 始终会覆盖该映射。
Model fallback policy¶
如果 config.model 未设置,active memory 将按以下顺序解析模型:
explicit plugin model (config.model)
-> current session model
-> agent primary model
-> optional configured fallback model (config.modelFallback)
如果该链中没有任何一项能够解析,active memory 将跳过该轮的召回。config.modelFallbackPolicy 是保留给旧配置的兼容字段,已在 v2026.4.12 中弃用;它不再改变运行时行为——modelFallback 严格来说是上述链中的最后手段,而不是在解析到的模型出错时切换到另一个模型的运行时故障转移机制。
Speed recommendations¶
保持 config.model 未设置(继承当前会话模型)是最安全的默认选择:它会遵循你现有的提供商、认证和模型偏好。为降低延迟,可以改用专用的快速模型——召回质量固然重要,但在这里延迟比主回答路径更重要,而且工具面很窄(仅有记忆召回工具)。
良好的快速模型选项:
cerebras/gpt-oss-120b,一个专用的低延迟召回模型google/gemini-3-flash,无需更改你的主要聊天模型即可使用的低延迟后备选项- 保持
config.model未设置,使用你的常规会话模型
Cerebras setup¶
{
models: {
providers: {
cerebras: {
baseUrl: "https://api.cerebras.ai/v1",
apiKey: "${CEREBRAS_API_KEY}",
api: "openai-completions",
models: [{ id: "gpt-oss-120b", name: "GPT OSS 120B (Cerebras)" }],
},
},
},
plugins: {
entries: {
"active-memory": {
enabled: true,
config: { model: "cerebras/gpt-oss-120b" },
},
},
},
}
请确认 Cerebras API 密钥对所选择的模型具有 chat/completions 访问权限——仅有 /v1/models 可见性并不能保证这一点。
本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw