跳转至

个人智能体基准测试包

Personal Agent Benchmark Pack 是一个基于仓库的小型 QA 场景包,用于本地个人助理工作流。它不是通用的模型基准测试,也不需要新的运行器:它复用了私有 QA 技术栈(QA 概述)、合成 QA 通道,以及现有的 qa/scenarios YAML 目录。

场景

十个场景,定义在 qa/scenarios/personal/*.yaml 中:

场景 ID 检查项
personal-reminder-roundtrip 通过本地 cron 投递模拟个人提醒
personal-channel-thread-reply 通过 qa-channel 模拟 DM 和线程回复路由
personal-memory-preference-recall 从临时 QA 工作区记忆文件中模拟偏好回忆
personal-redaction-no-secret-leak 模拟秘密不回显检查
personal-tool-safety-followthrough 在简短审批式回合后进行基于读取的安全工具跟进
personal-approval-denial-stop 针对敏感本地读取请求的审批拒绝停止行为
personal-task-followthrough-status 基于证据的任务状态报告,保持待处理、阻塞和已完成状态分离
personal-share-safe-diagnostics-artifact 可安全共享的诊断产物,保留有用状态的同时省略原始个人内容
personal-no-fake-progress 基于证据的完成声明,在本地证据存在之前避免虚假进度
personal-failure-recovery 报告部分状态并保持重试边界清晰的故障恢复

机器可读的 personal-agent 配置文件位于根目录 taxonomy.yaml 中,以语义覆盖 ID 的形式存在。QA Lab 从目录中解析每个主要所有者;不存在第二个场景 ID 列表。

运行该基准包需要 OpenClaw 仓库的源码检出 — pnpm openclaw 是工作区脚本,而非发布的 CLI — 以及 OPENCLAW_ENABLE_PRIVATE_QA_CLI=1,该环境变量用于暴露私有 qa 命令组。运行方式如下:

OPENCLAW_ENABLE_PRIVATE_QA_CLI=1 pnpm openclaw qa run \
  --qa-profile personal-agent \
  --provider-mode mock-openai \
  --concurrency 1

使用重复的 --scenario 标志来缩小配置文件范围。场景文件和 taxonomy 的顺序不影响成员关系或执行顺序。

该基准包以 qa-channel 为目标,使用 mock-openai 或其他本地 QA 提供商通道。不要将其指向实时聊天服务或真实的个人账户。

隐私模型

场景仅使用模拟用户、模拟偏好、模拟秘密,以及测试套件创建的临时 QA 网关工作区。它们不得读取或写入真实的 OpenClaw 用户记忆、会话、凭据、启动代理、全局配置或实时网关状态。

产物保留在现有 QA 套件产物目录下,并被视为测试输出。脱敏检查使用模拟标记,因此失败时可以安全地检查并提交到 issue 中。

扩展该基准包

在 qa/scenarios/personal/ 下添加新的 .yaml 用例,声明它们所验证的确切主要覆盖 ID,并在该语义 ID 属于此基准测试范围时将其添加到 taxonomy 配置文件中。保持每个用例小巧、本地化、在 mock-openai 中具有确定性,并聚焦于单一的个人助理行为。

良好的后续候选:脱敏后的轨迹导出检查、纯本地插件工作流检查。

在场景目录拥有足够多的稳定用例来支撑新增这些组件之前,避免添加新的运行器、插件、依赖、实时传输或模型评判器。

  • QA 通道 — 这些场景运行的合成通道
  • QA 概述 — 更广泛的 QA 技术栈和场景编写

本页原文 Markdown:在 AtomGit 查看·内容源自开源项目 cl/openclaw