跳转至

Benchmark 设计

我们如何知道 Agent 学会了实验,而不只是学会在一个固定世界里得高分?

ChemWorld 分开报告任务结果、约束、资源、适应和自主性,不把不同物理任务与交互层级压缩成一个普适智能分数。

评估单元

每个 campaign 是一个规范 Task × Scenario × Agent × Seed 单元。Task 提供稳定公开合同,World 提供隐藏因果规律,Scenario 把二者绑定到初始状态和干预条件,Seed 用于重建实例。

三种 Suite 角色

  • Confirmatory: 在两个指定公开任务合同上进行预注册 Agent 比较。
  • Diagnostic: 可辨识性、反馈使用、失败恢复、反事实和适应归因。
  • Showcase: 环境覆盖、教学、训练和方法开发,不自动产生排名声明。

六条报告轴

  1. 任务特定终点和实际效应阈值。
  2. 操作风险、合法性与失败次数。
  3. 实验、测量、样品与过程成本。
  4. 受控世界变化后的适应速度。
  5. 信息效率与不确定性降低。
  6. 方法资源:训练算力、环境步数、token、成本与延迟。

终点提升不能抵消未声明的风险或资源退化。

泛化轴并不等价

新 seed 测试实例随机性,参数外推测试范围变化,新机理家族测试因果适应,独立后端测试模拟器捷径,真实数据与物理系统测试桥接有效性。它们不能彼此替代。

信任链

submission → 轨迹校验 → 确定性回放
→ 指标重算 → 约束/资源审计 → 验证结果

正式比较应在运行确认集之前冻结版本和任务哈希、Agent 与 provider 身份、prompt 或策略配置、反馈条件、资源限制、seed、失败策略、排除规则、主要指标与不确定性分析。

当前公开状态

Public v0.4 引擎、校验、回放与有限资格证据已经可运行。仓库不包含已完成的跨方法 Agent 排名或机理适应排行榜。浏览器比较仅用于行为检查;单任务单 seed 结果不能升级为 Benchmark 声明。

继续阅读确认性任务证据与当前状态适用边界