实验智能¶
回答化学问题,并不等于完成一次实验。
实验智能把知识转化为可证伪行动。Agent 必须判断尚未知晓的部分,选择能够消除不确定性的操作或测量,在证据不一致时修正解释,并在安全、成本与时间约束下继续推进。
六种能力¶
| 能力 | 在 ChemWorld 中的操作含义 |
|---|---|
| 观测 | 区分测得的公开证据与评测者持有的隐藏状态 |
| 假设 | 保留暂时解释,但不把它当作真值 |
| 设计 | 选择能够区分竞争解释的干预 |
| 操作 | 通过合法动作控制物料、装置与仪器 |
| 更新 | 获得新证据后改变信念和后续行动 |
| 约束 | 权衡结果、风险、成本、时间与样品使用 |
测量本身是动作¶
调用仪器不是免费读取隐藏状态。它可能消耗时间、金钱或样品,并且只释放任务合同允许的通道。好的策略因此不会问“我能测什么”,而会问“哪项观测会改变我的下一步决定”。
失败也是实验的一部分¶
ChemWorld 记录前置条件无效、测量无信息、提案被拒绝以及生命周期未闭合等情况。无效动作不改变状态,也不消耗任务预算。识别问题、选择纠正步骤并避免重复,是可观测的恢复能力。
三层机理证据¶
- 声明: Agent 表达对机理或变化的信念。
- 预测: 该信念能够预测尚未执行的干预。
- 可行动: 它改变下一次实验,并在固定预算下改善恢复或 regret。
这三层不应被压缩为一个标签准确率。Public v0.4 提供了设计此类研究所需的交互基座和受控 fork 证据,但不声称已经完成机理理解排名。
两个尺度的记忆¶
- 单次实验内: 已加入的物料、经历的条件、测量与失败。
- 多次实验间: 已测试配方、结果、假设与剩余 campaign 资源。
实验能力不是第一次就猜对,而是在猜错之后知道该测量什么。
下一步:因果世界 · Agent Tracks · Benchmark 设计