为什么是 ChemWorld¶
ChemWorld 为实验智能提供一套属于它自己的世界引擎。
许多科学 Benchmark 要求模型从固定输入中检索、预测或解释。真实实验不同:证据并不完整,测量会消耗资源,操作可能失败,而下一步是否有价值取决于刚刚发生的事情。
ChemWorld 把这种交互变成一等研究对象。Agent 获得公开任务合同和部分可观测实验室,必须选择操作与仪器、遵守资源和前置条件、解释公开信号、在方案失败后恢复,并主动闭合实验。
缺失的中间层¶
| 知识 Benchmark | ChemWorld | 真实实验室 |
|---|---|---|
| 证据已经给出 | Agent 必须主动获取证据 | 通过真实设备获取证据 |
| 对一次回答评分 | 审计完整轨迹 | 流程和测量承担真实风险 |
| 世界规则通常固定 | 可通过受控 fork 改变隐藏规则 | 物理规律固定,但系统与设备不同 |
ChemWorld 位于二者之间:它足够丰富,可以研究实验决策;又足够确定、可检查,可以精确回放。
核心研究路线¶
- 世界: 在稳定公开接口后组合有边界的化工过程模型。
- 交互: 显式表示测量、失败、资源与生命周期选择。
- Agent: 比较策略如何获取证据和适应,而不只比较终点。
- 评估: 分开报告结果、约束、资源、适应与自主性。
- 桥接: 通过独立后端、数据集和狭窄且获批的物理系统检验迁移。
什么才算成功¶
目标不是会背诵化学知识的聊天机器人,也不是普适数值模拟器;而是一套可审计环境,让实验能力可以被测量:选择信息量高的干预、根据证据更新、从失败中恢复,并在旧的局部模型失效时适应。
Public v0.4 边界¶
Public v0.4 提供 15 个有类型任务、通过资格测试的世界组合、provider-free 交互 Agent、单规律受控 fork、精确回放和一条完整净化 Agent 生命周期。它不发布跨方法 Agent 排名、私有确认集、普适化学保真度声明或真实实验室迁移结果。