跳转至

为什么是 ChemWorld

ChemWorld 为实验智能提供一套属于它自己的世界引擎。

许多科学 Benchmark 要求模型从固定输入中检索、预测或解释。真实实验不同:证据并不完整,测量会消耗资源,操作可能失败,而下一步是否有价值取决于刚刚发生的事情。

ChemWorld 把这种交互变成一等研究对象。Agent 获得公开任务合同和部分可观测实验室,必须选择操作与仪器、遵守资源和前置条件、解释公开信号、在方案失败后恢复,并主动闭合实验。

缺失的中间层

知识 Benchmark ChemWorld 真实实验室
证据已经给出 Agent 必须主动获取证据 通过真实设备获取证据
对一次回答评分 审计完整轨迹 流程和测量承担真实风险
世界规则通常固定 可通过受控 fork 改变隐藏规则 物理规律固定,但系统与设备不同

ChemWorld 位于二者之间:它足够丰富,可以研究实验决策;又足够确定、可检查,可以精确回放。

核心研究路线

  1. 世界: 在稳定公开接口后组合有边界的化工过程模型。
  2. 交互: 显式表示测量、失败、资源与生命周期选择。
  3. Agent: 比较策略如何获取证据和适应,而不只比较终点。
  4. 评估: 分开报告结果、约束、资源、适应与自主性。
  5. 桥接: 通过独立后端、数据集和狭窄且获批的物理系统检验迁移。

什么才算成功

目标不是会背诵化学知识的聊天机器人,也不是普适数值模拟器;而是一套可审计环境,让实验能力可以被测量:选择信息量高的干预、根据证据更新、从失败中恢复,并在旧的局部模型失效时适应。

Public v0.4 边界

Public v0.4 提供 15 个有类型任务、通过资格测试的世界组合、provider-free 交互 Agent、单规律受控 fork、精确回放和一条完整净化 Agent 生命周期。它发布跨方法 Agent 排名、私有确认集、普适化学保真度声明或真实实验室迁移结果。

继续阅读实验智能因果世界系统模型