Agent Observatory¶
Agent Observatory 是 chemworld lab 内置的、无需 Provider 的策略观测台。它用来理解 Agent
如何通过 ChemWorld 的公开合同采取行动,不展示私有推理,也不把一次运行包装成 leaderboard
结论。
打开公网 Agent Observatory 打开 Student Lab
免费预览实例闲置后可能需要短暂唤醒。如需私有本地实例:
chemworld lab
打开 http://127.0.0.1:8876/agent/。相邻的 /student/ 仍是手动实验台。
接入了什么¶
浏览器直接启动正式的 run_agent() 执行路径。策略收到的公开决策上下文与 CLI 运行一致,所有
请求也经过同一套动作校验和事务环境。首批目录包含确定性参考与回放策略、带 seed 的实验设计和
搜索基线,以及带安全约束的贝叶斯优化;这些入口均不调用在线模型。
观测台不会替 Agent 编造理由。它只显示 Agent 实际提交的结构化 trace,以及 runner 独立生成的 decision audit。
运行控制和回放¶
- 单步只放行一个动作,并在下一个公开步骤边界暂停。
- 连续运行执行到任务终止;暂停在步骤边界生效。
- 时间线可回看每个已提交或被拒绝的动作,不会重新运行环境。
- 下载 JSON导出观测台的公开投影;正式回放验证和评测应使用 CLI 生成的 JSONL artifact。
为保证页面响应速度,谱图会抽样绘制。数据来自环境返回的公开仪器信号,不会重建隐藏化学状态。
探索性策略对比¶
对比面板可让 2–4 个本地策略在完全相同的任务和 seed 上运行,并展示终点得分、成本、安全风险 和步数。单 seed 对比适合调试行为,但不能证明某策略普遍更优。正式比较仍需固定任务版本、策略 版本、seed 组、方法资源上限和评测协议。
为什么在线 Provider 不是一键按钮¶
ChemWorld 已支持自定义 Python Agent,以及可选的 DeepSeek 和 Codex adapter。在线运行涉及 凭据、模型身份、prompt 合同、重试策略和资源上限,因此保留在显式 Python API 中。接入方式见 接入 Agent。
本地网页服务只绑定 loopback,不会向外部服务发送数据。托管预览运行相同的 provider-free 目录,并显式启用容量、过期、并发和限流边界。两种模式的运行都只保存在内存中。