一句话推荐:HarnessEval-W 是 MirroS 团队开源的世界模型评测系统,把固定指标升级为会规划、选择技能、调用工具、搜集证据并验证结论的 Agent 化评测流程。

HarnessEval-W 是什么?
传统 Benchmark 往往对所有案例套用同一组指标,而 HarnessEval-W 会先理解每个案例的初始世界、目标动作和评测意图,再选择真正适用的评测技能,把抽象问题拆成可验证的子问题。
它如何完成一次评测?
- 案例级路由:根据案例上下文选择适用 Skill,并记录跳过其他检查的理由。
- 子智能体诊断:把目标定位、状态变化、物理合理性、时序一致性等问题交给专门 Agent 和工具。
- 证据验证与聚合:父级 Agent 检查证据是否足够,再生成分数和可审计的案例卡。
当前覆盖范围
2026 年 8 月公开版本提供 330 个评测案例、11 个专业评测 Skills、5940 条带完整推理轨迹的评分 rollout,并在 18 个代表性世界模型上构建排行榜。
三大评测维度
- 观测质量:画面是否具有感知一致性、结构合理性和视觉真实感。
- 状态转移正确性:指定动作是否作用于正确目标,并在正确时间产生预期变化。
- 世界持续性:长序列中的布局、对象状态、回访一致性与离屏演化是否可信。
适合谁使用?
适合世界模型、视频生成、机器人仿真和 Agent 评测研究者,也适合希望构建“分数 + 证据链”评测系统的算法团队。项目采用 Apache 2.0 许可证,可在遵守许可条件的前提下研究和扩展。
使用前注意
当前部署需要配置多个 Conda 环境、模型凭据和本地路径,主要面向具备 Python 与命令行经验的研究或工程用户。评测输出应结合人工抽检,不应把单一排行榜分数视为完整结论。






