### [HarnessEval-W – 把世界模型评测变成可追溯证据链的开源Agent基准](https://www.zuoshipin.com/) **Published:** 2026-08-24T03:00:58 **Author:** 天才交易员 **Excerpt:** HarnessEval-W以Agent化评测流程动态路由Skills、调用诊断工具并生成证据树,为世界模型提供… **一句话推荐:**HarnessEval-W 是 MirroS 团队开源的世界模型评测系统,把固定指标升级为会规划、选择技能、调用工具、搜集证据并验证结论的 Agent 化评测流程。 ![HarnessEval-W 世界模型评测项目展示图](https://admin.zuoshipin.com/wp-content/uploads/2026/08/arenanext-world-og.jpg) ## HarnessEval-W 是什么? 传统 Benchmark 往往对所有案例套用同一组指标,而 HarnessEval-W 会先理解每个案例的初始世界、目标动作和评测意图,再选择真正适用的评测技能,把抽象问题拆成可验证的子问题。 ## 它如何完成一次评测? 1. **案例级路由:**根据案例上下文选择适用 Skill,并记录跳过其他检查的理由。 2. **子智能体诊断:**把目标定位、状态变化、物理合理性、时序一致性等问题交给专门 Agent 和工具。 3. **证据验证与聚合:**父级 Agent 检查证据是否足够,再生成分数和可审计的案例卡。 ## 当前覆盖范围 2026 年 8 月公开版本提供 330 个评测案例、11 个专业评测 Skills、5940 条带完整推理轨迹的评分 rollout,并在 18 个代表性世界模型上构建排行榜。 ## 三大评测维度 - **观测质量:**画面是否具有感知一致性、结构合理性和视觉真实感。 - **状态转移正确性:**指定动作是否作用于正确目标,并在正确时间产生预期变化。 - **世界持续性:**长序列中的布局、对象状态、回访一致性与离屏演化是否可信。 ## 适合谁使用? 适合世界模型、视频生成、机器人仿真和 Agent 评测研究者,也适合希望构建“分数 + 证据链”评测系统的算法团队。项目采用 Apache 2.0 许可证,可在遵守许可条件的前提下研究和扩展。 ## 使用前注意 当前部署需要配置多个 Conda 环境、模型凭据和本地路径,主要面向具备 Python 与命令行经验的研究或工程用户。评测输出应结合人工抽检,不应把单一排行榜分数视为完整结论。 ---