做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

HarnessEval-W - 把世界模型评测变成可追溯证据链的开源Agent基准

92
从固定指标走向会规划、会调查、能给出证据链的评测系统
评分
开源协议:Apache 2.0项目类型:Agent化世界模型评测评测案例:330评测Skills:11覆盖模型:18使用方式:Python / Conda / CLI
HarnessEval-W以Agent化评测流程动态路由Skills、调用诊断工具并生成证据树,为世界模型提供…
AI研究机构·Github神器

一句话推荐:HarnessEval-W 是 MirroS 团队开源的世界模型评测系统,把固定指标升级为会规划、选择技能、调用工具、搜集证据并验证结论的 Agent 化评测流程。

HarnessEval-W 世界模型评测项目展示图

HarnessEval-W 是什么?

传统 Benchmark 往往对所有案例套用同一组指标,而 HarnessEval-W 会先理解每个案例的初始世界、目标动作和评测意图,再选择真正适用的评测技能,把抽象问题拆成可验证的子问题。

它如何完成一次评测?

  1. 案例级路由:根据案例上下文选择适用 Skill,并记录跳过其他检查的理由。
  2. 子智能体诊断:把目标定位、状态变化、物理合理性、时序一致性等问题交给专门 Agent 和工具。
  3. 证据验证与聚合:父级 Agent 检查证据是否足够,再生成分数和可审计的案例卡。

当前覆盖范围

2026 年 8 月公开版本提供 330 个评测案例、11 个专业评测 Skills、5940 条带完整推理轨迹的评分 rollout,并在 18 个代表性世界模型上构建排行榜。

三大评测维度

  • 观测质量:画面是否具有感知一致性、结构合理性和视觉真实感。
  • 状态转移正确性:指定动作是否作用于正确目标,并在正确时间产生预期变化。
  • 世界持续性:长序列中的布局、对象状态、回访一致性与离屏演化是否可信。

适合谁使用?

适合世界模型、视频生成、机器人仿真和 Agent 评测研究者,也适合希望构建“分数 + 证据链”评测系统的算法团队。项目采用 Apache 2.0 许可证,可在遵守许可条件的前提下研究和扩展。

使用前注意

当前部署需要配置多个 Conda 环境、模型凭据和本地路径,主要面向具备 Python 与命令行经验的研究或工程用户。评测输出应结合人工抽检,不应把单一排行榜分数视为完整结论。

0 / 600
细中粗
0 讨论
热门最新
总结
暂无总结

相关网站

热门最新
暂无链接数据;请在后台添加链接或调整分类筛选。
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1