做视频AI导航网
做视频AI导航网
AI导航
  • 热门工具
  • Agent智能体
  • Skills技能
  • AI大模型
  • AI创作
  • AI工具集
视频Video
  • 素材下载
  • 创作灵感
Github神器
搜索
  • 导航
  • 资讯
  • 视频素材
  • 视频模版
  • 音乐音效
  • Luts调色预设
  • 整合包
首页/
打开 MD 链接

HarnessEval-W - 把世界模型评测变成可追溯证据链的开源Agent基准

6
从固定指标走向会规划、会调查、能给出证据链的评测系统
评分
开源协议:Apache 2.0项目类型:Agent化世界模型评测评测案例:330评测Skills:11覆盖模型:18使用方式:Python / Conda / CLI
HarnessEval-W以Agent化评测流程动态路由Skills、调用诊断工具并生成证据树,为世界模型提供…
AI研究机构·Github神器

一句话推荐:HarnessEval-W 是 MirroS 团队开源的世界模型评测系统,把固定指标升级为会规划、选择技能、调用工具、搜集证据并验证结论的 Agent 化评测流程。

HarnessEval-W 世界模型评测项目展示图

HarnessEval-W 是什么?

传统 Benchmark 往往对所有案例套用同一组指标,而 HarnessEval-W 会先理解每个案例的初始世界、目标动作和评测意图,再选择真正适用的评测技能,把抽象问题拆成可验证的子问题。

它如何完成一次评测?

  1. 案例级路由:根据案例上下文选择适用 Skill,并记录跳过其他检查的理由。
  2. 子智能体诊断:把目标定位、状态变化、物理合理性、时序一致性等问题交给专门 Agent 和工具。
  3. 证据验证与聚合:父级 Agent 检查证据是否足够,再生成分数和可审计的案例卡。

当前覆盖范围

2026 年 8 月公开版本提供 330 个评测案例、11 个专业评测 Skills、5940 条带完整推理轨迹的评分 rollout,并在 18 个代表性世界模型上构建排行榜。

三大评测维度

  • 观测质量:画面是否具有感知一致性、结构合理性和视觉真实感。
  • 状态转移正确性:指定动作是否作用于正确目标,并在正确时间产生预期变化。
  • 世界持续性:长序列中的布局、对象状态、回访一致性与离屏演化是否可信。

适合谁使用?

适合世界模型、视频生成、机器人仿真和 Agent 评测研究者,也适合希望构建“分数 + 证据链”评测系统的算法团队。项目采用 Apache 2.0 许可证,可在遵守许可条件的前提下研究和扩展。

使用前注意

当前部署需要配置多个 Conda 环境、模型凭据和本地路径,主要面向具备 Python 与命令行经验的研究或工程用户。评测输出应结合人工抽检,不应把单一排行榜分数视为完整结论。

0 讨论
热门最新
总结
暂无总结
0 / 600
细中粗

相关网站

热门最新

Orca – 值得关注的世界模型研究页,适合看 AI 往哪儿走的人

北京智源团队的世界模型研究页面,围绕观察、推理、认知和行动展开。

Orca 是北京智源人工智能研究院团队发布的世界模型研究页,重点讨论 next state predictio…

0

爱马仕Hermes Agent – 会记忆、能分工的开源个人智能体

适合想把 AI 真的放进工作流里的人:Hermes Agent 运行在本机,能记忆项目、调度子代理、做网页搜索和沙盒执行,更像一套个人智能体系统。

Hermes Agent 是 Nous Research 推出的开源个人智能体,支持 macOS、Window…

0

rekursiv.ai – AI自我改进与自动化研究平台

面向自动化机器学习研究的AI Scientist平台,可并行提出假设、运行实验并追溯证据。

面向自动化机器学习研究的AI Scientist平台,可并行提出假设、运行实验并追溯证据。

0

Agnes AI – 全模态模型、AI Agent 与免费 API 平台

覆盖文本、图像、视频与推理模型,连接 AI Agent、编程、短剧创作和开发者 API

Agnes AI 是覆盖文本、图像、视频、AI Agent 和开发者 API 的全模态平台,旗下包括 Agne…

0

Browser Use – 让 AI 像人一样直接驱动浏览器的开源代理框架

让 AI Agent 直接驱动浏览器的开源代理框架

Browser Use 让 AI Agent 直接开浏览器、点按钮、填表单,正反两面都能跑。在 Odyssey…

0

Doubao-Seed-Evolving – 面向 Coding 与 Agent 长任务的豆包模型

推荐!为大型代码仓库、长程规划与多模态Agent补上更长上下文和视觉能力

Doubao-Seed-Evolving聚焦Coding与Agent,支持复杂任务编排、最高1M上下文、视觉理…

0

Qwen3.8-27B – 24GB显存可尝试的开源多模态Agent模型

推荐!把前沿Coding与Agent能力压缩到27B尺寸,本地部署和强能力第一次真正靠近

Qwen3.8-27B是27B Dense开源多模态模型,强化Coding、工具调用与长程Agent,4bit…

0

Agent-Skills.md – 从 8 万+ Agent Skills 中快速找到合适能力的开放市场

推荐!把海量Agent Skills变成可搜索目录,用关键词、作者和社区热度快速锁定值得尝试的能力

推荐!聚合8万+ Agent Skills,支持关键词和热门技术栈搜索,用作者、描述与社区热度帮你快速筛出值得…

0

Agent Reach – 为AI Agent安装15个平台互联网能力

让 Claude Code、Cursor、Windsurf 与 OpenClaw 获得跨平台搜索和读取能力

Agent Reach 是开源的多平台互联网能力安装、路由与健康检查工具,让命令行 AI Agent 读取和搜…

0

QwenPaw官网直达 – 能装Skills、接MCP、跑定时任务的开源个人AI助手

推荐!不只聊天,还能用Skills、MCP、定时任务与长期记忆把工作真正跑起来

推荐!这款开源个人AI智能体能装Skills、接MCP与多渠道,支持定时任务、长期记忆、多Agent协作和可审…

0
所有的成功,都源自一个勇敢的开始
不辜负每一个勇敢的开始
做视频AI导航网 © 2026闽ICP备16009488号-1