Embodied World Model Benchmark (EWMBM) 是一个专门设计用于评估Embodied World Models (EWMs)的基准框架,旨在评估文本驱动视频生成模型在具体任务中的表现。EWMBM系统评估生成内容在三个关键维度上的物理合理性和任务一致性:视觉场景一致性、运动正确性和语义对齐。与传统感知指标相比,EWMBM更关注生成结果在具体环境中的实际可用性和合理性。
该数据集是在模型icefog72/IceCoffeeTest2的评估运行期间自动创建的,用于在Open LLM Leaderboard上进行评估。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到,分割以运行的时间戳命名。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,用于计算和显示在Open LLM Lead