PhyGenBench
收藏资源简介:
PhyGenBench是由上海交通大学、上海人工智能实验室、香港大学和香港中文大学的研究团队创建的一个综合物理生成基准数据集,旨在评估文本到视频生成模型在物理常识方面的正确性。该数据集包含160个精心设计的提示,涵盖27个不同的物理定律,跨越四个基本领域,全面评估模型对物理常识的理解。数据集的创建过程包括从基础物理定律出发,通过头脑风暴和参考教科书等方式构建反映物理定律的提示,确保每个提示都能清晰地反映物理现象。PhyGenBench主要应用于评估和提升文本到视频生成模型在物理常识方面的表现,旨在解决当前模型在生成符合物理常识的视频方面的不足。
PhyGenBench is a comprehensive physical generation benchmark dataset developed by research teams from Shanghai Jiao Tong University, Shanghai AI Laboratory, The University of Hong Kong, and The Chinese University of Hong Kong. It is designed to evaluate the physical common sense validity of text-to-video generation models. This dataset includes 160 meticulously crafted prompts spanning 27 distinct physical laws across four core domains, enabling a comprehensive assessment of models' understanding of physical common sense. The construction process of PhyGenBench begins with foundational physical laws, where prompts reflecting corresponding physical phenomena are generated via brainstorming and reference to textbooks, ensuring each prompt clearly demonstrates a specific physical phenomenon. PhyGenBench is primarily applied to evaluate and enhance the performance of text-to-video generation models in terms of physical common sense, with the goal of addressing the current limitations of existing models in generating videos that align with physical common sense.
PhyGenBench 数据集概述
数据集简介
PhyGenBench 是一个综合的物理生成基准,旨在评估视频生成中的物理常识正确性。该基准包含160个精心设计的提示,涵盖27个不同的物理定律,跨越四个基本领域,全面评估模型对物理常识的理解。
数据集组成
- 测试提示:包含在
prompts.json文件中。 - 示例问题:包含在
single_question.json、multi_question.json和video_question.json文件中,分别对应 PhyGenEval 中的三个不同阶段。 - 视频测试:包含在
PhyVideos文件夹中,用户需根据prompts.json生成视频并放置在此文件夹中。
评估框架
PhyGenEval 是一个新颖的评估框架,采用分层评估结构,利用先进的视觉-语言模型和大型语言模型来评估物理常识。评估过程分为三个阶段:
- 关键物理现象检测
- 物理顺序验证
- 整体自然性评估
排行榜
PhyGenBench 提供了一个排行榜,展示了不同模型在物理常识生成任务中的表现。排行榜包括以下模型:
- CogVideoX
- Open-Sora V1.2
- Lavie
- Vchitect 2.0
- Pika
- Gen-3
- Kling
快速开始
文件结构
PhyGenBench:包含测试提示和示例问题。PhyGenEval:包含语义评估方法和三阶段物理常识评估方法的代码。result:包含 Kling 在 PhyGenBench 上的评估结果。PhyVideos:包含待测试的视频。
环境配置
- 使用 GPT-4o 或开源模型进行评估,需配置 VQAScore 环境。
- 使用开源模型进行评估,需配置 VQAScore、LLava-Interleave 和 InternVideo2 环境,并下载相应模型。
问题生成
- 生成单阶段问题:
python PhyGenEval/single/generate_question.py - 生成多阶段问题:
python PhyGenEval/multi/generate_question.py - 生成视频阶段问题:
python PhyGenEval/video/generate_question.py
三阶段评估
- 关键物理现象检测:
python PhyGenEval/single/vqascore.py - 物理顺序验证:
- 检索关键帧:
python PhyGenEval/multi/multiimage_clip.py - 多图像问答:
python PhyGenEval/multi/GPT4o.py或python PhyGenEval/multi/LLaVA-NeXT-interleave_inference/llava/eval/model_vqa_multi.py
- 检索关键帧:
- 整体自然性评估:
- 使用 GPT-4o:
python PhyGenEval/video/GPT4o.py - 使用 InternVideo2:
python PhyGenEval/video/MTScore/InternVideo_physical.py
- 使用 GPT-4o:
总体评分计算
python PhyGenEval/overall.py
联系方式
如有任何问题,请联系 Fanqing Meng (mengfanqing33@gmail.com)。

- 1Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation上海交通大学, 上海人工智能实验室, 香港大学, 香港中文大学 · 2024年



