遇见数据集

PhysRAG 数据集

收藏
arXiv2026-06-25 更新2026-06-29 收录
官方服务:

资源简介:

PhysRAG 数据集是由北京大学和中国科学院研究团队构建的物理感知视频生成专用数据集,旨在解决视频生成中物理规律建模的难题。该数据集包含约7000条高质量视频样本,源自WISA-80K原始数据集的精选子集,通过两阶段过滤流程确保内容与物理现象的相关性。数据集构建过程采用基于Qwen3-VL模型的粗粒度预筛选和细粒度多模态验证,有效剔除了文本描述不相关或视频内容不一致的低质量样本。该数据集主要应用于增强视频生成模型的物理感知能力,能够支持热力学、力学、光学等多种物理现象的建模,为物理世界模拟、机器人操作和自动驾驶等下游任务提供可靠的数据基础。

The PhysRAG dataset is a specialized dataset for physics-aware video generation, constructed by research teams from Peking University and the Chinese Academy of Sciences, aiming to address the challenge of physical law modeling in video generation. This dataset contains approximately 7,000 high-quality video samples, which are a curated subset derived from the original WISA-80K dataset. A two-stage filtering pipeline is adopted to ensure the relevance between content and physical phenomena. The dataset construction process uses coarse-grained pre-screening and fine-grained multimodal validation based on the Qwen3-VL model, effectively eliminating low-quality samples with irrelevant text descriptions or inconsistent video content. This dataset is mainly applied to enhance the physics-aware capability of video generation models, and can support the modeling of various physical phenomena such as thermodynamics, mechanics, and optics. It provides a reliable data foundation for downstream tasks including physical world simulation, robot manipulation, and autonomous driving.

创建时间:
2026-06-25
原始信息汇总

数据集名称

PhysRAG(Physics-Aware Retrieval-Augmented Generation Dataset)

数据来源与用途

  • 来源:视频选自公开数据集 WISA-80K
  • 用途:用于训练和评估增强物理感知的视频生成模型(PhysRAG),通过检索增强生成(RAG)技术提升视频生成中的物理合理性。

数据集规模与构成

  • 视频数量:6,869 个训练视频。
  • 参考库:包含 170 个视频的参考库,用于物理知识检索。
  • 数据内容
    • 视频文件(MP4 格式),按类别存放在 videos/<category>/<video_id>.mp4
    • 文本提示文件:prompts_new.txt(每行一个提示)。
    • 视频路径文件:videos_new.txt(每行对应视频路径)。
    • 元数据文件:metadata.jsonl
    • 检索增强生成(RAG)数据:
      • rag/metadata.jsonl:参考视频元数据。
      • rag/features/<category>/<video_id>.pt:参考视频的预提取特征(VideoCLIP-XL 编码)。
      • rag/faiss_index/:FAISS 索引文件(config.jsonmetadata.jsonvideo_features.index),用于高效检索。

数据格式与布局

提取后的数据目录结构如下:

data/physrag/ ├── prompts_new.txt ├── videos_new.txt ├── metadata.jsonl ├── videos/<category>/<video_id>.mp4 └── rag/ ├── metadata.jsonl ├── features/<category>/<video_id>.pt └── faiss_index/{config.json,metadata.json,video_features.index}

  • 视频分辨率与帧数:训练和推理时默认使用 49 帧、704×480 分辨率。
  • 缓存文件:Wan2.2 的文本嵌入和视频潜在表示(cache_wan_49f_480x704)需在本地构建,不随数据集分发。

获取方式

  • 数据集下载:通过 Hugging Face 平台获取,命令如下: bash huggingface-cli download sediment1024/PhysRAG --repo-type dataset --local-dir data/PhysRAG

  • 数据解压:下载后需解压 27 个视频分片并复制 RAG 包,运行: bash python tools/extract_dataset_shards.py --dataset-dir data/PhysRAG --output-dir data/physrag

相关资源

搜集汇总
数据集介绍
PhysRAG 数据集 数据集图片
构建方式
视频生成领域长期面临物理一致性不足的困境,现有模型往往难以准确模拟热力学、力学与光学等多样化的物理现象。为突破这一瓶颈,PhysRAG数据集基于WISA-80K原始语料,设计了一套两阶段数据筛选流水线。第一阶段通过Qwen3-VL-4B大模型对文本描述的物理相关性与质量进行评分,保留得分最高的前10%候选样本;第二阶段则采用多模态一致性验证,均匀抽取关键帧与文本描述共同输入Qwen3-VL-4B,剔除文本与视频内容不匹配的伪正样本。该策略兼顾了计算效率与数据纯度,最终从8万条原始视频中精炼出约7000条高质量物理视频,为后续模型训练奠定了坚实的数据基础。
特点
该数据集的核心特色在于其面向物理感知的精细化构建逻辑与覆盖广度。首先,数据筛选并非简单粗暴的质量过滤,而是通过粗筛与细筛两级递进,确保样本在物理语义准确性与视觉内容一致性上均达到高标准。其次,数据集虽规模精简,却涵盖了碰撞、燃烧、爆炸等17类常见物理现象,每类手工精选10段代表性视频,形成了层次清晰、类别均衡的物理视频知识库。这种结构化设计既保证了检索时候选视频的物理相关性,又为模型学习跨实例的泛化物理先验提供了丰富且一致的参考范例。
使用方法
PhysRAG数据集的使用深度融合了检索增强生成范式。在推理阶段,用户输入文本提示后,首先借助VideoCLIP-XL模型从物理视频数据库中检索语义最相关的参考视频;随后利用预训练的VideoMAE V2编码器提取其时空特征,再通过可学习查询注入模块,以交叉注意力机制有选择地提取物理动态信息,并与扩散Transformer主干特征融合。该过程仅增加2.28%的参数与1.24%的推理延时,却显著提升了模型在复杂物理交互场景中的生成质量。训练时,数据集用于监督微调与RAG模块联合优化,采用AdamW优化器与20轮迭代,配合BF16混合精度与DeepSpeed ZeRO-3实现高效计算。
背景与挑战
背景概述
在视频生成领域,尽管生成式模型在视觉保真度上取得了令人瞩目的进展,但生成的视频内容往往难以忠实遵循真实的物理定律,诸如热力学、力学、光学等复杂物理现象的建模仍是一个亟待解决的难题。为攻克这一瓶颈,北京大学计算机科学学院与中国科学院人工智能产业研究院的研究人员于近期联合提出了PhysRAG数据集。该数据集的核心研究问题在于如何通过检索增强生成(RAG)范式,将显式物理知识高效注入视频扩散模型,从而提升生成视频的物理合理性。PhysRAG通过精心设计的两阶段数据过滤管道——涵盖粗粒度语义筛选与细粒度文本-视频一致性校验——从WISA-80K数据集中提炼出约7,000段高质量视频,并据此构建了涵盖17类物理现象的物理视频数据库。该工作不仅在PhyGenBench和VBench两项权威基准上取得了领先性能,更在流体动力学、机械交互等复杂物理场景中展现了卓越的物理一致性,为物理感知视频生成领域开辟了崭新的研究方向。
当前挑战
PhysRAG旨在攻克的核心挑战是现有视频生成模型普遍缺乏对真实物理定律的深刻理解与遵循能力。具体而言,该领域面临两大难题:其一,高质量物理感知视频数据的极度匮乏——现有数据集或受限于数据质量低下,或仅涵盖如自由落体等狭窄的物理现象,难以支撑模型对热力学、力学、光学等多样化物理规律的泛化学习;其二,在构建过程中,研究者须克服从粗粒度互联网视频中精准筛选物理合理样本的困难,为此设计了由文本质量评分与多模态一致性校验组成的两阶段过滤管道,最终仅从原始80,000段视频中保留了约7,000段高质量视频。此外,如何确保检索到的物理视频特征能够被有效抽取并注入到扩散模型之中,同时避免引入无关背景噪声,亦是该方法需要应对的另一关键挑战。
常用场景
经典使用场景
PhysRAG数据集最为经典的使用场景,是作为检索增强生成范式中物理视频数据库的核心支撑。该数据集精心筛选了涵盖力学、热学、光学与材料科学等17类物理现象的170段高质量视频,为视频生成模型提供了可检索的物理先验知识库。在推理过程中,给定一段文本提示,模型通过VideoCLIP-XL从该数据库中检索出蕴含相同物理规则的参考视频,继而利用VideoMAE V2编码其时空特征,最终借助可学习查询注入机制将这些物理知识融入视频扩散Transformer的生成流程。这一范式使得模型能够在保持高视觉保真度的同时,精准复现诸如流体动力学、机械交互等复杂物理过程,从而显著提升生成内容的物理一致性。
实际应用
PhysRAG数据集所驱动的方法在多个现实世界应用中展现出广阔前景。在具身智能领域,该技术可生成符合物理规律的机器人操作视频,为机器人运动规划与控制策略学习提供高保真仿真环境。在自动驾驶场景中,PhysRAG能够合成包含精确物理交互的行人、车辆运动视频,增强驾驶决策模型对复杂交通动态的理解能力。此外,在交互式世界建模与游戏内容生成中,该方法使得虚拟环境能够忠实再现真实物理现象,提升用户体验的沉浸感与可信度。值得注意的是,该数据集仅需170段精心编排的参考视频,配合其高效的检索注入机制,即可显著改善视频模型的物理合规性,这为工业级应用中低成本部署物理感知视频生成系统提供了可行性路径。
衍生相关工作
PhysRAG数据集及其技术路线催生了若干前沿研究方向。在数据层面,该工作提出的两级过滤管线为构建高质量物理视频数据集提供了可复现的范式,启发了后续研究对WISA-80K等大规模粗糙数据集的精细化清洗策略。在方法层面,基于可学习查询的物理先验注入机制,被后续工作拓展为更为通用的记忆调制模块,例如DiT-Mem中的频率滤波记忆令牌与MotionRAG中的运动检索增强框架。PhysRAG对于物理类别的手动划分与数据库构建策略,也推动了物理感知评估基准如PhyGenBench的演进,使得研究者能够系统性地衡量模型在不同物理现象上的生成能力。该数据集所奠定的检索增强物理理解路线,正逐渐成为融合外部知识与生成式模型的主流范式之一。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务