遇见数据集

OmniPhys

收藏
arXiv2026-07-28 更新2026-07-30 收录
数据链接:
官方服务:

资源简介:

OmniPhys是由浙江大学等机构联合构建的物理常识基准数据集,旨在系统评估文本到图像生成模型的物理合理性。该数据集包含1551个精心设计的样本,覆盖力学、光学和物体属性三大领域,基于物理知识图谱(PKG)和PhET模拟构建,确保每个样本均对应可视觉验证的物理知识节点。数据集通过隐式查询和双路径验证协议,诊断模型对基础物理定律的内化理解,而非表面模式匹配,主要应用于提升生成式AI的物理对齐能力,解决现有模型在流体静力学、光学折射等场景中的“物理幻觉”问题。

OmniPhys is a physical commonsense benchmark dataset jointly constructed by Zhejiang University and other institutions, aiming to systematically evaluate the physical plausibility of text-to-image generation models. This dataset includes 1551 meticulously designed samples covering three core domains: mechanics, optics, and object properties. It is built based on the Physical Knowledge Graph (PKG) and PhET simulations, ensuring that each sample corresponds to a visually verifiable physical knowledge node. Through implicit queries and a two-path validation protocol, the dataset diagnoses the model's internalized understanding of fundamental physical laws rather than superficial pattern matching. Its primary application is to enhance the physical alignment capability of generative AI and resolve the "physical hallucination" issues of existing models in scenarios such as hydrostatics and optical refraction.

创建时间:
2026-07-28
原始信息汇总

数据集概述:OmniPhys

  • 名称:OmniPhys
  • 来源地址:https://github.com/zjukg/OmniPhys
  • 描述:该数据集当前在GitHub上托管,项目名称为OmniPhys,具体内容尚未在README文件中详细说明。
搜集汇总
数据集介绍
OmniPhys 数据集图片
构建方式
OmniPhys的构建基于一个层级化的物理知识图谱,该图谱从PhET交互式模拟中提炼出涵盖力学、光学与物体属性三大领域的14个可验证物理知识点。通过知识图谱驱动的情景模板化与实体填充,研究团队生成了1,551个隐性提示样本——这些提示仅描述物理场景而刻意隐藏结果,迫使模型依赖内在推理而非关键词匹配。每个样本均锚定特定知识点,并附带经由LLM生成的成对判别式视觉问题与描述性一致性陈述,构建起细粒度的诊断测试基准。
特点
该数据集的核心特点体现在其知识图谱驱动的双层验证协议:图像必须同时通过二元视觉问答与描述性一致性审核,方能判定为物理合理,从而有效过滤启发式猜测。其金字塔式分类体系实现了从粗粒度领域到原子化物理语句的精细诊断,覆盖了连通器原理、弹性形变等现有基准难以触及的物理机制。此外,严格的可视化筛选确保每个知识点均具有可观测的二元视觉映射,避免了抽象概念带来的评估模糊性。
使用方法
使用OmniPhys时,用户可将隐性提示直接输入文本到图像生成模型,并采用提供的双路径验证协议自动评估输出。数据集附带的多模态评估器可对每张生成图像执行严格的逐点一致性检验,最终以联合分数形式输出模型在14个物理知识点上的结构化性能报告。对于优化任务,研究提出的OmniPrompt框架利用批量级反馈缓冲机制,通过文本梯度下降迭代进化元策略,用户可将其作为即插即用的提示增强方案跨模型迁移使用。
背景与挑战
背景概述
OmniPhys数据集由浙江大学与曼彻斯特大学等机构的研究人员于2026年创建,旨在系统性地评估与优化文本到图像生成模型中的物理常识推理能力。随着扩散模型与自回归模型在视觉合成领域取得突破性进展,生成的图像虽展现出令人瞩目的保真度,却频繁违反基础物理定律,如连通器液面不等、折射缺失或弹性形变未呈现等“物理幻觉”现象。既有基准如Commonsense-T2I与PhyBench仅提供粗粒度的领域级分析,无法精确诊断模型在具体物理知识点上的缺陷。OmniPhys基于物理知识图谱,将PhET交互式模拟与标准课程对齐,构建了涵盖力学、光学与物体属性三大领域、14个物理知识点的1551个样本,通过隐式查询与双路径验证协议,为模型物理一致性评估提供了严谨的诊断框架,在KDD 2026上发布后迅速成为该领域的重要参照。
当前挑战
OmniPhys数据集面临的核心挑战体现在两个层面。其一,所解决的领域问题是文本到图像生成模型普遍缺乏对物理常识的深层内化,仅依赖统计模式识别而非真实物理推理,现有方法难以精确识别模型在特定物理定律(如阿基米德原理、杠杆原理)上的掌握程度。其二,构建过程中,研究团队需将物理知识图谱中的抽象原则转化为视觉上可验证的隐式查询,确保每个样本的原子物理陈述具有二值可观测性,并设计严格的双路径验证协议以区分偶然性视觉伪影与系统性推理缺陷。此外,在优化阶段,生成过程的高随机性导致传统提示优化方法遭受“梯度幻觉”困扰,即优化器被瞬态视觉伪影误导,而非针对全局性物理失败进行改进,这要求构建跨查询的批量聚合反馈机制以过滤噪声。
常用场景
经典使用场景
在文本到图像生成模型的繁荣发展浪潮中,物理常识的缺失已成为制约模型从艺术创作工具迈向现实模拟器的核心瓶颈。OmniPhys作为首个以物理知识图谱为驱动的基准数据集,凭借其基于PhET仿真与标准课程对齐构建的层级化知识体系,以及涵盖力学、光学与物体属性三大领域共14个物理知识点的精细分类,为学界提供了一套严苛的诊断工具。研究者通常借助该数据集施加隐性物理查询的‘压力测试’,通过不直接透露物理结果的场景描述,迫使模型依赖内化的物理推理而非表层关键词匹配来生成图像。这一经典范式使得对模型在浮力、杠杆原理、折射等具体定律掌握程度的细粒度剖析成为可能,从而精确揭示不同架构与参数量级下模型在物理一致性上的共性瓶颈与个性缺陷。
衍生相关工作
OmniPhys的诞生催生了一系列围绕物理常识对齐的研究工作。其中最具代表性的当属同源提出的OmniPrompt迭代优化框架,该框架将物理对齐重构为离散优化问题,通过两级聚合策略——查询级别整合多幅图像的评估反馈,优化层面合并批次梯度——有效抑制了生成噪声,实现了元策略的稳健进化。受OmniPhys诊断范式的启发,后续研究开始探索将物理知识图谱更深入地嵌入生成模型的训练管线,例如通过图谱引导的隐式注入模块,使模型在潜在空间中直接内化浮力、压强等原理。另有一批工作聚焦于扩展知识图谱的覆盖范围,将OmniPhys的14个知识点拓展至热力学与电磁学领域,并引入时变动态场景的评估维度,构建了更为全面的物理常识基准体系。
数据集最近研究
最新研究方向
当前文本到图像生成模型虽在视觉 fidelity 上取得显著突破,却普遍缺乏对物理常识的深层理解,频繁生成违反基本物理定律的视觉内容。OmniPhys 数据集正是针对这一严峻挑战应运而生,它构建于精细的物理知识图谱之上,将 PhET 交互式模拟与标准课程体系深度融合,形成涵盖力学、光学与物体属性三大领域共 14 个知识点的诊断性基准。前沿研究聚焦于利用该基准进行系统性压力测试,揭示模型在结构力学与光折射等逻辑密集型概念上的普遍瓶颈,并由此催生了一种名为 OmniPrompt 的集体优化框架,通过两级聚合策略有效抑制生成过程的随机噪声,将物理对齐转化为可迭代的离散优化问题,显著提升了多代模型在物理一致性上的表现。这一工作不仅为评测生成模型的世界理解能力提供了金标准,更推动了从像素级匹配向物理推理对齐的范式跃迁。
相关研究论文
  • 1
    OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation浙江大学; 曼彻斯特大学; 爱丁堡大学; 蚂蚁集团 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务