遇见数据集

physcorp-pre-audit

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

PhysCorp Pre-Audit Raw Pool 是一个包含14,294条记录的物理推理多模态语料库,作为论文《Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning》的伴随资源发布。它聚合了来自九个不同来源的原始数据,形成在应用联合污染审核之前的完整语料库,核心目的是允许用户基于此原始池以不同阈值或针对新外部基准重新运行审核流程。数据集涵盖物理学科,特别侧重于奥林匹克竞赛级别的推理问题,任务类别包括图像-文本到文本和问答。数据形式包含文本和多模态样本,其中1,415条记录为多模态行,在`messages`字段中包含`<image>`标记,多模态图像主要来自MMMU Physics公共基准和PhysReason数据集。数据结构遵循固定schema,包含`source`(数据来源)、`messages`(JSON序列化的消息/问题)、`solution`(解决方案)和`metadata`(JSON序列化的元数据)字段。数据来源多样,包括UGPhysics、OpenStax College + University Physics等,每个来源都有明确的记录数、许可证(如CC BY-NC-SA 4.0、CC BY 4.0、公共领域等)和质量层级(Tier-1或Tier-2)标注。该预审核池是后续审核流程的起点:通过两阶段联合污染审核(第一阶段5-gram Jaccard >= 0.4,第二阶段mxbai-embed-large-v1余弦相似度 >= 0.85)针对六个标准评估集进行筛选,最终产生6,432条的审核后语料库(physcorp-a)和2,268条的封闭形式强化学习训练池(physr1corp)。数据集整体采用CC BY-NC 4.0许可证,但用户可根据`source`列中的信息按各来源原始许可证进行下游过滤和使用。

PhysCorp Pre-Audit Raw Pool is a multimodal corpus for physics reasoning containing 14,294 records. It is released as a companion resource to the paper Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning, aiming to aggregate raw data from nine different sources into a complete corpus before applying joint contamination auditing. Its core purpose is to allow users to re-run the auditing process on this raw pool with different thresholds or for new external benchmarks. The dataset covers the physics discipline, with a particular focus on Olympiad-level reasoning problems, and task categories include image-text-to-text and question answering. The data format includes text and multimodal samples, with 1,415 records being multimodal rows containing `<image>` tags in the `messages` field. These multimodal images primarily come from the MMMU Physics public benchmark and the PhysReason dataset. The dataset structure follows a fixed schema with four fields: `source` (data source), `messages` (JSON-serialized messages/questions), `solution` (solution), and `metadata` (JSON-serialized metadata). Data sources are diverse, including UGPhysics, OpenStax College + University Physics, Physics Stack Exchange, Kevin Zhous Olympiad handouts, Estonian Physics Olympiad (EFO), MMMU + o1-CoT seed data, PhysReason, and data scraped from competitions such as IPhO, NBPhO, EuPhO, APhO, USAPhO, and INPhO, each annotated with clear record counts, licenses (e.g., CC BY-NC-SA 4.0, CC BY 4.0, public domain), and quality tiers (Tier-1 or Tier-2). This pre-audit pool serves as the starting point for subsequent auditing: it undergoes a two-stage joint contamination audit (stage 1: 5-gram Jaccard >= 0.4, stage 2: mxbai-embed-large-v1 cosine similarity >= 0.85) against six standard evaluation sets, ultimately producing an audited corpus of 6,432 records (physcorp-a) and a closed-form reinforcement learning training pool of 2,268 records (physr1corp). The overall dataset is licensed under CC BY-NC 4.0, but users can filter and use it downstream based on the original licenses of each source as indicated in the `source` column.

创建时间:
2026-05-20
原始信息汇总

数据集概述

PhysCorp Pre-Audit Raw Pool 是一个未经污染审计的物理推理原始语料库,包含 14,294条记录,是 Physics-R1 项目的一部分,旨在为用户提供可自行调整阈值或针对新基准重新运行污染审计的灵活性。

基本信息

  • 许可证: CC BY-NC 4.0
  • 语言: 英语、中文
  • 任务类型: 图像-文本到文本、问答
  • 标签: 物理、推理、多模态、奥林匹克竞赛、预审计
  • 数据规模: 10K < n < 100K
  • 配置: 默认配置,包含一个训练集文件(physcorp_pre_audit.parquet

数据来源与构成

数据聚合自九个来源家族,记录数及许可证信息如下:

Source Records License Tier
UGPhysics 5,520 CC BY-NC-SA 4.0 Tier-2
OpenStax College + University Physics 2,381 CC BY 4.0 Tier-1
Physics Stack Exchange 2,291 CC BY-SA 4.0 Tier-1
Kevin Zhous olympiad handouts 692 CC BY-NC 4.0 Tier-2
Estonian Physics Olympiad (EFO) 418 Public-domain (competition policy) Tier-2
MMMU + o1-CoT seed 1,293 MIT (MMMU); generated CoT Tier-1
PhysReason 1,200 CC BY 4.0 Tier-1
IPhO + NBPhO + EuPhO scrape 258 Public-domain Tier-1
APhO + USAPhO + INPhO scrape 241 Public-domain Tier-1
Total 14,294

数据结构与加载

  • 模式: 与 physcorp-a 相同,包含字段:source, messages, solution, metadata。其中 messagesmetadata 以 JSON 格式序列化存储于 parquet 文件中。
  • 多模态记录: 包含 1,415条 多模态行(messages 中含有 <image> 标记)。其中:
    • 441条 来自 MMMU Physics(source = rl_sft_*),可通过提供的 loader.py 脚本解析图像路径。
    • 974条 来自 PhysReason(source = physreason_*),需用户自行运行 代码仓库 中的 prepare_additional_training_data.py 来获取图像,原因在于上游 PhysReason 数据集的分发条款限制。
  • 图像路径映射: 存储在 image_mapping.json 文件中(source_id → filename)。extra_images/ 目录下的438张PNG图像来自 MMMU 公共基准。

使用示例

  • 基础加载: python from datasets import load_dataset ds = load_dataset("shanyangmie/physcorp-pre-audit", split="train")

  • 多模态记录加载(使用脚本): python from loader import load_physcorp_pre_audit df = load_physcorp_pre_audit()

  • 命令行解析: bash python loader.py --out resolved.parquet

污染审计流程

该数据集是污染审计前的原始池,经过两阶段联合审计(Stage-1: 5-gram Jaccard >= 0.4;Stage-2: mxbai-embed-large-v1 cosine >= 0.85)后,可得到更小的子集:

  • 14,294条 预审计池(当前数据集)
  • → 6,432条 审计后子集:shanyangmie/physcorp-a
  • → 2,268条 闭式RL池:shanyangmie/physr1corp(实际用于训练)

相关数据集

  • shanyangmie/physcorp-a — 7,236条记录的审计后语料库
  • shanyangmie/physr1corp — 2,268条记录的闭式RL池
  • shanyangmie/physolym-a — 500条记录的审计后奥林匹克评测集

许可证与引用

  • 许可证: CC BY-NC 4.0,每条记录在 source 列中提供来源归属,便于按许可证层级过滤。
  • 引用: 如需引用,请使用提供的 BibTeX 格式。
搜集汇总
数据集介绍
physcorp-pre-audit 数据集图片
构建方式
PhysCorp Pre-Audit数据集汇聚了九个物理题目来源家族,在污染审计之前构成原始语料池,共包含14,294条记录。其构建路径清晰:从公开竞赛试题、教科书习题、在线问答社区及物理奥林匹克资源中系统性采集原始数据,并附加了来自MMMU Physics的多模态题目与o1思维链种子,以及PhysReason子集。所有条目均以统一的Schema组织,记录包括源标识、对话消息序列、解答及元数据字段,并通过Parquet格式序列化存储,确保了数据结构的稳定性和高效读取。
特点
该数据集最大的特色在于其多模态与双重审计机制的结合。包含1,415条带图像标记的多模态记录,其中441条来自MMMU Physics的图像已本地解析为PNG文件并附带映射清单,而其余974条PhysReason来源的图像需上游独立处理。更重要的是,数据集提供了完整的污染审计谱系:通过5-gram Jaccard与嵌入余弦相似度两阶段联合审计,可从14,294条原始记录中筛选出6,432条无污染的子集,为物理推理解耦模型训练提供了可靠的数据纯度保障。
使用方法
研究者可通过HuggingFace Datasets库直接加载数据,使用`load_dataset("shanyangmie/physcorp-pre-audit", split="train")`命令即可获取全部记录。针对多模态记录,建议使用附带的`loader.py`脚本调用`load_physcorp_pre_audit()`函数以自动解析MMMU Physics来源的图像路径;对于PhysReason来源的974条多模态条目,需另行运行代码仓库中的`prepare_additional_training_data.py`脚本,从上游数据集获取合法图像。用户还可通过`image_mapping.json`映射文件手动索引图像,或利用`source`字段按许可证层级过滤下游训练数据。
背景与挑战
背景概述
PhysCorp Pre-Audit数据集由Shan Yang于2026年创建,依托于Physics-R1项目,旨在为视觉物理推理研究提供大规模、多来源的物理竞赛级语料库。该数据集整合了九类物理问题来源,包括国际物理奥赛(IPhO)、美国物理奥赛(USAPhO)、欧洲物理奥赛(EuPhO)、Kevin Zhou的奥赛讲义、大学物理教材(OpenStax)、物理堆栈交换社区、MMMU物理基准及PhysReason数据集等,共计14,294条记录。其核心研究问题在于如何构建一个经过污染审计的高质量物理推理训练集,以提升多模态大语言模型在物理奥林匹克问题上的推理能力。该数据集的出现为物理多模态推理领域提供了标准化评估资源,对推动大模型在科学推理任务中的发展具有重要参考价值。
当前挑战
该数据集所解决的领域核心挑战在于多模态物理推理数据的稀缺与污染问题:现有物理问答数据集多聚焦于简单计算或常识,缺乏对视觉物理奥赛复杂推理的支持,且公开数据与评测基准间存在严重重叠,导致模型泛化能力虚高。构建过程中,研究团队面临多源异构数据整合难题——需统一处理来自不同版权的文本、图像及数学公式格式,并对441张来自MMMU的多模态图像进行路径映射与版权过滤。更为关键的是,团队设计了两阶段联合污染审计流程(5-gram Jaccard与嵌入余弦相似度),清除与六个下游评测基准重复的样本,最终从14,294条记录中逐步筛选至2,268条闭环强化学习可用集,确保数据纯洁性与模型评估的可信度。
常用场景
经典使用场景
PhysCorp Pre-Audit数据集专为视觉物理推理任务而构建,其最经典的使用场景在于为多模态物理问答和推理模型提供未经污染审计的原始训练语料。该数据集汇聚了来自九个不同来源的14,294条记录,涵盖大学物理教材、奥林匹克竞赛真题、物理问答社区及多模态基准测试等丰富领域,特别适合用于训练和评估具备图像理解能力的物理推理模型。研究者可利用其中包含的1,415条多模态样本(带有<image>标记),结合MMMU Physics和PhysReason来源的物理图像数据,构建能够解析物理图表、识别实验装置并完成复杂物理计算的端到端推理系统。
解决学术问题
该数据集的核心学术贡献在于解决了物理推理模型训练中的数据污染问题。研究团队通过两阶段联合污染审计(基于5-gram Jaccard相似度和嵌入余弦相似度)对原始语料进行严格过滤,从14,294条记录中剔除了与六个经典物理评估基准存在重叠的样本,最终生成6,432条纯净训练数据。这一方法论确保了模型性能评估的公正性和可信度,避免了因训练数据与测试集重合而导致的结果膨胀。PhysCorp Pre-Audit作为审计前的原始池,允许研究者在不同阈值下重新运行污染检测流程,为建立更严谨的物理推理评估体系提供了可复现的基础,对推动科学推理领域的研究方法论标准化具有深远意义。
衍生相关工作
PhysCorp Pre-Audit数据集催生了多个具有影响力的后续工作。其姊妹数据集PhysCorp-A(7,236条)代表了经过污染审计的纯净训练语料,而PhysR1Corp(2,268条)则进一步筛选出适合闭环强化学习训练的物理推理样本,为Physics-R1模型的训练提供了关键数据支撑。评估基准PhysOlym-A(500条)的构建使得物理奥林匹克级推理能力的量化评估成为可能。这些衍生数据集共同构成了一个完整的物理推理研究生态,推动了视觉语言模型在科学推理领域的专业化发展,也为其他学科(如化学、生物)的领域特定数据集构建提供了可借鉴的审计框架和技术路线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务