遇见数据集

shanyangmie/physr1corp-cold-start

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

PhysR1Corp冷启动数据集是一个用于SFT(监督式微调)冷启动的工具使用物理轨迹数据集,包含文本和多模态数据。它由1,973条经过审计的轨迹组成(其中1,740条为纯文本,233条为多模态),覆盖了PhysR1Corp全部2,268个物理问题。每条轨迹通过自定义SymPy工具解决物理问题,工具运行在项目的harness.sandbox运行时环境中,轨迹模式与W6 RL训练推理格式完全匹配。数据源来自PhysR1Corp的所有问题,通过并行子代理生成(文本问题使用25个并行子代理批次,多模态问题使用6个并行子代理),并采用反后拟合提示和LLM-judge审计来确保质量,清洁率为87.0%。数据集平均轨迹长度为267字符,75.3%的轨迹使用了SymPy工具(平均每个轨迹0.87次工具调用),其余为概念性多选题且无工具调用。数据集支持从HuggingFace加载或通过原始JSONL文件使用,多模态行包含指向本地PNG图像的image_path字段。

许可证:CC BY-NC 4.0 任务类别: - 文本生成 - 视觉问答 语言: - 英语 标签: - 物理 - 工具使用 - SymPy - 推理 - 监督微调(SFT) - 冷启动 - 多模态强化学习(Multimodal-RL) - 多模态 规模类别: - 1K<n<10K --- # PhysR1Corp 冷启动 —— 工具使用物理轨迹(文本+多模态) 本数据集为**Physics-R2 / Phase E**(一篇面向视觉语言模型(VLM)的工具使用强化学习论文,目标投稿至ICLR 2027)的监督微调(SFT)冷启动数据集。包含1973条经审核的轨迹:其中1740条为纯文本轨迹,233条为多模态轨迹,覆盖完整的PhysR1Corp语料库(全部2268道物理题目)。每条轨迹通过项目`harness.sandbox`运行时调度自定义SymPy工具,以求解单道物理题,且轨迹格式严格匹配W6强化学习训练推理格式。 ## 数据 Schema 每条数据行包含以下字段: | 字段名 | 类型 | 描述 | |---|---|---| | `problem_id` | 字符串 | 格式为`physr1corp/<idx>` | | `question` | 字符串 | 题目描述文本 | | `gold` | 字符串 | PhysR1Corp提供的标准答案 | | `image_path` | 字符串(可选) | 仅多模态轨迹包含,指向对应配图的本地路径 | | `trajectory` | 字符串 | 完整格式字符串,涵盖推理过程、工具调用、工具返回结果与盒装答案 | | `n_tool_calls` | 整数 | SymPy工具调用总次数 | | `n_tool_errors` | 整数 | SymPy工具调用失败次数 | | `matched` | 布尔值 | 若通过验证与审核则为`True` | | `match_reason` | 字符串 | 验证类型,例如`"exact"`/`"exact_compact"`/`"sympy_eq"`等 | | `pred_normalized` | 字符串 | 归一化后的预测结果 | | `judge_verdict` | 字符串 | 大语言模型评审结论:`"ok"`/`"unclear"`(待确认,无问题)/`"backfit"`(需过滤) | | `judge_reason` | 字符串 | 评审的单句理由说明 | ## 轨迹格式 {简洁推理过程,可引用题目配图} <tool>sympy: integrate(x**2, x)</tool> <tool_result>x**3/3</tool_result> {如需补充可继续推理} <answer>oxed{ANSWER}</answer> ## 加载方式 通过Hugging Face Datasets库加载: python from datasets import load_dataset ds = load_dataset("shanyangmie/physr1corp-cold-start", split="train") 或通过原始JSONL文件加载: python import json rows = [json.loads(l) for l in open("physr1corp_cold_start.jsonl")] ## 多模态轨迹说明 1973条轨迹中有233条包含`image_path`字段,指向本地PNG格式配图。若需将其用于SFT训练,请按以下步骤操作: 1. 从[`shanyangmie/physr1corp`](https://huggingface.co/datasets/shanyangmie/physr1corp)下载`extra_images/`文件夹: python from huggingface_hub import snapshot_download cache = snapshot_download("shanyangmie/physr1corp", repo_type="dataset", allow_patterns=["extra_images/*"]) 2. 将每条轨迹中的`image_path`映射至缓存路径(内置`loader.py`脚本可自动完成该映射)。 ## 生成方法 1. **数据来源**:全部2268道题目来自[`shanyangmie/physr1corp`](https://huggingface.co/datasets/shanyangmie/physr1corp)(Physics-R1使用的经审核闭式强化学习训练池,收录于NeurIPS 2026 数据集与基准赛道)。 2. **纯文本轨迹生成**:采用25个并行子智能体批次(使用Claude Code订阅版,非API接口),覆盖全部2005道纯文本题目。 3. **多模态轨迹生成**:采用6个并行子智能体,通过Read工具读取配图并调用Bash环境下的SymPy工具,覆盖全部263道带配图的题目。 4. **反拟合提示(Anti-back-fit prompting)**:从第3轮迭代起,智能体在出现分歧时对推导值而非标准答案进行盒装标注,可将真实的标准答案错误以诚实不匹配的形式暴露出来。 5. **LLM评审审核**:通过8个子智能体轮次生成的16个审核块,对每一条名义匹配的轨迹进行静默拟合检测。 6. **最终有效清洗率**:1973 / 2268 = 87.0%。 ## 污染情况统计 | 样本来源 | 数量 | 占比 | |---|---|---| | ✅ 有效样本(评审结论为`"ok"`或`"unclear"`) | 1,973 | 87.0% | | 评审检出的静默拟合样本 | 86 | 3.8% | | 智能体披露的拟合样本 | 16 | 0.7% | | 诚实不匹配样本(标准答案错误/验证器缺陷) | 85+ | 3.7% | | 沙箱错误残留(验证器格式缺陷) | 92+ | 4.1% | 我们直接检出的部分PhysR1Corp标准答案错误包括: - 题目`1810`:多普勒效应题标准答案为`0 . 01324 c`(科学计数法中存在空格) - 题目`1727`:相对论杆问题——洛伦兹收缩与彭罗斯-特雷尔效应歧义 - 题目`924`:抛体选择题:推导结果指向选项D,但标准答案为C - 题目`2813`:液态氢沸点标注为`77.36 K`(实际该温度为液氮沸点,液态氢沸点为20.3 K) - 题目`2457`:氢元素`<E>`算术题:标准答案应为-7.48,而非标注的-7.68 - 题目`1781`:粒子能量题:标准答案标注单位为`GeV`,但物理推导应为`MeV` - 题目`2862`:弦运动学题:标准答案误差系数为2 - 题目`156`:标准答案称“介质2中频率更高”,违反频率不变性原理 ## 统计信息 - 1,973条有效轨迹(1,740条纯文本轨迹 + 233条多模态轨迹) - 平均轨迹长度:267个字符 - 75.3%的轨迹使用了SymPy工具(剩余24.7%为无需工具调用的概念型选择题) - 每条轨迹平均调用SymPy工具0.87次 ## 文件说明 - `physr1corp_cold_start.jsonl`(1,973条数据):**训练就绪版**,仅包含经审核清洗后的有效样本 - `physr1corp_cold_start_full.jsonl`(2,268条数据):完整标注数据集,包含所有待重新分析的标记样本 - `loader.py`:Python辅助加载脚本 ## 许可证 CC BY-NC 4.0(继承自上游数据集PhysR1Corp) ## 引用 匿名作者(待发表), 2026. Physics-R2: 面向物理视觉语言模型的工具使用强化学习. ICLR 2027. 基础语料库引用: 匿名作者, 2026. Physics-R1: 面向视觉物理推理的经审核奥赛数据集与实现方案. NeurIPS 2026 数据集与基准赛道.

提供机构:
shanyangmie
搜集汇总
数据集介绍
shanyangmie/physr1corp-cold-start 数据集图片
构建方式
该数据集基于PhysR1Corp语料库中全部2,268道物理问题构建而成。生成过程采用多智能体并行策略:对于2,005道纯文本问题,通过25个并行子代理(基于Claude Code订阅而非API)生成轨迹;对于263道含图像问题,借助6个并行子代理读取图像并结合Bash SymPy工具完成推理。自第三轮迭代起引入反回溯拟合提示机制,促使模型在存在分歧时输出推导值而非真实答案,从而暴露语料库中的潜在错误。最终,所有初步匹配的轨迹经过LLM评判审计,剔除86条静默回溯拟合样本及16条代理主动披露的拟合样本,得到1,973条经审核的清晰轨迹,净清洁率为87.0%。
使用方法
用户可通过HuggingFace Datasets库直接加载数据,使用`load_dataset("shanyangmie/physr1corp-cold-start", split="train")`即可获取训练集。对于多模态样本,需从关联的PhysR1Corp数据集中下载`extra_images/`文件夹,并将各样本中的`image_path`字段重映射至本地缓存路径,数据集附带的`loader.py`脚本可自动完成此映射过程。数据以JSONL格式提供,包含`physr1corp_cold_start.jsonl`(1,973条训练就绪样本)及`physr1corp_cold_start_full.jsonl`(2,268条完整标注样本,含待重新分析的标记行)两个版本,方便用户根据需求选择使用。
背景与挑战
背景概述
PhysR1Corp Cold-Start数据集诞生于2026年,由匿名研究团队为Physics-R2项目所创建,旨在推动多模态大模型在物理推理领域的工具调用强化学习研究。该数据集源自更广泛的PhysR1Corp语料库,后者曾支撑Physics-R1模型在NeurIPS 2026数据集与基准轨道上取得突破。作为一个冷启动监督微调数据集,它精心筛选了1,973条经过审计的物理问题求解轨迹,涵盖文本与图像两类模态,并严格使用SymPy工具进行符号代数运算。其核心研究问题在于如何通过结构化的工具调用轨迹,训练多模态大模型在物理推理中准确运用外部计算工具,从而提升模型在复杂物理问题上的鲁棒性与可解释性,对后续ICLR 2027的Physics-R2论文具有奠基意义。
当前挑战
该数据集面临的挑战首先来自于所解决的领域问题:物理推理任务要求模型不仅理解自然语言与视觉信息,还需精确调用符号计算工具进行多步推导,这远比传统问答任务复杂,容易因工具调用错误或推理逻辑偏差导致答案失准。其次,数据集的构建过程遭遇了诸多困境,包括从2,268道原始题目中生成并审计轨迹时,需对抗模型的反向拟合行为——即模型通过记忆答案而非正确推理来匹配结果;为此,设计者从第三轮迭代起引入反反向拟合提示策略,迫使模型在分歧时显式推导而非直接套用参考答案。此外,审计工作揭示了大量黄金标注错误,如单位混淆、物理概念误用及数值计算偏差,这些错误共涉及85条以上轨迹,虽被诚实标记却暴露了语料库本身的质量隐患。最终,经过多轮并行子智能体生成与LLM法官审核,仅有87.0%的轨迹被认定为洁净可用,剩余部分因沙箱错误、验证器格式漏洞或黄金错误而成为污染源,凸显了构建高质量物理推理训练数据的艰辛与复杂性。
常用场景
经典使用场景
PhysR1Corp冷启动数据集在物理视觉语言模型的强化学习流程中扮演着奠基性角色。该数据集包含1,973条经过严谨审计的轨迹数据,涵盖纯文本与多模态两种形态,每条轨迹都完整记录了从问题接收到最终答案的推理链条,包括符号推理引擎SymPy的调用历史、中间计算结果以及最终答案的封装过程。研究者常将此数据集作为监督微调的初始样本池,用以赋予模型基础的符号计算与结构化推理能力,为后续基于强化学习的策略优化提供高质量的起点。其独特的轨迹格式与物理学奥林匹克竞赛问题相结合,使其成为训练能够进行数学严谨推理的智能系统的理想素材。
解决学术问题
该数据集的核心贡献在于解决了视觉语言模型在物理推理中普遍存在的符号计算脆弱性与推理过程不可追溯的学术难题。通过精心设计的轨迹结构,每个解答都嵌入了可执行的SymPy代码段及其执行结果,使模型能够学习将自然语言描述的物理问题转化为精确的符号表达式,并利用计算机代数系统进行可靠的数学操作。该数据集还直面了训练数据污染这一棘手问题,其审计流程揭示并标注了原始语料中的大量黄金标准答案错误与验证器缺陷,如单位混淆、科学记数法格式异常以及物理概念应用不当等,为构建更鲁棒的评估体系提供了宝贵参照。
实际应用
在实际应用层面,该数据集主要服务于物理教育智能化与科学计算自动化领域。基于此数据集训练的模型可以被部署为高级物理助教系统,能够逐步展示物理问题的求解过程,包括公式推导、数值计算与参数调整,为学习者提供可解释的推理示范。在科研辅助方面,经过微调的视觉语言模型能够处理包含图表的物理问题,将示意图中的空间关系自动转化为数学表达式,辅助研究人员快速验证假设或探索不同参数条件下的物理规律。此外,数据集中的多模态样本支持将图像理解与符号推理相结合的端到端系统开发,为物理实验数据的自动分析提供了可行路径。
数据集最近研究
最新研究方向
该数据集聚焦于物理推理领域的前沿方向,特别是结合工具增强推理与多模态强化学习的研究热点。PhysR1Corp Cold-Start 数据集为视觉语言模型(VLM)在物理问题求解中的工具调用能力提供了高质量的冷启动训练轨迹,通过 SymPy 符号计算引擎与沙箱运行时环境的集成,推动了可验证、可审计的物理推理范式发展。其独特之处在于融合了文本与图像多模态数据,并采用严格的反过拟合审计流程,识别并修正了源数据集中的标注错误(如科学记数法格式、物理常数混淆等问题),显著提升了训练数据的可靠性。该数据集支撑的 Physics-R2 研究代表了将强化学习与工具使用相结合的最新趋势,旨在培养模型在开放域物理推理中的自主验证与纠错能力,对推动可信赖的 AI 科学推理系统具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务