shanyangmie/physr1corp-cold-start
收藏资源简介:
PhysR1Corp冷启动数据集是一个用于SFT(监督式微调)冷启动的工具使用物理轨迹数据集,包含文本和多模态数据。它由1,973条经过审计的轨迹组成(其中1,740条为纯文本,233条为多模态),覆盖了PhysR1Corp全部2,268个物理问题。每条轨迹通过自定义SymPy工具解决物理问题,工具运行在项目的harness.sandbox运行时环境中,轨迹模式与W6 RL训练推理格式完全匹配。数据源来自PhysR1Corp的所有问题,通过并行子代理生成(文本问题使用25个并行子代理批次,多模态问题使用6个并行子代理),并采用反后拟合提示和LLM-judge审计来确保质量,清洁率为87.0%。数据集平均轨迹长度为267字符,75.3%的轨迹使用了SymPy工具(平均每个轨迹0.87次工具调用),其余为概念性多选题且无工具调用。数据集支持从HuggingFace加载或通过原始JSONL文件使用,多模态行包含指向本地PNG图像的image_path字段。
许可证:CC BY-NC 4.0 任务类别: - 文本生成 - 视觉问答 语言: - 英语 标签: - 物理 - 工具使用 - SymPy - 推理 - 监督微调(SFT) - 冷启动 - 多模态强化学习(Multimodal-RL) - 多模态 规模类别: - 1K<n<10K --- # PhysR1Corp 冷启动 —— 工具使用物理轨迹(文本+多模态) 本数据集为**Physics-R2 / Phase E**(一篇面向视觉语言模型(VLM)的工具使用强化学习论文,目标投稿至ICLR 2027)的监督微调(SFT)冷启动数据集。包含1973条经审核的轨迹:其中1740条为纯文本轨迹,233条为多模态轨迹,覆盖完整的PhysR1Corp语料库(全部2268道物理题目)。每条轨迹通过项目`harness.sandbox`运行时调度自定义SymPy工具,以求解单道物理题,且轨迹格式严格匹配W6强化学习训练推理格式。 ## 数据 Schema 每条数据行包含以下字段: | 字段名 | 类型 | 描述 | |---|---|---| | `problem_id` | 字符串 | 格式为`physr1corp/<idx>` | | `question` | 字符串 | 题目描述文本 | | `gold` | 字符串 | PhysR1Corp提供的标准答案 | | `image_path` | 字符串(可选) | 仅多模态轨迹包含,指向对应配图的本地路径 | | `trajectory` | 字符串 | 完整格式字符串,涵盖推理过程、工具调用、工具返回结果与盒装答案 | | `n_tool_calls` | 整数 | SymPy工具调用总次数 | | `n_tool_errors` | 整数 | SymPy工具调用失败次数 | | `matched` | 布尔值 | 若通过验证与审核则为`True` | | `match_reason` | 字符串 | 验证类型,例如`"exact"`/`"exact_compact"`/`"sympy_eq"`等 | | `pred_normalized` | 字符串 | 归一化后的预测结果 | | `judge_verdict` | 字符串 | 大语言模型评审结论:`"ok"`/`"unclear"`(待确认,无问题)/`"backfit"`(需过滤) | | `judge_reason` | 字符串 | 评审的单句理由说明 | ## 轨迹格式 {简洁推理过程,可引用题目配图} <tool>sympy: integrate(x**2, x)</tool> <tool_result>x**3/3</tool_result> {如需补充可继续推理} <answer>oxed{ANSWER}</answer> ## 加载方式 通过Hugging Face Datasets库加载: python from datasets import load_dataset ds = load_dataset("shanyangmie/physr1corp-cold-start", split="train") 或通过原始JSONL文件加载: python import json rows = [json.loads(l) for l in open("physr1corp_cold_start.jsonl")] ## 多模态轨迹说明 1973条轨迹中有233条包含`image_path`字段,指向本地PNG格式配图。若需将其用于SFT训练,请按以下步骤操作: 1. 从[`shanyangmie/physr1corp`](https://huggingface.co/datasets/shanyangmie/physr1corp)下载`extra_images/`文件夹: python from huggingface_hub import snapshot_download cache = snapshot_download("shanyangmie/physr1corp", repo_type="dataset", allow_patterns=["extra_images/*"]) 2. 将每条轨迹中的`image_path`映射至缓存路径(内置`loader.py`脚本可自动完成该映射)。 ## 生成方法 1. **数据来源**:全部2268道题目来自[`shanyangmie/physr1corp`](https://huggingface.co/datasets/shanyangmie/physr1corp)(Physics-R1使用的经审核闭式强化学习训练池,收录于NeurIPS 2026 数据集与基准赛道)。 2. **纯文本轨迹生成**:采用25个并行子智能体批次(使用Claude Code订阅版,非API接口),覆盖全部2005道纯文本题目。 3. **多模态轨迹生成**:采用6个并行子智能体,通过Read工具读取配图并调用Bash环境下的SymPy工具,覆盖全部263道带配图的题目。 4. **反拟合提示(Anti-back-fit prompting)**:从第3轮迭代起,智能体在出现分歧时对推导值而非标准答案进行盒装标注,可将真实的标准答案错误以诚实不匹配的形式暴露出来。 5. **LLM评审审核**:通过8个子智能体轮次生成的16个审核块,对每一条名义匹配的轨迹进行静默拟合检测。 6. **最终有效清洗率**:1973 / 2268 = 87.0%。 ## 污染情况统计 | 样本来源 | 数量 | 占比 | |---|---|---| | ✅ 有效样本(评审结论为`"ok"`或`"unclear"`) | 1,973 | 87.0% | | 评审检出的静默拟合样本 | 86 | 3.8% | | 智能体披露的拟合样本 | 16 | 0.7% | | 诚实不匹配样本(标准答案错误/验证器缺陷) | 85+ | 3.7% | | 沙箱错误残留(验证器格式缺陷) | 92+ | 4.1% | 我们直接检出的部分PhysR1Corp标准答案错误包括: - 题目`1810`:多普勒效应题标准答案为`0 . 01324 c`(科学计数法中存在空格) - 题目`1727`:相对论杆问题——洛伦兹收缩与彭罗斯-特雷尔效应歧义 - 题目`924`:抛体选择题:推导结果指向选项D,但标准答案为C - 题目`2813`:液态氢沸点标注为`77.36 K`(实际该温度为液氮沸点,液态氢沸点为20.3 K) - 题目`2457`:氢元素`<E>`算术题:标准答案应为-7.48,而非标注的-7.68 - 题目`1781`:粒子能量题:标准答案标注单位为`GeV`,但物理推导应为`MeV` - 题目`2862`:弦运动学题:标准答案误差系数为2 - 题目`156`:标准答案称“介质2中频率更高”,违反频率不变性原理 ## 统计信息 - 1,973条有效轨迹(1,740条纯文本轨迹 + 233条多模态轨迹) - 平均轨迹长度:267个字符 - 75.3%的轨迹使用了SymPy工具(剩余24.7%为无需工具调用的概念型选择题) - 每条轨迹平均调用SymPy工具0.87次 ## 文件说明 - `physr1corp_cold_start.jsonl`(1,973条数据):**训练就绪版**,仅包含经审核清洗后的有效样本 - `physr1corp_cold_start_full.jsonl`(2,268条数据):完整标注数据集,包含所有待重新分析的标记样本 - `loader.py`:Python辅助加载脚本 ## 许可证 CC BY-NC 4.0(继承自上游数据集PhysR1Corp) ## 引用 匿名作者(待发表), 2026. Physics-R2: 面向物理视觉语言模型的工具使用强化学习. ICLR 2027. 基础语料库引用: 匿名作者, 2026. Physics-R1: 面向视觉物理推理的经审核奥赛数据集与实现方案. NeurIPS 2026 数据集与基准赛道.




