遇见数据集

Darkyy/Phy-RL

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

IPhO Physics RLVR是一个基于国际物理奥林匹克竞赛(IPhO)的英文物理问题数据集,已整理成适合强化学习验证(RLVR)的问答格式。每个数据行包含完整的问题文本、共享上下文、具体问题、官方解决方案、结构化答案(包括值、单位、答案类型、容差、验证器、等效形式和子问题ID)、数据分割(训练或冻结测试)以及来源元数据。数据集分为训练集(510行)和冻结测试集(23行),后者包含根据本地训练策略保留的最近IPhO问题行,排除了需要手动审查或缺少解决方案的行。数据仅包含文本,支持确定性验证元数据,涵盖数值、符号/表达式、多项选择、集合/多选、元组和区间检查等验证器类型。源工作空间生成了533个已验证行(在分割导出前),46个待审查行和5个因缺少解决方案而被拒绝的行,去重后无验证错误。

IPhO Physics RLVR is a dataset of English physics problems curated from the International Physics Olympiad (IPhO), formatted into RLVR-ready question/answer rows. Each row includes the full problem text with context, shared reusable context, a focused question, the official solution evidence, structured answer targets (with value, unit, answer type, tolerance, verifier, equivalent forms, and subproblem ID), a split (train or frozen_test), and provenance metadata. The dataset is split into train (510 rows) and frozen_test (23 rows), where the frozen-test split consists of held-out recent IPhO rows according to the local training policy, excluding rows requiring manual review or missing solutions. Rows are text-only and include deterministic verifier metadata, supporting verifier families such as numeric, symbolic/expression, multiple choice, set/multi-select, tuple, and interval checks. Generation/audit artifacts from the source workspace produced 533 verified rows before split export, 46 rows held for review, 5 rejected rows with missing solutions, and 0 validation errors after deduplication.

提供机构:
Darkyy
搜集汇总
数据集介绍
Darkyy/Phy-RL 数据集图片
构建方式
Phy-RL数据集源自国际物理奥林匹克竞赛(IPhO)的英文物理问题,经过精心策划与构建,形成适用于强化学习与验证(RLVR)任务的问答数据对。每条数据包含完整的上下文提示与聚焦问题(problem_text)、可重复使用的共享上下文(shared_context)、可回答的具体问题(question)、官方解答作为证据支持(official_solution),以及结构化的验证目标(answers),涵盖数值、单位、答案类型、容差、验证器、等价形式与子问题标识。数据集划分为训练集(510条)和冻结测试集(23条),后者包含近期IPhO题目以遵循本地训练策略,仅收录无需人工复核且拥有完整解答的行。
特点
该数据集的核心特色在于其纯文本英文形式,并嵌入确定性验证器元数据,支持数值、符号/表达式、多项选择、集合/多选、元组及区间检查等多种验证器家族,为模型输出的自动验证提供严谨基础。数据来源清晰可溯,每条记录附带来源URL、哈希值与OCR元数据(provenance),确保可重复性与可信度。生成与审计流程严格,从533条已验证记录中剔除缺失解答的5条,保留46条待审,最终零验证错误,体现了高质量与高度结构化。
使用方法
用户可直接加载数据集中的'train'与'frozen_test'分割,利用'problem_text'和'question'字段作为模型输入,参考'官方解答'进行推理,并借助'answers'中的验证元数据实现自动化答案校验。该数据集特别适用于训练和评估物理推理模型,尤其在强化学习场景下,通过内置的验证器机制实现奖励信号的自定义设计。建议使用者结合验证器家族类型选择匹配的评估协议,并利用'shared_context'复用情境信息以提升推理效率。
背景与挑战
背景概述
物理奥林匹克竞赛(IPhO)作为全球中学生物理水平的顶级测评,其题目涵盖力学、电磁学、热学、光学及现代物理等核心领域,对推理严谨性与数学表达精确性提出极高要求。Phy-RL数据集由国际物理竞赛社区于2024年创建,旨在将IPhO历年真题转化为适用于强化学习与验证推理(RLVR)的结构化问答格式。该数据集由多位竞赛专家与机器学习研究者联合构建,核心研究问题聚焦于如何通过形式化验证机制提升大语言模型在科学推理任务中的可靠性。通过提供包含标准答案、容差范围及多类型验证器的元数据,Phy-RL为物理推理的自动化评估奠定了基准,对AI在科学教育、自动解题及可解释推理等领域的发展具有重要推动作用。
当前挑战
该数据集所解决的领域问题核心在于:物理竞赛推理任务中,模型不仅需生成答案,还必须满足严格的数学正确性与单位一致性,而传统自然语言评估难以捕捉数值精度与符号等价性。Phy-RL面临的主要挑战包括:一、高精度验证需求,需支持数值容差、符号表达式、集合选择及区间检测等多种验证器,避免因表述差异导致的误判;二、数据构建困难,原始IPhO题目的OCR识别、多步骤解答的结构化分解及缺失解决方案的补全均依赖大量人工审核,533条验证行中约9.5%因审核被暂留或拒绝;三、平衡训练集与冻结测试集的划分,确保模型在未见过的近年题目上评估的公正性,避免数据泄露对泛化能力测试的干扰。
常用场景
经典使用场景
Phy-RL数据集汇聚了国际物理奥林匹克(IPhO)的英文原题,并以强化学习与可验证推理(RLVR)的范式进行了结构化整理。每一道题目都包含完整的问题上下文、聚焦的子问题、官方解答以及可编程的验证器元数据,使其天然适用于训练和评估具备物理推理能力的语言模型。在经典使用场景中,研究者将数据集的“问题文本”与“共享上下文”作为模型输入,要求模型生成符合物理定律的解答,并利用内置的数值、表达式、多选题等验证器对输出进行自动评判,从而构建闭环的强化学习训练流程。这种设计不仅提升了模型在复杂物理推理任务上的准确性,也为其在竞赛级学科问题上的泛化能力奠定了坚实基础。
实际应用
在实际应用场景中,Phy-RL数据集可以赋能智能教育辅导系统,使其具备针对高中至大学预科阶段物理竞赛题目的自动解答与讲解能力。基于该数据集训练的模型能够理解复杂的物理情境,输出带有单位和容差范围的精确答案,甚至能够对学生的推导过程进行逐步验证,从而在个性化学习平台中扮演虚拟导师的角色。此外,这一数据集还可用于物理科研辅助工具的开发,帮助研究人员快速验证理论推导中的中间结果,或在自动化实验数据分析中提供可回溯的推理路径。随着强化学习与验证机制的深度融合,Phy-RL有望成为连接人工智能与真实物理世界定量推理的关键桥梁。
衍生相关工作
Phy-RL数据集的发布催生了一系列围绕可验证推理与物理学科考量的衍生工作。其中典型的方向包括基于该数据集开发的专用强化学习训练算法,能够在训练过程中动态调整验证器权重以提升模型对高难度题目的收敛效率。另一类衍生工作聚焦于跨任务迁移,研究者利用Phy-RL的标准化验证接口,将物理推理能力迁移至数学、化学等邻近学科的可验证推理任务中。此外,基于该数据集的验证器契约,社群衍生出许多开源工具链,支持自动将自由文本答案解析为可验证的符号形式,从而拓展了强化学习在符号数学领域的应用边界。这些工作共同推动了语言模型向具备严谨逻辑履约能力的科学推理演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务