r1k
收藏资源简介:
r1k数据集是一个高质量的逆向推理数据集,通过将s1k数据集中的1000个正向推理示例进行逆向转换而得到。该数据集由DeepSeek-R1模型生成,无需昂贵的数据收集、清洗或选择流程。r1k数据集旨在研究双向推理对大型语言模型推理能力的影响,并探索如何通过双向监督提升模型性能。数据集包含反向问题和推理路径,以及相应的答案,旨在支持更鲁棒的推理能力。
The r1k dataset is a high-quality backward reasoning dataset, derived by reversely converting 1000 forward reasoning examples from the s1k dataset. Generated by the DeepSeek-R1 model, this dataset circumvents the need for costly data collection, cleaning, or selection processes. It is intended to investigate the influence of bidirectional reasoning on the reasoning abilities of large language models (LLMs), as well as to explore how to improve model performance through bidirectional supervision. The dataset comprises backward questions, reasoning paths, and their corresponding answers, with the goal of supporting the cultivation of more robust reasoning capabilities.
数据集概述:When Inverse Data Outperforms: Exploring the Pitfalls of Mixed Data in Multi-Stage Fine-Tuning
基本信息
- 标题: When Inverse Data Outperforms: Exploring the Pitfalls of Mixed Data in Multi-Stage Fine-Tuning
- arXiv标识符: arXiv:2509.13079
- 提交日期: 2025年9月16日
- 作者: Mengyi Deng, Xin Li, Tingyu Zhu, Zhicheng Yang, Zhijiang Guo, Wei Wang
- 学科分类: 计算机科学 > 机器学习 (cs.LG); 计算与语言 (cs.CL)
- DOI: https://doi.org/10.48550/arXiv.2509.13079
摘要
现有研究表明,通过有限的数据蒸馏可以实现o1级性能,但大多数现有方法侧重于单向监督微调(SFT),忽略了不同推理模式之间复杂的相互作用。本文构建了r1k,一个通过反转s1k中的1,000个前向示例得到的高质量逆向推理数据集,并研究了在双向推理目标下SFT和直接偏好优化(DPO)如何影响对齐。在r1k上进行SFT相比s1k在评估基准上实现了1.6%--6.8%的准确率提升。然而,在SFT过程中简单混合前向和逆向数据会削弱方向区分。尽管DPO可以部分恢复这种区分,但它也会通过将概率质量转移到不相关的输出来抑制较少偏好的推理路径。这些发现表明混合推理数据引入了冲突的监督信号,强调了需要强大且方向感知的对齐策略。
数据集信息
- 数据集名称: r1k
- 数据来源: 通过反转s1k中的1,000个前向示例构建
- 数据类型: 逆向推理数据
- 对比数据集: s1k(前向推理数据集)
研究方法
- 主要方法: 监督微调(SFT)和直接偏好优化(DPO)
- 研究重点: 双向推理目标下的对齐效果
- 评估指标: 准确率提升(1.6%--6.8%)
主要发现
- 在r1k上进行SFT相比s1k带来显著准确率提升
- 混合前向和逆向数据会削弱方向区分
- DPO可部分恢复方向区分但会抑制较少偏好的推理路径
- 混合推理数据引入冲突的监督信号
相关链接
- PDF文档: http://arxiv.org/pdf/2509.13079
- TeX源码: http://arxiv.org/tex/2509.13079
- 其他格式: http://arxiv.org/format/2509.13079

- 1When Inverse Data Outperforms: Exploring the Pitfalls of Mixed Data in Multi-Stage Fine-Tuning香港科技大学(广州)信息枢纽、数据科学与分析研究中心,香港特别行政区,香港科技大学 · 2025年



