遇见数据集

IIGroup/X-Coder-SFT-376k

收藏
Hugging Face2026-02-07 更新2026-02-07 收录
官方服务:

资源简介:

X-Coder-SFT-376k是一个大规模、完全合成的数据集,旨在推动竞争性编程的发展。该数据集包含4个子集,共有887,321条合成记录,覆盖423,883个独特查询。它适用于监督微调,适合从零开始训练代码推理基础。数据集由先进的推理模型精心策划,查询由OpenAI GPT-o3-mini合成,解决方案由DeepSeek-R1-0528和Qwen3-235B-A22B-Thinking-2507生成。数据集包括独特提示、多解决方案、混合和已验证四个子集,每个子集有不同的用途和特点。

X-Coder-SFT-376k is a large-scale, fully synthetic dataset for advancing competitive programming. The dataset comprises 4 subsets with a total of 887,321 synthetic records across 423,883 unique queries. It is designed for supervised fine-tuning and suitable for cold start to train code reasoning foundations. X-Coder-SFT-376k is curated by state-of-the-art reasoning models. The query is synthesized by OpenAI GPT-o3-mini, the solutions are generated by DeepSeek-R1-0528 and Qwen3-235B-A22B-Thinking-2507. The dataset includes four subsets: unique-prompt, multiple-solution, hybrid, and verified, each with different purposes and features.

提供机构:
IIGroup
搜集汇总
数据集介绍
构建方式
在竞争性编程领域,高质量合成数据的构建是推动代码推理模型发展的关键。X-Coder-SFT-376k数据集由清华大学与微软联合打造,依托前沿推理模型全流程生成。其查询问题由OpenAI GPT-o3-mini合成,而解决方案则分别由DeepSeek-R1-0528与Qwen3-235B-A22B-Thinking-2507生成,确保了问题与答案的多样性与深度。数据集包含四个子集:unique-prompt、multiple-solution、hybrid与verified,总计887,321条记录,覆盖423,883个独特查询,专为监督微调与代码推理基础训练设计。
特点
该数据集的核心特色在于其分层架构与规模扩展性。unique-prompt子集强调查询多样性,每个查询仅对应一个解决方案,且与其他子集无重叠。multiple-solution子集则聚焦解决方案多样性,平均每个查询拥有6.51个响应,适合训练模型生成多样化代码。hybrid子集作为综合版本,融合了单响应、多响应及经过验证的高质量解决方案,其中verified子集包含100%经过严格验证的八响应查询。数据分布显示,随着任务数量与每个任务解决方案数量的扩展,模型性能呈现清晰的缩放规律,为训练代码推理基础提供了可靠支撑。
使用方法
使用该数据集进行模型训练时,可依据任务需求灵活选择子集。对于大规模监督微调,推荐直接加载hybrid子集,该子集包含已验证的高质量解决方案与推理过程。若需提升查询多样性,可组合unique-prompt子集与其他子集,无需去重。而若目标是增强解决方案多样性,则multiple-solution子集更为合适。通过HuggingFace的datasets库,仅需一行代码即可加载指定子集,例如使用load_dataset('IIGroup/X-Coder-SFT-376k', split='hybrid')。数据格式为简洁的JSON结构,每条记录包含查询与响应字段,便于集成至标准训练流程。
背景与挑战
背景概述
在人工智能与程序合成领域,竞争性编程(Competitive Programming)长期被视为评估模型推理与代码生成能力的严苛试金石。2026年,由清华大学与微软研究院联合团队(Wu et al.)构建的X-Coder-SFT-376k数据集应运而生,旨在突破传统人工标注数据规模有限、多样性不足的瓶颈。该数据集完全通过合成方式生成,涵盖887,321条记录与423,883个独立查询,依托OpenAI GPT-o3-mini、DeepSeek-R1-0528及Qwen3-235B-A22B-Thinking-2507等前沿推理模型,自动生成任务描述、解决方案与测试用例。其研究核心在于探索大规模合成监督微调数据对代码推理能力的冷启动训练效果,并通过系统性缩放实验揭示了数据规模与模型性能之间的缩放定律,为后续强化学习与验证驱动训练奠定了方法论基础。
当前挑战
当前数据集面临的首要挑战在于领域问题的复杂性:竞争性编程要求模型不仅理解自然语言描述的算法逻辑,还需生成精确且高效的代码实现,这对模型在抽象推理、边界条件处理及多步规划能力上提出了极高要求。其次,构建过程中遭遇了合成数据质量控制难题,尽管采用多模型协作生成与验证机制,但如何确保合成任务与真实竞赛场景的语义一致性,避免伪相关或逻辑漏洞,仍是亟待攻克的难点。此外,数据集的混合拆分结构(如unique-prompt与multiple-solution子集间的独立性设计)虽提升了多样性,但子集间约55%的重叠率要求后续使用时需谨慎去重,否则可能引入偏差。最后,大规模合成数据的存储与处理(如24.3GB的混合子集)对计算资源与训练效率构成了实际挑战,尤其是在冷启动场景下平衡数据规模与模型收敛速度的关系。
常用场景
经典使用场景
X-Coder-SFT-376k 数据集专为提升大语言模型在竞争性编程领域的推理与代码生成能力而设计,其经典使用场景在于监督微调(SFT)阶段,为模型提供大规模、全合成的编程任务、解决方案与测试用例。研究者可借助该数据集对基础模型进行冷启动训练,构建强大的代码推理基础,尤其适用于需要模型从零开始理解复杂算法逻辑并生成高质量代码的场景。数据集包含四个子集(unique-prompt、multiple-solution、hybrid、verified),其中hybrid子集融合了单响应与多响应数据,兼顾查询多样性与解决方案丰富度,为训练兼具广度与深度的代码模型提供了理想资源。
实际应用
在实际应用中,X-Coder-SFT-376k 可赋能自动化编程助手、在线判题系统及算法竞赛辅助工具,显著提升模型在真实编程环境中的问题解决效率。例如,开发者可基于该数据集微调模型,使其能够针对复杂编程挑战生成多样化的解决方案,并自动输出带有推理过程的代码,便于调试与学习。此外,verified子集中的高置信度解可用于构建代码质量评估系统,辅助教育平台为学生提供精准反馈。该数据集的全合成特性还降低了领域适配门槛,使非英语母语的开发者也能借助翻译后的查询生成可靠代码,拓展了编程智能工具的全球化应用前景。
衍生相关工作
X-Coder-SFT-376k 的发布催生了多项衍生研究,包括基于其数据生成管道的自动化合成框架(如GitHub仓库中提供的完整pipeline),以及结合强化学习与验证反馈(RLVR)的模型优化方法。研究者进一步探索了数据缩放定律,揭示了增加独特任务数量与每个任务解决方案数量对模型性能的不同影响,为高效数据配比策略提供了理论指导。此外,该数据集被用作多模型协作蒸馏的基准,例如利用多个推理模型生成互补解,训练出更鲁棒的代码生成器。这些工作不仅深化了全合成数据在代码智能中的应用理解,还推动了开放源码社区中编程模型训练范式的革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务