遇见数据集

poolside-laguna-hackathon/laguna-xs2-synthetic-training-data

收藏
Hugging Face2026-05-30 更新2026-06-14 收录
官方服务:

资源简介:

Laguna XS.2合成训练数据是一个用于改进Laguna XS.2模型在编码和科学推理任务上性能的合成数据集。该数据集是在Poolside Research Hackathon(2026年5月)中生成的。数据集包含两个主要部分:1) 编码部分:基于SWE-bench数据集,由Qwen3.6-35B-A3B教师模型生成的软件工程任务解决方案补丁,格式为JSONL,每个条目包括问题、教师生成的补丁和分数,适用于监督微调(SFT)或组策略优化(GRPO)训练;2) 科学部分:基于GPQA Diamond(研究生级科学问题)数据集,由AM-thinking-v1教师模型生成的思维链推理轨迹,格式为JSONL,每个条目包括问题、完整的推理轨迹和答案,适用于SFT训练,旨在提高模型在科学推理任务上的性能(在GPQA基准测试中测得42.6%的准确率)。数据集的生成动机是解决Laguna XS.2模型在GPQA Diamond(42.6%准确率,仅比随机高17.6%)和MATH500(46.6%准确率,在微积分和中级代数方面表现较弱)基准测试中的明显弱点。数据集的使用可以通过Python代码加载JSONL文件实现。

Laguna XS.2 Synthetic Training Data is a synthetic dataset generated to improve the Laguna XS.2 model on coding and scientific reasoning tasks. It was produced as part of the Poolside Research Hackathon in May 2026. The dataset consists of two main components: 1) Coding: SWE-bench coding trajectories generated by the Qwen3.6-35B-A3B teacher model, in JSONL format, each entry containing a problem, teacher solution patch, and score, suitable for SFT or GRPO training to enhance software engineering capabilities; 2) Scientific: GPQA Diamond reasoning traces generated by the AM-thinking-v1 teacher model, in JSONL format, each entry containing a question, full chain-of-thought reasoning trace, and answer, intended for SFT training to improve scientific reasoning performance (measured at 42.6% on GPQA). The motivation for creating this data is to address Laguna XS.2s weaknesses in benchmarks such as GPQA Diamond (42.6%, only 17.6% above random) and MATH500 (46.6%, with struggles in Precalculus and Intermediate Algebra). Usage involves loading the JSONL files with Python.

搜集汇总
数据集介绍
poolside-laguna-hackathon/laguna-xs2-synthetic-training-data 数据集图片
构建方式
该数据集是围绕提升Laguna XS.2模型在编程与科学推理任务上的表现而构建的。构建过程引入了两类强教师模型:在编程领域,使用Qwen3.6-35B-A3B模型对SWE-bench基准中的问题生成补丁方案,并以JSONL格式记录包括问题描述、教师解决方案及质量评分在内的完整轨迹数据;在科学推理方面,借助AM-thinking-v1模型对GPQA Diamond数据集中的研究生级别科学问题进行作答,生成了包含完整思维链推理过程的详细轨迹。整个数据集在Poolside Research Hackathon期间完成。
特点
该数据集的最大特色在于其精准的弱点导向性和高质量的合成数据特性。数据集的核心构建思路并非盲目扩充样本,而是基于Laguna XS.2在GPQA Diamond(仅42.6%准确率)和MATH500(46.6%准确率)等测试中暴露的明显薄弱环节,有针对性地利用更强模型进行知识蒸馏。因此,数据涵盖编程和科学推理两大关键领域,其中编程数据包含带评分的补丁方案,科学数据则提供详尽的思维链中间步骤,有效提升了数据的信息密度和训练价值。
使用方法
数据集的使用便捷灵活,主要支持监督微调(SFT)和组相对策略优化(GRPO)两种训练范式。用户可通过Python的json库直接读取JSONL格式的压缩文件:对于编程任务,加载'coding/teacher_patches_scored.jsonl'文件,即可获取包含问题、补丁和评分的结构化条目;对于科学推理任务,则读取'scientific/scientific_traces.jsonl'文件,获得包含问题、完整思维链和最终答案的样本。数据的开放性使得研究人员能快速将其集成到Laguna XS.2或其他模型的训练流程中。
背景与挑战
背景概述
Laguna XS.2 Synthetic Training Data 数据集由 Saurabh Mallik 在 Poolside Research Hackathon(2026年5月)期间创建,旨在提升 poolside/Laguna-XS.2 模型在代码生成与科学推理任务上的表现。该数据集通过强教师模型(如 Qwen3.6-35B-A3B 和 AM-thinking-v1)生成合成训练数据,聚焦于软件工程与研究生级科学问题(GPQA Diamond)两大核心挑战。Laguna XS.2 模型在 GPQA Diamond 上仅达 42.6%(略高于随机水平17.6%),在 MATH500 上为 46.6%,暴露出其在复杂推理与领域知识应用上的显著短板。该数据集的发布为小型语言模型在专业推理任务上的能力突破提供了关键训练资源,推动了合成数据在小模型优化中的实践探索。
当前挑战
该数据集面临的核心挑战包含三方面:首先,所解决的领域问题在于提升小规模语言模型在软件工程(如 SWE-bench 补丁生成)与科学推理(如 GPQA Diamond 高阶问答)中的专业化能力,这两个任务要求模型具备精准的代码修正逻辑与跨学科知识整合能力,远超通用文本生成范畴。其次,构建过程需要从零生成高质量的教师轨迹,包括对 SWE-bench 问题生成可靠的补丁并评分过滤,以及对 GPQA Diamond 问题生成完整的思维链(CoT)推理过程,这要求教师模型本身具备极强的领域专长,同时也面临数据规模与多样性的平衡挑战。此外,合成数据的泛化性与潜在偏差控制是持续难点,需确保训练数据能有效迁移至真实场景中的复杂任务,避免过拟合于教师模型特定模式。
常用场景
经典使用场景
该数据集专为提升Laguna XS.2模型在编程与科学推理任务上的能力而设计,其经典使用场景涵盖监督微调(SFT)与组相对策略优化(GRPO)两种范式。在编程领域,数据集中包含了来自SWE-bench的教师模型补丁,可用于训练模型生成高质量软件工程修复方案;在科学推理方面,GPQA Diamond数据集提供的链式思维推理轨迹则适用于增强模型在研究生级别科学问题上的逻辑推演能力。研究者可借助JSONL格式的标准化数据,便捷地加载教师补丁与评分结果,或直接使用完整推理轨迹进行多轮训练,从而系统性地弥补基础模型在数学与高阶推理中的性能短板。
衍生相关工作
该数据集的诞生与使用催生了一系列关联性研究工作。其核心方法论——即利用强教师模型生成合成数据以蒸馏推理能力——与近年来兴起的Self-Instruct、STaR(Self-Taught Reasoner)及ReST(Reinforced Self-Training)等范式一脉相承。此外,基于SWE-bench的补丁生成任务直接呼应了OpenAI的CriticGPT与CodiumAI等代码修复研究方向,而GPQA轨迹数据则为O1-style慢思考模型的训练提供了关键数据支撑。该数据集亦可作为后续研究如DSPy程序化编译、RLAIF(基于AI反馈的强化学习)或混合专家模型(MoE)理性对齐的基准数据源,推动高效推理与领域自适应技术的持续迭代。
数据集最近研究
最新研究方向
当前,合成数据生成与弱模型知识蒸馏正成为提升小型语言模型在编码与科学推理任务上表现的前沿范式。该数据集针对Laguna XS.2在GPQA Diamond仅42.6%及MATH500仅46.6%的显著短板,利用Qwen3.6-35B-A3B与AM-thinking-v1作为教师模型,分别生成SWE-bench编码轨迹与研究生级科学推理链,旨在通过SFT与GRPO训练突破瓶颈。这一工作不仅呼应了开源社区对代码智能体与推理增强的迫切需求,更以Poolside研究黑客松为催化剂,展示了合成数据在定向修复模型弱点中的核心价值——为轻量模型追赶前沿能力提供了可复现的工程路径,对推动高效能科学计算与自动化编程的普及具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务