遇见数据集

swegym_qwen80b_1500i

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集包含1500个训练样本,每个样本由以下字段组成:instance_id(字符串,实例唯一标识)、resolved(布尔值,表示是否已解决)、messages(列表,包含对话消息,每个消息有content(字符串,内容)和role(字符串,角色,如用户或助手))、broad_then_narrow(布尔值,表示是否先宽泛后精确)、multi_round_refinement(布尔值,表示是否进行多轮细化)、read_after_narrowing(布尔值,表示是否在细化后阅读)、judge_notes(字符串,法官备注)。数据集大小约为231MB,仅提供训练集。字段命名暗示该数据集可能用于多轮对话、信息检索或逐步精化任务,但具体用途需参考原始任务说明。

The dataset contains 1500 training samples, each consisting of the following fields: instance_id (string, unique instance identifier), resolved (boolean, indicating whether resolved), messages (list, containing dialogue messages, each message has content (string) and role (string, e.g., user or assistant)), broad_then_narrow (boolean, indicating whether broad then narrow), multi_round_refinement (boolean, indicating whether multi-round refinement), read_after_narrowing (boolean, indicating whether read after narrowing), judge_notes (string, judge notes). The dataset size is about 231MB, with only the training set provided. The field names suggest the dataset may be used for multi-turn dialogue, information retrieval, or stepwise refinement tasks, but the specific use case needs to refer to the original task description.

创建时间:
2026-08-26
原始信息汇总

数据集概述

该数据集名为 synthetic-code-training/swegym_qwen80b_1500i,托管于 Hugging Face 平台。它是一个用于代码合成训练的数据集,包含 1500 个训练样本,总大小约为 232 MB(下载大小约为 84 MB)。

数据特征

数据集中每个样本包含以下字段:

  • instance_id(字符串):实例的唯一标识符。
  • resolved(布尔值):指示该实例是否已解决。
  • messages(列表):由多个消息组成,每个消息包含:
    • content(字符串):消息内容。
    • role(字符串):消息角色(如 system、user、assistant)。
  • broad_then_narrow(布尔值):是否采用“先宽后窄”的策略。
  • multi_round_refinement(布尔值):是否进行了多轮细化。
  • read_after_narrowing(布尔值):是否在细化后进行了阅读。
  • judge_notes(字符串):评估者的备注或说明。

数据划分

  • train 分割:包含全部 1500 个样本,字节数为 231,869,924。

数据文件

  • 默认配置 default 下的训练数据文件位于 data/train-*,即数据以多个分片文件形式存储。

用途

该数据集主要用于代码合成模型的训练,可能涉及代码生成、问题解决等任务,并强调多轮迭代和策略性细化过程。特征中的布尔字段和评估备注为训练过程提供了额外的监督信号。

搜集汇总
数据集介绍
swegym_qwen80b_1500i 数据集图片
构建方式
该数据集名为swegym_qwen80b_1500i,源自SWE-Gym项目,由Qwen 80B模型自动生成,包含1500个经过筛选的软件工程问题实例。每个实例均包含唯一标识符(instance_id)和是否被解决的标记(resolved),并以多轮对话消息(messages)的形式呈现,每条消息记录角色(role)和内容(content)。此外,数据集详细标注了三个解题策略特征:broad_then_narrow(是否采用先广泛后狭窄的搜索策略)、multi_round_refinement(是否进行多轮细化)、read_after_narrowing(缩小范围后是否重新阅读代码),以及judge_notes字段,用于存储评估过程中的裁判备注。所有数据整合在train分割中,总大小约为232MB。
特点
该数据集的核心特点在于其针对代码生成与修复任务的高质量交互数据。实例均基于真实的软件工程问题,且由顶尖大语言模型生成,确保了问题的真实性与代表性。每条记录不仅包含问题解决的完整对话流程,还附带了三个元认知策略标注,为研究模型在复杂任务中的推理模式提供了独特的视角。数据集以训练分割统一提供,格式简洁,包含1500个样本,规模适中,既适合深度学习模型的微调,也便于进行小样本下的策略分析实验。此外,数据集中裁判备注的存在,为其在模型评估与可解释性研究上增添了价值。
使用方法
使用时,用户可直接利用HuggingFace的datasets库加载train分割。数据集以多轮对话格式组织,适合用于训练代码生成模型或进行模型策略分析。具体地,用户可将messages字段作为模型输入,预测resolved标签,或利用策略标注(如broad_then_narrow)进行多任务学习。对于数据分割,由于数据已统一在train中,用户可根据需要自行划分验证集和测试集。典型使用场景包括:基于SWE-bench基准的模型微调、代码修复策略的对比研究,以及大语言模型在软件工程任务中推理过程的可视化分析。
背景与挑战
背景概述
swegym_qwen80b_1500i数据集于近期构建,源自SWE-Gym项目的扩展,由研究团队基于Qwen2.5-80B模型生成,包含1500个软件工程实例,旨在促进语言模型在真实代码仓库中解决GitHub问题的能力。该数据集以实例ID、解析状态、多轮对话及精细标注为特征,其创建源于对自动化软件维护中代码智能体评估与训练的需求,核心研究问题聚焦于提升模型在复杂代码环境中的问题定位与修改能力。作为SWE-Gym的衍生资源,该数据集为多轮交互式代码生成提供了高质量训练语料,对代码智能领域的发展具有潜在推动力,尤其为强化学习与监督微调提供了基准,其影响力体现在为评估和优化代码语言模型在真实世界软件工程任务中的表现提供了关键数据支撑。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域上,软件工程问题复杂度高,需模型在庞大代码库中精准定位错误并生成有效补丁,涉及跨文件依赖、上下文理解及代码逻辑推理,现有模型常因长序列处理能力不足而失效,且数据集中实例多需多轮交互式修正,这对模型的自我反思与逐步求解能力提出严峻考验。构建上,生成1500个实例需大规模模型推理,成本高昂且易引入噪声,包括错误标注、低质量的修复建议及不一致的格式;同时,数据筛选与清洗需平衡实例多样性与难度,确保标签(如resolved、multi_round_refinement)的准确性,而自动评估流程的可靠性也是一大挑战,需避免幻觉或部分正确但未完全解决的案例污染训练集,从而影响下游模型性能与泛化能力。
常用场景
经典使用场景
该数据集源于SWE-Gym基准,聚焦于真实世界软件工程问题的自动化解决,包含1500个由Qwen-80B模型生成的实例,每个实例涵盖问题描述、多轮对话及解决状态。其典型应用场景是训练和评估大规模语言模型在代码修复与程序合成方面的能力,尤其是在端到端软件工程任务中,模型需理解问题、生成补丁并验证正确性。研究者常利用此数据集进行指令微调、强化学习或少样本学习,以提升模型处理复杂代码库的泛化能力。
实际应用
在实际应用中,该数据集可用于开发智能编程助手,辅助开发者自动修复代码仓库中的缺陷,提升开发效率。企业可基于此数据微调内部模型,实现从问题报告到补丁建议的半自动化流程,减少人工排查时间。此外,该数据集的交互记录(如read_after_narrowing)可指导设计更合理的用户-模型协作界面,使模型在工程师提示下逐步精化解决方案,加速迭代式开发。
衍生相关工作
此数据集衍生出多项经典工作,例如基于过程监督的奖励模型训练,利用broad_then_narrow标志强化中间步骤的正反馈;多轮修复策略的研究,通过multi_round_refinement分析模型在多次迭代中的改进模式;以及针对性数据增强技术,结合judge_notes生成更丰富的负样本,增强模型鲁棒性。此外,该数据集常与SWE-bench等基准结合,作为预训练后适应阶段的数据源,催生了多项在真实GitHub问题上的SOTA方法,推动了代码智能领域的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务