遇见数据集

swegym_opus45_1495i

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集包含1495条训练样本,每条样本包含一个对话历史(messages字段,由角色和内容组成),以及多个布尔属性字段(broad_then_narrow、multi_round_refinement、read_after_narrowing)和一个字符串字段judge_notes。此外,每条样本还有一个resolved布尔字段表示是否已解决,以及唯一标识instance_id。数据集可用于对话系统的属性分析或质量评估任务。

This dataset contains 1495 training samples, each consisting of a conversation history (messages field, composed of role and content), multiple boolean attribute fields (broad_then_narrow, multi_round_refinement, read_after_narrowing), a string field judge_notes, a boolean field resolved indicating whether the issue is resolved, and a unique identifier instance_id. The dataset can be used for attribute analysis or quality evaluation tasks of dialogue systems.

创建时间:
2026-08-23
原始信息汇总

数据集概述

基本信息

数据划分

  • 训练集(train):包含 1,495 个样本,数据字节数为 342,527,708
  • 数据文件路径:data/train-*

特征字段

该数据集包含以下特征字段:

字段名 类型 说明
instance_id string 实例标识符
resolved bool 是否已解决
messages list 消息列表,包含 content(字符串)和 role(字符串)两个子字段
broad_then_narrow bool 是否采用“先广泛后聚焦”策略
multi_round_refinement bool 是否进行多轮优化
read_after_narrowing bool 是否在聚焦后阅读
judge_notes string 评判备注

配置信息

  • 配置名称:default
  • 数据文件:训练集文件为 data/train-* 模式匹配的多个文件

该数据集用于 SWE-Gym 相关的代码合成训练任务,包含 1,495 个实例,每个实例附带详细的解决状态、消息交互过程以及多轮优化等元数据信息。

搜集汇总
数据集介绍
swegym_opus45_1495i 数据集图片
构建方式
本数据集名为swegym_opus45_1495i,源自SWE-Gym项目,由智能体Opus 4.5在1495个真实世界软件工程任务上交互生成。每条样本包含实例ID、是否解决(resolved)、完整的对话消息序列(messages)、是否采用从宽到窄的搜索策略(broad_then_narrow)、是否进行多轮细化(multi_round_refinement)、收窄后是否阅读上下文(read_after_narrowing)以及裁判注释(judge_notes)。数据通过记录智能体在解决GitHub issue时的完整轨迹构建而成,涵盖多种问题解决策略,形成丰富的多轮交互语料。
使用方法
使用时,可将数据集加载为HuggingFace Dataset格式,通过train split获取数据。典型应用包括:训练代码修复模型或智能体,将messages作为输入序列,resolved作为监督信号;分析不同策略(如broad_then_narrow)对成功率的影响;利用judge_notes进行模型行为的定性分析。数据格式简洁,易于适配到序列到序列或强化学习框架。建议将数据集按8:1:1划分为训练、验证和测试子集,以评估模型泛化能力。
背景与挑战
背景概述
随着深度学习在软件工程领域的深度渗透,基于大语言模型的代码生成与自动修复技术日益成为研究前沿。swegym_opus45_1495i数据集于近期由相关研究团队构建并发布,旨在系统评估前沿多模态大模型在真实世界软件工程问题上的解决能力。该数据集以SWE-bench基准为蓝本,精选1495个源自GitHub的真实issue,并采用Claude Opus 4.5等强模型生成候选补丁,覆盖代码缺陷修复、功能增强及测试生成等核心任务。其构建依托多语言代码仓库,融合多轮对话、上下文细化等交互模式,为探究模型在复杂代码环境中的理解、推理与修改能力提供了高质量测试床。自发布以来,该数据集已迅速成为衡量大模型软件工程素养的重要参照,有力推动了代码智能领域评估范式的发展。
当前挑战
当前,该数据集面临的挑战多维且深刻。于领域问题而言,真实软件工程issue天然具备高复杂度与强上下文依赖性,模型需精准定位相关代码片段并合成语义正确的修改,而现有大模型在此类精确代码变更任务上仍存明显短板,尤其在跨文件依赖、非局部逻辑更迭等场景下,失败率居高不下;同时,补丁的正确性验证依赖构建与测试通过,过程繁琐且易受环境波动干扰。于构建过程而言,从海量issue中筛选可复现样例、生成高质量监督信号及设计鲁棒评判机制均属繁琐工程,且需人工介入以去除噪声、保证标签纯净,致使数据规模与质量处于两难平衡,进而制约了模型性能提升与基准泛化能力的拓展。
常用场景
经典使用场景
在软件开发与程序语言处理领域,代码生成与优化任务始终是研究的核心议题。swegym_opus45_1495i数据集汇集了1495个真实的软件工程问题实例,每个实例均包含完整的交互消息序列、解决状态以及多轮修正的标注信息。这一数据集为评估大语言模型在代码生成、错误修复和程序合成等方面的能力提供了标准化的测试基准,尤其适用于深入探究模型在复杂代码环境下的推理与修改能力。
解决学术问题
该数据集直面当前大语言模型在代码生成领域所面临的泛化能力薄弱与鲁棒性不足等学术挑战。通过提供带有细粒度过程标注(如广泛先于狭窄搜索策略、多轮细化、窄化后重读等)的高质量实例,它使研究者能够系统分析模型在代码修复过程中的决策路径和学习行为。这种精细化的数据支撑,有助于揭示模型理解代码语义和定位缺陷的根本机制,从而推动构建更具解释性和可靠性的代码智能模型,对软件工程自动化研究具有深远影响。
实际应用
在实际应用层面,该数据集可直接服务于智能编程助手、自动化代码审查系统以及故障诊断平台等工具的研发与迭代。开发团队可借助此数据集训练并验证模型在真实软件仓库场景下的缺陷修复和功能增强能力,进而提升开发者编码效率与软件质量。此外,数据集中交互消息的结构化呈现,也为构建多轮人机协同编程接口提供了宝贵的训练语料,加速了从研究原型到工业级应用的转化进程。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中基于大型语言模型的自主问题解决能力评估,其构建的1495个实例融合了多轮对话交互与动态问题收窄策略,为智能体在真实代码仓库中的端到端修复性能提供了高保真基准。当前前沿研究趋势强调从静态代码生成转向动态环境下的持续学习与自校正,此数据集通过捕获解决过程中的精细决策节点(如多轮细化与阅读策略),有力支撑了对于模型推理透明度及策略适应性的深度剖析。其与近期大模型在复杂软件开发任务上泛化能力的热点探讨紧密相连,对于揭示模型在不确定性信息下的规划潜力和鲁棒性边界具有里程碑意义,进而推动更可靠、更具备上下文意识的自动化编程助手的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务