遇见数据集

AlienKevin/SWE-ZERO-1M-Qwen3-1.7B-Base-ECHO-eval

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集记录了在SWE-bench Verified的100个任务上,对一个基于Qwen3-1.7B-Base模型、使用100万条SWE-ZERO轨迹并应用全转录损失(full-transcript loss)进行监督微调(SFT)的检查点所进行的评估结果。评估旨在研究在扩大训练数据规模(从10K、100K到1M)时,使用全转录损失(即训练时用户和工具令牌也计入损失)与仅使用助手令牌损失相比,对模型在软件工程任务(如代码修复)上性能的影响。数据集包含每个任务的评估结果,如任务是否解决(resolved)、奖励值(reward)、尝试次数(n_attempts)、助手交互轮次(n_assistant_turns)以及完整的交互轨迹(trajectory)。结果显示,在1M规模下,全转录损失模型的pass@1得分为4%(4/100),与基线模型(11/100)相比存在7个百分点的性能差距,且趋势与较小规模时相反。分析表明模型行为健康,未出现病理性问题,但性能差距可能源于统计噪声或训练配置差异。

This dataset contains the evaluation results of a Qwen3-1.7B-Base model checkpoint that was supervised fine-tuned (SFT) on 1 million SWE-ZERO trajectories using a full-transcript loss (where user and tool tokens contribute to the loss, not just assistant tokens, analogous to ECHO-style unmasking). The evaluation is performed on the 100-task SWE-bench Verified slice. The dataset aims to study the impact of scaling training data (from 10K, 100K to 1M) and using full-transcript loss versus assistant-only loss on model performance in software engineering tasks (e.g., code repair). It includes per-task evaluation metrics such as whether the task was resolved (resolved), reward value, number of attempts, number of assistant turns, and the full interaction trajectory. Results show that at the 1M scale, the full-transcript loss model achieved a pass@1 score of 4% (4/100), exhibiting a 7 percentage-point gap compared to the baseline model (11/100), with a trend reversal from smaller scales. Analysis indicates healthy model behavior without pathological issues, but the performance gap may be attributed to statistical noise or training configuration differences.

提供机构:
AlienKevin
搜集汇总
数据集介绍
AlienKevin/SWE-ZERO-1M-Qwen3-1.7B-Base-ECHO-eval 数据集图片
构建方式
本数据集为基于Qwen3-1.7B-Base模型在SWE-ZERO轨迹数据上进行监督微调(SFT)后的评估结果,训练数据规模达100万条,源自SWE-ZERO-12M轨迹库的随机采样,每条轨迹被右截断至8192个token。其核心构建差异在于采用自定义Qwen3对话模板,将用户与工具消息包裹于`{% generation %}`标签内,使得所有token(而非仅助手输出)均参与损失计算,实现了类似于ECHO框架的全转录本损失掩码策略。微调过程采用v5p-32架构,批大小为64,历经15625步单周期训练,学习率为2e-5并配以余弦退火调度,与仅掩码助手token的对照臂保持除模板外所有超参数一致。
特点
该数据集的核心特色在于系统性地探索了全转录本损失掩码策略在扩大数据规模时的行为演变。在1000条与10万条规模下,全转录本策略与仅助手策略的性能差距呈缩小趋势(从2个百分点缩至1个百分点),暗示了稀释假设;然而当规模跃升至100万条时,差距反向扩大至7个百分点,这一非线性逆转现象挑战了简单稀释的解释。此外,模型行为分析显示其轨迹健康度良好,无空助手轮次出现(相较10K规模的28次),清洁提交率高达28%,读、编辑、执行操作占比分别为45.5%、26.5%与4.1%,表明策略退化并非性能差距的根源,而更像是一种微妙的低效策略效应。
使用方法
数据集可直接用于评估SWE-bench Verified上100个真实世界软件工程任务的修复能力,其模式映射与HuggingFace上其他SWE-ZERO评估分支(如10K与100K版本)完全一致。用户可通过`task_id`访问具体任务标识,利用`resolved`与`resolved_any_attempt`字段分别获取单次尝试与多次尝试下的通过率,`trajectory`字段以列表字典形式记录了完整代理交互轨迹,便于进行深层次行为分析。配套的Harbor与mini-swe-agent v1评估框架及Daytona执行环境为复现提供了标准化流水线,vLLM推理引擎在温度1.0、最大输出4096个token的设置下驱动代理循环,最大交互轮次设定为50。
背景与挑战
背景概述
该数据集源于SWE-ZERO项目,由研究者AlienKevin等人于近期创建,旨在评估基于Qwen3-1.7B-Base模型在软件工程任务上的微调性能。核心研究问题聚焦于探索全转录本损失掩码(ECHO风格)对模型在SWE-bench Verified基准上解决真实世界代码修复任务的影响。该数据集是10K与100K规模评估的延续,通过扩展至1M条轨迹,系统分析了损失掩码策略随数据量增长的变化趋势,为理解训练信号分配与模型行为退化之间的关系提供了关键实证。其对软件工程自动化领域具有重要影响,尤其推动了基于语言模型的开源程序修复研究。
当前挑战
该数据集面临的核心领域挑战是如何在代码修复任务中有效平衡训练信号分配。具体而言,当采用全转录本损失掩码(包含用户与工具令牌)时,1M规模下模型的性能反而出现逆转,与预期的稀释效应相悖,表明可能存在单种子噪声、环境令牌污染或超参数失配等复杂因素。构建过程中,研究者需应对评估噪声(约4个百分点的标准差)、高计算成本下的单次试验限制,以及如何确保模型轨迹行为健康而非病理化,例如避免空助手轮次等退化现象。
常用场景
经典使用场景
SWE-ZERO-1M-Qwen3-1.7B-Base-ECHO 数据集的核心用途在于评估基于全转录本损失(full-transcript loss)训练的轻量级语言模型在软件工程基准测试 SWE-bench Verified 上的代码修复能力。该数据集记录了 Qwen3-1.7B-Base 模型在 100 项软件工程任务上的单次尝试(pass@1)结果,涵盖代理轨迹、奖励信号和解决状态等关键信息。其经典使用范式是作为缩放实验(scaling experiment)的一部分,与仅助理损失(assistant-only)的基线模型进行对比,用以探究损失掩码策略随训练数据量增长(从 10K 到 100K 再到 1M)如何影响模型在自动化程序修复任务中的表现。研究者可通过该数据集复现 4% 的 pass@1 准确率,并分析健康轨迹行为、回合分布和任务解决重叠等细粒度指标,从而深入理解全转录本训练范式在不同规模下的动态演化规律。
实际应用
在实际应用层面,该数据集为构建轻量级、可部署的自动化代码修复系统提供了关键性能基准。其采用 1.7B 参数的小型模型,在成本敏感的工业场景中具有显著优势,例如集成到持续集成/持续部署(CI/CD)流水线中自动处理 bug 修复任务,或作为开发者工具中的实时代码建议引擎。数据集揭示的 4% pass@1 准确率虽看似有限,但结合其低延迟和低成本特性,可在高召回率敏感的场景(如安全补丁的初步筛选)中发挥作用。此外,该数据集的评测框架(Harbor + mini-swe-agent v1)和轨迹记录格式已被设计为可直接复用的标准化组件,允许企业基于自身私有仓库构建类似评测流水线,从而将这一学术基准转化为可量化的工程效能度量工具。
衍生相关工作
该数据集衍生了多条重要的研究线索。首先是其作为 ECHO 风格损失掩码(全转录本损失)从 10K 到 1M 缩放实验的旗舰版本,与同系列数据集(SWE-ZERO-10K 和 SWE-ZERO-100K 版本)共同构成了探索训练数据规模与损失函数交互效应的完整谱系。其次,该数据集催生了关于‘环境令牌污染’的深入理论探讨——研究者通过对比全转录本与仅助理损失在 1M 规模的非单调性趋势,提出了超参数失配和单种子噪声等假设,推动了训练稳定性与收敛条件的研究。此外,该数据集的评估配置(如 max_turns=50、max_output_tokens=4096 等超参数)已成为 TerminalWorld 项目及更广泛的 mini-swe-agent 生态的参考基准,促使后续工作关注观测截断策略、温度参数和终止行为优化,进而衍生出 Dayss、SWE-Agent 等更强基线模型的系统性对比研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务