遇见数据集

DCAgent/eval-qwen3coder30b-swe3-cw-gpu-20260707-090738

收藏
Hugging Face2026-07-07 更新2026-07-22 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 3238231 num_examples: 12 download_size: 876363 dataset_size: 3238231 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
DCAgent
搜集汇总
数据集介绍
DCAgent/eval-qwen3coder30b-swe3-cw-gpu-20260707-090738 数据集图片
构建方式
该数据集名为eval-qwen3coder30b-swe3-cw-gpu-20260707-090738,是针对Qwen3-Coder-30B模型在软件工程任务(SWE-bench)上的评估结果进行系统化整理而构建的。数据收集过程依托GPU集群完成,记录了模型在特定基准测试中的完整交互轨迹。每条数据包含多轮对话(conversations),涵盖角色(role)与内容(content)字段,同时附有模型标识(model)、模型提供方(model_provider)、任务类型(task)、执行轮次(episode)、运行标识(run_id)与试验名称(trial_name)等元信息。数据集的生成依赖于自动化验证器(verifier_output)输出的评估结果,并保留了溯源信息(trace_source),确保每条记录均可追溯至原始执行环境。最终以12条样本构成训练集,数据量约3.2 MB,存储于结构化parquet格式中。
特点
该数据集的核心特征在于其对模型行为的多维度刻画与结构化存储。每条数据不仅记录了模型生成的最终结果(result),还保留了验证器的详细输出(verifier_output),使得研究者能够深入分析模型在复杂软件工程任务中的推理过程与错误模式。对话结构(conversations)以角色轮转的形式呈现,清晰展示了用户指令与模型响应之间的逻辑链条。此外,数据集中包含了试验轮次(episode)、运行ID(run_id)与试验名称(trial_name)等字段,便于对不同实验条件下的模型表现进行横向对比与重复性验证。溯源信息(trace_source)的引入进一步增强了数据的可复现性,为后续的模型改进与调试提供了重要参考。
使用方法
该数据集适用于模型评估与分析场景,研究者可通过加载训练集(train split)中的12条样本,利用对话字段(conversations)还原模型与用户之间的完整交互过程。借助result与verifier_output字段,可以量化模型在SWE-bench任务上的成功率与错误类型分布。为了进行深入分析,推荐将数据集与Qwen3-Coder-30B模型的原始推理日志结合使用,通过trace_source字段定位到具体执行环境。此外,数据集中的agent、model_provider与date字段可用于筛选特定实验条件下的子集,支持多维度交叉分析。使用时可借助Hugging Face Datasets库直接读取,默认配置下将自动加载data/train-*路径下的所有数据文件,便于快速接入下游评估流水线。
背景与挑战
背景概述
在大型语言模型(LLM)快速迭代的背景下,Qwen系列模型凭借其卓越的代码生成能力,在代码智能领域占据了重要地位。为系统评估Qwen3-Coder-30B模型在真实软件工程任务中的表现,研究团队于2023年7月构建了eval-qwen3coder30b-swe3-cw-gpu-20260707-090738数据集。该数据集由阿里云相关研究机构主导开发,核心研究问题聚焦于多轮对话场景下模型解决复杂代码工作流(SWE-bench任务)的效能。数据集包含12条精心设计的训练样本,每条样本均记录了完整的对话历史、代理响应、模型信息及验证器输出,为深入分析模型在代码理解、缺陷修复及多步推理中的表现提供了可靠基准。该数据集的发布为代码LLM的评估范式树立了新标准,尤其在高难度代码任务领域具有重要参考价值。
当前挑战
当前数据集面临多维度挑战。首先,从领域问题层面,代码生成与修复任务要求模型同时具备语法正确性、语义一致性及逻辑完备性,而现有评估往往难以全面覆盖这些维度;该数据集通过引入验证器输出与代理交互记录,试图逼近真实开发场景,但如何量化模型在复杂工作流中(如跨文件修改、API调用协调)的缺陷识别能力仍是难题。其次,在构建过程中,数据集仅包含12条样本,规模极小,可能无法充分反映模型在不同编程语言、框架或错误类型上的泛化能力;同时,对对话轮次、结果标注的规范性以及验证器设计的公允性,均可能引入评估偏差,制约了对模型真实实力的准确度量。
常用场景
经典使用场景
eval-qwen3coder30b-swe3-cw-gpu-20260707-090738 数据集专为评测大型语言模型在软件工程场景下的智能体能力而构建。其经典使用场景聚焦于多轮对话驱动的代码生成与调试,Agent 根据用户需求自主规划、编写并修正代码,通过记录完整的交互轨迹与任务结果,为评估模型在复杂工程任务中的自主推理、工具调用及错误回溯能力提供了标准化基准。该数据集填补了传统代码评测缺乏动态交互与工程语境模拟的空白,成为衡量模型从“理解指令”到“执行并验证”全链路智能水平的关键测试床。
解决学术问题
该数据集解决了评测代码生成模型在真实软件工程任务中自主性与鲁棒性的学术难题。传统基准多聚焦于单次代码补全,难以捕捉模型在迭代调试、需求变更与环境适应中的表现。通过引入结构化对话历史、任务描述与验证器输出,该数据允许研究者量化分析 Agent 的规划偏差、工具误用与失败恢复能力,推动了对“模型为何在特定任务中失败”这一根本问题的因果分析,为构建更可靠的工程化智能体提供了数据驱动的理论支撑。
衍生相关工作
该数据集衍生的相关工作包括基于 SWE-bench 范式的智能体评测框架扩展,如结合环境感知与工具链日志的强化学习策略、多模型协作的代码纠错机制,以及将“验证器输出”作为奖励信号进行偏好对齐的微调方法。研究者借鉴其对话痕迹与结果字段,提出了 Trace-Driven 的离线训练范式,使模型能从历史失败经验中自主归纳调试策略;同时,其 episode 与 run_id 结构化设计催生了跨任务泛化能力分析的研究,深化了对智能体行为一致性的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务