遇见数据集

eval-penfever_stageD-thinkbudget-80-8B_DCAgent2_swebench-verified-random-100-folders-traces

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

该数据集是一个结构化对话数据集,包含1639个训练样本,总大小约为254MB。数据特征包括:conversations字段,以列表形式存储对话内容,每个条目包含content(内容)和role(角色)字符串;其他字段如agent(代理)、model(模型)、model_provider(模型提供商)、date(日期)、task(任务)、episode(剧集)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)和trace_source(追踪来源),均为字符串类型,提供了对话的元数据和执行上下文。数据集适用于对话系统分析、多轮交互建模、代理行为评估或任务导向对话研究等场景,通过结构化字段支持对模型性能、任务执行结果和对话轨迹的深入分析。

This dataset is a structured dialogue dataset containing 1639 training samples with a total size of approximately 254MB. The data features include: a conversations field that stores dialogue content in a list format, with each entry containing content and role strings; other fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source are all string types, providing metadata and execution context for the dialogues. The dataset is suitable for scenarios such as dialogue system analysis, multi-turn interaction modeling, agent behavior evaluation, or task-oriented dialogue research, and supports in-depth analysis of model performance, task execution results, and dialogue trajectories through structured fields.

提供机构:
LAION eV
创建时间:
2026-06-17
原始信息汇总

数据集概述

项目 内容
数据集名称 eval-penfever_stageD-thinkbudget-80-8B_DCAgent2_swebench-verified-random-100-folders-traces
链接地址 https://huggingface.co/datasets/laion/eval-penfever_stageD-thinkbudget-80-8B_DCAgent2_swebench-verified-random-100-folders-traces
数据集大小 约 253.98 MB(数据集总字节数)
下载大小 约 145.05 MB
配置 默认配置(default)
数据分割 仅训练集(train),共 1,639 条样本

数据特征

该数据集包含以下字段:

  • conversations(对话列表):每个对话包含:
    • content:对话内容(字符串)
    • role:角色(字符串)
  • agent(代理,字符串)
  • model(模型,字符串)
  • model_provider(模型提供方,字符串)
  • date(日期,字符串)
  • task(任务,字符串)
  • episode(轮次,字符串)
  • run_id(运行ID,字符串)
  • trial_name(试验名称,字符串)
  • result(结果,字符串)
  • verifier_output(验证器输出,字符串)
  • trace_source(追踪来源,字符串)

数据文件

  • 训练集数据文件位于 data/train-*(通配符匹配多个文件)。
搜集汇总
数据集介绍
eval-penfever_stageD-thinkbudget-80-8B_DCAgent2_swebench-verified-random-100-folders-traces 数据集图片
构建方式
该数据集基于SWE-bench Verified基准测试构建,采样了100个随机文件夹的代理轨迹数据。通过部署ThinkBudget 80-8B模型驱动的DCAgent系统,在解决软件工程任务的过程中自动生成交互日志。每条数据包含完整的多轮对话记录,涵盖agent(代理)、model(模型)、model_provider(模型提供方)等元信息,并记录最终任务执行结果与验证器输出。数据集采用标准化JSON结构存储,共包含1639条训练样本,总容量约254MB,确保了轨迹数据的结构化与可复现性。
特点
数据集的核心特点在于其多维度的元数据标注体系。每条样本不仅包含角色(role)与内容(content)分离的对话历史,还关联了agent、model、task等10个字段的上下文信息,便于追踪不同模型配置下的智能体行为。特别地,verifier_output字段提供了外部验证结果,而trace_source标注了轨迹来源,支持对模型推理过程进行细粒度分析。这种设计使得数据集特别适合用于评估代码生成智能体在执行复杂工程任务时的性能表现与错误模式。
使用方法
数据集以HuggingFace Datasets格式发布,可通过load_dataset接口直接加载默认配置的train分片。使用时需注意数据集中conversations字段包含嵌套的字典列表,建议通过角色字段筛选用户输入与模型响应。推荐结合SWE-bench的评估协议,利用verifier_output字段进行任务完成度的自动化验证。对于需要分析智能体推理过程的场景,可依据trace_source和episode字段对轨迹进行分组研究。数据集兼容Python的json与datasets库,便于进行轨迹重放与行为分析。
背景与挑战
背景概述
该数据集名为eval-penfever_stageD-thinkbudget-80-8B_DCAgent2_swebench-verified-random-100-folders-traces,由特定研究机构于近期构建,聚焦于软件工程领域中基于大语言模型(LLM)的智能代理(Agent)在代码补全与修复任务中的表现评估。其核心研究问题在于探索有限思考预算(thinkbudget)下,LLM代理在SWE-bench验证集子集上的决策轨迹与成功模式,旨在揭示模型在复杂软件工程环境中的推理效率与鲁棒性。数据集包含1639条对话记录、代理类型、模型版本及验证结果等结构化字段,为分析代理行为的可复现性提供了标准化基准,对推动LLM在自动化编程、调试等实际应用中的发展具有重要参考价值。
当前挑战
当前数据集面临多重挑战。在领域问题上,其核心挑战在于度量LLM代理在有限计算资源下解决真实软件工程任务(如代码缺陷修复)时的性能边界,需平衡推理深度与响应时效;此外,对话轨迹的复杂性与长程依赖关系使得可靠评估代理的决策逻辑成为难题。在构建过程中,挑战包括:如何从大规模SWE-bench验证集中随机抽样100个文件夹以代表多样性故障场景,同时确保轨迹完整性与标注一致性;以及如何设计统一的验证器输出(verifier_output)以消除不同模型、代理策略间的比较偏差,避免因运行环境差异引入噪声。
常用场景
经典使用场景
该数据集主要用于评估和验证基于大型语言模型的智能代理在复杂软件工程任务中的表现,特别是针对SweBench验证集中的随机样本。其核心使用场景是衡量模型在代码生成、调试和自动化修复等过程中的决策能力与执行效率。通过记录完整的代理对话轨迹、运行结果及验证器输出,研究者能够深入分析模型在不同任务场景下的行为模式,从而推动LLM驱动自动化编程代理的迭代优化。
衍生相关工作
该数据集衍生了一系列关于LLM代理推理预算分配与工具使用策略的经典研究。受其启发,研究者提出了自适应思考预算机制,通过动态调整推理深度来平衡任务完成质量与计算成本。此外,基于该数据集的多代理协作框架(如DCAgent)也被广泛讨论,探讨如何在分布式环境中协同多个专业化代理高效解决复杂软件工程问题。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中的自动化代码修复任务,特别是基于智能体(Agent)的端到端问题解决能力评估。当前前沿研究方向集中于利用大语言模型构建多步骤推理与代码生成的自主代理系统,并通过此类细粒度交互数据(如Agent的思考预算、执行轨迹与验证结果)来优化模型在真实代码仓库(如SWE-bench)上的修复性能。相关热点事件包括各团队在大规模代码修复基准上的性能竞赛,以及将强化学习中的思考预算控制引入代理决策以平衡效率与准确性。该数据集的意义在于提供了高质量、结构化的代理任务轨迹,有助于推动可验证、可复现的自主软件开发研究,进而影响代码审查自动化与持续集成系统的智能化演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务