遇见数据集

eval-laion_symclip-30-8B_DCAgent2_swebench-verified-random-100-folders-traces

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

该数据集是一个专为AI模型评估与分析设计的结构化对话数据集。其核心由多轮对话构成,每条记录包含一个对话序列(conversations),其中每个对话回合均标明了发言角色(role)和具体内容(content)。数据集还包含了丰富的元数据,用于记录对话运行的上下文信息,包括:使用的智能体(agent)、模型名称(model)、模型提供商(model_provider)、任务类型(task)、运行日期(date)、运行标识(run_id)、试验名称(trial_name)、关键的结果指标(result)以及验证器输出(verifier_output)。数据来源通过trace_source字段标注。数据集共包含1775个训练样本,总大小约为298 MB。它适用于研究AI模型在多轮对话任务中的表现、进行模型行为分析、结果验证以及任务特定的性能评估。

This is a structured conversational dataset specifically designed for AI model evaluation and analysis. Its core consists of multi-turn dialogues, where each record contains a conversation sequence (conversations), and each dialogue turn is annotated with the speaker role (role) and corresponding content (content). The dataset also includes rich metadata for recording contextual information of dialogue runs, including: the employed AI Agent (agent), model name (model), model provider (model_provider), task type (task), run date (date), run ID (run_id), trial name (trial_name), key result metrics (result), and verifier output (verifier_output). The data source is labeled via the trace_source field. The dataset comprises a total of 1,775 training samples, with an overall size of approximately 298 MB. It is applicable for researching the performance of AI models in multi-turn dialogue tasks, conducting model behavior analysis, result verification, and task-specific performance evaluation.

提供机构:
LAION eV
创建时间:
2026-06-17
原始信息汇总
  • 数据集名称: eval-laion_symclip-30-8B_DCAgent2_swebench-verified-random-100-folders-traces
  • 来源: LAION (Large-scale Artificial Intelligence Open Network)
  • 数据集大小: 约285 MB (298,483,934 字节)
  • 下载大小: 约152 MB (158,991,158 字节)
  • 数据规模: 包含1,775个样本,所有样本均位于训练集(train split)
  • 数据字段:
    • conversations: 对话内容列表,每条包含 content (字符串型) 和 role (字符串型)
    • agent: 智能体标识 (字符串型)
    • model: 使用的模型名称 (字符串型)
    • model_provider: 模型提供方 (字符串型)
    • date: 日期 (字符串型)
    • task: 任务描述 (字符串型)
    • episode: 剧集/回合标识 (字符串型)
    • run_id: 运行ID (字符串型)
    • trial_name: 试验名称 (字符串型)
    • result: 结果 (字符串型)
    • verifier_output: 验证器输出 (字符串型)
    • trace_source: 追踪来源 (字符串型)
  • 数据配置: 默认配置(config_name: default),数据文件路径为 data/train-*
搜集汇总
数据集介绍
eval-laion_symclip-30-8B_DCAgent2_swebench-verified-random-100-folders-traces 数据集图片
构建方式
该数据集源自LAION SymCLIP项目的30亿参数模型,通过DCAgent2框架与SWE-bench验证环境交互,从随机选取的100个文件夹中收集了完整的智能体轨迹数据。每个样本包含多轮对话记录、智能体标识、模型信息及执行结果,最终整理为1775条训练样本,数据以Parquet格式存储并分片处理。
特点
数据集聚焦于软件工程领域的智能体行为建模,融合了对话历史、任务描述、执行结果及验证器反馈等多维信息。特别引入了'verifier_output'字段记录自动化验证结果,'trace_source'标注轨迹来源,为分析智能体决策过程与错误模式提供了细粒度的结构化数据基础。
使用方法
适用于训练和评估代码生成、漏洞修复等软件工程任务的智能体模型。用户可通过HuggingFace Datasets库加载,利用'conversations'字段中的多轮对话构建训练序列,结合'result'和'verifier_output'字段进行监督学习或强化学习,支持智能体行为克隆与策略优化研究。
背景与挑战
背景概述
该数据集名为eval-laion_symclip-30-8B_DCAgent2_swebench-verified-random-100-folders-traces,源于对大型语言模型(LLM)智能体在软件工程任务中表现的研究。由LAION等机构的研究人员创建,旨在评估基于SymCLIP架构的30-8B模型在执行SWE-bench验证集上的能力。核心研究问题聚焦于模型能否在随机选取的100个文件夹级代码仓库中,通过多轮对话与工具调用自主完成调试与修复任务。该数据集记录了1775条智能体与环境的交互轨迹,包含任务描述、模型输出、验证结果等关键字段,为评估LLM在真实软件工程场景中的泛化性与可靠性提供了标准化基准。其对相关领域的影响力体现在推动了代码智能与自主编程助手的可重复评估,促进了从静态代码理解到动态问题解决的范式转型。
当前挑战
该数据集面临的挑战首先在于解决软件工程领域的复杂问题,即如何使LLM智能体在有限交互内准确理解多文件仓库的结构、定位缺陷并生成符合语法的修复方案,这要求模型具备长程依赖推理与工具选择能力。构建过程中,挑战则包括:设计随机采样的任务子集以平衡覆盖性与计算成本,确保验证器输出(verifier_output)能可靠区分修复正确性;同时需要标准化1775条跨不同模型(如agent字段)、日期与运行轨迹(trace_source)的对话数据,消除因环境差异引入的噪声。此外,如何避免数据泄露——即模型在预训练中或之前版本中见过类似问题——也是评估有效性的关键难点。
常用场景
经典使用场景
eval-laion_symclip-30-8B_DCAgent2_swebench-verified-random-100-folders-traces数据集专为评估和训练基于大语言模型的自主代理(Agent)在软件工程任务中的表现而设计。其经典使用场景聚焦于代码仓库级别的自动化调试与修复,代理需在模拟的开发者环境中,依据自然语言描述的故障报告,遍历代码目录、定位缺陷根源并生成补丁。数据集中的1765条轨迹详细记录了代理与命令行环境的完整交互会话,包括执行的命令、产生的输出及最终结果,为研究者提供了标准化的评测基准。通过对比不同模型、不同代理策略(如推理链长度、工具调用频率)在相同任务上的成功率与效率,该数据集成为了衡量代码智能体在真实软件开发流程中自主解决问题能力的黄金标准。
衍生相关工作
该数据集的发布催生了多项开创性研究,其中最引人注目的是基于其轨迹数据进行行为克隆(Behavior Cloning)与强化学习(RL)的代理训练工作。研究者们发现,通过将成功的修复轨迹(result为True的样例)作为正例,使用监督微调(SFT)可以显著提升Base模型在类似任务上的首次修复成功率。更进一步,有工作利用该数据集中代理的多轮决策序列,构建了逆向强化学习(IRL)模型,旨在让代理学习隐含的搜索策略,例如何时应该扩大搜索范围而非死磕单个文件。此外,一些最新的工作引入了基于验证器反馈的强化学习(RLVF),模拟在轨迹中某一步执行错误命令时,验证器立即给予负向惩罚,从而提升代理在错误条件下实时调整策略的能力。这些衍生工作共同推动了从静态代码分析到交互式代码修复的范式转变。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中基于大语言模型的自主智能体在代码仓库级别任务上的评估与训练。当前前沿方向集中在利用多轮对话交互轨迹(conversations)与执行结果(result, verifier_output)的配对数据,构建具备环境感知与错误纠正能力的智能体系统。结合Symbolic Library Matching和Contrastive Pre-training等图像-文本对齐技术,该数据为研究模型在复杂多文件(如swebench-verified)任务中的泛化能力提供了基准,尤其关注自然语言指令到代码修改的端到端执行轨迹。其意义在于推动智能体从静态代码生成向动态环境交互、迭代调试的演进,呼应了AI for Software Engineering(AI4SE)领域对可验证、可复现的智能体行为评估需求,为构建更鲁棒的自动化编程助手奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务