遇见数据集

dev_set_v2_a1_stack_pytest_20260811_184327

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条样本包括对话历史(conversations,含角色和内容)、代理(agent)、模型(model)及提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)。适用于对话系统、模型评估或基于任务的多轮交互研究。训练集共4953个样本,数据大小约477MB。

This dataset contains multi-turn dialogue records, with each sample including conversation history (conversations, containing roles and content), agent, model and model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. It is suitable for dialogue systems, model evaluation, or task-based multi-turn interaction research. The training set consists of 4953 samples, with a data size of approximately 477MB.

提供机构:
LAION eV
创建时间:
2026-08-13
原始信息汇总

数据集概述:dev_set_v2_a1_stack_pytest_20260811_184327

基本信息

该数据集由 LAION 组织发布,托管于 Hugging Face 平台,数据集名称为 dev_set_v2_a1_stack_pytest_20260811_184327

数据规模

  • 数据集总大小:477,393,384 字节(约 455 MB)
  • 下载大小:409,379,785 字节(约 390 MB)
  • 训练集样本数:4,953 条
  • 数据划分:仅包含 train 划分

数据结构

数据集中包含以下特征字段:

对话相关字段

  • conversations:对话记录,为列表结构,包含两个子字段:
    • role(字符串):角色标识(如用户、助手等)
    • content(字符串):对话内容文本

元信息字段

  • agent(字符串):代理标识
  • model(字符串):模型名称
  • model_provider(字符串):模型提供方
  • date(字符串):日期信息
  • task(字符串):任务类型

运行与结果字段

  • episode(字符串):回合/场景编号
  • run_id(字符串):运行标识
  • trial_name(字符串):试验名称
  • result(字符串):执行结果
  • verifier_output(字符串):验证器输出
  • trace_source(字符串):追踪来源

数据文件

  • 配置名称:default
  • 数据文件路径data/train-*(通配符匹配多个分片文件)

内容特征

该数据集侧重于 代码测试与堆栈相关场景(从名称中 "stack_pytest" 推测),包含多轮对话、代理操作记录、模型运行结果及验证信息,适用于智能代理训练、代码测试任务或多轮对话系统的研究。

搜集汇总
数据集介绍
dev_set_v2_a1_stack_pytest_20260811_184327 数据集图片
构建方式
该数据集立足于智能体评估与软件工程自动化交叉领域,采用pytest测试框架作为任务验证的基准环境,通过多轮交互轨迹采集构建而成。构建过程以任务驱动型对话为核心,将智能体在解决具体编程或测试任务时产生的完整对话流、工具调用记录及验证器输出逐条沉淀,并附加代理类型、底层模型、模型提供商、运行标识、试验名称与追踪来源等元信息,最终形成包含4953条训练样本、总规模约477MB的结构化数据集合。
特点
数据集以对话序列建模为主线,每条样本完整保留角色与内容交替的交互结构,同时引入结果与验证器输出字段,使任务成败可直接追溯。多维度元数据覆盖智能体配置、模型来源、时间戳与运行环境,为对比不同代理策略和模型行为提供细粒度依据。数据体量适中且经过统一格式封装,兼顾训练效率与信息丰富度,适用于智能体行为分析、过程奖励建模及自动化测试场景下的模型能力评估。
使用方法
使用时可借助HuggingFace datasets库直接加载默认配置,读取train切分中的对话字段与配套元数据。研究者可按agent或model字段筛选特定智能体的交互记录,结合result与verifier_output进行成功率统计或失败模式归因;也可将conversations字段解析为消息列表,用于监督微调、偏好对齐或轨迹重放实验。若需复现实验,可依据run_id、trial_name与trace_source定位原始运行上下文,确保评估过程具备可追溯性。
背景与挑战
背景概述
面向智能体代码生成与执行验证的研究在近年来快速兴起,该数据集约构建于2026年前后,由关注自动化软件工程的研究团队整合多源智能体运行轨迹而成。其核心问题在于评估大语言模型驱动的智能体在真实软件测试场景中编写、执行并修正代码的能力。数据集汇聚了来自不同模型、不同提供方的多轮对话记录、执行结果与验证器输出,为分析智能体在编程任务中的表现提供了细粒度素材,对推动自主编程与自动化测试研究具有参考价值。
当前挑战
该数据集所应对的领域问题在于智能体编程能力的可信评估,即如何超越静态代码生成指标,衡量智能体在动态执行、错误诊断与迭代修复中的实际表现。构建过程中的挑战同样显著:多来源轨迹在模型接口、环境配置与执行反馈格式上存在异构性,需统一并清洗;对话内容与执行结果之间的因果关联需被谨慎保留;验证器输出的可靠性依赖外部工具链,可能引入噪声;此外,数据规模与任务类型是否足以覆盖真实软件测试的多样性,亦构成持续挑战。
常用场景
经典使用场景
在自动化软件工程与智能体评估领域,该数据集凭借其4953条对话轨迹与多元验证器输出,构筑起代码修复与测试执行的经典实验场。研究者通常利用其包含的agent、model、task及episode等字段,系统性地复现智能体在pytest测试框架下的完整行为链,进而对比不同模型提供者在真实代码库中的调试策略与修复效率。
解决学术问题
该数据集有效回应了智能体在复杂软件工程任务中行为可复现性不足、评估维度单一的学术困境。通过记录对话内容、验证器输出与运行标识,它为分析模型推理路径与测试通过率之间的因果关联提供了细粒度证据,推动了自动化程序修复领域从静态基准向动态交互评估的范式演进,其影响延展至智能体鲁棒性度量与代码生成质量归因等方向。
衍生相关工作
围绕该数据集,后续研究衍生出若干经典工作,包括基于对话轨迹的智能体行为克隆与强化学习微调、面向测试通过率的奖励建模,以及跨模型提供者的鲁棒性基准比较。这些工作进一步扩展了其在自动化调试、多智能体协作与代码大模型评估中的方法学边界,形成从数据到算法的持续迭代生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务