遇见数据集

dev_set_v2_a1_stack_go_20260811_103421

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每个对话由一系列消息组成,每条消息包含角色(role)和内容(content)。此外,每条记录还附带了与对话相关的元数据,包括使用的agent、模型名称、模型提供商、日期、任务类型、对话轮次(episode)、运行ID、试验名称、最终结果、验证器输出以及追踪来源(trace_source)。数据集共有6069个训练样本,总大小约为484MB。该数据集适用于训练和评估对话系统、agent行为分析、任务完成度评估以及模型验证等场景。

This dataset contains multi-turn dialogue records, each consisting of a series of messages, where each message includes a role and content. Additionally, each record is accompanied by metadata related to the conversation, including the agent used, model name, model provider, date, task type, dialogue episode, run ID, trial name, final result, validator output, and trace source. The dataset has a total of 6069 training samples, with a total size of approximately 484MB. It is suitable for training and evaluating dialogue systems, agent behavior analysis, task completion assessment, and model validation.

提供机构:
LAION eV
创建时间:
2026-08-13
原始信息汇总

数据集概述:dev_set_v2_a1_stack_go_20260811_103421

该数据集由 LAION 发布,是一个用于训练和评估智能体(Agent)在 StackGo 环境中的多轮交互与任务执行能力的数据集。

核心信息

  • 数据集名称:dev_set_v2_a1_stack_go_20260811_103421
  • 发布机构:LAION
  • 任务类型:基于智能体(Agent)的交互式任务数据集(涉及 StackGo 环境)
  • 数据集规模
    • 总样本量:6,069 条
    • 数据集总大小:484,031,599 字节(约 484 MB)
    • 下载大小:422,770,125 字节(约 423 MB)

数据结构

数据集包含 13 个特征字段,具体如下:

字段名 数据类型 说明
conversations list(嵌套结构) 多轮对话记录,包含 role(角色)与 content(内容),均为字符串类型
agent string 智能体标识或配置信息
model string 使用的模型名称
model_provider string 模型提供商(如 OpenAI、Anthropic 等)
date string 数据产生日期
task string 任务描述或任务 ID
episode string 回合编号(用于区分同一任务的不同执行轮次)
run_id string 运行标识
trial_name string 试验名称
result string 智能体任务的最终结果
verifier_output string 验证器输出(用于结果校验)
trace_source string 溯源数据来源(trace 的出处)

数据划分

该数据集仅包含一个划分:

  • train(训练集):包含全部 6,069 条样本

数据特点

  • 数据以 Parquet 格式存储(路径为 data/train-*
  • 每个样本包含完整的 智能体执行轨迹(包括多轮对话、模型配置、运行记录及验证结果),可用于监督微调(SFT)、奖励建模或智能体行为评估等场景
  • 数据集带有 verifier_output 字段,适合用于带验证信号的强化学习或偏好优化类任务
搜集汇总
数据集介绍
dev_set_v2_a1_stack_go_20260811_103421 数据集图片
构建方式
该数据集源于面向编程智能体评估的多轮交互轨迹采集流程,以Go语言任务为领域载体,通过构建可复现的沙箱环境,驱动不同模型在标准化接口下完成代码生成与调试。每次试验均记录完整的会话序列、智能体配置、模型标识、运行时间戳及任务归属等元信息,并经由自动化验证器输出执行结果与校验反馈,最终以Parquet格式序列化存储,形成包含6069条训练样本、约484MB数据规模的结构化集合。
特点
数据集以细粒度会话轨迹为核心组织单元,每条样本完整保留角色交替的对话内容与工具调用痕迹,同时附带agent、model、model_provider、task、episode、run_id、trial_name等十余项元字段,便于追溯实验条件与模型行为。result与verifier_output字段提供了程序化评估信号,trace_source则标明轨迹来源,使数据兼具行为观测与结果验证的双重属性,适用于编程智能体能力分析与泛化性研究。
使用方法
研究人员可通过HuggingFace datasets库直接加载默认配置下的train划分,利用conversations字段还原多轮交互上下文,结合task与episode字段进行任务级或回合级聚合分析。模型响应质量可依据result与verifier_output进行筛选或标注,agent与model_provider字段支持跨模型、跨提供方的对比实验。该数据集亦可用于训练编程智能体的决策策略、构建过程奖励模型或开展失败模式归因,使用时需遵循对应模型与平台的使用条款。
背景与挑战
背景概述
在大语言模型驱动自主智能体的研究浪潮中,智能体在真实软件工程任务中的行为轨迹与执行结果逐渐成为评估其能力的关键依据。该数据集于2026年8月构建,命名为dev_set_v2_a1_stack_go,由关注智能体评测的研究团队基于Go语言技术栈的软件开发场景采集而成,核心研究问题在于刻画智能体在多轮对话、代码生成与任务验证中的综合表现。数据集收录6069个训练样本,涵盖对话历史、智能体标识、底层模型及其提供商、任务类型、运行标识与验证器输出等多维字段,为智能体行为分析、模型能力对比及失败模式诊断提供了结构化语料。其影响力延伸至智能体基准测试、软件工程自动化与模型可靠性评估等方向,为相关领域提供了可复用的实证基础。
当前挑战
该数据集所应对的领域问题在于软件工程智能体的真实任务评测,其挑战源自任务本身的开放性、代码执行环境的复杂性以及验证信号的稀疏性。构建过程中面临多重困难:多智能体与多模型配置下的轨迹采集需要统一接口与稳定调度,海量对话与运行元数据的存储与版本管理要求严格的数据治理,验证器输出的可靠性依赖于代码仓库状态与测试用例的完整覆盖。此外,Go语言技术栈的工程任务在依赖管理、编译约束与并发语义上具有特定难度,智能体在长程任务中的错误累积与上下文漂移亦难以通过单一指标刻画,这些因素共同构成了数据集持续应用与扩展的核心挑战。
常用场景
经典使用场景
在智能体与代码生成研究领域,该数据集凭借其涵盖多轮对话轨迹与验证反馈的复合结构,成为评估和训练编程智能体的典型资源。经典使用场景包括:以对话形式模拟人机协作编程过程,使智能体在交互中完成代码编写、调试与优化任务;同时利用verifier_output字段提供的验证信号,进行强化学习或监督微调,提升模型在复杂编程任务中的执行准确率。
衍生相关工作
围绕该数据集,已衍生出若干经典工作,包括基于对话历史的智能体行为克隆研究、利用验证反馈进行拒绝采样微调的方法,以及面向多轮编程交互的奖励建模探索。这些工作进一步拓展了数据集在强化学习与代码智能领域的应用边界,并催生了针对编程智能体鲁棒性和泛化能力的系统性评测框架。
数据集最近研究
最新研究方向
在智能体与多轮对话系统交叉领域,该数据集以丰富元数据(代理、模型、任务、验证器输出)构建了细粒度交互轨迹库,推动了基于执行反馈的智能体自我改进研究。当前前沿方向聚焦于利用验证器信号进行过程奖励建模与错误归因,从而提升代码生成、工具调用等复杂任务中的推理鲁棒性。该数据集对可复现评估、跨模型行为对比以及真实部署场景下的对齐研究具有重要支撑意义,亦为构建可解释、可审计的自主代理系统提供了关键基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务