dev_set_v2_a1_stack_csharp_20260810_232536
收藏资源简介:
该数据集包含5144个样本,每个样本记录了一次多轮对话交互过程。对话由一系列角色-内容对组成(conversations),同时记录了执行该对话的agent名称、使用的模型及模型提供商、日期、任务标识、episode编号、运行ID、试验名称、结果、验证器输出以及追踪来源。数据集适用于分析agent行为、模型性能、多轮对话任务评估等场景。数据格式为JSON,训练集文件约481MB。
This dataset contains 5,144 samples, each recording a multi-turn dialogue interaction process. The conversation consists of a series of role-content pairs (conversations), along with the agent name, the model used and its provider, date, task identifier, episode number, run ID, experiment name, result, validator output, and trace source. The dataset is suitable for analyzing agent behavior, model performance, evaluating multi-turn dialogue tasks, etc. The data format is JSON, and the training set file is approximately 481 MB.
数据集概述
该数据集名为 dev_set_v2_a1_stack_csharp_20260810_232536,由 LAION 组织发布,托管于 Hugging Face 平台。数据集聚焦于 C# 编程任务,包含开发者与代理(agent)之间的多轮交互记录,可用于训练和评估代码生成、问题解决等场景中的对话代理模型。
数据集详细信息
- 数据集名称:dev_set_v2_a1_stack_csharp_20260810_232536
- 创建者:LAION
- 数据集大小:下载大小约 416.46 MB(416,461,918 字节),解压后总大小约 481.69 MB(481,687,178 字节)
- 数据量:训练集包含 5,144 条样本
- 数据划分:仅包含
train分割
数据特征
每条样本包含 12 个字段,具体说明如下:
| 字段名 | 数据类型 | 描述 |
|---|---|---|
conversations |
列表(包含 role 与 content 两个子字段,均为字符串) |
多轮对话内容,记录用户与代理的交互消息,role 表示发言角色(如用户、代理),content 为消息文本 |
agent |
字符串 | 使用的代理名称或标识 |
model |
字符串 | 代理所调用的底层模型名称 |
model_provider |
字符串 | 模型提供方(如 OpenAI、Anthropic 等) |
date |
字符串 | 记录生成的日期 |
task |
字符串 | 任务类型或描述 |
episode |
字符串 | 会话轮次或情节标识 |
run_id |
字符串 | 运行标识符,用于追踪实验批次 |
trial_name |
字符串 | 试验名称标识 |
result |
字符串 | 任务执行结果(如成功、失败等) |
verifier_output |
字符串 | 验证器输出内容,可能包含验证或评估信息 |
trace_source |
字符串 | 跟踪数据来源 |
数据集用途
- 适用于训练和评估代码生成、编程问题解决、对话式代理等自然语言处理任务。
- 特别适合需要多轮交互上下文的场景,如助手引导调试、代码解释、任务分解等。
- 由于数据集聚焦 C# 语言,可用于研究特定编程语言环境下的代理行为与性能。
文件结构
数据以 Parquet 格式存储,路径为 data/train-*(通配符匹配多个分片文件)。默认配置名为 default,仅提供 train 分割。
补充说明
- 数据集中包含
verifier_output字段,表明数据可能经过结果验证或质量筛选,增强数据可信度。 run_id和trial_name字段便于回溯具体实验配置,适合复现实验或进行消融研究。- 数据集未提供测试集或验证集,用户若需评估模型性能,需自行划分训练集。




