dev_set_v2_a1_unitsyn_python_20260813_021034
收藏资源简介:
该数据集是一个多轮对话记录数据集,包含5200个训练样本,总大小约496MB。每条样本包含以下字段:conversations(对话历史,由角色和内容组成)、agent(代理名称)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务)、episode(轮次)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)、trace_source(追踪来源)。数据集适用于对话系统评估、模型行为跟踪、任务型对话分析等场景,可用于研究不同模型在多种任务下的对话表现和结果。
This dataset is a multi-turn dialogue record dataset, containing 5200 training samples with a total size of approximately 496MB. Each sample includes the following fields: conversations (dialogue history composed of roles and content), agent (agent name), model (model name), model_provider (model provider), date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset is suitable for scenarios such as dialogue system evaluation, model behavior tracking, and task-oriented dialogue analysis, and can be used to study the dialogue performance and outcomes of different models across various tasks.
数据集概述:laion/dev_set_v2_a1_unitsyn_python_20260813_021034
基本信息
- 数据集名称:dev_set_v2_a1_unitsyn_python_20260813_021034
- 提供方:LAION(Large-scale Artificial Intelligence Open Network)
- 许可证:未在README中明确指定
数据规模与划分
- 总大小:约496.56 MB(数据集文件),下载大小约423.62 MB
- 数据划分:仅包含训练集(train)
- 训练集样本数:5,200条
- 训练集大小:496,558,659字节
数据特征(字段说明)
该数据集共包含12个字段,具体如下:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
| conversations | 列表(list) | 对话记录,包含角色(role)和内容(content)两个子字段 |
| agent | 字符串 | 智能体标识 |
| model | 字符串 | 使用的模型名称 |
| model_provider | 字符串 | 模型提供方 |
| date | 字符串 | 日期信息 |
| task | 字符串 | 任务标识 |
| episode | 字符串 | 会话轮次编号 |
| run_id | 字符串 | 运行标识 |
| trial_name | 字符串 | 试验名称 |
| result | 字符串 | 结果记录 |
| verifier_output | 字符串 | 验证器输出 |
| trace_source | 字符串 | 追踪来源 |
- conversations字段为列表型数据,每个元素包含:
- role(角色):字符串类型
- content(内容):字符串类型
数据格式与文件结构
- 配置文件:默认配置(default),共1个配置
- 数据文件:位于
data/train-*(支持通配符匹配)
数据集特点
该数据集以对话(conversations)为核心结构,结合智能体、模型、任务、运行追踪等元信息,适用于多轮对话生成、智能体行为分析、模型验证等场景的研究与开发。




