a1-e2egit-tb2-leonardo-20260731
收藏资源简介:
该数据集是一个多轮对话数据集,包含 3971 个训练样本。每条样本包含一个对话列表(conversations),每个对话条目由内容(content)和角色(role)组成。此外,还包含代理(agent)、模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、episode、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等元数据字段。数据集总大小约为 425MB。该数据集适用于对话系统训练、模型评估、任务型对话分析等场景。
This dataset is a multi-turn dialogue dataset containing 3,971 training samples. Each sample includes a conversation list (conversations), where each conversation entry consists of content and role. Additionally, it contains metadata fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The total size of the dataset is approximately 425MB. This dataset is suitable for dialogue system training, model evaluation, task-oriented dialogue analysis, and other scenarios.
数据集详情总结
- 数据集名称:laion/a1-e2egit-tb2-leonardo-20260731
- 数据集地址:https://huggingface.co/datasets/laion/a1-e2egit-tb2-leonardo-20260731
- 数据集规模:
- 训练集(train)包含 3,971 个样本,数据大小为 425,395,841 字节(约 406 MB)。
- 整个数据集下载大小为 101,210,429 字节(约 97 MB)。
- 数据集配置:默认配置(config_name: default),数据文件为
data/train-*。
数据特征(Features)
该数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(list) | 对话内容,每个元素包含 content(字符串,内容)和 role(字符串,角色) |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合标识 |
run_id |
字符串 | 运行ID |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
数据集用途
该数据集包含对话记录以及任务执行的相关信息(智能体、模型、任务、回合、结果等),可能用于训练或评估基于智能体的对话系统或任务导向型模型。




