dev_set_v2_a1_taco_20260812_082511
收藏资源简介:
该数据集包含多轮对话记录,每条样本由对话内容(conversations)以及相关的元数据组成。对话内容为角色(role)和文本(content)交替的列表,元数据包括所使用的智能体(agent)、模型名称(model)、模型提供方(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据集仅包含训练集,共 4520 个样本,总大小约 406 MB。适用于对话系统评估、模型行为追踪、多轮对话分析等任务。
This dataset contains multi-turn conversation records, each sample consists of a list of alternating roles and contents (conversations) along with associated metadata. The metadata includes the agent used, model name, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The dataset contains only the training set, with 4520 samples, totaling approximately 406 MB. It is suitable for tasks such as dialogue system evaluation, model behavior tracking, and multi-turn dialogue analysis.
数据集概述:dev_set_v2_a1_taco_20260812_082511
基本信息
- 来源平台:Hugging Face
- 数据集名称:dev_set_v2_a1_taco_20260812_082511
- 官方标识:
laion/dev_set_v2_a1_taco_20260812_082511
数据规模
- 总数据量:406,063,100 字节(约 387 MB)
- 下载大小:347,517,545 字节(约 331 MB)
- 样本数量:4,520 条数据
- 数据划分:仅包含
train(训练)划分
数据特征(字段结构)
该数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(包含 role 和 content 字段,均为字符串) |
对话记录,包含角色与内容 |
agent |
字符串 | 智能体信息 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合/集数 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果信息 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
数据格式
- 数据文件存储路径:
data/train-*(使用通配符匹配多个分片文件) - 配置文件名为
default,使用train划分
内容特点
该数据集主要包含多轮对话记录(conversations 字段),每轮对话包含角色(如用户/助手)和内容,同时附带智能体、模型、任务类型等元数据信息,适用于研究 AI 智能体交互、模型行为分析等场景。




