dev_set_v2_a1_synatra_20260815_025225
收藏资源简介:
该数据集包含多轮对话记录,每条对话由角色和内容组成。此外,每条记录还关联了智能体名称、模型名称、模型提供商、日期、任务描述、对话轮次、运行ID、实验名称、结果、验证器输出以及追踪来源。数据集共有5011条训练样本,总大小约488MB。该数据集适用于智能体对话系统、任务型对话、模型评估或结果分析等场景。
The dataset contains multi-turn conversation records, each conversation consists of role and content. Additionally, each record is associated with agent name, model name, model provider, date, task description, conversation turns, run ID, experiment name, result, validator output, and trace source. The dataset has a total of 5011 training samples, with a total size of about 488MB. It is suitable for scenarios such as agent dialogue systems, task-oriented dialogues, model evaluation, or result analysis.
数据集详情总结
基本信息
- 数据集名称:
laion/dev_set_v2_a1_synatra_20260815_025225 - 数据集来源:Hugging Face
- 下载大小:约 422.69 MB
- 数据集总大小:约 488.26 MB
- 数据分割:仅包含
train分割,共 5,011 条数据样本
数据字段说明
该数据集包含以下 12 个字段:
| 字段名 | 类型 | 描述 |
|---|---|---|
conversations |
列表(含 role 和 content 两个子字段) |
对话记录,包含角色(如用户/助手)和内容 |
agent |
字符串 | 使用的智能体名称或标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 数据生成日期 |
task |
字符串 | 任务类型或名称 |
episode |
字符串 | 会话/回合编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 任务结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 数据来源追踪信息 |
数据用途
该数据集由 LAION 组织提供,版本标识为 dev_set_v2_a1_synatra,属于开发集(dev set),主要用于模型训练或评估场景,尤其适用于多轮对话、智能体交互或任务结果验证相关的机器学习任务。数据集包含完整的对话轨迹、模型信息、任务执行结果及验证信息,适合用于训练或评估具有任务型对话能力的AI系统。
数据文件
- 配置名称:
default - 文件路径:
data/train-*(通配符表示多个分片文件)




