a1-nemotron_csharp-tb2-leonardo-20260720
收藏资源简介:
该数据集是一个多轮对话数据集,包含2076个训练样本,总大小约201MB。每个样本包含一个对话历史(conversations),由多个消息组成,每个消息包括角色(role)和内容(content)。此外,还提供了丰富的元数据字段:agent(代理标识)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务描述)、episode(轮次)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)和trace_source(追踪来源)。该数据集适用于对话系统训练、多轮对话评估、任务型对话建模等场景。
This dataset is a multi-turn dialogue dataset, containing 2076 training samples with a total size of approximately 201MB. Each sample includes a conversation history (conversations) composed of multiple messages, each comprising a role and content. Additionally, it provides rich metadata fields: agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. This dataset is suitable for dialogue system training, multi-turn dialogue evaluation, task-oriented dialogue modeling, and other scenarios.
数据集概述
该数据集名为 a1-nemotron_csharp-tb2-leonardo-20260720,由 laion 组织发布,托管在 Hugging Face 平台上。
基本信息
- 数据集规模:训练集包含 2,076 条样本,总大小约为 201 MB(
num_bytes),下载大小约为 52.9 MB。 - 数据格式:仅包含一个 train 分割,数据文件路径为
data/train-*。 - 配置:默认配置名为
default。
数据特征
数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话记录,包含 content(字符串,内容)和 role(字符串,角色) |
agent |
字符串 | 智能体标识 |
model |
字符串 | 模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合/会话编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
内容推测
- 该数据集包含 对话数据(
conversations字段),并记录了模型、智能体、任务、运行上下文及验证结果等元信息。 - 从名称中的 "csharp" 推测,数据可能与 C# 编程语言 相关的智能体任务或代码生成任务有关。
- 数据集的日期标识为 2026-07-20,属于较新的数据集。




