dev_set_v2_a1_exercism_python_20260805_125430
收藏资源简介:
该数据集包含多轮对话记录,每轮对话由角色(role)和内容(content)组成。除对话外,每条记录还包含代理(agent)、模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、集次(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及跟踪来源(trace_source)等元数据字段。训练集包含3426个样本,总数据大小约386MB。该数据集可用于训练或评估对话代理的推理轨迹、任务完成情况以及模型行为分析。
This dataset contains multi-turn dialogue records, where each turn consists of a role and content. In addition to the dialogues, each record includes metadata fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The training set contains 3426 samples with a total data size of approximately 386MB. This dataset can be used for training or evaluating the reasoning traces, task completion, and model behavior analysis of dialogue agents.
数据集概述:dev_set_v2_a1_exercism_python_20260805_125430
基本信息
- 数据集名称:dev_set_v2_a1_exercism_python_20260805_125430
- 提供方:LAION
- 数据集大小:386,340,236 字节(约 368.5 MB)
- 下载大小:338,591,688 字节(约 322.9 MB)
- 数据分割:仅包含训练集(train)
数据规模
- 训练集样本数:3,426 条
- 训练集字节数:386,340,236 字节
数据特征
该数据集包含以下字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
| conversations | 列表(包含role和content两个子字段) | 对话记录,每条包含角色(role)和内容(content) |
| agent | 字符串 | 智能体标识 |
| model | 字符串 | 使用的模型名称 |
| model_provider | 字符串 | 模型提供方 |
| date | 字符串 | 日期信息 |
| task | 字符串 | 任务描述 |
| episode | 字符串 | 会话轮次 |
| run_id | 字符串 | 运行ID |
| trial_name | 字符串 | 试验名称 |
| result | 字符串 | 执行结果 |
| verifier_output | 字符串 | 验证器输出 |
| trace_source | 字符串 | 追踪来源 |
数据集配置
- 配置文件名称:default
- 数据文件路径:
data/train-*(训练集采用分片存储方式)
内容主题
根据数据集名称推测,该数据集与 Exercism 平台的 Python 编程练习相关,可能包含编程任务的对话轨迹、智能体执行过程及结果验证信息,适用于训练或评估代码生成、编程辅助等方向的人工智能模型。




