dev_set_v2_a1_stack_cpp_20260814_211707
收藏资源简介:
该数据集包含5658个训练样本,每个样本包含多轮对话(conversations),其中每轮对话由角色(role)和内容(content)组成。此外,还包含智能体(agent)、模型名称(model)、模型提供者(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)等字段。数据集可用于分析多轮对话交互、评估智能体或模型在特定任务上的表现,以及追踪实验运行细节。
This dataset contains 5658 training samples, each consisting of multi-turn conversations with role and content fields. Additionally, it includes fields such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset can be used to analyze multi-turn dialogue interactions, evaluate agent or model performance on specific tasks, and track experimental run details.
数据集详情
基本信息
该数据集由LAION发布,名称为 dev_set_v2_a1_stack_cpp_20260814_211707,是一个用于开发或测试目的的数据集子集,主要面向C++编程任务。
数据规模
- 数据集总大小:610,704,018 字节(约582 MB)
- 下载大小:515,585,519 字节(约492 MB)
- 样本数量:5,658 条
- 数据划分:仅包含训练集(train),共5,658条样本
数据结构
每个样本包含以下字段:
| 字段名 | 类型 | 描述 |
|---|---|---|
conversations |
列表 | 对话记录,包含多轮对话 |
agent |
字符串 | 代理/智能体标识 |
model |
字符串 | 模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合/会话编号 |
run_id |
字符串 | 运行ID |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 运行结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
其中 conversations 字段包含两个子字段:
role:角色(如用户或助手的对话角色标识)content:对话内容
数据集用途
该数据集包含C++编程相关的对话和运行轨迹数据,可能用于训练或评估代码生成、程序合成或智能体(agent)相关任务,涉及模型交互、任务执行结果和验证输出等信息,适合用于代码生成、智能体调试及模型性能评估等研究方向。




