dev_set_v2_a1_pymethods2test_20260810_151931
收藏资源简介:
该数据集包含4621个训练样本,每个样本记录了一次多轮对话任务的过程与结果。样本字段包括:conversations(对话历史,每条消息包含角色和内容)、agent(代理标识)、model(模型名称)、model_provider(模型提供商)、date(日期)、task(任务描述)、episode(实验轮次)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)以及trace_source(追踪来源)。数据适用于对话系统、代理评估、模型行为分析等研究。
This dataset contains 4621 training samples, each recording the process and result of a multi-turn dialogue task. Sample fields include: conversations (dialogue history, each message containing role and content), agent (agent identifier), model (model name), model_provider (model provider), date (date), task (task description), episode (experiment round), run_id (run ID), trial_name (trial name), result (result), verifier_output (verifier output), and trace_source (trace source). The data is suitable for research on dialogue systems, agent evaluation, model behavior analysis, etc.
数据集概述:laion/dev_set_v2_a1_pymethods2test_20260810_151931
基本信息
- 数据所有者/组织:LAION
- 数据集名称:
dev_set_v2_a1_pymethods2test_20260810_151931 - 数据集地址:https://huggingface.co/datasets/laion/dev_set_v2_a1_pymethods2test_20260810_151931
内容与用途
该数据集似乎是一个面向Python方法到测试用例生成(pymethods2test)的开发验证集(dev set),版本为 v2_a1,可能用于评估或训练模型从 Python 方法生成对应测试的对话任务。
数据规模
- 总下载大小:约 362.59 MB(download_size: 362590992 字节)
- 数据集总大小:约 436.70 MB(dataset_size: 436699094 字节)
- 数据划分:仅包含
train划分- 训练集样本数:4621 条
- 训练集字节数:436699094 字节
数据特征(字段结构)
每条数据包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表(list) | 对话内容 |
└ role |
字符串 | 角色(如用户/助手) |
└ content |
字符串 | 对话文本内容 |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期 |
task |
字符串 | 任务类型 |
episode |
字符串 | 会话轮次/情节编号 |
run_id |
字符串 | 运行ID |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 轨迹来源 |
数据格式
- 数据文件格式:Parquet(数据路径:
data/train-*,默认配置default) - 该数据集只有一个配置(
default),仅包含train拆分。
使用提示
- 数据中每条样本包含多轮对话(
conversations),并附带丰富的元数据(模型、任务、运行信息、验证结果等),适合用于分析模型生成 Python 测试用例的行为或进行微调。




