dev_set_v2_a1_stack_pytest_20260811_184327
收藏资源简介:
该数据集包含多轮对话记录,每条样本包括对话历史(conversations,含角色和内容)、代理(agent)、模型(model)及提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)。适用于对话系统、模型评估或基于任务的多轮交互研究。训练集共4953个样本,数据大小约477MB。
This dataset contains multi-turn dialogue records, with each sample including conversation history (conversations, containing roles and content), agent, model and model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. It is suitable for dialogue systems, model evaluation, or task-based multi-turn interaction research. The training set consists of 4953 samples, with a data size of approximately 477MB.
数据集概述:dev_set_v2_a1_stack_pytest_20260811_184327
基本信息
该数据集由 LAION 组织发布,托管于 Hugging Face 平台,数据集名称为 dev_set_v2_a1_stack_pytest_20260811_184327。
数据规模
- 数据集总大小:477,393,384 字节(约 455 MB)
- 下载大小:409,379,785 字节(约 390 MB)
- 训练集样本数:4,953 条
- 数据划分:仅包含
train划分
数据结构
数据集中包含以下特征字段:
对话相关字段
- conversations:对话记录,为列表结构,包含两个子字段:
role(字符串):角色标识(如用户、助手等)content(字符串):对话内容文本
元信息字段
- agent(字符串):代理标识
- model(字符串):模型名称
- model_provider(字符串):模型提供方
- date(字符串):日期信息
- task(字符串):任务类型
运行与结果字段
- episode(字符串):回合/场景编号
- run_id(字符串):运行标识
- trial_name(字符串):试验名称
- result(字符串):执行结果
- verifier_output(字符串):验证器输出
- trace_source(字符串):追踪来源
数据文件
- 配置名称:default
- 数据文件路径:
data/train-*(通配符匹配多个分片文件)
内容特征
该数据集侧重于 代码测试与堆栈相关场景(从名称中 "stack_pytest" 推测),包含多轮对话、代理操作记录、模型运行结果及验证信息,适用于智能代理训练、代码测试任务或多轮对话系统的研究。




