dev_set_v2_a1_stack_jest_20260811_140751
收藏资源简介:
该数据集包含多轮对话记录,每条对话由角色(role)和内容(content)组成,并附带相关元数据,包括交互代理(agent)、使用的模型(model)及模型提供商(model_provider)、日期(date)、任务(task)、片段(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和跟踪来源(trace_source)。训练集共4813个样本,适用于对话系统训练、评估或分析任务。
This dataset contains multi-turn dialogue records, each consisting of a role and content, along with associated metadata including interaction agent, model used and model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The training set has a total of 4813 samples, suitable for training, evaluation, or analysis of dialogue systems.
数据集概述
该数据集名为 laion/dev_set_v2_a1_stack_jest_20260811_140751,托管于 Hugging Face,是一个面向开发者的数据集。
基本信息
- 数据集地址:https://huggingface.co/datasets/laion/dev_set_v2_a1_stack_jest_20260811_140751
- 数据集大小:约 436 MB(
dataset_size: 436314831字节) - 下载大小:约 366 MB(
download_size: 366474524字节) - 分割(Split):仅包含训练集(
train),共 4,813 个样本,占 436,314,831 字节
数据特征(Features)
数据集包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
conversations |
列表 | 对话内容,每个元素包含 role(字符串,角色)和 content(字符串,内容) |
agent |
字符串 | 智能体标识 |
model |
字符串 | 使用的模型名称 |
model_provider |
字符串 | 模型提供方 |
date |
字符串 | 日期信息 |
task |
字符串 | 任务类型 |
episode |
字符串 | 回合/情节编号 |
run_id |
字符串 | 运行标识 |
trial_name |
字符串 | 试验名称 |
result |
字符串 | 结果信息 |
verifier_output |
字符串 | 验证器输出 |
trace_source |
字符串 | 追踪来源 |
配置信息
- 配置名称:
default - 数据文件路径:训练集数据位于
data/train-*(使用通配符匹配多个文件)
数据用途
该数据集包含多轮对话、模型代理运行日志、任务执行结果及验证信息,适用于研究智能体行为、模型输出分析、任务评估等场景。数据集名称中的 a1_stack_jest 暗示可能涉及栈(stack)相关任务或测试环境,20260811_140751 为时间戳,表明这是特定时间点的快照数据。




