dev_set_v2_a1_stackexchange_unix_20260813_104843
收藏资源简介:
该数据集包含4844个训练样本,每个样本包括多轮对话(conversations,每条消息有角色和内容)、代理(agent)、模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。数据可用于分析对话系统、代理行为、模型性能或任务执行记录。
This dataset contains 4844 training samples, each including multi-turn conversations (conversations, each message has role and content), agent, model, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The data can be used to analyze dialogue systems, agent behavior, model performance, or task execution records.
数据集概述
该数据集名为 laion/dev_set_v2_a1_stackexchange_unix_20260813_104843,托管于 Hugging Face 平台,属于 LAION 项目下的开发集(dev set)。数据集主要围绕 StackExchange 的 Unix 板块内容,可能用于训练或评估 AI 代理(agent)在 Unix 相关问答场景中的表现。
数据集特征
数据集中每条样本包含以下字段:
- conversations:多轮对话列表,每轮包含
role(角色)和content(内容)两个字段。 - agent:代理标识。
- model:使用的模型名称。
- model_provider:模型提供方。
- date:日期。
- task:任务类型。
- episode:会话期次。
- run_id:运行编号。
- trial_name:试验名称。
- result:结果。
- verifier_output:验证器输出。
- trace_source:追踪来源。
数据规模
- 总样本数:4,844 条(train 分割)。
- 数据集大小:约 481.9 MB(原始数据下载大小约 419.8 MB)。
- 分割情况:仅提供
train分割,数据文件路径为data/train-*。
用途说明
该数据集包含对话记录及丰富的元数据(如代理信息、模型信息、任务类型等),可用于研究 AI 代理在 Unix 技术问答场景中的表现、多轮对话生成、模型评估或强化学习训练等任务。




