dev_set_v2_a1_nnetnav_live_20260814_080555
收藏资源简介:
该数据集是一个多轮对话数据集,每条样本包含一段对话历史(conversations),由角色(role)和消息内容(content)组成。此外,每条数据还记录了智能体(agent)、使用的模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、回合(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等元信息。数据集共包含5655条训练样本,总大小约572MB,适用于对话系统评估、智能体行为分析、模型性能比较等任务。
This dataset is a multi-turn dialogue dataset. Each sample contains a conversation history (conversations) composed of roles and message contents. Additionally, each sample records metadata such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset contains 5655 training samples with a total size of approximately 572MB, suitable for tasks such as dialogue system evaluation, agent behavior analysis, and model performance comparison.
数据集概述
该数据集名为 laion/dev_set_v2_a1_nnetnav_live_20260814_080555,由 LAION 组织发布,托管于 Hugging Face 平台。数据集包含 5,655 个训练样本,总大小约 572 MB(下载大小约 505 MB),采用默认配置,数据文件以 data/train-* 模式存储。
数据字段
数据集包含以下字段:
- conversations:对话列表,每条包含角色(
role,字符串)和内容(content,字符串)。 - agent:代理标识(字符串)。
- model:模型名称(字符串)。
- model_provider:模型提供方(字符串)。
- date:日期(字符串)。
- task:任务描述(字符串)。
- episode:回合编号(字符串)。
- run_id:运行标识(字符串)。
- trial_name:试验名称(字符串)。
- result:结果信息(字符串)。
- verifier_output:验证器输出(字符串)。
- trace_source:追踪来源(字符串)。
数据集拆分
- 训练集(train):包含 5,655 个样本,占用 572,156,579 字节。
数据用途
该数据集包含多轮对话及丰富的元数据(如代理、模型、任务、运行信息等),适用于训练或评估智能代理的交互行为、模型推理过程及结果验证等场景,尤其适合关注代理轨迹追踪与多轮任务执行的机器学习任务。




