dev_set_v2_a1_stack_rust_20260811_214638
收藏资源简介:
该数据集包含 4461 条训练样本,每条样本由以下字段组成:conversations(多轮对话列表,每轮包含 role 和 content 字段)、agent、model、model_provider、date、task、episode、run_id、trial_name、result、verifier_output、trace_source。数据以对话形式记录,可能用于对话系统、agent 行为分析、强化学习或模型评估等任务。
This dataset contains 4,461 training samples. Each sample consists of the following fields: conversations (a list of multi-turn dialogues, each turn containing role and content fields), agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, trace_source. The data is recorded in dialogue format and may be used for tasks such as dialogue systems, agent behavior analysis, reinforcement learning, or model evaluation.
数据集概述
该数据集名为 laion/dev_set_v2_a1_stack_rust_20260811_214638,由 LAION 组织发布,托管于 Hugging Face 平台。这是一个面向 Rust 编程语言相关任务的开发验证集,可能用于大语言模型(LLM)在代码生成、执行或调试场景中的训练与评估。
数据规模与结构
| 项目 | 详情 |
|---|---|
| 数据集总大小 | 435,415,624 字节(约 415 MB) |
| 下载大小 | 385,595,177 字节(约 368 MB) |
| 划分(Split) | 仅包含 train(训练集) |
| 训练集样本数 | 4,461 条 |
| 训练集字节数 | 435,415,624 字节 |
特征字段
数据集中每条样本包含 12 个字段:
- conversations(对话列表):由
role(角色,字符串)和content(内容,字符串)组成的多轮对话结构。 - agent(智能体标识,字符串)
- model(模型名称,字符串)
- model_provider(模型提供方,字符串)
- date(日期,字符串)
- task(任务类型,字符串)
- episode(回合编号,字符串)
- run_id(运行标识,字符串)
- trial_name(试验名称,字符串)
- result(结果,字符串)
- verifier_output(验证器输出,字符串)
- trace_source(轨迹来源,字符串)
数据用途推断
根据字段组合(conversations、agent、verifier_output、trace_source、episode 等),该数据集很可能记录了智能体在 Rust 编程任务中的多轮交互过程、执行结果以及验证信息,适用于训练或评测具备代码编写、调试或工具调用能力的语言模型。数据集命名为“dev_set_v2_a1_stack_rust”暗示这是一个开发验证集的第二版本,专注于 Rust 技术栈。




