open-instruct-termigen
收藏资源简介:
该数据集名为TermiGen - Open Instruct formatted,是一个经过格式化处理的数据集,专为open-instruct分支的使用而设计。数据来源于terminal-bench-env项目,包含3556个训练样本。数据集的结构化特征包括:messages(包含content和role字段的列表)、ground_truth(字符串)、dataset(字符串)、env_config(结构体,包含env_name、image和task_id字段)以及source(字符串)。这些特征表明数据集可能涉及终端环境中的任务执行或指令交互,适用于指令微调或相关机器学习任务。
The dataset is named TermiGen - Open Instruct formatted, which is a formatted dataset specifically designed for use with the open-instruct branch. The data originates from the terminal-bench-env project and contains 3556 training samples. The structured features of the dataset include: messages (a list containing content and role fields), ground_truth (string), dataset (string), env_config (a struct containing env_name, image, and task_id fields), and source (string). These features suggest that the dataset may involve task execution or instruction interaction in terminal environments, making it suitable for instruction fine-tuning or related machine learning tasks.
数据集概述
数据集名称: TermiGen - Open Instruct formatted
来源: 原始数据源自 Terminal-Bench 环境,经过格式转换用于 open-instruct 分支 的训练。
数据集大小:
- 总大小:17,969,463 字节
- 下载大小:5,362,094 字节
- 训练集样本数:3,556 条
数据特征
| 字段名 | 类型 | 描述 |
|---|---|---|
| messages | 列表(元素含 content 和 role 字段) | 对话消息内容及角色(如系统、用户、助手) |
| ground_truth | 字符串 | 真实答案或标签 |
| dataset | 字符串 | 所属数据集名称 |
| env_config | 结构体(含 env_name、image、task_id) | 环境配置信息,包括环境名称、镜像、任务ID |
| source | 字符串 | 数据来源标识 |
数据划分
- 训练集:仅包含 train 分割,共 3,556 个样本。
相关资源
注意:更多详细信息请参见上述链接。




