swegym_opus45_1495i
收藏资源简介:
该数据集包含1495条训练样本,每条样本包含一个对话历史(messages字段,由角色和内容组成),以及多个布尔属性字段(broad_then_narrow、multi_round_refinement、read_after_narrowing)和一个字符串字段judge_notes。此外,每条样本还有一个resolved布尔字段表示是否已解决,以及唯一标识instance_id。数据集可用于对话系统的属性分析或质量评估任务。
This dataset contains 1495 training samples, each consisting of a conversation history (messages field, composed of role and content), multiple boolean attribute fields (broad_then_narrow, multi_round_refinement, read_after_narrowing), a string field judge_notes, a boolean field resolved indicating whether the issue is resolved, and a unique identifier instance_id. The dataset can be used for attribute analysis or quality evaluation tasks of dialogue systems.
数据集概述
基本信息
- 数据集名称:swegym_opus45_1495i
- 数据集地址:https://huggingface.co/datasets/synthetic-code-training/swegym_opus45_1495i
- 数据集大小:342,527,708 字节(约 326.7 MB)
- 下载大小:107,794,494 字节(约 102.8 MB)
数据划分
- 训练集(train):包含 1,495 个样本,数据字节数为 342,527,708
- 数据文件路径:
data/train-*
特征字段
该数据集包含以下特征字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
instance_id |
string | 实例标识符 |
resolved |
bool | 是否已解决 |
messages |
list | 消息列表,包含 content(字符串)和 role(字符串)两个子字段 |
broad_then_narrow |
bool | 是否采用“先广泛后聚焦”策略 |
multi_round_refinement |
bool | 是否进行多轮优化 |
read_after_narrowing |
bool | 是否在聚焦后阅读 |
judge_notes |
string | 评判备注 |
配置信息
- 配置名称:default
- 数据文件:训练集文件为
data/train-*模式匹配的多个文件
该数据集用于 SWE-Gym 相关的代码合成训练任务,包含 1,495 个实例,每个实例附带详细的解决状态、消息交互过程以及多轮优化等元数据信息。




