swegym_gpt5mini_1500i
收藏资源简介:
该数据集包含1500个训练样本,每个样本包含一个对话实例(messages字段),其中每条消息由角色(role)和内容(content)组成。此外,数据集还提供了布尔字段用于标注对话是否已被解决(resolved)、是否采用先宽后窄策略(broad_then_narrow)、是否经过多轮细化(multi_round_refinement)、以及是否在细化后重新阅读(read_after_narrowing)。最后,judge_notes字段存储评估者的注释信息。该数据集可用于研究对话策略、多轮对话细化或人工评估任务。
This dataset contains 1500 training samples, each consisting of a conversation instance (messages field) where each message is composed of a role and content. Additionally, the dataset provides boolean fields to annotate whether the conversation has been resolved (resolved), whether a broad-then-narrow strategy was used (broad_then_narrow), whether multi-round refinement occurred (multi_round_refinement), and whether re-reading occurred after narrowing (read_after_narrowing). Finally, the judge_notes field stores evaluator comments. This dataset can be used for studying dialogue strategies, multi-round dialogue refinement, or human evaluation tasks.
数据集概述
该数据集名为 synthetic-code-training/swegym_gpt5mini_1500i,由 synthetic-code-training 组织发布,托管于 Hugging Face 平台。数据集主要用于代码相关任务(如问题修复或代码生成)的训练与评估,包含 1500 条训练样本。
数据规模与结构
- 总样本数:1500 条(全部位于
train划分中) - 数据大小:约 261 MB(
dataset_size),下载大小约 97 MB(download_size) - 文件格式:数据文件路径为
data/train-*(可能为分片存储)
数据字段说明
每条样本包含以下字段:
| 字段名 | 类型 | 说明 |
|---|---|---|
instance_id |
字符串 | 实例唯一标识符 |
resolved |
布尔值 | 是否已解决(可能表示问题是否被成功修复) |
messages |
列表(含 content 和 role 字段) |
对话或指令消息,content 为消息内容,role 为消息角色(如用户或助手) |
broad_then_narrow |
布尔值 | 是否采用“先广泛后细化”的策略 |
multi_round_refinement |
布尔值 | 是否进行多轮细化 |
read_after_narrowing |
布尔值 | 是否在细化后阅读相关代码或内容 |
judge_notes |
字符串 | 评判者的备注或评估注释 |
数据用途
该数据集可能是用于训练或评估代码生成模型(如 GPT-5 mini)在特定编程任务(如代码修复、问题解决)上的性能,带有多种策略标记(如多轮细化、先广泛后细化等),以分析不同推理策略对任务结果的影响。




