GaMS-Translator-GRPO-Training
收藏资源简介:
该数据集是一个双语(英语和斯洛文尼亚语)文本数据集,包含训练集和验证集,分别有103,351条和1,044条样本。每条样本由四个字段组成:prompt(包含角色和内容的多轮对话输入)、chosen(包含角色和内容的选定响应)、comet_score(一个浮点数评分,可能用于衡量生成质量)以及translator(翻译者信息)。数据集适用于训练或评估基于偏好的文本生成模型、翻译质量评估或多轮对话系统。
This dataset is a bilingual (English and Slovenian) text dataset, containing a training set with 103,351 samples and a validation set with 1,044 samples. Each sample consists of four fields: prompt (a multi-turn dialogue input with role and content), chosen (a selected response with role and content), comet_score (a floating-point score possibly used to measure generation quality), and translator (translator information). The dataset is suitable for training or evaluating preference-based text generation models, translation quality assessment, or multi-turn dialogue systems.
GaMS-Translator-GRPO-Training 数据集详情
数据集概述
该数据集专门用于机器翻译模型(GaMS-Translator)的GRPO(Group Relative Policy Optimization)训练,涉及英语(en)和斯洛文尼亚语(sl)两种语言。数据集采用 CC BY-NC 4.0(知识共享-非商业使用) 许可协议,适用于非商业研究和开发用途。
数据规模与划分
| 数据集划分 | 样本数量 | 数据大小 |
|---|---|---|
| 训练集(training) | 103,351 条 | 670,183,226 字节 |
| 验证集(validation) | 1,044 条 | 6,517,314 字节 |
| 合计 | 104,395 条 | 约 676.7 MB |
压缩下载大小约为 405.6 MB。
数据结构与特征
每条数据包含以下四个字段:
| 字段名称 | 数据类型 | 说明 |
|---|---|---|
| prompt | 消息列表(角色+内容) | 翻译任务的输入提示,包含 role(角色)和 content(内容)两部分,用于指导模型进行翻译 |
| chosen | 消息列表(角色+内容) | 训练中选择的参考翻译输出,作为GRPO训练中的优选响应 |
| comet_score | 浮点数(float64) | 机器翻译质量评估指标COMET的得分,用于衡量翻译质量 |
| translator | 字符串(string) | 生成该翻译结果的翻译器/系统标识 |
数据用途
该数据集专为翻译模型的强化学习(GRPO)训练而构建:
- prompt 提供翻译指令与源文本
- chosen 提供优质参考译文(基线选择)
- comet_score 作为质量反馈信号(奖励依据)
- translator 记录翻译来源,便于分析不同翻译系统的表现差异
数据集中同时包含了训练集与验证集,便于进行模型训练效果评估与调参。
许可与语言范围
- 许可协议:CC BY-NC 4.0(仅限非商业用途)
- 涉及语言:英语(en)、斯洛文尼亚语(sl)




