遇见数据集

slanggpt-feedback-dataset

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

SlangGPT用户反馈数据集是一个专门用于评估和改进埃及阿拉伯语到现代标准阿拉伯语(MSA)机器翻译质量的数据集。该数据集收集了用户对SlangGPT模型生成的翻译的反馈,旨在为翻译质量评估、翻译正确性检测器训练、从人类反馈中强化学习(RLHF)以及埃及阿拉伯语自然语言处理系统改进提供支持。数据集包含6个核心字段:原始埃及阿拉伯语句子(egyptian_arabic)、SlangGPT生成的MSA翻译(generated_msa)、用户对翻译正确性的二元标签(user_label,取值为correct或incorrect)、用户对翻译质量的评分(user_rating,范围为0-5分)、用户在翻译不正确或评分较低时提供的更好翻译(corrected_msa)以及反馈时间戳(timestamp)。数据收集过程通过向用户展示埃及阿拉伯语句子及其对应的模型翻译,要求用户判断翻译正确性、提供质量评分,并在必要时给出改进翻译。该数据集适用于机器翻译评估、RLHF奖励建模、翻译质量分类、埃及阿拉伯语NLP研究和人类偏好建模等多种任务。数据集采用MIT许可证发布,可用于学术和商业用途。

The SlangGPT User Feedback Dataset is a specialized dataset designed for evaluating and improving the quality of machine translation from Egyptian Arabic to Modern Standard Arabic (MSA). This dataset collects user feedback on translations generated by the SlangGPT model, aiming to support machine translation quality assessment, training of translation correctness detectors, reinforcement learning from human feedback (RLHF), and the improvement of Egyptian Arabic natural language processing systems. The dataset contains 6 core fields: original Egyptian Arabic sentence (egyptian_arabic), MSA translation generated by SlangGPT (generated_msa), binary user label for translation correctness (user_label, with values of correct or incorrect), user rating of translation quality (user_rating, ranging from 0 to 5), improved translation provided by users when the translation is incorrect or the rating is low (corrected_msa), and feedback timestamp (timestamp). The data collection process involves displaying users with Egyptian Arabic sentences and their corresponding model-generated translations, asking users to judge the translation correctness, provide a quality rating, and provide improved translations when necessary. This dataset is applicable to multiple tasks including machine translation evaluation, RLHF reward modeling, translation quality classification, Egyptian Arabic NLP research, and human preference modeling. The dataset is released under the MIT License and can be used for both academic and commercial purposes.

创建时间:
2026-05-24
原始信息汇总

数据集概述:SlangGPT 用户反馈数据集

该数据集包含用户对 SlangGPT(将埃及阿拉伯语方言转换为现代标准阿拉伯语的模型)生成翻译的人工反馈,用于评估翻译质量、构建翻译正确性检测器、支持基于人类反馈的强化学习以及改进埃及阿拉伯语 NLP 系统。

核心信息

  • 语言: 阿拉伯语 (ar)
  • 许可证: MIT
  • 数据集规模: 1K < n < 10K
  • 数据集拆分: 仅包含训练集 (train),共 9 个样本。
  • 数据字段:
    • egyptian_arabic (string): 原始埃及阿拉伯语句子。
    • generated_msa (string): SlangGPT 生成的现代标准阿拉伯语翻译。
    • user_label (string): 用户判断翻译是否正确,值为 correctincorrect
    • user_rating (int64): 用户对翻译质量的评分,范围 0–5。
    • corrected_msa (string): 用户提供的更优翻译,当翻译被标记为不正确或评分 ≤ 2 时填充,否则为空。
    • timestamp (string): ISO 8601 UTC 时间戳。

数据采集过程

向用户展示一对句子(埃及阿拉伯语句子及其 SlangGPT 生成的现代标准阿拉伯语翻译),并要求用户:

  1. 判断翻译是否正确。
  2. 对翻译质量进行评分。
  3. 在必要时提供更优翻译。

所有响应均带有时间戳。

建议使用场景

  • 机器翻译评估
  • RLHF 奖励建模
  • 翻译质量分类
  • 埃及阿拉伯语 NLP 研究
  • 人类偏好建模

相关资源

搜集汇总
数据集介绍
slanggpt-feedback-dataset 数据集图片
构建方式
该数据集的构建源于对埃及阿拉伯语方言与现代标准阿拉伯语翻译质量的评估需求。通过SlangGPT翻译模型生成目标语句后,向用户呈现原始埃及阿拉伯语句子及其对应的现代标准阿拉伯语译文,邀请用户对翻译的正确性进行二元判定,并给出0至5分的质量评分。当用户判定为错误或评分不超过2分时,还需提供修正后的翻译文本。所有反馈均附带时间戳记录,从而形成了包含原始句子、生成译文、用户标签、评分、更正译文及时戳的六维结构化数据。
特点
该数据集的核心特色在于融合了人工主观评判与客观修正数据,为翻译质量检测与偏好建模提供了丰富监督信号。每条样本均包含用户对翻译正确性的明确标签以及量化评分,且在不合格情况下附带人工提供的优质译文,由此构成错误修正对,适用于训练翻译正确性分类器或强化学习中的奖励模型。此外,数据覆盖真实用户反馈场景,具备实际应用中的噪声多样性与偏好差异,有助于提升埃及阿拉伯语自然语言处理系统的鲁棒性。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,并利用pandas转换为DataFrame以进行灵活的数据探索与预处理。基于'user_label'字段可分别筛选正确与错误翻译样本;借助'corrected_msa'字段获取所有人工修正条目,并通过分组聚合提取同一句子对应的多种修正方案,为翻译模型微调提供丰富候选。同时,依据'user_rating'字段可划定高、低质量子集,用于针对性分析或训练不同层级的质量评估模型,从而支撑机器翻译评估、RLHF奖励建模及方言自然语言处理研究。
背景与挑战
背景概述
该数据集由Adham Ashraf、Abdelrahman Ahmed与Ahmed Fekry于2026年创建,聚焦于埃及阿拉伯语方言到现代标准阿拉伯语(MSA)的机器翻译评估与优化。埃及阿拉伯语作为阿拉伯世界最具影响力的口语变体之一,其与标准语之间的转换在自然语言处理领域长期面临资源匮乏与质量评估难题。该数据集通过收集人类对SlangGPT模型翻译输出的反馈,构建了包含用户标注、质量评分及人工修正译文的多维度评价资源,为埃及方言NLP系统改进、翻译正确性检测器训练以及基于人类反馈的强化学习(RLHF)提供了关键数据基础。作为该领域罕有的受众导向型反馈数据集,它填补了低资源阿拉伯方言翻译质量评估库的空白,对推动现实场景下非标准阿拉伯语NLP研究具有重要参考价值。
当前挑战
该数据集应对的核心领域挑战在于埃及阿拉伯语方言与现代标准阿拉伯语之间因语法、词汇及文化表达差异而导致的翻译质量不可靠性问题,此类转换需兼顾方言语义保真度与标准语可读性,现有模型常产生语义偏离或信息丢失的译文。构建过程中面临三大困难:一是高质量方言-标准语平行语料稀缺,需依赖具备双母语能力的用户众包标注;二是用户主观评价标准不一致,导致不同评分者的“正确”定义存在偏差,影响标签可靠性;三是数据规模极小(仅9条训练样本),难以支撑统计显著的模型训练与评估,以及人工修正译文的规范化处理,均为小样本学习与噪声控制带来严峻挑战。
常用场景
经典使用场景
在阿拉伯语自然语言处理领域,该数据集最经典的用途是评估与优化埃及方言至现代标准阿拉伯语的机器翻译系统。研究者可借助其中包含的人类反馈标签(正确/错误)、质量评分(0–5)以及用户修正后的译文,构建翻译质量分类器或翻译正确性检测模型。此外,该数据集也常用于基于人类反馈的强化学习(RLHF)流程,为奖励模型提供偏好数据,从而提升方言翻译系统的语义准确性与流畅度。
实际应用
在实际应用中,该数据集支撑了面向埃及方言用户的智能翻译助手与对话系统的迭代优化。开发人员可利用其中的评分与修正对,微调生产环境中的翻译模型,使其更精准地捕捉俚语表达与口语化句式。此外,基于用户反馈训练的翻译正确性探测器可嵌入实时翻译服务,自动识别并标记低质量输出,提升用户体验。该数据集还为人机协作的翻译纠错平台提供了基础设施,助力阿拉伯语数字内容的无障碍传播。
衍生相关工作
基于该数据集,研究者已开展多项衍生工作。以用户修正对为训练数据,一些工作构建了翻译质量排序模型,并引入对比学习框架以区分正误译文。另有工作将其集成至RLHF管线中,训练面向埃及方言的奖励模型,进而通过近端策略优化(PPO)算法提升生成译文的自然度。此外,该数据集中的低分样本也被用于增强翻译模型的鲁棒性,通过对抗性训练减少方言特有表达的翻译模糊性,为后续阿拉伯语多方言统一翻译系统的构建奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务