遇见数据集

airesearch/generated_reviews_enth

收藏
Hugging Face2024-01-18 更新2024-05-25 收录
官方服务:

资源简介:

`generated_reviews_enth`数据集是为机器翻译任务创建的,主要用于英语到泰语的翻译质量评估、机器翻译和情感分析。数据集包含由CTRL生成的英语产品评论,通过Google Translate API翻译成泰语,并由人类注释者根据翻译的流畅性和充分性进行标注。数据集的结构包括翻译、评论星级和翻译是否正确等字段。数据集的创建过程、注释过程、数据字段和分割情况也在README中详细描述。

`generated_reviews_enth`数据集是为机器翻译任务创建的,主要用于英语到泰语的翻译质量评估、机器翻译和情感分析。数据集包含由CTRL生成的英语产品评论,通过Google Translate API翻译成泰语,并由人类注释者根据翻译的流畅性和充分性进行标注。数据集的结构包括翻译、评论星级和翻译是否正确等字段。数据集的创建过程、注释过程、数据字段和分割情况也在README中详细描述。

提供机构:
airesearch
原始信息汇总

数据集概述

名称: generated_reviews_enth

目的: 用于机器翻译任务,特别是英语到泰语的翻译质量估计、机器翻译和情感分析。

语言: 英语(en)、泰语(th)

许可证: CC BY-SA 4.0

数据来源:

  • 英语产品评论由CTRL生成。
  • 泰语评论通过Google Translate API从英语翻译而来。

数据集大小:

  • 训练集: 141,369样本
  • 验证集: 15,708样本
  • 测试集: 17,453样本

数据集结构

数据字段:

  1. translation: 包含英语和泰语的产品评论。
    • en: 英语评论,由CTRL生成。
    • th: 泰语评论,由Google Translate API翻译。
  2. review_star: 评论的星级,用于CTRL生成评论的条件。
  3. correct: 翻译的接受与否,1表示接受,0表示拒绝,由人工标注者根据翻译的流畅性和充分性标注。

数据分割:

  • 训练集、验证集和测试集分别包含不同数量的样本,具体分布如下:
    分割 样本数
    训练 141,369
    验证 15,708
    测试 17,453

数据集创建

数据生成过程:

  • 英语评论由CTRL生成,指定星级作为生成条件。
  • 泰语评论通过Google Translate API从英语翻译。
  • correct字段由人工标注者根据翻译的质量(流畅性和充分性)标注。

标注过程:

  • 人工标注者对英语和泰语评论对进行评估,根据翻译的流畅性和充分性标注是否接受。

标注者:

使用数据集的考虑

社会影响:

  • 提高英语到泰语的翻译质量。
  • 支持泰语产品评论的情感分析。

已知限制:

  • 由于标注过程的限制,一星级评论的数量显著高于其他星级评论,导致数据集轻微不平衡。
搜集汇总
数据集介绍
airesearch/generated_reviews_enth 数据集图片
构建方式
在机器翻译与跨语言自然语言处理领域,高质量平行语料库的构建始终是研究的关键挑战。generated_reviews_enth数据集正是为解决英-泰翻译质量评估任务而精心设计。其构建过程别具匠心:首先,利用CTRL条件生成模型,依据给定的星级评分(1至5星)自动生成英文产品评论;随后,借助Google Translate API将这些英文评论逐条翻译为泰语;最后,聘请专业人工标注员依据译文的流利度与充分性,对每对英-泰翻译进行二元标注(接受为1,拒绝为0)。为确保数据纯净,构建者还执行了严格的预处理流程,包括去除基于原文、译文、星级及标注的重复项,剔除无效星级与标注值,并对英文源句进行去重。
使用方法
研究者可通过HuggingFace Datasets库便捷地加载该数据集,仅需一行代码即可获取完整的英-泰平行语料及标注信息。使用时,需关注三个核心字段:'translation'字段包含'en'(英文源句)与'th'(泰语译文)组成的字典;'review_star'字段记录生成评论的原始星级(1-5);'correct'字段提供翻译质量的二元标签(0表示不合格,1表示合格)。针对翻译质量评估任务,可直接以'correct'为目标标签进行二分类建模;对于机器翻译任务,可提取'translation'字段的平行句对;若进行情感分析,则可利用'review_star'作为多分类标签。数据加载后,建议根据具体任务对不平衡的星级分布进行适当重采样或采用加权损失函数。
背景与挑战
背景概述
在神经机器翻译领域,翻译质量评估一直是制约系统实用性的关键瓶颈,尤其在资源稀缺的语种对如英-泰翻译中,高质量标注数据的匮乏更为突出。由泰国AIResearch机构于2020年创建的generated_reviews_enth数据集,正是在此背景下应运而生。该数据集基于CTRL条件语言模型生成的英文产品评论,通过谷歌翻译API转换为泰文后,由人工标注员根据流畅性与充分性对译文质量进行二元判定,旨在为英-泰翻译质量估计提供基准资源。其研究团队来自VISTEC与AIResearch,核心贡献在于提出了一种结合生成模型与人工校验的数据构建范式,有效缓解了低资源翻译任务中标注数据不足的困境。该数据集不仅支撑了scb-mt-en-th-2020大规模平行语料库的构建,更推动了翻译质量估计、机器翻译及情感分析等多任务研究的交叉发展,成为泰语自然语言处理领域的重要基石。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:翻译质量估计需在缺乏参考译文的情况下精准识别低质量翻译,而机器翻译的语义等价性判断本身具有高度主观性,导致二元标注难以涵盖所有歧义情形。此外,数据构建过程中遭遇多重困难:CTRL生成的原始评论存在语言风格单一、情感分布不均等问题,一星评论数量显著高于其他星级,造成类别不平衡;谷歌翻译API在处理口语化表达与文化负载词时频繁产生生硬译文,增加了人工标注的认知负荷;标注一致性受限于不同标注员对流畅性与充分性的理解差异,需通过重复标注与一致性校验来降低噪声。数据去重环节还需谨慎处理因翻译检查流程导致的重复条目,同时避免过度删除影响语料多样性,这些技术细节共同构成了数据集构建的核心瓶颈。
常用场景
经典使用场景
generated_reviews_enth数据集最经典的使用场景是英-泰机器翻译质量估计(Translation Quality Estimation, TQE),其核心任务在于对机器翻译产出的译文进行二元标注,判断其是否在流畅度与充分性上达到可接受标准。该数据集包含了由CTRL模型生成的英文产品评论及其经Google Translate API翻译为泰语后的结果,并经由人工标注者逐一评估,构建起一个规模达17万余条样本的平行语料库。借助这一资源,研究者可以训练出能够自动判别翻译质量的分类模型,从而在缺乏参考译文的情况下评估机器翻译系统的表现。此外,该数据集亦可被用于英-泰机器翻译模型的训练与评估,以及基于评论文本的跨语言情感分析任务,展现出多任务适配的潜力。
解决学术问题
该数据集有效解决了低资源语言对(如英语-泰语)在机器翻译质量自动评估中缺乏标注数据的关键瓶颈。在学术研究中,传统的翻译质量评估往往依赖人工判断或需要参考译文,成本高昂且难以规模化。generated_reviews_enth通过提供大规模、人工标注的二元质量标签,使得研究者能够训练出基于监督学习的质量估计模型,从而推动无参考译文场景下的自动评估方法发展。这一工作不仅填补了泰语翻译质量估计领域的空白,也为构建面向低资源语言的鲁棒性评估体系提供了重要基准。其意义在于降低了机器翻译系统迭代中的评估门槛,促进了跨语言信息处理技术的普惠化。
实际应用
在实际应用层面,generated_reviews_enth可用于构建面向电子商务平台的英-泰翻译质量监控系统。例如,跨境电商网站常依赖机器翻译将英文产品评论实时转换为泰语,但翻译错误可能导致用户误解或体验下降。基于该数据集训练的翻译质量估计模型能够自动过滤低质量译文,触发人工复核或回退至备用翻译策略,从而保障用户获取准确信息。此外,该数据集还可支撑泰语情感分析应用的开发,帮助商家从翻译后的评论中提取用户对产品的态度倾向,优化本地化运营决策。这些应用场景在泰国及东南亚的数字经济生态中具有显著的商业与社会价值。
数据集最近研究
最新研究方向
在神经机器翻译与跨语言自然语言处理领域,generated_reviews_enth数据集正成为英泰翻译质量估计与情感分析交叉研究的前沿资源。该数据集通过CTRL模型生成英文产品评论,经谷歌翻译API转化为泰语后,由人类标注者根据翻译的流畅性与充分性进行二分类质量评估,开创性地将生成式语言模型与人工校验机制相结合。当前热点聚焦于利用该数据集训练轻量级翻译质量估计器,以替代传统BLEU等自动评估指标,同时探索其在低资源语言机器翻译任务中的泛化能力。此外,数据集中蕴含的多粒度情感标签(1-5星)为跨语言情感分析提供了独特训练样本,推动着从简单文本分类向细粒度情感推理的范式演进。这一数据集的出现,不仅缓解了泰语等小语种高质量平行语料匮乏的困境,更为构建可解释、可信赖的机器翻译评估体系奠定了重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务