遇见数据集

FBK-MT/Neo-GATE

收藏
Hugging Face2024-10-28 更新2024-06-12 收录
官方服务:

资源简介:

Neo-GATE是一个双语语料库,旨在评估机器翻译系统在使用性别包容性新词素从英语翻译成意大利语时的能力。该数据集基于GATE构建,包含841个测试条目和100个开发条目。每个条目包括一个英语源句子和三个意大利语参考句子,这些参考句子在性别标记词的使用上有所不同。数据集的设计允许评估任何意大利语中的新词素范式,并提供了适应不同新词素范式的工具和脚本。

Neo-GATE is a bilingual corpus designed to benchmark the ability of machine translation (MT) systems to translate from English into Italian using gender-inclusive neomorphemes. It includes 841 test entries and 100 dev entries. Each entry consists of an English source sentence and three Italian references which differ in the use of gender-marked terms. The dataset is designed to evaluate any neomorpheme paradigm in Italian and provides tools and scripts for adapting to different neomorpheme paradigms.

提供机构:
FBK-MT
原始信息汇总

数据集概述

数据集名称

Neo-GATE

数据集描述

Neo-GATE是一个双语语料库,旨在评估机器翻译(MT)系统从英语到意大利语使用性别包容性新形态词的翻译能力。该数据集基于GATE,一个用于评估性别重写器和MT中性别偏见的基准。

数据集内容

  • 测试集:包含841个条目,文件名为Neo-GATE.tsv
  • 开发集:包含100个条目,文件名为Neo-GATE-dev.tsv

每个条目包括一个英语源句子,三个意大利语参考句子(分别使用男性、女性和非二元性别词汇),以及用于评估性别包容性MT的目标词注释。

数据字段

  • #:Neo-GATE唯一标识符。
  • GATE-ID:条目在GATE中的唯一标识符。
  • SOURCE:英语源句子。
  • REF-M:意大利语参考句子,所有性别标记词为男性。
  • REF-F:意大利语参考句子,所有性别标记词为女性。
  • REF-TAGGED:意大利语参考句子,所有性别标记词带有Neo-GATE的注释。
  • ANNOTATION:词级注释。

数据集创建

数据集的详细创建过程请参考原始论文。

数据集适应性

为适应特定的新形态词范式,需要一个.json文件,将Neo-GATE的标签集映射到所需形式。使用neo-gate_format.py脚本进行格式转换。

许可证

数据集遵循Creative Commons Attribution 4.0 International license (CC BY 4.0)。

引用信息

使用该数据集时,请引用以下论文:

@misc{piergentili2024enhancing, title={Enhancing Gender-Inclusive Machine Translation with Neomorphemes and Large Language Models}, author={Andrea Piergentili and Beatrice Savoldi and Matteo Negri and Luisa Bentivogli}, year={2024}, eprint={2405.08477}, archivePrefix={arXiv}, primaryClass={cs.CL} }

搜集汇总
数据集介绍
FBK-MT/Neo-GATE 数据集图片
构建方式
在机器翻译领域,性别包容性翻译正逐渐成为研究焦点。Neo-GATE数据集基于GATE基准构建,旨在评估英译意机器翻译系统使用性别包容性新词素的能力。数据集包含841条测试样本和100条开发样本,每条样本由一句性别模糊的英文源句、三句仅因阳性、阴性或非二元词汇而异的意大利语参考译文,以及目标词汇的标注组成。构建过程中,原始GATE中的意大利语参考译文被编辑,在涉及人类指代的性别词素和功能词处插入占位符标签,这些标签覆盖表达语法性别的所有语法成分,并允许被替换为任意新词素范式下的对应形式。
特点
Neo-GATE数据集的核心特点在于其高度灵活性和适配性。它支持评估意大利语中任何新词素范式,通过标签映射机制实现,用户只需提供JSON格式的标签映射文件即可将数据集适配至特定范式,如Schwa或星号范式。数据集提供两种配置:main配置包含待替换占位符的版本,schwa_simple配置则已直接适配至Schwa范式。此外,其标注体系涵盖词级标注,包括冠词、所有格形容词等语法功能词,确保对性别包容性翻译的全面评估。
使用方法
使用Neo-GATE数据集时,首先需确定目标新词素范式并准备相应的JSON标签映射文件。运行提供的neogate_adapt.py脚本,通过--tagset参数指定映射文件路径,--out参数指定输出文件名,即可生成适配后的参考译文和标注文件。若需使用开发集或其他文件,可通过--neogate参数指定TSV文件路径。评估方面,可参考fbk-NEUTR-evAL仓库中的评估代码,该代码提供了与Neo-GATE兼容的评估流程,支持对机器翻译系统在性别包容性方面的表现进行量化分析。
背景与挑战
背景概述
在机器翻译领域,性别偏见的消除与包容性语言的生成已成为伦理与公平性研究的重要议题。由意大利布鲁诺·凯斯勒基金会(FBK)的研究人员Andrea Piergentili、Beatrice Savoldi和Luisa Bentivogli等人于2024年创建的Neo-GATE双语语料库,正是针对这一核心挑战而设计。该数据集基于GATE基准(Rarrick et al., 2023)构建,旨在评估机器翻译系统从英语到意大利语的性别包容性翻译能力,尤其聚焦于使用新形态素(neomorphemes)替代传统阳性和阴性屈折词缀的翻译策略。Neo-GATE包含841条测试数据和100条开发数据,每条数据由英语源句、三种意大利语参考译文(分别对应阳性、阴性和非二元性别标记)以及相关词级标注组成,为性别包容性机器翻译的标准化评估提供了重要资源,对推动自然语言处理领域的伦理发展具有深远影响。
当前挑战
Neo-GATE所面临的挑战首先体现在其解决的领域问题上:机器翻译系统在翻译性别模糊的英语句子时,往往默认采用男性代词或名词形式,忽略了非二元性别群体的语言需求。如何使模型准确识别需要性别包容性翻译的上下文,并生成符合新形态素范式的意大利语译文,是当前的技术难点。其次,在数据集构建过程中,挑战在于对原始GATE语料中所有与人类指代相关的性别标记词(如冠词、形容词、名词等)进行系统性的标签替换,设计一套覆盖意大利语语法性别表达全范围的标签体系,并确保标签能够灵活适配不同的新形态素范式(如Schwa或星号范式)。此外,保持源句的性别歧义性同时保证参考译文的自然性与准确性,也是语料库构建中的关键难题。
常用场景
经典使用场景
Neo-GATE数据集的核心用途在于评估机器翻译系统从英语到意大利语时,使用性别包容性新词素(neomorphemes)进行翻译的能力。该数据集基于GATE基准构建,包含841条测试样本和100条开发样本,每条样本由英语源句、三种意大利语参考译文(分别对应阳性、阴性和非二元性别标记)以及目标词注释组成。其设计允许研究者灵活适配任意意大利语新词素范式,通过标签映射机制实现跨范式的标准化评估,为性别包容性机器翻译研究提供了可复现的评测基准。
衍生相关工作
Neo-GATE的发布催生了一系列具有影响力的衍生研究。Piergentili等人(2024)基于该数据集提出了利用大型语言模型增强性别包容性翻译的方法,证明了LLM在理解新词素范式上的潜力。研究者进一步开发了fbk-NEUTR-evAL评估工具包,实现了对Neo-GATE基准的自动化评分。后续工作扩展了其范式适配框架,衍生出针对西班牙语、法语等罗曼语族的性别包容性评测数据集。在技术伦理领域,有学者基于该数据集分析了主流翻译API的性别偏见程度,揭示了商业系统在非二元性别处理上的系统性不足。这些衍生工作共同构建了从评测到改进的完整研究生态。
数据集最近研究
最新研究方向
Neo-GATE数据集聚焦于机器翻译中的性别包容性前沿方向,特别是通过新形素(neomorphemes)实现非二元性别表达的翻译。该研究基于GATE基准扩展,针对英语到意大利语的翻译任务,构建了包含841条测试样本和100条开发样本的双语语料库,每条数据提供三种性别变体(阳性、阴性、非二元)的参考译文。当前热点集中在评估大型语言模型在性别歧义语境下生成性别中立译文的能力,以及新形素范式(如schwa、星号等特殊字符)在意大利语语法结构中的适配效果。该数据集的意义在于为机器翻译系统的公平性评估提供了标准化工具,推动了自然语言处理领域对性别包容性伦理规范的关注,尤其在欧洲多语言环境中具有重要的社会影响和应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务