Gender Issues in Machine Translation
收藏资源简介:
该数据集旨在作为机器翻译中性别问题的评估基准。它考虑了在机器翻译背景下建模和处理性别语言的挑战,并扩展了之前使用合成示例识别问题的工作。该数据集专注于中性人称参考翻译为性别形式时出现的问题类别。数据集包括英文源句和四种目标性别语言(法语、德语、西班牙语和俄语),揭示了MT编码中的性别问题,发现了以前手动方法未覆盖的新问题。
This dataset is designed to serve as an evaluation benchmark for gender issues in machine translation. It addresses the challenges of modeling and processing gendered language within the context of machine translation, and extends previous work that identified issues using synthetic examples. The dataset focuses on the category of problems that arise when translating neutral personal references into gendered forms. It includes English source sentences and four target gendered languages (French, German, Spanish, and Russian), revealing gender-related issues in MT encoding and uncovering new problems not previously covered by manual methods.
数据集概述
数据集名称
Gender Issues in Machine Translation
数据集目的
作为评估机器翻译中性别问题的基准。
数据集内容
- 源语言:英语
- 目标语言:法语、德语、西班牙语、俄语
- 数据实例:包含英语句子对及其在性别化语言中的翻译,每对句子在单个词(人称实体)上有所不同。
数据集创建
创建流程
- 筛选出仅含单一人类实体的性别中性句子。
- 对源句中的人类实体进行扰动,形成原始/扰动句子对。
- 将所有对翻译为目标语言,并筛选出人类实体性别在原始和扰动句子间不同的对。
- 人类标注者验证这些“有风险”的对。
- 添加随机的“无风险”对到数据集中。
语言统计
- 法语:100对“有风险”,100对“无风险”
- 德语:100对“有风险”,100对“无风险”
- 西班牙语:100对“有风险”,100对“无风险”
- 俄语:59对“有风险”,100对“无风险”
数据集结构
数据字段
- 原始/替换句子:英语句子及其目标语言翻译
- 单词:英语句子中的单词及其目标语言翻译
- 语法性别:目标语言中单词的语法性别(女性或男性)
使用考虑
社会影响
旨在通过提供评估基准,促进机器翻译中的公平性,特别是性别偏见问题。
已知限制
- 数据集规模相对较小。
- 所选句子依赖于所使用的翻译模型,本数据集使用Google Translate。




