遇见数据集

Cultivar

收藏
arXiv2026-08-10 更新2026-08-12 收录
官方服务:

资源简介:

Cultivar是一个面向多语言翻译的本地化基准数据集,由多个国际研究机构联合创建,旨在评估机器翻译模型在文化内容适应性和数据污染鲁棒性方面的表现。该数据集基于FLORES开发,包含27个语言-脚本-地点组合,共5400条句子对,覆盖21种语言和21个国家/地区,每条句子均通过命名实体识别、LLM辅助重写和人工后编辑流程进行本地化改造,确保内容与目标地域的文化语境高度契合。Cultivar通过对比本地化版本与原始FLORES版本之间的性能差异,能够有效诊断模型对训练数据的过拟合程度,并量化其对不同地域文化内容的翻译保真度,为翻译系统的地域化评估提供了创新性的测试工具。

Cultivar is a localization benchmark dataset for multilingual translation, jointly created by multiple international research institutions, which aims to evaluate the performance of machine translation models in terms of cultural content adaptability and robustness against data contamination. Developed based on FLORES, this dataset consists of 5400 sentence pairs across 27 language-script-location combinations, covering 21 languages and 21 countries/regions. Each sentence has undergone localization processing through a workflow including named entity recognition, LLM-assisted rewriting and human post-editing, ensuring that the content highly matches the cultural context of the target region. By comparing the performance gaps between the localized versions and the original FLORES versions, Cultivar can effectively diagnose the extent of model overfitting to training data, and quantify the translation fidelity of the model towards cultural content from different regions, thus providing an innovative testing tool for the localization evaluation of translation systems.

创建时间:
2026-08-10
原始信息汇总

数据集概述:pinzhenchen/Cultivar-flores

基本信息

  • 数据集名称:Cultivar-flores
  • 许可证:CC BY-SA 4.0
  • 当前版本:v1.0
  • 文件大小:1.52 MB

数据集简介

Cultivar 是一个面向**语言区域(locale)**的多语言机器翻译评估基准。该数据集是 FLORES 数据集的“本地化”变体,通过将 FLORES 的子集本地化到不同地理位置而创建,旨在提供可比、本地化且未被污染的测试数据。当前版本覆盖 28 种语言-地点组合,每个区域包含 200 条 dev 分割句子

设计动机

传统翻译测试数据(如 FLORES)常包含由英语翻译而来的内容(如关于斯坦福大学医学院的文本),这些文本可能已被模型在训练中见过,且不符合真实使用场景。Cultivar 通过将内容本地化到特定地区(如将美国地点替换为西班牙马德里康普顿斯大学),提供更贴近实际且无污染评估实例。

用途说明

  • 单独使用:用于区域导向的翻译评估,评估单元为特定区域的语种对(如 cmn_Hans_China -> Eng_Latn)。
  • 与 FLORES 配对使用:可在实例级别(和语言-区域级别)与 FLORES 配对,提供两种诊断:FLORES 污染检测和本地化鲁棒性评估。

使用条款

  • 可下载本地使用,但不得公开重新分发(除非保护数据免受自动抓取)。
  • 不得针对此基准优化模型或系统。

数据结构

示例实例(以 deu_Latn_Switzerland-eng_Latn 子集为例)

json { "id": "183", "flores_id": "768", "lang1_iso_639_3_code": "deu", "lang1_iso_15924_code": "Latn", "lang1_glottocode": "stan1295", "lang2_iso_639_3_code": "eng", "lang2_iso_15924_code": "Latn", "lang2_glottocode": "stan1293", "location": "Switzerland", "lang1_text": "Weitere Skiveranstaltungen finden im Skigebiet Corviglia in St. Moritz statt, etwa 200 km von Bern entfernt.", "lang2_text": "Other skiing events will be at the Corviglia ski area in St. Moritz, about 200 km from Bern.", "last_updated": "1.0", "split": "dev" }

数据字段说明

字段名 说明
id 每个实例的唯一 ID,同一分割中相同 ID 的实例互为可比实例
flores_id 对应 FLORES 中原始(未本地化)实例的 ID,可用于检索更多元数据
lang1_iso_639_3 语言 1 的 ISO 639-3 代码(本地化语言)
lang1_iso_15924 语言 1 的 ISO 15924 书写文字代码
lang1_glottocode 语言 1 对应的 Glottocode
lang2_iso_639_3 语言 2 的 ISO 639-3 代码(配对的本地化语言)
lang2_iso_15924 语言 2 的 ISO 15924 书写文字代码
lang2_glottocode 语言 2 对应的 Glottocode
location 该实例被本地化的地点,同一子集中所有实例通常具有相同地点(少数例外)
lang1_text 语言 1 的本地化文本
lang2_text 语言 2 的配对本地化文本
last_updated 该实例最后更新的 Cultivar-flores 版本
split 数据分割(与原始 FLORES 中对应实例相同)

引用信息

官方建议引用方式如下: bibtex @misc{cultivar2026, title={Cultivar: A Contrastive and Locale-Oriented Translation Benchmark for Investigating Contamination and Localisation Robustness}, author={Pinzhen Chen and Koel Dutta Chowdhury and Xiaoya Xu and David Tan and Doreen Osmelak and Ona de Gibert and Ariun-Erdene Tumurchuluun and Ashok Urlana and Bouazza Laracha and Fedor Sizov and Hale Sirin and Jesujoba Alabi and Karrar Talib Abed and Mateusz Klimaszewski and Nikolay Bogoychev and Niyati Bafna and Patricia Schmidtova and Preksha Manjunath Shanbhag and Sherrie Shen and Teresa Sy Ortin and Vilem Zouhar and Vivek Iyer and Yasser Hamidullah and Yusser Al Ghussin and Zheng Zhao}, year={2026}, url={https://huggingface.co/datasets/pinzhenchen/Cultivar-flores}, }

同时建议引用 FLORES 相关论文。

贡献者

v1.0 版本的技术与数据贡献者名单(按贡献及名字排序):Pinzhen Chen、Koel Dutta Chowdhury、Xiaoya Xu、David Tan、Doreen Osmelak、Ona de Gibert、Ariun-Erdene Tumurchuluun、Ashok Urlana、Bouazza Laracha、Fedor Sizov、Hale Sirin、Jesujoba Alabi、Karrar Talib Abed、Mateusz Klimaszewski、Nikolay Bogoychev、Niyati Bafna、Patricia Schmidtova、Preksha Manjunath Shanbhag、Sherrie Shen、Teresa Sy Ortin、Vilem Zouhar、Vivek Iyer、Yasser Hamidullah、Yusser Al Ghussin、Zheng Zhao。

搜集汇总
数据集介绍
Cultivar 数据集图片
构建方式
Cultivar基准数据集源于对FLORES数据集的深度本地化改造,旨在弥补传统多语言翻译评测中源语言内容单一性与文化背景缺失的不足。其构建过程遵循一条严谨的三阶段流水线:首先,借助spaCy工具识别FLORES开发集中富含命名实体的句子,并辅以人工校正,筛选出约200条包含至少两个实体的实例;继而,利用GPT-5.5等大语言模型对选定实例进行创造性改写,在保持原句结构的基础上,将其中蕴含的文化专有项替换为目标地区的对应表达;最后,邀请精通源语言、目标语言且熟悉目标地区文化背景的标注者进行人工审核与编辑,通过接受、修正或回退三种方式确保本地化内容的质量与文化适宜性,从而生成覆盖27种语言-文字-地区组合的本地化测试集。
特点
Cultivar数据集的独特之处在于其源对比性与地区导向性设计,使其成为评估机器翻译鲁棒性与数据污染诊断的利器。该数据集包含200条平行测试实例,每条均与未本地化的FLORES原始数据形成配对,通过性能差异(如ΔBLEU与ΔchrF)可精确量化模型对文化内容变化的敏感度,有效区分模型的一般翻译能力与本地化适应能力。此外,数据集覆盖21种独特语言或方言、8种书写系统及21个国家或地区,其中包含同一语言(如中文、印地语)在不同非官方地区的多种本地化变体,为探究模型训练数据中的地域偏见(如美国中心主义)提供了系统性对照。标注统计显示,超过98%的内容为全新本地化文本,且仅约28%的LLM生成结果需人工修订,确保了数据的高质量与真实性。
使用方法
使用Cultivar时,研究者可将本地化测试集与原版FLORES作为对比组,对目标翻译模型进行成对评估。具体而言,应分别计算模型在本地化源文本与原始源文本上的BLEU、chrF等自动指标,进而求得ΔBLEU与ΔchrF分数,以衡量模型的本地化鲁棒性——负值越大表明模型在文化内容替换后表现退化越严重,可能暗示其对FLORES风格的过拟合或训练数据污染。此外,数据集还支持基于词召回率的细粒度分析,通过统计翻译中是否出现原FLORES特有词汇(假阳性)或遗漏本地化新增词汇(假阴性),可探测模型是否存在记忆效应。在应用时,可参考论文中给出的32款开放权重模型的基准结果,对不同规模与类型的翻译系统进行横向比较,或针对特定语言-地区对(如中文面向新加坡、美国)开展局部偏差剖析。
背景与挑战
背景概述
Cultivar基准数据集由Queen's University Belfast等多家研究机构于2026年联合推出,旨在突破传统机器翻译评测的局限。该数据集基于FLORES构建,通过LLM与人工协同创作管线,将200个富含命名实体的句子本地化至27个语言-文字-地域组合,覆盖21种语言与21个国家或地区。其核心研究问题在于推动评测从语言导向转向地域导向,通过源对比范式量化模型对文化内容的鲁棒性,并诊断基准污染。该数据集对多语言机器翻译评测领域具有重要影响力,为评估模型的本地化适应能力提供了系统性工具。
当前挑战
Cultivar面临的挑战多维且深刻。领域层面,现有基准普遍以英语为源头,导致评测内容与目标语言文化脱节,且易受数据污染;语言与地域的非一一对应关系使得单一语言测试难以反映多元文化背景。构建过程中,本地化需兼顾语义保持与文化替换的平衡,LLM生成的改写常需人工大量修订,平均每个实例需4-5处编辑,且需确保翻译方向的可比性。此外,评测发现MT专用模型与小型模型对本地化内容鲁棒性不足,部分模型过度拟合FLORES,且普遍存在美国中心偏差,这些均构成数据集构建与评测的核心挑战。
常用场景
经典使用场景
Cultivar作为首个面向区域文化定位的对比式机器翻译基准,其经典使用场景在于构建源语言与目标语言均经文化本地化处理的平行语料对,从而评估翻译模型在不同地域情境下的表现。该基准基于FLORES开发,针对27个特定语言-地区组合,通过保留句子结构但替换文化实体,实现了对模型本地化鲁棒性的精准度量。研究通常将模型在Cultivar与原始FLORES上的翻译质量进行对比,利用BLEU、chrF等指标量化性能差异,以揭示模型对文化内容的适应能力。这一范式尤其适用于检测模型是否过度拟合基准数据,以及在不同文化背景下是否表现出显著的性能波动,为翻译系统的跨地域泛化能力提供了标准化测试环境。
衍生相关工作
Cultivar的发布催生了众多后续研究,主要围绕数据污染诊断和本地化翻译优化展开。后续工作借鉴其源对比范式,构建了多语种、多区域的本地化测试集,如扩展Cultivar覆盖更多语言对,或将其方法应用于其他NLP任务(如对话系统、信息抽取)。部分研究利用Cultivar的对比机制开发了新的评估指标,结合词元召回率和错误分析,更细致地定位模型的文化不敏感问题。此外,该基准还推动了训练数据去重和模型微调策略的改进,研究者尝试在训练中融入本地化样本以提升模型的跨文化鲁棒性。Cultivar还成为研究多语言模型偏差和公平性的参考工具,其区域对比结果常被用于论证模型训练的美国中心偏向,从而引导更平衡的数据采集与算法设计。
数据集最近研究
最新研究方向
Cultivar基准的提出标志着机器翻译评估从语言导向向场所导向的范式转变,其前沿方向聚焦于利用源对比对照设计来诊断基准污染与本地化鲁棒性。该数据集通过LLM与人类协同创作,将FLORES中的英文原句本地化为27个不同场所的变体,并保留原始结构以维持可比性。当前研究热点包括:利用对比性能差异量化模型对文化内容的敏感度,揭示MT专用模型在本地化内容上的性能退化,以及暴露模型对FLORES的过度拟合和美国中心偏差。Cultivar不仅为多语翻译评估提供了更真实的文化语用考量,而且通过配对设计使研究者能够系统性探测模型对特定区域内容的偏好,推动多语评估向更具文化包容性和实际应用价值的方向演进。
相关研究论文
  • 1
    Cultivar: A Contrastive and Locale-Oriented Translation Benchmark for Investigating Contamination and Localisation Robustness贝尔法斯特女王大学; 纽伦堡工业大学; 萨尔大学; 墨尔本大学; 赫尔辛基大学; 海得拉巴国际信息技术学院; 塔塔咨询服务研究部; 约翰斯·霍普金斯大学; 伊玛目贾法尔·萨迪克大学; Cohere; Last Token; 查理大学; 爱丁堡大学; 苏黎世联邦理工学院; 苏黎世大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务