遇见数据集

Last Translation Benchmark

收藏
arXiv2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Last Translation Benchmark(LTB)是由苏黎世联邦理工学院等多家机构联合创建的大型挑战性基准数据集,旨在暴露当前最先进机器翻译模型的失败案例。数据集包含3456条人工撰写并经同行评审的困难翻译输入,覆盖109种语言,并集成文本、图像、音频和视频多模态形式,每条示例均配有手工设计的验证规则。创建过程采用众包方式,由244位贡献者提交,经同行评审确保质量,并持续接受新贡献。该数据集应用于机器翻译评测领域,旨在提供可靠、可重复且可解释的评估方法,突破静态基准饱和局限,推动翻译模型持续进步。

Last Translation Benchmark (LTB) is a large-scale challenging benchmark dataset jointly created by ETH Zurich and multiple other institutions, aiming to expose failure cases of current state-of-the-art machine translation models. It comprises 3456 manually authored and peer-reviewed challenging translation inputs spanning 109 languages, and integrates multimodal content including text, images, audio and video. Each instance is paired with manually crafted validation rules. The dataset was developed via a crowdsourcing workflow, with submissions from 244 contributors; its quality was rigorously ensured through peer review, and it continues to accept new contributions. This dataset is applied in the field of machine translation evaluation, aiming to provide a reliable, reproducible and interpretable evaluation paradigm, break through the saturation bottleneck of static benchmarks, and drive the continuous advancement of translation models.

创建时间:
2026-09-04
原始信息汇总

Last Translation Benchmark 数据集详情

数据集概览

  • 名称:Last Translation Benchmark (LTB)
  • 最新版本:LTBv1(包含截至2026年9月1日前接受的贡献)
  • 许可协议:CC-BY-4.0
  • 数据集大小:1K < n < 10K(LTBv1包含3,456条难翻译示例)
  • 任务类型:翻译、文本生成
  • 核心特点:这是一个实时更新的数据集,接受社区贡献,旨在测试最先进机器翻译模型的极限

语言覆盖

数据集支持54种语言,包括英语、中文、德语、法语、西班牙语、日语、俄语、意大利语、葡萄牙语、荷兰语、波兰语、阿拉伯语、韩语、越南语、土耳其语、捷克语、瑞典语、乌克兰语、波斯语、印尼语、罗马尼亚语、加泰罗尼亚语、芬兰语、匈牙利语、丹麦语、挪威语、希伯来语、希腊语、泰语、印地语、斯洛伐克语、克罗地亚语、立陶宛语、爱沙尼亚语、孟加拉语、乌尔都语、泰米尔语、泰卢固语、马拉地语、白俄罗斯语、南非荷兰语、世界语、拉丁语、爪哇语、缅甸语、维吾尔语、坎纳达语、奥里亚语、阿萨姆语、豪萨语、约鲁巴语、库尔德语、梵语、卢森堡语、提格里尼亚语、罗曼什语、林堡语、沃拉普克语等。

数据集内容

每个示例包含以下字段:

  • source:输入文本
  • source_lang, target_lang:人类可读的语言名称
  • source_lang_iso, target_lang_iso:ISO639-3语言代码(若存在)
  • source_instructions:特殊翻译指令(可选)
  • source_media:图像、音频和视频(Base64编码字符串,可选)
  • verification_rules:翻译需要满足的验证规则列表(一条或多条)
  • translations:人类和现有模型的翻译列表,并包含是否通过验证规则的信息
  • linguistics:导致翻译困难的语言学标注
  • attribution:创建该示例所依据资源的链接
  • tags:所属子集(LTBv1为全部,LTBv1-text为纯文本,LTBv1-micro为微型纯文本)

数据集特点

  • 包含人类撰写且经同行评审的示例(文本、图像、音频、视频)
  • 每个示例配有手工制定的验证规则,用于可靠、客观地评估任何未来翻译
  • 示例来源多样,涵盖多种语言对,专门打破最先进的机器翻译模型
  • 创新性地解决了当前机器翻译基准测试中存在的琐碎化不真实化问题

数据示例

数据集提供了JSON格式的示例,展示英译德任务中人类与多个模型(Google Translate、Gemini 3.1 Pro、Gemma 4等)的翻译对比及验证结果。

外部资源

  • 论文:https://arxiv.org/abs/2609.04173
  • 贡献提交及模型排行榜:https://last-translation-benchmark.vilda.net/
  • 排行榜结果:https://last-translation-benchmark.vilda.net/leaderboard-results
  • 简单JSON格式数据:http://last-translation-benchmark.vilda.net/LTBv1.json

引用方式

数据集提供完整的BibTeX引用格式,作者列表过长时可截断或使用author={LTB}代替。

搜集汇总
数据集介绍
Last Translation Benchmark 数据集图片
构建方式
随着机器翻译技术的飞速发展,传统基准测试逐渐饱和,难以揭示前沿模型的失败案例。基于此,Last Translation Benchmark 采用众包方式,汇聚了来自166个机构的244名贡献者,共同构建了一个动态的、持续更新的测试集。每个提交的示例均须经过严格的同行评审流程,确保其针对性强且质量可靠。在提交过程中,示例先由多个主流翻译模型处理,贡献者依据其失败表现,精心制定验证规则,最终形成的输入覆盖文本、图像、音频和视频等多种模态,旨在捕捉真实场景中的翻译难题。
特点
该基准的核心特色在于其创新的评估机制——每个示例配有一组人工撰写的验证规则,能够精确识别翻译中的具体失败模式。相较于传统评估方法,这种基于规则的验证方式不仅更具客观性和可解释性,还显著降低了评估成本,并有效避免了模型自我偏好等偏差。此外,数据集规模宏大,包含3456个示例,覆盖109种语言,从英语到极小众语言均有涉猎,且部分示例涉及方言、文化特有概念及多模态信息,全面反映了机器翻译所面临的多元挑战。
使用方法
使用时,研究人员可将待评估模型的翻译输出与数据集中的验证规则逐一对照,由LLM裁判判定是否通过,从而获得可复现的通过率指标。该基准支持多种使用模式:研究者可基于文本、图像等子集进行针对性分析,也可采用“盲测”或“oracle”模式参与公开排行榜。同时,数据集附带着翻译难度分类法,帮助用户深入探究模型失败的原因。建议采用开源LLM作为验证器,以保障评估的稳定性与可复现性,进而有效追踪翻译模型的进步轨迹。
背景与挑战
背景概述
随着机器翻译模型性能的快速提升,传统基准测试逐渐趋于饱和,评估指标亦面临失真与不可解释的困境,行业亟需能够揭示前沿模型缺陷的新范式。在此背景下,由苏黎世联邦理工学院、约翰霍普金斯大学、MBZUAI等多家顶尖机构于2026年联合发起,汇集244位来自166个机构的研究者共同构建了Last Translation Benchmark(LTBv1)。该数据集以众包方式征集3,456个人类撰写且经同行评审的高难度翻译样本,覆盖109种语言及文本、图像、音频与视频多模态形式,旨在通过聚焦失败案例和人工验证规则,突破现有静态基准的局限,为机器翻译领域树立动态、可持续的评测里程碑。
当前挑战
该数据集直面机器翻译评测领域的深层挑战:现有静态基准已趋饱和,难以区分强模型的细微差距;传统的基于重叠的自动指标与人类判断脱节,而基于神经网络的指标和LLM评委易受偏见与奖励黑客攻击,尤其在域外场景下可靠性不足;即便人类评估也受限于主观性、不可重复性与高昂成本。同时,构建过程本身亦充满挑战,需确保每个案例既真实自然又对多数前沿模型构成障碍,同时设计精准的验证规则以捕获特定失败模式,这要求贡献者具备深厚语言与文化背景,且需通过严格的双盲同行评审流程保证数据质量与公平性,无疑提升了构建的技术与协作难度。
常用场景
经典使用场景
Last Translation Benchmark作为一项动态演进的基准测试,其核心应用在于对前沿神经机器翻译系统进行严苛的压力测试与细粒度诊断。该数据集汇集了精心构造的文本、图像、音频及视频等多模态挑战样本,旨在暴露在常规评估中难以触发的深层翻译缺陷。其独特的验证规则机制,使得研究者能够针对特定失败模式进行自动化的、可复现的评估,从而在模型性能逼近饱和的背景下,提供一种精准定位系统能力边界与瓶颈的有效工具。这一基准不仅服务于模型间的横向比对,更可用于追踪技术迭代中具体难点的消解进程,为机器翻译的长期发展设立了一个动态的、不断更新的挑战性标尺。
解决学术问题
该数据集直面当前机器翻译评估领域的核心困境:传统静态基准的饱和化致使模型间性能差异难以区分,而现有自动评估指标在忠实度与可解释性上存在显著缺陷,人为评估又面临可扩展性与一致性的挑战。Last Translation Benchmark通过众包方式收集那些能够击溃最强系统的自然主义难点,并辅以人工审核的验证规则,构建了一套具有明确通过标准的可复制评估体系。此举有效缓解了生成器与评估器之间信息不对称的问题,为衡量翻译质量提供了更贴近真实能力维度的、具备校准意义的评估范式,进而填补了现存基准在揭示强模型弱点方面的空白。
衍生相关工作
该基准的发布催生了多个方向的后续研究。其一,验证规则评估范式的提出,启发了探索如何利用更精细的、面向假说验证的评估指令来增强大语言模型作为评判者的可靠性与可解释性,相关研究涉及规则自动生成与模型自我偏见的度量。其二,数据集内在的多语言与难度标注信息,为构建翻译难度预测模型提供了训练语料,推动了对于何种语言现象构成源语言固有挑战的量化研究。其三,基于示例在不同目标语言间成功迁移的经验,衍生出半自动构建跨语言平行挑战集的方法学探讨,旨在实现更公平的多语言模型对比评估。这些工作共同丰富了机器翻译评测的方法论内涵,并拓展了动态基准建设的思想。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务