遇见数据集

Unbabel/TowerEval-Data-v0.1

收藏
Hugging Face2024-03-05 更新2024-03-04 收录
官方服务:

资源简介:

TowerEval-Data是一套用于评估专门用于翻译任务的语言模型的数据集,包括机器翻译(如通用、文档、术语感知或上下文感知翻译)、自动后编辑、命名实体识别、语法错误纠正和释义生成等任务。数据集由Unbabel、Instituto Superior Técnico、CentraleSupélec、University of Paris-Saclay等机构策划,支持英语、葡萄牙语、西班牙语、法语、德语、荷兰语、意大利语、韩语、中文和俄语等多种语言。数据集包含来自Flores、WMT23、TICO-19等多个公开数据源的0-shot和few-shot指令及其对应的原始数据。

TowerEval-Data是一套用于评估专门用于翻译任务的语言模型的数据集,包括机器翻译(如通用、文档、术语感知或上下文感知翻译)、自动后编辑、命名实体识别、语法错误纠正和释义生成等任务。数据集由Unbabel、Instituto Superior Técnico、CentraleSupélec、University of Paris-Saclay等机构策划,支持英语、葡萄牙语、西班牙语、法语、德语、荷兰语、意大利语、韩语、中文和俄语等多种语言。数据集包含来自Flores、WMT23、TICO-19等多个公开数据源的0-shot和few-shot指令及其对应的原始数据。

提供机构:
Unbabel
原始信息汇总

数据集卡片:TowerEval-Data

概述

TowerEval-Data 是一套用于评估 Tower 语言模型的数据集,这些模型专门用于翻译任务,如机器翻译(例如通用、文档、术语感知或上下文感知翻译)、自动后期编辑、命名实体识别、语法错误校正和释义生成。

数据集详情

TowerEval 包含从以下来源创建的0-shot和few-shot指令及其相应的原始数据:

数据来源 任务
Flores 通用翻译
WMT23 通用翻译
TICO-19 领域特定翻译
WMT23 自动后期编辑(NLLB 3B 在 WMT23 测试数据上的翻译)
MultiCoNER II 命名实体识别(随机选择的1000个测试实例)
CoNLL-2014 语法错误校正
COWS-L2H 语法错误校正
mlconvgec2018 语法错误校正

预期用途和限制

TowerEval-Data 旨在用于评估大型语言模型在翻译及相关任务上的表现。

引用

bibtex @misc{tower_llm_2024, title={Tower: An Open Multilingual Large Language Model for Translation-Related Tasks}, author={Duarte M. Alves and José Pombal and Nuno M. Guerreiro and Pedro H. Martins and João Alves and Amin Farajian and Ben Peters and Ricardo Rei and Patrick Fernandes and Sweta Agrawal and Pierre Colombo and José G. C. de Souza and André F. T. Martins}, year={2024}, eprint={2402.17733}, archivePrefix={arXiv}, primaryClass={cs.CL} }

搜集汇总
数据集介绍
Unbabel/TowerEval-Data-v0.1 数据集图片
构建方式
在自然语言处理领域,翻译任务的评估需要覆盖多样化的场景与语言对。TowerEval-Data数据集由Unbabel、里斯本高等理工学院、中央高等电力学院及巴黎-萨克雷大学联合构建,旨在系统评估以翻译为核心的大型语言模型(如Tower系列)。该数据集整合了来自Flores、WMT23、TICO-19、MultiCoNER II、CoNLL-2014、COWS-L2H及mlconvgec2018等多个权威数据源的原始语料,并基于这些语料生成了零样本与少样本指令。构建过程涵盖了通用翻译、领域特定翻译、自动后编辑、命名实体识别、语法错误纠正及释义生成等任务,确保了评估维度的全面性。
特点
TowerEval-Data展现出显著的多元性与专业性。其语言覆盖范围广泛,涵盖英语、葡萄牙语、西班牙语、法语、德语、荷兰语、意大利语、韩语、中文及俄语等十种语言,支持跨语言任务的深度评估。数据集规模介于1万至10万条之间,既保证了样本的丰富性,又避免了冗余。在任务类型上,它不仅包含传统的机器翻译,还延伸至自动后编辑、命名实体识别与语法错误纠正等复杂场景,从而全面检验模型在翻译相关任务中的泛化能力与鲁棒性。此外,数据集整合了多个国际竞赛与学术基准的测试实例,进一步提升了评估的权威性。
使用方法
TowerEval-Data专为评估大型语言模型在翻译及关联任务中的表现而设计。用户可通过配套的tower-eval代码库便捷地加载数据并执行生成与评估流程。具体而言,研究人员能够利用数据集中的零样本与少样本指令,结合原始文本,对模型在通用翻译、术语感知翻译、上下文感知翻译及后编辑等任务上进行标准化测试。数据集支持多种语言对与任务类型的灵活组合,允许用户根据研究需求定制评估方案。通过调用tower-eval仓库中的接口,可自动完成指标计算与结果分析,从而高效验证模型性能。
背景与挑战
背景概述
在自然语言处理领域,大规模语言模型在翻译及相关任务中的表现评估日益受到关注。Unbabel联合Instituto Superior Técnico、CentraleSupélec及巴黎-萨克雷大学的研究人员于2024年推出了TowerEval-Data-v0.1数据集,旨在系统评估专为翻译任务设计的大语言模型Tower。该数据集覆盖英语、葡萄牙语、西班牙语、法语等十种语言,整合了来自Flores、WMT23、TICO-19等多个权威来源的零样本和少样本指令数据,支持机器翻译、自动后期编辑、命名实体识别、语法错误纠正及释义生成等多样化任务。作为Tower模型评估的核心基准,TowerEval-Data为多语言翻译相关研究提供了标准化测试平台,推动了该领域模型性能的客观比较与进步。
当前挑战
TowerEval-Data所应对的领域挑战在于,现有翻译评估数据集往往局限于单一任务或语言对,难以全面衡量大语言模型在多语言、多任务场景下的综合能力。该数据集通过整合通用翻译、领域特定翻译、自动后期编辑、命名实体识别、语法错误纠正及释义生成等六大任务,要求模型同时具备跨语言理解、语境感知及细粒度语义修正能力。构建过程中的挑战则体现在数据来源的异构性上:来自Flores、WMT23、TICO-19等不同基准的数据格式、任务定义及评估指标存在差异,需统一指令模板并确保高质量标注。此外,从MultiCoNER II中随机选取的1000个测试实例以及多个语法错误纠正数据集的融合,需平衡样本代表性并避免任务间干扰,最终形成可复现的评估流水线。
常用场景
经典使用场景
Unbabel/TowerEval-Data-v0.1 数据集专为评估多语言大型语言模型在翻译及相关任务上的表现而设计。其经典使用场景涵盖通用机器翻译、文档级翻译、术语感知翻译、上下文感知翻译、自动后编辑、命名实体识别、语法纠错以及释义生成等。研究者可借助该数据集构建零样本或少样本指令,系统性地测试模型在多语种(如英、葡、西、法、德、荷、意、韩、中、俄)任务中的泛化能力与鲁棒性。
实际应用
在实际应用中,TowerEval-Data 支撑了企业级翻译系统的性能验证与优化,例如 Unbabel 的翻译服务可通过该数据集评估模型在医疗(TICO-19)、新闻(WMT23)等垂直领域的翻译质量。此外,它还被用于自动后编辑系统的开发,帮助提升机器翻译输出的流畅度与准确性,并应用于多语言客服、跨语言信息检索等商业场景,显著降低人工校对成本。
衍生相关工作
该数据集衍生了一系列经典工作,最著名的是 Tower 系列多语言大语言模型的构建与评测。相关研究还包括基于该数据集的指令微调方法探索、多任务翻译模型的对比分析,以及针对低资源语言的迁移学习策略。这些工作不仅验证了 TowerEval-Data 作为评测基准的有效性,还推动了跨语言自然语言处理中评估范式的标准化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务