遇见数据集

CzechDocs

收藏
arXiv2026-06-18 更新2026-06-20 收录
数据链接:
官方服务:

资源简介:

CzechDocs是由查理大学团队构建的一个多语言并行格式化文档数据集,旨在支持评估在翻译过程中保留文档格式的机器翻译系统。该数据集包含316个文档的并行语言变体,涵盖HTML、DOCX和PDF三种格式,总计60,153个可翻译片段、271,111个单词和126,833个标记,数据主要来源于捷克政府网站、教育门户和公共服务平台等真实场景。其创建过程涉及网络爬取、手动对齐、格式转换和预处理流水线,确保了片段级对齐和标记的高密度保留。该数据集专注于解决本地化内容中标记感知翻译的评估难题,特别适用于危机沟通、公民融合材料等多语言内容快速部署领域,为格式保持机器翻译的研究提供了关键资源。

CzechDocs is a multilingual parallel formatted document dataset constructed by the team from Charles University, which aims to support the evaluation of machine translation systems that preserve document formatting during translation. This dataset contains parallel language variants of 316 documents, covering three formats: HTML, DOCX and PDF, with a total of 60,153 translatable segments, 271,111 words and 126,833 tokens. The data is mainly sourced from real-world scenarios such as Czech government websites, educational portals and public service platforms. Its creation process involves web crawling, manual alignment, format conversion and a preprocessing pipeline, ensuring segment-level alignment and high-density retention of tokens. This dataset focuses on addressing the evaluation challenge of token-aware translation in localized content, and is particularly suitable for fields requiring rapid deployment of multilingual content such as crisis communication and citizen integration materials, providing a critical resource for research on format-preserving machine translation.

创建时间:
2026-06-18
搜集汇总
数据集介绍
CzechDocs 数据集图片
构建方式
CzechDocs数据集由捷克查理大学的研究团队构建,专注于机器翻译中格式保留的评估。数据收集源自14个捷克公共网站,涵盖政府服务、教育门户、市政信息及公共健康文档等面向外籍居民的内容。共计316份多语言平行文档(77份独特文档),涵盖HTML、DOCX与PDF三种格式。构建流程包括:手动与自动化网页爬取获取原始文档;利用Okapi Tikal工具将内容提取为XLIFF、Moses InlineText及纯文本格式;对HTML文档执行人工段落级对齐,确保源语言与目标语言的片段严格平行;而对PDF与DOCX仅进行文档级对齐。最终通过重新导出流程,使所有语言版本共享统一的片段结构,从而形成高质量、段级对齐的平行语料库。
特点
该数据集的核心特点在于其高度聚焦于格式保留机器翻译的评估需求。语料包含60,153个可翻译片段、271,111个词及126,833个标记标签,平均每片段含4.5个词与2.1个标签,标签密度高达90.3%,凸显了结构化文档的典型特征。语言覆盖以捷克语、乌克兰语为主,辅以越南语、英语、俄语等15种少数族裔语言,反映捷克共和国移民社区的实际语言需求。数据集独特之处在于其多格式并行性——同一内容以HTML、DOCX和PDF三种格式呈现,支持跨格式评估。此外,手动对齐的HTML子集为细粒度评估标记保留能力提供了可靠基准,而文档级对齐的PDF与DOCX则适用于整体结构保真度测试。
使用方法
CzechDocs数据集专为评估格式感知机器翻译系统而设计。研究者可利用其验证集(19份HTML文档)比较不同翻译策略:一是去标签后翻译(detag-and-project),即移除标记后翻译纯文本,再通过词对齐工具(如awesome-align)重新插入标签;二是直接输入带标签的片段,利用大语言模型(如GPT-4.1-nano或Aya-expanse-8b)进行翻译;三是通过提示工程显式要求模型保留标记位置。评估时可采用带标签BLEU与无标签BLEU双指标,分别衡量标记保真度与翻译质量。数据集还提供XLIFF、Moses InlineText及纯文本格式,便于集成到现有本地化工作流中。完整资源(含源码与处理脚本)公开发布于GitHub,测试集将留作未来共享任务使用。
背景与挑战
背景概述
捷克查理大学形式与应用语言学研究所的Josef Jon与Ondřej Bojar于2026年发布了CzechDocs数据集,旨在应对少数民族语言文档翻译中格式保留的严峻挑战。该数据集聚焦于捷克境内乌克兰语、英语、越南语等少数民族语言的格式化文档(HTML、DOCX、PDF),核心研究问题在于评估机器翻译系统在保持文档结构与标记完整性方面的性能。受2022年乌克兰难民危机驱动,超过50万乌克兰人涌入捷克,催生了对法律文件、政府网站及公共卫生信息等高保真翻译的迫切需求。CzechDocs的推出为多语言、多格式、高标记密度的翻译评估提供了标准化基准,显著推动了格式感知机器翻译领域的发展。
当前挑战
CzechDocs所应对的领域挑战在于机器翻译中标记标签与文档结构的保真度——传统评价指标如BLEU侧重语义准确性,却忽略了HTML标签、XML结构等元素的完整性,这在实际本地化工作流中至关重要,直接影响下游处理与网页发布。构建过程中,团队面临多重困难:源文档存在跨语言版本的非平行内容(如多余段落或未翻译部分),需手动编辑HTML确保段级对齐;PDF及DOCX格式仅能实现文档级对齐,内部段界不一致;高标记密度(平均每段2.1个标记)与短句特性(均长4.5词)加剧了模型对格式异常敏感的问题。此外,去标记-投影方法与直接输入标记的LLM策略间存在性能波动,何种文档属性决定方法优劣仍待探索。
常用场景
经典使用场景
CzechDocs数据集的核心应用在于评估和推动格式感知机器翻译领域的发展。它专门针对捷克语及在捷克境内的少数民族语言(如乌克兰语、英语、越南语等)构建,提供了包含HTML、DOCX和PDF三种格式的多路平行文档语料。其最经典的用途是作为基准测试集,用以比较不同翻译策略在保留文档原始标记结构(如标签、排版、超链接等)方面的表现。研究者可以借助该数据集,系统性地衡量从传统的去标签-投影方法到基于大语言模型的直接翻译等多种范式在格式保真度与翻译质量上的优劣,从而为面向生产环境的本地化翻译系统提供可靠的评估框架。
实际应用
在实际应用中,CzechDocs直接服务于跨语言文档本地化与信息发布的场景,尤其是在需要快速生产多语言内容的公共部门与应急通信中。例如,捷克政府机构可利用该数据集评价和改进其多语种门户网站、法律表格与公共服务手册的自动翻译流程,确保翻译后的网页能够保留原有的HTML结构和交互元素,无需人工二次修复。在2022年乌克兰难民涌入捷克的背景下,该数据集所覆盖的捷克-乌克兰平行文档(如移民指南、教育材料、卫生公告)可助力部署敏捷的翻译管道,将关键信息迅速转化为外语版本,同时维持字段标签、表单控件与链接锚点的完整性,从而保障信息的可访问性与合规性。此外,它也可供商业本地化公司、开源翻译工具(如LibreTranslate)及企业级内容管理系统用于验证其格式保持插件的鲁棒性,降低后期人工排版与调试的成本。
衍生相关工作
自CzechDocs发布以来,它直接衍生并催化了多项针对格式保持机器翻译的经典工作。其验证子集已被用于评测大语言模型在标记感知翻译中的性能差异,例如Dabre等人基于该数据集研究了零样本与少样本提示策略对标记传播准确性的影响,发现模型对标签复杂度和语言对的敏感性存在显著波动。此外,该数据集为开发更精细的标记迁移算法提供了对照基准,诸如基于词对齐的启发式重插入方法(如awesome-align结合Charles Translator的流程)与端到端标签保留解码策略的对比实验,均以CzechDocs为测试平台揭示了各自在BLEU得分与标记准确率上的权衡。未来,该数据集还将支撑一个专门的共享任务,聚焦于文档级别的格式保持翻译,鼓励学界提出能够同时处理段内标记与跨段结构一致性的统一框架,从而将相关工作从片段级评测推向更贴近真实文档全局结构的挑战。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务