遇见数据集

zetavg/mlqa_en_zh_tw

收藏
Hugging Face2023-04-27 更新2024-03-04 收录
官方服务:

资源简介:

MLQA en-zh_tw数据集是MLQA(多语言问答)数据集的中英双语版本,特别转换为台湾正体中文,并合并了中文和英文版本的相同项目,以便于双语语言模型使用。数据集分为dev和test两个部分,分别包含302和2986组数据。转换过程包括使用OpenCC将简体中文转换为台湾正体中文,使用pangu.js在中英文之间添加空格,以及合并中英文数据集中的相同项目。已知问题包括某些项目可能缺少一种语言的版本,部分问题与答案可能存在理解偏误或歧异,以及不同语言版本的context长度和内容范围可能有很大差异。

The MLQA en-zh_tw dataset is a Chinese-English bilingual variant of the MLQA (Multilingual Question Answering) dataset, where the Chinese portion has been specially converted to Taiwan Traditional Chinese, and identical entries from the original Chinese and English versions of the dataset are merged to facilitate use by bilingual language models. The dataset is divided into two subsets: dev and test, containing 302 and 2986 data samples respectively. The conversion procedures include using OpenCC to convert Simplified Chinese to Taiwan Traditional Chinese, using pangu.js to insert spaces between Chinese and English text, and merging identical entries across the Chinese and English datasets. Known issues include that some entries may be missing a version in one of the two languages, some questions and answers may contain comprehension biases or ambiguities, and the context length and content scope of different language versions may differ considerably.

提供机构:
zetavg
原始信息汇总

数据集概述

基本信息

  • 许可证:CC-BY-3.0
  • 任务类别
    • 问答
    • 翻译
  • 语言
    • 中文
    • 英文
  • 数据集大小:1K<n<10K
  • 美观名称:MLQA en-zh_tw

数据集内容

  • 描述:MLQA (MultiLingual Question Answering) 中英双语问答资料集,为原始 MLQA 资料集转换为台湾正体中文的版本,并合并中文与英语版本的相同项目,方便供双语语言模型使用。
  • 数据划分:分为 devtest 两个 split,分别包含 302 和 2986 组数据。

数据示例

json [ { "title": { "en": "Curling at the 2014 Winter Olympics", "zh_tw": "2014 年冬季奧林匹克運動會冰壺比賽" }, "paragraphs": [ { "context": { "en": "Qualification to the curling tournaments at the Winter Olympics was determined through two methods. Nations could qualify teams by earning qualification points from performances at the 2012 and 2013 World Curling Championships. Teams could also qualify through an Olympic qualification event which was held in the autumn of 2013. Seven nations qualified teams via World Championship qualification points, while two nations qualified through the qualification event. As host nation, Russia qualified teams automatically, thus making a total of ten teams per gender in the curling tournaments.", "zh_tw": "本屆冬奧會冰壺比賽參加資格有兩種辦法可以取得。各國家或地區可以透過 2012 年和 2013 年的世界冰壺錦標賽,也可以透過 2013 年 12 月舉辦的一次冬奧會資格賽來取得資格。七個國家透過兩屆世錦賽積分之和來獲得資格,兩個國家則透過冬奧會資格賽。作為主辦國,俄羅斯自動獲得參賽資格,這樣就確定了冬奧會冰壺比賽的男女各十支參賽隊伍。" }, "qas": [ { "id": "b08184972e38a79c47d01614aa08505bb3c9b680", "question": { "zh_tw": "俄羅斯有多少隊獲得參賽資格?", "en": "How many teams did Russia qualify for?" }, "answers": { "en": [ { "text": "ten teams", "answer_start": 543 } ], "zh_tw": [ { "text": "十支", "answer_start": 161 } ] } } ] } ] } ]

已知问题

  • 有些项目的 titleparagraphcontext、问题或是答案可能缺少其中一种语言的版本。
  • 部分问题与答案可能存在理解偏误或歧义。
  • paragraphcontext 在不同语言的版本下可能长度与涵盖的内容范围有很大落差。
搜集汇总
数据集介绍
构建方式
MLQA en-zh_tw 数据集是基于 Facebook Research 发布的 MLQA 多语言问答数据集,通过系统化的转换流程构建而成。原始数据集包含中英文的上下文、问题与答案对。转换过程首先利用 OpenCC 工具,采用 s2twp.json 配置,将简体中文转换为台湾正体中文及常用词汇,随后借助 Python 版本的 pangu.js 在中英文之间自动插入空格以优化排版。最后,将中文与英语版本中相同标题和段落结构的项目进行合并,形成双语对齐的问答对。数据集划分为 dev 和 test 两个子集,分别包含 302 和 2986 组数据,结构上保留了原始 JSON 格式,涵盖标题、段落上下文及问答列表。
特点
该数据集的核心特点在于其双语对齐特性,每个样本均包含英语和台湾正体中文的标题、上下文、问题与答案,便于训练和评估双语语言模型。数据覆盖多个领域,如体育、科技等,丰富了问答任务的多样性。然而,数据集存在若干已知局限:部分条目可能缺失某一语言版本的标题或答案;由于翻译和转换过程,某些问题与答案之间可能存在语义理解偏差或歧义;此外,不同语言版本的上下文长度和内容覆盖范围差异显著,例如中文版本可能仅为简短描述,而英文版本则包含详尽段落。这些特点既体现了数据集在跨语言研究中的价值,也提示了使用时需注意的语言不一致性。
使用方法
用户可通过 HuggingFace 数据集库直接加载该数据集,指定 split 参数为 'dev' 或 'test' 以获取相应子集。数据以 JSON 格式提供,每个样本包含 'title'、'paragraphs' 和 'qas' 字段,其中 'title' 和 'context' 为双语字典,键 'en' 和 'zh_tw' 分别对应英语和中文版本。问答对包含唯一标识符 'id'、双语问题及答案列表,答案中 'text' 为具体文本,'answer_start' 标记在上下文中的起始位置。适用于问答任务、翻译任务或跨语言模型微调,使用时需注意数据中的缺失和偏差问题,建议结合原始 MLQA 文档进行验证。
背景与挑战
背景概述
在跨語言自然語言處理領域,多語言問答系統的發展長期受限於高品質平行語料庫的匱乏,尤其當目標語言涉及地域性變體時,如繁體中文與簡體中文之間的語言鴻溝,更對模型泛化能力構成嚴峻考驗。由Facebook研究團隊於2019年發布的MLQA(多語言問答基準)資料集,旨在評估模型在不對等跨語言情境下的理解與推理能力,其原始版本涵蓋七種語言,但中文部分僅包含簡體中文。為填補台灣正體中文在該領域的空白,研究者Zetavg於2023年基於MLQA原始資料,透過OpenCC工具進行簡轉繁轉換,並合併中英文問答對,創建了「zetavg/mlqa_en_zh_tw」資料集。該資料集聚焦於雙語問答與翻譯任務,包含302組開發集與2986組測試集,為評估雙語語言模型在正體中文與英語之間的跨語言遷移能力提供了關鍵資源,其影響力體現在促進繁體中文社群參與多語言NLP研究,以及推動語言變體處理技術的進步。
当前挑战
該資料集面臨多重挑戰。首先,在領域問題層面,跨語言問答需解決語言不對稱性帶來的語義對齊難題,例如中英文上下文長度與資訊密度差異顯著(如「Adobe Photoshop」項目中,繁體中文僅兩句而英文為完整段落),導致模型難以精準定位答案。其次,構建過程遭遇兩大技術難關:一是簡繁轉換可能引入詞彙習慣差異(如「軟體」vs「軟件」),OpenCC雖採用台灣常用詞彙配置,仍難完全避免地域性用語偏誤;二是部分問答對存在語言版本缺失或理解歧義,如範例中「俄羅斯有多少隊獲得參賽資格?」的答案「十支」與英文答案「ten teams」在數詞表達上存在文化差異,可能誤導模型學習不恰當的對應關係。此外,原始資料的問答起點標註(answer_start)在轉換後因字數變動而需重新校準,增加了後處理的複雜性。
常用场景
经典使用场景
在跨语言自然语言处理研究中,zetavg/mlqa_en_zh_tw 数据集最经典的使用场景是作为双语机器阅读理解与问答系统的评测基准。该数据集将原始 MLQA 中英平行语料进行繁简转换与对齐,使得研究者能够同时评估模型在中文(台湾正体)与英文两种语言上的理解能力,尤其适用于验证多语言预训练模型(如 mBERT、XLM-R)在双语语境下的泛化性能与跨语言迁移效果。
衍生相关工作
该数据集衍生了一系列经典研究工作,包括基于对比学习的跨语言表示增强方法、双语知识蒸馏技术,以及针对台湾正体中文优化的预训练模型。此外,研究者还利用该数据集探讨了上下文长度不一致对跨语言问答性能的影响,并提出了动态对齐策略。这些工作不仅丰富了多语言问答的理论体系,也为后续构建更高质量的双语评测资源奠定了方法论基础。
数据集最近研究
最新研究方向
当前,多语言与跨语言问答系统成为自然语言处理领域的前沿热点,尤其在全球化语境下,双语或多语言对齐数据的稀缺性制约了模型性能的提升。MLQA en-zh_tw数据集正是针对这一挑战而构建,它将原始MLQA中英双语问答资料通过简繁转换与词汇本地化处理,整合为台湾正体中文与英文对齐的版本。该数据集不仅保留了上下文、问题与答案的双语对应结构,还特别适用于训练和评估双语语言模型在跨语言理解与生成任务中的表现。其研究意义在于推动中文与英语在问答场景下的深度语义对齐,为多语言预训练模型(如mT5、XLM-R)提供更贴近实际应用场景的微调基准,尤其在处理中文地区特有表达与英文原意之间的转换时,展现出重要的实用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务