遇见数据集

bashkir-wikipedia-parallel

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集是从巴什基尔语和俄语维基百科转储(日期为2026年8月1日)中提取的句子级平行语料库,旨在支持巴什基尔语-俄语机器翻译研究,特别针对低资源语言场景。数据集提供四个配置版本:cleaned(默认推荐,包含72,007个句子对,来自34,566个关联文章对,经过URL、MediaWiki标记、卡片片段和异常标点符号的清理,移除了重复和相同句子对,保留了句子索引)、precleaned(包含91,949个句子对,是早期提取的版本,过滤较少,可能包含较旧的Wiki标记、链接和对齐噪声)、scored(与cleaned的行完全相同,但增加了基于Meta LASER句子嵌入的质量分数,包括laser_cos、laser_margin、laser_margin_xling)、filtered(包含69,706个句子对,采用保守的双编码器过滤,保留了所有评分列,移除的句子对主要是模板不匹配和跨文章主题匹配)。数据来源为巴什基尔语维基百科(bawiki-20260801)和俄语维基百科(ruwiki-20260801)转储。cleaned配置使用文章内句子索引、数值锚点、长度比检查、语言检查、重复移除和服务片段过滤。scored和filtered配置在此基础上添加了多语言句子嵌入评分,不修改文本。该数据集适用于巴什基尔语-俄语机器翻译训练、平行语料库质量评估及跨语言句子嵌入研究。

This dataset is a sentence-level parallel corpus extracted from Bashkir and Russian Wikipedia dumps (dated August 1, 2026), designed to support Bashkir-Russian machine translation research, particularly for low-resource language scenarios. The dataset provides four configurations: cleaned (default recommended, containing 72,007 sentence pairs from 34,566 linked article pairs, cleaned of URLs, MediaWiki markup, board fragments, and abnormal punctuation, with duplicates and identical sentence pairs removed, preserving sentence indices), precleaned (containing 91,949 sentence pairs, an earlier extraction with less filtering, potentially including older Wiki markup, links, and alignment noise), scored (identical rows to cleaned but with additional quality scores based on Meta LASER sentence embeddings, including laser_cos, laser_margin, laser_margin_xling), and filtered (containing 69,706 sentence pairs, using conservative dual-encoder filtering, retaining all scoring columns, with removed pairs mainly due to template mismatches and cross-article topic mismatches). The data source is Bashkir Wikipedia (bawiki-20260801) and Russian Wikipedia (ruwiki-20260801) dumps. The cleaned configuration uses intra-article sentence indices, numeric anchors, length ratio checks, language checks, duplicate removal, and service segment filtering. The scored and filtered configurations add multilingual sentence embedding scoring on top of the cleaned version without modifying the text. This dataset is suitable for Bashkir-Russian machine translation training, parallel corpus quality evaluation, and cross-lingual sentence embedding research.

创建时间:
2026-08-24
原始信息汇总

数据集概述

Bashkir-Russian Wikipedia Parallel Corpus 是一个句子级别的巴什基尔语-俄语平行语料库,数据来源于日期为 2026-08-01 的巴什基尔语和俄语维基百科转储文件。该数据集专注于低资源语言的机器翻译研究,采用知识共享署名-相同方式共享 4.0 国际许可协议(CC BY-SA 4.0)。

配置说明

该数据集提供四种配置,供不同用途选择:

配置名 句子对数 特点
cleaned(默认推荐) 72,007 去除URL、MediaWiki标记、卡片片段和错误标点,并移除重复及相同句子对,适用于机器翻译训练
precleaned 91,949 较早的提取版本,过滤较轻,包含旧版维基标记和链接噪声,适用于替代预处理和研究
scored 72,007 cleaned 行完全一致,额外包含基于 LASER 嵌入的质量分数
filtered 69,706 scored 基础上应用双编码器保守过滤,移除约 3.20% 的句子对

各配置字段

cleaned 配置字段

  • ba_title:巴什基尔语维基百科文章标题
  • ru_title:俄语维基百科文章标题
  • sectionleadfacts
  • ba:巴什基尔语句子
  • ru:俄语句子
  • ba_sentence_index:巴什基尔语文章中的句子索引
  • ru_sentence_index:俄语文章中的句子索引

precleaned 配置字段

  • ba_titleru_titlesectionbaru

scoredfiltered 配置字段(在 cleaned 基础上)

  • laser_cos:LASER 嵌入对之间的余弦相似度
  • laser_margin:按同语言 kNN 密度归一化的边际分数
  • laser_margin_xling:按跨语言 kNN 密度归一化的边际分数(推荐使用的 LASER 过滤分数)
  • filtered 配置额外包含 labse_coslabse_margin_xling(基于 LaBSE 编码器的分数)

数据处理细节

  • 编码器:巴什基尔语使用 LASER3 bak_Cyrl(NLLB),俄语使用 LASER2,1024 维 L2 归一化嵌入,k=4 邻居。
  • 过滤条件:仅当 LASER 和 LaBSE 两个评分器都将某对句子置于各自底部 5% 时(laser_margin_xling < 0.876labse_margin_xling < 0.723)才移除该对。
  • 移除的句子对主要是模板不匹配句子(如河流支流模板中的不同事实)和跨文章主题匹配。

分数分布

完整 72,007 对句子上的分数分布如下:

分数 p01 p05 p25 p50 p75 p95 p99
laser_cos 0.597 0.705 0.828 0.863 0.887 0.914 0.928
laser_margin_xling 0.760 0.876 0.988 1.033 1.063 1.102 1.129
labse_cos 0.206 0.408 0.698 0.789 0.859 0.932 0.963
labse_margin_xling 0.373 0.723 1.035 1.132 1.202 1.295 1.358

使用与许可

搜集汇总
数据集介绍
bashkir-wikipedia-parallel 数据集图片
构建方式
该数据集源自2026年8月1日的巴什基尔语与俄语维基百科快照,通过系统化的语句级对齐流程构建而成。构建过程深度整合了维基百科条目结构信息,采用条目局部句索引与数值锚点技术实现事实性句对的精准匹配,并历经长度比例校验、语言识别、重复剔除及服务性片段过滤等多重净化步骤。在此基础之上,进一步引入Meta LASER与Google LaBSE两种多语种句子嵌入编码器,对对齐句对进行质量评分,并依据双编码器交叉验证策略,构建了从原始提取至严格筛选的四个渐进式数据版本,形成了层次分明、可溯源的数据集体系。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载,用户可根据研究目标灵活选用不同配置。默认推荐使用清洗版作为机器翻译训练的基准数据。评分版则更适合需要自定义质量阈值的场景,研究者可基于LASER或LaBSE的特定分数指标进行二次筛选,构建专属的严格训练子集。过滤版提供了开箱即用的高质量数据,适用于直接进行模型微调。此外,鉴于数据包含条目标题与句索引,亦可用于跨语言信息检索、维基百科条目对齐及低资源语言句法分析等拓展研究,具有良好的学术应用潜力。
背景与挑战
背景概述
该数据集由研究者failed09于2026年创建,旨在构建巴什基尔语-俄语的高质量平行语料库,以缓解低资源语言机器翻译领域的数据匮乏问题。巴什基尔语作为俄罗斯联邦的一种少数民族语言,其数字资源极为有限,严重制约了神经机器翻译模型的训练与性能提升。该数据集从巴什基尔语和俄语维基百科的2026年8月1日快照中抽取句子级平行语料,经过多级过滤和清洗,提供了四个版本(cleaned、precleaned、scored、filtered),其中默认的cleaned版本包含72,007个句对,适用于机器翻译训练。其核心研究问题在于如何利用维基百科的结构化信息(如文章标题、段落、数值锚点)自动挖掘高质量的平行句对,同时结合LASER和LaBSE等多语言嵌入模型进行质量评分与过滤,以提升语料的纯净度与可靠性。该数据集为巴什基尔语-俄语这一低资源语言对的翻译研究提供了宝贵的资源,推动了低资源NLP领域的发展。
当前挑战
数据集面临的挑战集中于两方面。在领域问题层面,巴什基尔语作为低资源语言,其平行语料稀少,且与俄语在句法结构、词汇形态上差异显著,加之维基百科文章内容的非对称性(如模板不匹配、事实表述差异),导致自动对齐的句对常常存在错位或语义不一致,为此需设计有效的质量过滤机制。在构建过程中,挑战包括:从原始维基百科快照中提取句对时需处理复杂的MediaWiki标记、URL、列表片段等噪声;不同语言版本的文章长度和结构差异导致句对数量不平衡;需要对句子索引、重复对、语言误判等进行精细清洗。此外,多语言嵌入模型(LASER3、LaBSE)的评分阈值选择需兼顾召回率与精确率,而保守的过滤策略虽提升了数据纯度,却可能丢弃部分潜在有效句对。这些挑战凸显了在低资源场景下构建高质量平行语料的复杂性与精细性。
常用场景
经典使用场景
作为巴什基尔语-俄语低资源神经机器翻译研究的基石性语料,该数据集以维基百科平行句对为依托,为跨语言模型训练提供了高质量的监督信号。其cleaned配置剔除了URL、媒体标记及重复句对,保留了句级对齐索引,可直接用于序列到序列模型的训练与评估。scored与filtered配置则嵌入LASER与LaBSE双编码器质量评分,支持研究者依据阈值筛选严格平行子集,从而在低资源条件下优化翻译模型的鲁棒性与泛化能力。
解决学术问题
该数据集直面低资源语言对平行语料稀缺的学术困境,为巴什基尔语这一形态丰富的小语种提供了规模可观的句级对齐资源。通过多元配置设计,它解决了平行句对质量控制的难题,将LASER跨语言边际分数与LaBSE评分相结合,有效过滤模板错配与主题误匹配噪声,显著提升了训练数据的纯度。此举推动了低资源机器翻译、跨语言句子嵌入及双语词典归纳等研究方向的量化评估,为巴什基尔语自然语言处理奠定了可复现的数据基础。
实际应用
在实际应用中,该数据集可服务于巴什基尔语-俄语双向机器翻译系统的开发,赋能少数民族语言的数字化传承与跨语言信息获取。基于其平行句对训练的翻译模型,可应用于维基百科条目本地化、政府公文多语发布、教育资源的双语化改造等场景。此外,句级对齐数据还可支持跨语言信息检索、双语术语抽取及语料库语言学分析,助力区域语言技术服务与智能问答系统的构建。其开放许可(CC BY-SA 4.0)亦利于工业界与学术界的安全复用。
数据集最近研究
最新研究方向
在低资源机器翻译领域,该数据集聚焦于巴什基尔语与俄语的句子级平行语料构建,通过多版本配置(cleaned、scored、filtered)探索质量过滤策略,并结合LASER与LaBSE双编码器评分机制,为低资源语言的神经机器翻译模型训练提供了高置信度数据支撑。其研究前沿在于利用跨语言嵌入相似度与边际分数进行语料净化,以缓解低资源场景下的数据稀疏与噪声问题,同时推动维基百科多语言知识对齐研究,对巴什基尔语的数字化保护及俄语辅助翻译任务具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务