遇见数据集

dagestan-constitution

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

该数据集提供了达吉斯坦共和国宪法的扫描件,构成一个包含13种语言的文档级平行语料库。核心内容包括11种达吉斯坦及北高加索地区的本土语言(如阿古尔语、鲁图尔语、察胡尔语、塔巴萨兰语、拉克语等),以及阿塞拜疆语和俄语。这些语言大多属于高加索语系或突厥语系,使用扩展的西里尔字母书写,且作为低资源或濒危语言,公开可用的机器可读文本及OCR真实数据极为稀缺。数据集包含两个子集:1) `dag_constitution`(默认子集):一个手动在文章级别对齐的文本语料库,以宽表形式组织,包含13列(每列对应一种语言)和121行(对应宪法文档的结构单元,如标题、105个条款等)。每一行中的单元格内容在语义上对应同一宪法条款在不同语言中的表述,因此可直接用于构建任意两种语言之间的平行句对。2) `pdfs`子集:提供了13个PDF扫描文件的元数据(包括语言、语系、页面统计、文件大小)及下载链接。数据规模方面,总计包含13个PDF文件,291个PDF页面。由于大多数PDF页面是包含两本书页的跨页扫描,实际书籍页面数为536页,数据总体积约为177 MB。其中,俄语版本为原生数字PDF文件,可作为OCR评估的参考真实文本;其余12种语言的版本均为扫描图像,并附带了机器生成的OCR文本(未经人工验证,应视为有噪声数据)。该数据集的主要应用场景包括:为使用西里尔字母的少数语言和濒危语言训练和评估OCR模型;利用其文章级别的平行对齐特性,进行机器翻译、跨语言检索等自然语言处理任务的模型开发与研究。对于其中多种语言而言,这是目前极少存在的平行语料资源之一。

This dataset provides scanned copies of the Constitution of the Republic of Dagestan, forming a document-level parallel corpus in 13 languages. The core content includes 11 indigenous languages from Dagestan and the North Caucasus region (such as Agul, Rutul, Tsakhur, Tabasaran, Lak, etc.), as well as Azerbaijani and Russian. Most of these languages belong to the Caucasian or Turkic language families, are written using extended Cyrillic alphabets, and are low-resource or endangered languages, with publicly available machine-readable text and OCR ground truth being extremely scarce. The dataset consists of two subsets: 1) `dag_constitution` (the default subset): a manually aligned text corpus at the article level, organized in a wide-table format with 13 columns (each corresponding to a language) and 121 rows (corresponding to structural units of the constitutional document, such as titles and 105 articles). The content in each rows cells semantically corresponds to the same constitutional provision in different languages, allowing direct construction of parallel sentence pairs between any two languages. 2) `pdfs` subset: provides metadata (including language, language family, page statistics, file size) and download links for 13 scanned PDF files. In terms of data scale, it includes a total of 13 PDF files and 291 PDF pages. Since most PDF pages are scanned spreads containing two book pages, the actual number of book pages is 536, with an overall data volume of approximately 177 MB. Among these, the Russian version is a native digital PDF file, which can serve as reference ground truth for OCR evaluation; the other 12 language versions are scanned images accompanied by machine-generated OCR text (unverified and should be considered noisy data). The main application scenarios of this dataset include: training and evaluating OCR models for minority and endangered languages using Cyrillic alphabets; leveraging its article-level parallel alignment for model development and research in natural language processing tasks such as machine translation and cross-lingual retrieval. For many of these languages, this represents one of the few existing parallel corpus resources.

创建时间:
2026-07-10
搜集汇总
数据集介绍
dagestan-constitution 数据集图片
构建方式
该数据集收录了达吉斯坦共和国宪法在十三种语言中的扫描版本,涵盖阿古尔语、阿瓦尔语、北阿塞拜疆语、车臣语、达尔金语、库梅克语、拉克语、列兹金语、诺盖语、俄语、鲁图尔语、塔巴萨兰语和察胡尔语。其中除俄语为原生数字文档外,其余十二种语言均源自纸质印刷品的Adobe Scan扫描图像,共291页PDF文件,实际包含536个书籍页面。数据集的构建核心在于人工对齐:基于各语言版本中统一的文章编号标记,将105条宪法条文逐条手工匹配至同一表格,形成了横跨十三列、纵贯文档顺序的平行语料库。扫描文件和对齐后的CSV表格分别存储于数据集的`pdfs`和`dag_constitution`两个子集中。
特点
该数据集最显著的特点在于其稀有性与平行性。它涵盖的多种语言——如阿古尔语、鲁图尔语、察胡尔语——在现有的机器可读文本资源中极为匮乏,且几乎不存在OCR标注数据。这些语言均使用西里尔字母扩展正字法,包含`гъ`、`къ`、`хь`、`Ӏ`等特殊字符,对通用OCR系统构成严峻挑战。所有扫描页面多为双页跨页形式,需分割处理;俄语版作为原生数字文本,可充当评估OCR性能的黄金标准。数据集经人工核实,除车臣语缺失第95条外,其余版本均包含全部105条宪法条文,对齐程度精确至文章层级,为低资源语言的机器翻译与跨语种检索提供了难得的平行语料基础。
使用方法
使用者可通过HuggingFace Datasets库便捷加载数据。默认子集`dag_constitution`返回包含十三列的语言对齐表格,每一行对应一个对齐单元(如标题、序言、文章),语言间已天然平行,任意语言对只需提取相同行的两列即可。`pdfs`子集提供每份PDF的元数据与下载链接,需通过`hf download`命令获取原始扫描文件。OCR生成的文本位于`ocr/`目录下,未经母语者校验,存在机器噪声,建议在使用前进行错误率评估。对于需要构建OCR流水线的用户,需注意将跨页图像在装订线处分割,并统一处理特殊字符`Ӏ`的编码形式,确保字符标准化。
背景与挑战
背景概述
达吉斯坦共和国宪法多语言平行语料库由Alidar Asvarov于2025年至2026年间构建,源自俄罗斯国立图书馆馆藏的纸质宪法文本扫描件。该数据集涵盖13种语言,包括11种达吉斯坦及北高加索原住民语言(如阿古尔语、鲁图尔语、查库尔语等),以及阿塞拜疆语和俄语,共291页PDF(536个书页)。其核心研究问题在于为极度缺乏机器可读文本的低资源语言提供首个平行语料库,尤其针对西里尔字母扩展字符(如гъ、къ、хь、Ӏ)的OCR识别难题,以及跨语言翻译与信息检索。该数据集因其独特的多语言法律文本对齐性质,成为计算语言学、文档分析与濒危语言数字化领域的重要资源,填补了高加索语言资源的关键空白。
当前挑战
该数据集面临多重挑战:首先,领域问题方面,西里尔字母扩展字符在现有OCR引擎中表现糟糕,且多数语言(如阿古尔语、拉克语)缺乏任何OCR标注数据,导致自动文本识别准确率极低;其次,句子编码器(如LaBSE、LASER)完全不覆盖其中9种语言,传统平行语料挖掘方法失效,迫使采用人工按文章标题跨13个版本逐行对齐,耗时且易出错;此外,扫描文档多为双页跨版排版(245/291页为书页展开),需先处理页面分割;同时,OCR文本未经母语者验证,字符错误率未知,俄语版为原生数字文本而其他语言为扫描生成,两者不可混淆。
常用场景
经典使用场景
该数据集以达吉斯坦共和国宪法为核心,收录了阿古尔、阿瓦尔、列兹金等十三种语言的平行文本,覆盖大量濒危且资源匮乏的高加索语系语言。其经典使用场景聚焦于光学字符识别(OCR)系统的训练与评估——由于这些语言均采用西里尔字母变体并包含诸多特殊字符(如гъ、хь、Ӏ等),通用OCR引擎往往表现不佳。因此,研究者可将扫描文档作为输入,利用人工对齐的条文级文本作为参照,系统性地优化针对低资源西里尔书写系统的文字识别能力。
实际应用
在实际应用层面,该数据集的扫描文档与对齐文本可服务于多语种政务系统的构建。例如,可用于开发面向达吉斯坦地区少数民族语言的宪法文本数字化阅读平台,支持民众通过母语查阅法律条文。进一步地,该语料还可作为训练素材,构建支持阿古尔、鲁图尔等语种的文档扫描翻译流水线,辅助执法人员或移民服务机构高效处理涉及该区域的文书材料,促进多民族地区的法治普及与行政沟通。
衍生相关工作
围绕该数据集已涌现出若干衍生性工作。基于其提供的PDF扫描图像与手工对齐的分章节文本,研究者可开发针对高加索语系的双页面展开文档自动切割算法,有效解决开放书籍扫描件中页面混杂的读取顺序问题。此外,该语料已催生针对西里尔变体字母的规范化工具,例如将英语字母I自动转换为西里尔字母Ӏ(У+04C0)的模块。未来还可依托该语料构建首个阿古尔-俄语等低资源语言对的神经机器翻译基线模型,或用于验证零样本跨语言法律文档检索方法在小语种上的鲁棒性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务