遇见数据集

Uzbek Legal Corpus (Oʻzbek huquqiy korpusi)

收藏
github2026-07-19 更新2026-07-21 收录
官方服务:

资源简介:

25个经过清理、审核、机器可读的乌兹别克斯坦共和国宪法、20部法典和4部主要法律的文本,采用乌兹别克语(拉丁字母),源自官方国家立法数据库(lex.uz)。快照日期:2026年7月。包含7,368篇文章。专为乌兹别克法律文本的NLP / LLM / RAG工作而构建。由Tomaris AI发布。

25 cleaned, reviewed, and machine-readable texts consisting of the Constitution of the Republic of Uzbekistan, 20 codes, and 4 major national laws, all written in Uzbek (Latin script). The dataset is sourced from the official national legislative database lex.uz, with a snapshot date of July 2026. It contains 7,368 articles, and is specifically developed for NLP, LLM, and RAG tasks focused on Uzbek legal texts. Released by Tomaris AI.

创建时间:
2026-07-19
原始信息汇总

数据集概述:Uzbek Legal Corpus (Oʻzbek huquqiy korpusi)

该数据集是一个乌兹别克语法律文本语料库,由 Tomaris AI 发布,数据来源于乌兹别克斯坦国家立法数据库(lex.uz)。数据快照时间为 2026年7月,共包含 7,368 个条文

1. 数据集内容

数据集涵盖乌兹别克斯坦共和国宪法、20 部法典及 4 部主要法律,均采用乌兹别克语(拉丁字母)文本。具体包含以下文件与结构:

  • data/raw/*.txt:清洗后的纯文本文件,每部法典/法律对应一个文件。
  • data/articles/*.jsonl:按条文拆分的 JSON 记录,每行代表一条结构化数据。
  • manifest.csv:文件清单,包含官方标题、lex.uz 文档 ID、通过日期、条文数量、最后一条条文、SHA-256 哈希及快照日期。
  • scripts/clean.py:文本规范化处理流程(从 lex.uz 原始文本转为清洗后的纯文本)。
  • scripts/parse_articles.py:将清洗后的纯文本解析为 JSONL 格式并生成清单。

2. JSONL 数据模式

每条 JSON 记录包含以下字段:

  • seq:条文在文档中的序列号。
  • code:法典或法律的内部标识符。
  • code_title:官方标题(乌兹别克语)。
  • article_id:条文标准 ID(如 480.1,表示插入的第 480¹ 条)。
  • article_display:显示用的条文编号(如 480¹-modda)。
  • article_raw:原始文本中的条文编号(如 4801-modda,数字扁平化形式)。
  • kind:条文类型(如 insert 表示插入条文)。
  • title:条文名称。
  • section:所属部分(如 XXI BOʻLIM. ...)。
  • chapter:所属章节(如 71¹-bob. ...)。
  • text:条文正文内容。
  • lex_uz_doc:lex.uz 上的文档标识符。
  • snapshot_date:数据快照日期。

特殊记录:

  • article_id: "_front":序言或开篇内容(如宪法的 “Muqaddima”)。
  • article_id: "_end":尾部材料(如刑法中的法律术语词汇表)。

3. 重要约定与规范

  • 编码标准:所有文本中的撇号统一使用 Unicode 字符。oʻ/gʻ 中的撇号为 U+02BB (ʻ)maʼlumot 中的撇号为 U+02BC (ʼ),严格一致,不得修改。
  • 上标条文处理:原始文本中插入条文的上标数字被扁平化(如 480¹ 变为 4801),而 JSONL 中的 article_id 已根据文档位置解析为正确的规范形式(如 480.1)。
  • 废除条文处理:文本中存在的编号空缺(gap)对应已被废除的条文,并非数据缺失。所有空缺已对照 lex.uz 及合并版本进行核实。
  • 保留与移除内容
    • 保留:全部法律正文,包括行内法律引用、废除条文清单、刑法词汇表及过渡性条款。
    • 移除:lex.uz 的修订注释(括号内的公报引用)、导航/界面冗余内容、BOM 标记及控制字符。
  • 解析提示:解析自行编写的 -modda 模式时,应匹配 d+s*-s*modda 的正则形式,而非严格格式(原始文本偶尔出现 599- modda)。

4. 数据来源与时效性

  • 来源:数据来自乌兹别克斯坦国家立法数据库(lex.uz)的合并版本,快照时间为 2026 年 7 月。
  • 覆盖版本:包括 2022 年的新《劳动法典》(Mehnat kodeksi)、2025 年的《水法典》(Suv kodeksi,2025 年 10 月 31 日生效)、2023 年的《竞争法》(Raqobat qonuni)及 2023 年宪法。1993 年的《航空法典》(Havo kodeksi)仍有效(截至快照时,新的 ICAO 协调版本正在起草中)。
  • 法律声明:此为研究和机器学习目的的非官方副本。法律文本会不断更新,lex.uz 是唯一权威来源。

5. 法律状态与许可

  • 法律文本:根据乌兹别克斯坦版权法(OʻRQ-42, 2006.07.20, 第 8 条),官方文件(法律、决议等)及其官方翻译不受版权保护。因此,法律文本本身属于公共领域。
  • 数据data/, manifest.csv):采用 CC0 1.0 许可协议(LICENSE),不对数据集编译和清洗主张任何权利。
  • 代码scripts/):采用 MIT 许可协议(LICENSE-CODE)。
  • 建议(非必须)引用时注明 lex.uz 并附上此仓库链接。

6. 数据统计

法典/法律名称 内部标识符 条文数 词数
宪法 konstitutsiya 155 10,563
劳动法典 mehnat_kodeksi 581 80,270
水法典 suv_kodeksi 165 26,338
选举法典 saylov_kodeksi 110 14,857
城市规划法典 shaharsozlik_kodeksi 85 14,059
竞争法 raqobat_qonuni 49 11,248
投资活动法 investitsiyalar_faoliyati_qonuni 69 8,643
有价证券市场法 qimmatli_qogozlar_bozori_qonuni 65 10,262
中央银行法 markaziy_bank_qonuni 76 8,956
税务法典 soliq_kodeksi 496 149,577
民法典(第一部分) fuqarolik_kodeksi_1qism 386 34,255
民法典(第二部分) fuqarolik_kodeksi_2qism 811 76,905
民事诉讼法典 fuqarolik_protsessual_kodeksi 508 53,736
刑法典 jinoyat_kodeksi 392 53,498
刑事诉讼法典 jinoyat_protsessual_kodeksi 762 101,971
刑事执行法典 jinoyat-ijroiya_kodeksi 196 18,384
行政责任法典 mamuriy_javobgarlik_kodeksi 660 76,664
行政诉讼法典 mamuriy_sud_ishlarni_yuritish_kodeksi 306 34,286
经济诉讼法典 iqtisodiy_protsessual_kodeksi 385 49,133
预算法典 budjet_kodeksi 172 24,903
海关法典 bojxona_kodeksi 419 59,190
家庭法典 oila_kodeksi 220 17,486
土地法典 yer_kodeksi 110 18,300
航空法典 havo_kodeksi 136 11,367
商业活动法 tadbirkorlik_faoliyati_qonuni 54 6,455
总计 7,368 971,306

词数统计涵盖条文标题和正文(不包括序言和尾部材料)。根据分词器不同,每个乌兹别克语单词大约对应 2.5–3.5 个 token

7. 如何加载

python from datasets import load_dataset ds = load_dataset("javohirmat/uzbek-legal-corpus", data_files="data/articles/*.jsonl", split="train")

8. 更新说明

此数据集为快照版本(2026-07),不与 lex.uz 持续同步。法律会变化,lex.uz 是唯一权威来源。

9. 引用方式

Uzbek Legal Corpus (2026-07 snapshot). Tomaris AI. Source texts: Qonunchilik maʼlumotlari milliy bazasi (lex.uz).

bibtex @misc{uzbek_legal_corpus_2026, title = {Uzbek Legal Corpus (2026-07 snapshot)}, author = {{Tomaris AI}}, year = {2026}, note = {Source texts: Qonunchilik malumotlari milliy bazasi (lex.uz)}, url = {https://huggingface.co/datasets/javohirmat/uzbek-legal-corpus} }

搜集汇总
数据集介绍
Uzbek Legal Corpus (Oʻzbek huquqiy korpusi) 数据集图片
构建方式
乌兹别克法律语料库的构建以官方立法数据库lex.uz为唯一权威来源,系统采集了乌兹别克斯坦共和国宪法、20部法典及4部主要法律的正式文本。数据清洗流程严格遵循标准化规范,包括移除修正案注释、导航界面元素、BOM及控制字符,同时保留所有法律条文及内嵌法律括号引用。通过双阶段流水线实现结构化处理:首先由标准化脚本将原始文本转化为统一编码的纯文本文件,再经由文章解析脚本按条款位置逐条提取,生成包含序言、章节、条款编号及正文的JSONL结构化记录。针对lex.uz中上标条款的数字展平问题,构建方法基于文档内位置信息将歧义原始编号解析为精确的条款标识符。
特点
该语料库最显著的特征在于其统一的字符编码标准,全库统一使用U+02BB(ʻ)和U+02BC(ʼ)作为特定字母表示,且严格禁止使用弯引号或ASCII撇号,从根本上消除了不同编码导致的嵌入空间分裂问题。经过审计验证的废弃条款以间隙形式明确标注,而非简单删除或缺失处理,共计追踪了十余部法典中的数百条废弃条款及其替代关系,为法律文本演化研究提供了关键参照。语料库包含25份机器可读文本、7,368个条款和近百万词规模,涵盖2023年新版宪法及多部近期修订法典,确保了数据的时效性与法律权威性。
使用方法
用户可通过Hugging Face Datasets库便捷加载,使用load_dataset函数指定data/articles/*.jsonl数据文件路径即可获得训练数据集。每条记录以JSON格式呈现,包含序列号、法典标识、条款编号、标题、章节归属及正文文本,特别标注了前导序言(_front)和尾随附录(_end)两类特殊记录。对于需要自定义解析的场景,头部匹配应采用正则表达式\d+\s*-\s*modda以兼容原始文本中偶尔出现的异常格式。研究人员可据此构建面向乌兹别克语法律文本的自然语言处理模型、大型语言模型及检索增强生成系统,需注意条款标识符article_id是定位条款内容的核心字段,而非歧义的原始数字编号。
背景与挑战
背景概述
乌兹别克语法律语料库(Uzbek Legal Corpus)由Tomaris AI团队于2026年7月创建,旨在为乌兹别克语法律文本的自然语言处理(NLP)、大语言模型(LLM)及检索增强生成(RAG)研究提供高质量的数据基础。该语料库收录了乌兹别克斯坦共和国宪法、20部法典及4部主要法律,共计7368条条文,所有文本均采用拉丁字母乌兹别克语,并经过严格的清洗与审计,来源为官方国家立法数据库(lex.uz)。该语料库的发布填补了中亚低资源语言在法律领域机器学习研究的空白,为法律文本分析、信息检索及多语言法律AI系统的开发提供了标准化且机器可读的基准资源,对推动乌兹别克语计算语言学研究具有里程碑意义。
当前挑战
该语料库所解决的核心领域挑战在于乌兹别克语法律文本的数字化与机器可读性不足,此前缺乏经过统一编码与结构化的高质量法律语料,限制了法律NLP模型的训练与评估。构建过程中面临多重挑战:其一,lex.uz原始文本中上标文章编号被数字扁平化处理(如480¹变为4801),导致原始编号歧义,必须通过文档位置解析为规范的article_id;其二,部分法典存在因条款废止而产生的文章编号空缺,需逐一核查lex.uz与官方合并版以确认这些空缺并非数据缺失;其三,字符编码需严格统一,使用U+02BB(ʻ)表示okina、U+02BC(ʼ)表示tutuq belgisi,避免因编码混合导致嵌入空间分裂;其四,需移除lex.uz中的修正注解与导航UI元素,同时保留所有法律正文及合法的内部引用列表,确保语料的法律准确性。
常用场景
经典使用场景
在自然语言处理与法律智能的交叉领域中,Uzbek Legal Corpus为乌兹别克语法律文本的自动理解与推理提供了结构化、经过严格审校的数据基础。该语料库涵盖宪法、20部法典及4部主要法律,共计7368条条文,以统一的拉丁字母乌兹别克文呈现,并采用规范的JSONL格式逐条记录。其最经典的使用场景在于构建面向乌兹别克法律体系的检索增强生成(RAG)系统与法律专用大语言模型微调。研究者可利用该语料库训练模型执行法律条文匹配、案例引证分析、多文档问答等任务,从而突破通用语言模型在法律领域知识匮乏的瓶颈。
衍生相关工作
该数据集的衍生工作已初步形成以乌兹别克法律知识图谱与专用语言模型为核心的学术生态。例如,基于其细致的条文结构设计,研究者可开发法律条文关系抽取器,自动构建涵盖《刑法》与《刑事诉讼法》之间引用关系的动态知识图谱。进一步地,利用该语料库微调的乌兹别克语法律BERT模型,有望在条文分类与法律要素识别任务上超越通用多语言模型。此外,该语料库的发布催生了对其他中亚语种(如哈萨克语、土库曼语)法律语料库的建设倡议,推动了区域法律文本的跨语言对齐与迁移学习研究,为构建多语言法律推理系统奠定了基础。
数据集最近研究
最新研究方向
乌兹别克语法律语料库的构建为低资源语言法律自然语言处理开辟了新前沿。当前研究聚焦于利用该语料库进行基于检索增强生成(RAG)的法律问答系统开发,以及针对乌兹别克语特有的拉丁字母编码规范(如ʻ和ʼ字符的标准化)进行嵌入空间对齐,以消除编码碎片化对模型性能的影响。同时,语料库中宪法、20部法典及4部主要法律的完整覆盖,为乌兹别克斯坦司法数字化、法律文本自动摘要及跨法条矛盾检测提供了坚实的数据基石,其2026年7月快照版本更反映了该国近期水法典、竞争法等重大立法改革,对中亚法律信息化建设具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务