遇见数据集

ipfs_mongolia_laws

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

该数据集是蒙古国法律信息(legalinfo.mn / 统一法律信息系统)的研究快照,由蒙古国司法部/统一法律信息系统提供。数据集收录了截至2026年9月9日的官方国家立法文本,包含773项法律/法规(laws)和10,493个条款/章节(articles),全部为蒙古语。数据以Parquet格式存储,分为两个配置:laws(每行一项法律/法规)和 articles(每行一个条款/章节)。该数据集适用于文本检索任务,尤其适合蒙古国法律文本的检索、分析与研究。注意:本数据集非法律建议,官方公报/权威来源应优先于本语料库。

This dataset is a research snapshot of Mongolian legal information (legalinfo.mn / Unified Legal Information System), provided by the Ministry of Justice of Mongolia / Unified Legal Information System. It contains official national legislative texts as of September 9, 2026, including 773 laws/regulations and 10,493 articles/chapters, all in Mongolian. The data is stored in Parquet format with two configurations: laws (one law/regulation per row) and articles (one article/chapter per row). This dataset is suitable for text retrieval tasks, especially for the retrieval, analysis, and research of Mongolian legal texts. Note: This dataset does not constitute legal advice; official gazettes/authoritative sources should take precedence over this corpus.

创建时间:
2026-09-05
原始信息汇总

数据集概述:蒙古国法律数据(legalinfo.mn / 统一法律信息系统)

该数据集是一个研究性快照,收录了来自蒙古国司法部统一法律信息系统(Legalinfo.mn)的官方国家立法文本。数据集以蒙古语(mn)提供,涵盖蒙古国司法管辖区的法律文书和条款。

基本信息

项目 详情
数据集名称 Mongolia Laws (legalinfo.mn / Unified Legal Information System)
语言 蒙古语(mn)
司法辖区 蒙古国
数据来源 Legalinfo.mn(司法部 / 统一法律信息系统)
授权许可 mn-legalinfo-official-texts(其他)
任务类别 文本检索(text-retrieval)
标签 法律、蒙古国、法律信息、官方文本
数据规模 10K < n < 100K

快照详情

字段
快照日期 2026-09-09
覆盖范围 legalinfo-laws-batch
采集工具 scrapers/collect_mn.py
法律/文书数量 773
条款数量 10,493

内容与结构

该数据集包含两个数据子集配置:

  1. laws(法律):数据文件为 data/laws.parquet,每一行对应一份法律文书/工具。该配置为默认配置。
  2. articles(条款):数据文件为 data/articles.parquet,包含同一快照中法律文书下的条款/章节行数据。

数据集中还包含采集器脚本 scrapers/collect_mn.py,用于构建此快照。

使用与许可说明

  • 数据集提供的是官方法律文本的研究性快照,不构成法律建议
  • 当数据集内容与官方公报或权威来源存在差异时,以官方来源为准。
  • 已知局限:数据采集基于 Legalinfo.mn 的 HTML 详情页及官方链接的 CDX PDF 文件。

来源

  • 原始数据来源网站:https://legalinfo.mn/
搜集汇总
数据集介绍
ipfs_mongolia_laws 数据集图片
构建方式
该数据集源于蒙古国司法部统一法律信息系统的官方发布文本,借助自动化采集脚本scrapers/collect_mn.py,对legalinfo.mn平台上的法律条文进行系统化抓取与结构化处理。采集范围覆盖773部法律文件,总计10,493条条款,数据以Parquet格式分别存储于laws.parquet与articles.parquet两个配置文件中。每条记录均保留原始发布来源与版本信息,形成一份具有明确时间戳(2026年9月9日)的研究快照,为法律文本的检索与分析提供基础数据支撑。
特点
数据集聚焦于蒙古国成文法律体系,以蒙古语为唯一语言载体,涵盖法律与条款两级粒度,兼具宏观法律框架与微观条文细节。其数据规模适中,法律文件数量与条款数量比例均衡,适用于跨法律条文检索、条款关联分析及法律知识库构建等任务。数据来源为官方统一法律信息系统,具有较高的权威性与规范性,同时明确声明官方文本优先,避免因数据快照导致的时效性偏差,为研究者提供可靠的法律文本语料。
使用方法
使用该数据集时,可依据HuggingFace平台加载配置为laws或articles的数据文件,分别获取法律级或条款级数据。研究者可通过文本检索任务对法律条文进行语义匹配与信息抽取,亦可结合法律编号与条款结构构建蒙古国法律知识图谱。由于数据涉及法律专业领域,使用时应严格遵循非法律建议原则,任何应用需以官方发布文本为准,确保合规性与准确性。
背景与挑战
背景概述
蒙古国法律信息统一系统(Legalinfo.mn)由司法部维护,是该国权威法律文本的官方发布平台。随着蒙古国法律体系的持续更新与数字化进程加速,学术界与实务界对系统化、可计算法律语料的需求日益增长。在此背景下,ipfs_mongolia_laws数据集于2026年9月9日构建完成,采集了773部法律文件及10,493条条款,形成了具有研究价值的法律文本快照。该数据集为蒙古国法律检索、自然语言处理及法律信息学研究提供了基础资源,有助于推动低资源语言法律智能分析的发展,并对蒙古国法律透明度与比较法学研究产生积极影响。
当前挑战
该数据集所应对的核心领域问题在于蒙古语法律文本的检索与结构化解析——蒙古语作为低资源语言,其法律术语的形态复杂性与句法独特性对文本处理构成显著障碍。构建过程中亦面临多重挑战:法律文本来源分散、格式异构,须从HTML详情页与CDX存档PDF中抽取并整合信息;官方文本的权威性与时效性要求严格,快照采集需确保与司法部发布内容一致;此外,法律文件层级结构(如法律与条款的对应关系)的准确还原亦增加了数据处理的复杂性。这些挑战共同影响了数据集在检索精度与下游任务中的可用性。
常用场景
经典使用场景
蒙古国法律信息数据集(ipfs_mongolia_laws)在自然语言处理与法律信息学领域,最为经典的应用场景在于法律文本检索与条文级信息抽取。该数据集以蒙古国司法部统一法律信息系统的官方文本为来源,囊括773部法律文书及10493条条文,为研究者提供了结构化程度较高的法律语料。典型任务包括基于蒙古语的法律问答系统构建、法条相似度匹配以及跨法律条文的引用关系解析,使得法律专业人员能够借助文本检索技术快速定位相关规范,提升法律信息获取的准确性与效率。
衍生相关工作
围绕该数据集,已衍生出一系列相关研究工作。研究者基于其条文结构开展了蒙古语法律文本的预训练语言模型适配,并探索了法律条文自动摘要与关键词抽取方法。部分工作聚焦于跨法律引用网络的构建,用以分析蒙古国法律体系的内在关联。另有研究将此数据集与多语言法律语料进行对齐,推动低资源法律机器翻译的进展。这些工作共同拓展了蒙古语法律信息处理的研究边界,并为后续法律知识图谱构建提供了必要的数据支撑。
数据集最近研究
最新研究方向
蒙古国法律信息统一系统(legalinfo.mn)所衍生的ipfs_mongolia_laws数据集,正推动法律文本检索与自然语言处理交叉领域的前沿探索。当前研究聚焦于低资源语言蒙古语的法律条文语义建模,利用该数据集包含的773部法律文书与10,493条条款,构建面向法律问答、条文相似度匹配及跨语言法律信息检索的基准。同时,结合IPFS去中心化存储架构,研究者尝试实现法律文本的版本溯源与完整性验证,以应对官方源动态更新的挑战。该数据集亦为法律人工智能中的公平性、可解释性研究提供稀缺资源,尤其在蒙古语法律术语标准化与司法知识图谱构建方面具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务