遇见数据集

ipfs_tunisia_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集是突尼斯官方立法研究快照,文本收集自《突尼斯官方公报》(Journal Officiel de la République Tunisienne, IORT/JORT)。数据集包含两个配置:laws(每行对应一部法律/文书,包含 ID、标题、全文、日期、状态、标识符、条款数量和来源 URL)和 articles(每行对应一个条款/章节,包含法律 ID、条款编号、标题、文本和来源 URL)。截至2026年9月7日,收录了1967部法律和64135个条款,语言为法语,管辖区域为突尼斯。数据集适用于法律文本检索、立法分析等研究任务,但并非官方整合版本,不构成法律建议,官方源头优先。

This dataset is a snapshot of Tunisian official legislation research, with texts collected from the Official Gazette of the Republic of Tunisia (Journal Officiel de la République Tunisienne, IORT/JORT). It contains two configurations: laws (each row corresponds to a law/act, including ID, title, full text, date, status, identifier, number of articles, and source URL) and articles (each row corresponds to an article/section, including law ID, article number, title, text, and source URL). As of September 7, 2026, it includes 1,967 laws and 64,135 articles, in French, covering the jurisdiction of Tunisia. The dataset is suitable for legal text retrieval, legislative analysis, and other research tasks, but is not an official consolidated version, does not constitute legal advice, and official sources take precedence.

创建时间:
2026-09-05
原始信息汇总

数据集概述

该数据集为突尼斯法律数据集,是对突尼斯官方公报(Journal Officiel,简称IORT/JORT)所载官方立法文本的研究快照。

基本信息

字段 内容
数据集名称 Laws of Tunisia
语言 法语(fr)
司法辖区 突尼斯
许可证 tn-jort(其他)
数据规模 1K < n < 10K
任务类别 文本检索(text-retrieval)
标签 法律、突尼斯、官方文本

数据内容

数据集包含两个配置:

  1. laws 配置data/laws.parquet):每个法律/文书一行,包含编号、标题、全文、日期、状态、标识符、条款数量和来源URL。
  2. articles 配置data/articles.parquet):每个条款/章节一行,包含所属法律编号、条款编号、标题、文本和来源URL。

数据规模

  • 法律/文书数量:2027项
  • 条款数量:64816条

数据来源与收集

  • 来源:突尼斯官方公报(iort.gov.tn / ocr.jort.tn)
  • 快照日期:2026-09-07
  • 覆盖范围:基于目录的不完整覆盖
  • 收集工具scrapers/collect_tn.py 及辅助脚本(common.pyworld_lib.pyarchive_fallbacks.py),后者支持实时官方URL获取及Wayback回退机制。

重要声明

  • 该数据集并非官方整合版本,也不构成法律建议;官方公报或政府门户网站的内容优先于该语料库。
  • 官方政府/公报文本可依据来源门户的公共部门条款进行复用,但该数据集的打包格式、元数据和收集脚本仅供研究使用。
搜集汇总
数据集介绍
ipfs_tunisia_laws 数据集图片
构建方式
该数据集源自突尼斯官方公报(Journal Officiel IORT/JORT),通过专项爬虫工具从政府门户系统采集而成,覆盖了自官方网站及其OCR镜像所发布的立法文本。采集过程历经系统化整理,将每项法律文书及其内部条文结构分别提炼并存储于两个互补的数据模块中。其中,法律层级的数据表以单一文书为单位,详尽收录了标题、全文、颁布日期、法律状态、识别编号及来源链接等关键元数据;条文层级则精细到每一条法律条款,记录了其所属法律、条款序号、标题、正文及出处URL。这种双轨制架构确保了数据从宏观法律到微观条款的全方位透视,为法律文本的深度研究与检索提供了坚实的数据基石。
使用方法
该数据集适用于法律文本挖掘、跨语言检索以及司法领域的自然语言处理研究。研究者可直接使用内置的parquet文件进行数据加载,两大数据模块——laws与articles,可根据不同的研究粒度进行灵活调用。例如,在开展法律条文级别的语义相似度比较时,可依据law_id字段将条款文本与所属法律进行无缝关联。值得注意的是,由于数据快照日期设定为2026年9月,属于前瞻性研究切片,并非官方最终合意版,使用者需明确其作为研究快照的定位,在涉及具体法律适用时,应以官方发布文本为准绳。
背景与挑战
背景概述
该数据集由研究团队于2026年9月创建,旨在系统化突尼斯官方立法文献,数据源自突尼斯官方公报(Journal Officiel,简称JORT/IORT),通过自研爬虫工具采集,涵盖2307部法律文件及66632个条文,以法语呈现。其核心研究问题在于构建一个结构化的法律文本语料库,支持法律文本检索、自然语言处理及法律信息学等领域的研究。作为官方文本的镜像快照,该数据集为跨国法律比较、法律语言学分析及法律人工智能模型训练提供了宝贵资源,对促进北非及法语区法律数据的开放获取与研究具有显著影响力。
当前挑战
该数据集所面临的挑战多维且严峻。首要挑战在于法律领域的固有复杂性:法律文本结构繁复,交叉引用稠密,且存在大量修订版与失效条文,给数据一致性维护带来巨大困难。其次,构建过程中,源网站法规多为扫描件或非结构化格式,需依赖OCR技术转化,但识别精度受制于版面噪声与历史印刷质量,易引入文本错误。此外,官方门户的访问限制、页面动态加载及反爬机制迫使爬虫需集成多个备用策略,如Wayback回退机制,以确保数据采集的完整性。最后,法律文本的时效性要求持续跟进官方更新,而当前快照仅反映特定时间点状态,后续维护与版本追踪亦构成了严峻的技术与资源挑战。
常用场景
经典使用场景
该数据集汇集了突尼斯官方公报(JORT)发布的2307部法律文书及66632个条文,以法语呈现,覆盖该国立法体系的广泛领域。其核心经典用途在于支撑法律文本的细粒度检索与结构化分析,研究者可依托条文级数据构建关键词查询、语义索引或跨法条关联模型。此类研究常涉及自然语言处理中的长文档理解与机器阅读理解任务,尤其针对法律语言的句式复杂性与术语专业性,该数据集为模型训练与评估提供了具有领域深度的语料基础。
解决学术问题
在计算法学与文本挖掘领域,该数据集解决了小语种(法语)法律语料稀缺的问题,为非洲法系研究提供了标准化、可机读的语料库。它支持对突尼斯立法演进规律的量化分析,如法律主题聚类、时间趋势检测以及法律条文间的引用网络构建,从而促进比较法学与法律信息学交叉研究。此外,该数据集的条文级划分及元数据(日期、状态、来源)有助于探究法律实效与修订规律,为法律文本生成、摘要及翻译等任务提供基准,推动低资源场景下的法律AI发展。
实际应用
实际应用中,该数据集可服务于法律科技产品的研发,如突尼斯及法语国家的法律搜索引擎、法规问答系统,或用于自动化合同审查与合规检查。对律师事务所及政府机构,其可辅助法律研究,加速对特定法规或条款的定位与比较。数据集的法律条文与结构化标识符亦便于构建法律知识图谱,通过关联条文与案例或行政通知,提升法律信息服务的精准度。鉴于数据来源的权威性,它还可作为法律教育工具,支持学生进行法语法规的阅读分析与比较学习。
数据集最近研究
最新研究方向
该数据集聚焦于突尼斯官方立法文本的数字化工序,其最新研究趋势紧密关联法律科技与开放政府数据的深度融合。研究者正借助此类语料库推动法律信息检索的精细化,例如开发面向法语法律文本的语义检索模型,以提升判例与法条之间的交叉引用效率。同时,数据集的构建方式体现了对官方公报原始性与可追溯性的尊重,其存档回退机制(如Wayback)旨在增强法律数据的历史完整性与鲁棒性,为法律史和比较法研究提供了坚实素材。此举不仅赋能北非地区法律数据的跨国界共享与理解,也为构建可验证、负责任的人工智能法律助手奠定了数据基础,预示着法律实践向智能化、透明化方向迈进的趋势。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务