遇见数据集

louisbrulenaudet/code-expropriation-utilite-publique

收藏
Hugging Face2024-07-21 更新2024-06-11 收录
官方服务:

资源简介:

该数据集名为Code de lexpropriation pour cause dutilité publique,专注于法律领域的微调预训练语言模型,以提高法律实践中的效率和准确性。数据集生成过程中使用了指令微调的方法,通过人类提供的指令来指导模型行为,使其能够适应多种任务,如翻译、摘要、问答等。数据集的内容包括法律文章的全文生成,每个条目包含指令、输入、输出、生效日期、过期日期和文章编号等信息。

该数据集名为Code de lexpropriation pour cause dutilité publique,专注于法律领域的微调预训练语言模型,以提高法律实践中的效率和准确性。数据集生成过程中使用了指令微调的方法,通过人类提供的指令来指导模型行为,使其能够适应多种任务,如翻译、摘要、问答等。数据集的内容包括法律文章的全文生成,每个条目包含指令、输入、输出、生效日期、过期日期和文章编号等信息。

提供机构:
louisbrulenaudet
原始信息汇总

数据集概述

基本信息

  • 许可证: Apache-2.0
  • 语言: 法语
  • 多语言性: 单语种
  • 标签:
    • 微调
    • 法律
    • 法国法律
    • 公用事业征用法
  • 来源数据集: 原始数据
  • 美观名称: 公用事业征用法
  • 任务类别:
    • 文本生成
    • 表格问题回答
    • 摘要
    • 文本检索
    • 问答
    • 文本分类
  • 大小类别: 1K<n<10K

数据集生成

  • 数据结构: JSON文件,每个字典包含以下字段:
    • instruction: 字符串,与元素相关的指令。
    • input: 字符串,元素的输入详情。
    • output: 字符串,元素的输出信息。
    • start: 字符串,文章生效日期。
    • expiration: 字符串,文章失效日期。
    • num: 字符串,文章ID。
  • 生成指令: 一系列用于生成数据的指令,主要涉及文章全文的撰写和内容表述。
搜集汇总
数据集介绍
构建方式
该数据集名为《公用征收法典》(Code de l'expropriation pour cause d'utilité publique),由研究者louisbrulenaudet构建,旨在为法学研究、法律实务及教育领域提供精简且实时更新的法国法律文本资源。数据每日从官方法律数据库自动刷新,覆盖全部法律条文。每个条目以词典形式组织,包含丰富元数据,如条文编号、生效与废止日期、法律状态、历史版本、父级章节层级关系、欧洲立法标识符(ELI)以及HTML格式的正文与备注,确保结构化程度高且可追溯性强。
特点
数据集具有多重显著特点。首先,它专注于法国公用征收领域的法律文本,语种为法语,规模介于1千至1万条之间,适合微调与检索任务。其次,数据每日更新,确保法律条文的时效性与准确性。此外,每条记录均包含详细的版本历史、扩展日期、技术注入标识以及章节层级信息,支持对法律条文的演化追踪与上下文还原。数据集还兼容多种自然语言处理任务,包括文本生成、问答、摘要、分类与表格问答,展现了高度的通用性与专业深度。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,例如使用`load_dataset("louisbrulenaudet/code-expropriation-utilite-publique")`获取数据。为便捷地整合多个法国法典,推荐安装RAGoon工具(`pip3 install ragoon`),并通过`ragoon.load_datasets`函数批量加载指定数据集列表,随后利用`datasets.concatenate_datasets`进行合并。数据集中每个条目的字段如`texte`、`num`、`historique`等可直接用于法律文本分析、模型微调或检索系统构建,降低法律领域NLP应用的开发门槛。
背景与挑战
背景概述
在法国法律体系日益数字化与开放化的背景下,法律文本的结构化与可机读性成为推动司法智能化与公共信息透明化的关键基石。由研究者louisbrulenaudet于2025年9月20日创建的“louisbrulenaudet/code-expropriation-utilite-publique”数据集,聚焦于法国《公用征收法典》的全文内容,旨在为研究人员、法律从业者及法学学生提供经过标准化处理的、每日更新的法律文本资源。该数据集以Apache-2.0许可证开放,涵盖文本生成、摘要、问答、分类等多项自然语言处理任务,显著降低了法律领域模型微调与标注流程的门槛,为基于开放数据的法语法律AI研究奠定了坚实基础,并对欧洲范围内的法律文本数字化与多语言模型协作产生了积极影响。
当前挑战
该数据集所面临的挑战主要体现在两个层面。其一,在领域问题层面,法国法律体系庞大且条款间存在复杂的层级关联与历史版本更迭,如何从非结构化的原始法律文本中准确提取并保持条款间的父子关系、时间效力与状态变更(如“MODIFIE_MORT_NE”)的语义一致性,是构建高质量法律NLP模型的核心难题。其二,在构建过程中,每日自动刷新所有法典内容要求高效的数据抓取与同步管线,同时需处理多版本并存、扩展日期(如dateFinExtension)与历史记录等元数据的规范化,以及HTML与纯文本内容的互转与去噪,这些技术细节对数据集的完整性、时效性与可用性构成了持续挑战。
常用场景
经典使用场景
在法国法律体系与自然语言处理的交叉研究领域,该数据集为研究者提供了《公用征收法典》全文的结构化语料。其经典使用场景在于微调法语法律领域的生成式语言模型,通过将法典中每一条文的编号、生效日期、法律状态及层级关系等元数据与正文文本对齐,构建高质量的训练样本,从而让模型精准理解法国行政法中的征收程序、补偿机制与公共利益判定规则。
实际应用
在实际应用中,该数据集赋能了法国公共行政与司法领域的智能化服务。法律从业者可借助基于此数据训练的工具快速检索特定征收条款的现行有效版本,自动生成项目合规性报告;城市规划部门能通过问答系统实时获取征地补偿标准与程序指引,减少行政争议;开源社区则利用其每日更新的特性,为公民提供免费的法律条文变动提醒与通俗化解释服务。
衍生相关工作
基于该数据集衍生的经典工作包括RAGoon法律检索增强生成框架,它通过整合多个法国法典数据集,实现了跨法典的联合查询与多跳推理;此外,研究者利用其结构化的元数据开发了法律文本版本差异自动标注工具,可高亮显示条文修订前后的措辞变化,并进一步催生了面向法国行政法的指令微调数据集,推动开源法律大模型在判例预测与文书生成任务上的性能突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务