遇见数据集

louisbrulenaudet/code-impots

收藏
Hugging Face2024-07-21 更新2024-06-11 收录
官方服务:

资源简介:

该数据集名为Code général des impôts,主要用于法律领域的微调预训练语言模型,以提高模型在法律实践中的效率和准确性。数据集包含法语文本,涉及的任务类别包括文本生成、表格问答、摘要、文本检索、问答和文本分类。数据集的规模在1K到10K之间。数据集通过基于指令的微调方法进行优化,强调了其在任务特定适应、减少歧义、高效知识转移、可解释性和自适应行为方面的优势。数据集的生成过程包括每个数据项的字段(如指令、输入、输出、生效日期、过期日期和文章编号)以及用于生成数据集的指令列表。

The dataset, named Code général des impôts, is primarily used for fine-tuning pre-trained language models in the legal domain to enhance their efficiency and accuracy in legal practice. The dataset contains French text and covers task categories such as text generation, table question answering, summarization, text retrieval, question answering, and text classification. The dataset size ranges between 1K and 10K. The dataset is optimized using instruction-based fine-tuning, emphasizing its advantages in task-specific adaptation, reduced ambiguity, efficient knowledge transfer, interpretability, and adaptive behavior. The dataset generation process includes fields for each data item (such as instruction, input, output, start date, expiration date, and article number) and a list of instructions used for generating the dataset.

提供机构:
louisbrulenaudet
原始信息汇总

数据集概述

基本信息

  • 许可证: Apache-2.0
  • 语言: 法语
  • 多语言性: 单语种
  • 标签:
    • 微调
    • 法律
    • 法国法律
    • 法国税法总则
  • 来源数据集: 原始数据
  • 美观名称: 法国税法总则
  • 任务类别:
    • 文本生成
    • 表格问题回答
    • 摘要生成
    • 文本检索
    • 问答
    • 文本分类
  • 大小类别: 1K<n<10K

数据集内容

  • 数据集生成: 数据集由JSON文件组成,每个字典包含以下字段:
    • instruction: 字符串,与元素相关的指令。
    • input: 字符串,元素的输入细节。
    • output: 字符串,元素的输出信息。
    • start: 字符串,文章生效日期。
    • expiration: 字符串,文章失效日期。
    • num: 字符串,文章ID。

使用说明

  • 微调方法: 本项目专注于通过微调预训练语言模型,创建适用于法律实践的高效准确模型。微调过程涉及在特定任务或领域数据上进一步训练模型参数,采用指令基础的微调方法,通过人类提供的指令引导模型行为,提高模型在特定任务上的表现和可解释性。
搜集汇总
数据集介绍
构建方式
该数据集以法国《税法通则》(Code général des impôts)为原始语料,依托法国法律公开数据源LEGI,每日自动更新以确保时效性。数据构建过程中,每条法律条文被精细化为结构化的字典条目,涵盖基础信息(如条文编号、生效与废止日期)、法律状态(如自主或修改状态)、内容与注释(包括纯文本与HTML格式)、版本追溯与扩展信息,以及层级关系(如所属章节标题与标识符)。通过系统化的字段设计,数据集实现了对法国税法条文的完整数字化映射,为法律文本的机器可读与下游应用奠定基础。
特点
该数据集的核心特点在于其高度结构化与多维度元数据覆盖。每条记录不仅包含法律条文的纯文本与HTML内容,还提供了丰富的版本历史、法律状态标识(如“MODIFIE_MORT_NE”)、欧洲立法标识符(ELI)及章节层级关系(如父章节ID与标题)。此外,数据集支持多任务场景,包括文本生成、表格问答、摘要、检索、分类与问答,适用于法律领域的自然语言处理研究。其每日更新的机制保证了数据的新鲜度,而Apache-2.0许可协议则促进了开放科学社区的协作与再利用。
使用方法
研究人员可通过HuggingFace Datasets库直接加载该数据集,例如使用`load_dataset("louisbrulenaudet/code-impots")`命令。对于需要跨法典分析的应用,推荐使用RAGoon工具包,通过`pip install ragoon`安装后,调用`load_datasets`函数并行加载多个法国法律数据集,并利用`concatenate_datasets`方法实现聚合。数据集以`item`字典形式提供,用户可根据字段如`texte`(文本)、`num`(条文号)、`historique`(历史记录)等灵活提取信息,用于微调语言模型、构建法律问答系统或进行条文检索与分类任务。
背景与挑战
背景概述
在自然语言处理与法律人工智能交叉领域,结构化法律文本的数字化与可计算性一直是研究难点。2025年,由研究者louisbrulenaudet主导构建的Code général des impôts数据集正式发布,其核心目标是为研究人员、法律从业者及法学学生提供一套持续更新、结构丰富的法国税法全文数据。该数据集依托法国官方法律数据库LEGI,每日自动刷新,覆盖《法国税法典》全部条文,并以精细化的元数据结构(如条文效力状态、版本历史、层级关系等)支持文本生成、问答、摘要、检索与分类等多项下游任务。作为LegalKit生态的关键组成部分,该数据集推动了基于开放数据的法语法律大语言模型训练,对欧洲法律科技领域具有重要示范意义。
当前挑战
数据集面临的首要挑战是法律文本的时序性与版本复杂性:同一法条可能经历多次修订、废止或延期,其效力状态(如“MODIFIE_MORT_NE”)与多版本共存现象要求模型具备时间感知与版本消歧能力。其次,法律条文间的层次嵌套结构(如章节、条款、子条款)使得非结构化文本生成任务难以精准捕获上下文依赖。此外,数据集构建过程中需处理来自LEGI的异构原始数据,包括HTML与纯文本格式的混合、注释与历史信息的冗余嵌入,以及跨条文引用关系的自动解析。每日刷新的高频更新机制也对数据一致性校验与增量索引提出了工程化挑战。
常用场景
经典使用场景
在法国税法与人工智能交叉研究领域,louisbrulenaudet/code-impots数据集为法律文本的自动化处理提供了结构化、多维度且持续更新的语料基础。其经典使用场景聚焦于基于法国《通用税法》全文的生成式预训练模型微调,研究者可借助数据集中包含的条款编号、生效日期、法律状态及层级关系等丰富元数据,构建能够理解法国税法体系逻辑的文本生成模型。此外,该数据集亦广泛用于法律文档摘要、表格问答及信息检索任务,尤其适合需要同时处理法律条文原文与结构元数据的复杂场景,为法国法律自然语言处理研究树立了标准化基准。
实际应用
在实际应用中,该数据集已成为法国税务咨询自动化、合规审查系统及法律知识图谱构建的关键基础设施。税务科技公司可基于数据集的条款文本与生效日期信息,开发能够实时检索最新税法规定并生成合规建议的智能助手。法律事务所利用其结构化元数据快速定位特定条款的修订历史与关联条文,显著提升尽职调查效率。此外,法国公共行政部门借助该数据集训练面向公民的税法问答机器人,使非专业人士能够通过自然语言交互获取个性化的税务政策解读,大幅降低公共法律服务门槛。
衍生相关工作
该数据集催生了多项具有影响力的衍生工作,包括基于检索增强生成框架的法国法律问答系统RAGoon,其通过整合多个法律法典数据集实现了跨领域法律知识检索与生成。研究社区进一步开发了专门针对法国税法条款的语义嵌入模型,利用数据集中的层级关系进行对比学习预训练,在法律文本相似度计算与条款推荐任务上取得突破。另有工作基于该数据集的版本历史字段构建了税法演化预测模型,通过分析条款修改模式预测未来立法趋势。这些工作共同推动了法国法律人工智能从通用模型向领域专业化发展的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务