遇见数据集

louisbrulenaudet/bofip

收藏
Hugging Face2023-12-18 更新2024-03-04 收录
官方服务:

资源简介:

该项目专注于微调预训练语言模型,以创建适用于法律实践的高效准确模型。微调是通过进一步训练模型参数,使其适应特定任务或领域的过程。数据集生成过程涉及使用一系列指令来生成JSON文件,每个字典包含instruction、input和output字段。数据集的语言为法语,标签包括finetuning、legal、french law等。

该项目专注于微调预训练语言模型,以创建适用于法律实践的高效准确模型。微调是通过进一步训练模型参数,使其适应特定任务或领域的过程。数据集生成过程涉及使用一系列指令来生成JSON文件,每个字典包含instruction、input和output字段。数据集的语言为法语,标签包括finetuning、legal、french law等。

提供机构:
louisbrulenaudet
原始信息汇总

数据集概述

基本信息

  • 许可证: Apache-2.0
  • 语言: 法语
  • 多语言性: 单语种
  • 标签: 微调, 法律, 法国法律, 法国税法, Bofip
  • 数据来源: 原始数据
  • 数据集名称: Bulletin officiel des finances publiques - impôts
  • 任务类别: 文本生成, 表格问答, 摘要, 对话
  • 数据规模: 1K<n<10K

数据集生成

  • 数据格式: JSON文件,包含多个字典

  • 字段:

    • instruction: 字符串,表示与元素相关的指令
    • input: 字符串,表示元素的输入细节
    • output: 字符串,表示元素的输出信息
  • 指令列表: python instructions = [ "Compose lintégralité de la publication sous forme écrite.", "Écris la totalité du contenu de la publication.", "Formule la totalité du texte présent dans la publication.", "Produis lintégralité de la publication en écriture.", "Développe la publication dans son ensemble par écrit.", "Génère lensemble du texte contenu dans la publication.", "Formule le contenu intégral de la publication en entier.", "Rédige la totalité du texte de la publication en entier.", "Compose lintégralité du contenu textuel de la publication.", "Rédige lensemble du texte qui constitue la publication.", "Composez lintégralité de la publication sous forme écrite.", "Écrivez la totalité du contenu de la publication.", "Formulez la totalité du texte présent dans la publication.", "Développez la publication dans son ensemble par écrit.", "Générez lensemble du texte contenu dans la publication.", "Formulez le contenu intégral de la publication en entier.", "Rédigez la totalité du texte de la publication en entier.", "Composez lintégralité du contenu textuel de la publication.", "Écrivez la publication dans son intégralité en termes de texte.", "Rédigez lensemble du texte qui constitue la publication.", "Composer lintégralité de la publication sous forme écrite.", "Écrire la totalité du contenu de la publication.", "Formuler la totalité du texte présent dans la publication.", "Produire lintégralité de la publication en écriture.", "Développer la publication dans son ensemble par écrit.", "Générer lensemble du texte contenu dans la publication.", "Formuler le contenu intégral de la publication en entier.", "Rédiger la totalité du texte de la publication en entier.", "Composer lintégralité du contenu textuel de la publication.", "Rédiger lensemble du texte qui constitue la publication.", "Quelles sont les dispositions de la publication ?", "Quelles dispositions sont incluses dans la publication ?", "Quelles sont les dispositions énoncées dans la publication ?", "Quel est le texte intégral de la publication ?", "Quelle est la lettre de la publication ?" ]

搜集汇总
数据集介绍
louisbrulenaudet/bofip 数据集图片
构建方式
该数据集源自法国官方税收法律文献《Bulletin officiel des finances publiques - impôts》(Bofip),收录了截至2023年12月11日共计8,804条法律文本条目。每条数据包含类型、标题、生效日期、系列、分部、法律标识符、永久链接、纯文本内容及HTML格式内容等九个结构化字段。数据集以单一训练集形式组织,总大小约186.7 MB,采用Apache-2.0许可证发布,专为法语法律领域的指令微调任务而设计。
特点
数据集的核心特点在于其高度专业化的法律领域属性与指令微调适配性。所有文本均为法语法律实务中的真实税收规定,确保了领域知识的权威性与准确性。数据不仅提供纯文本形式,还保留了HTML格式,便于模型学习结构化法律文档的排版特征。其丰富的元数据字段(如生效日期、法律标识符)为模型提供了细粒度的上下文信息,有助于提升法律问答、摘要生成等任务的精准度与可解释性。
使用方法
该数据集可直接用于预训练语言模型的指令微调,尤其适用于法律文本生成、表格问答及摘要等任务。使用时需通过HuggingFace Datasets库加载默认配置的训练集,数据以标准JSON格式存储。研究人员可根据任务需求,利用其中的'contenu'字段作为模型输入,结合'type'或'titre'等字段构造指令模板。建议在微调过程中保留完整的元数据,以充分发挥法律领域知识的引导作用,提升模型在法国税法场景下的表现力与可控性。
背景与挑战
背景概述
在人工智能与法律交叉领域,大语言模型的高效适配是推动司法智能化的关键。louisbrulenaudet/bofip数据集由Louis Brulé Naudet于2023年创建,专注于法国公共财政与税收领域的法律文本,旨在通过指令微调技术优化预训练语言模型在税务实践中的表现。该数据集源自《法国公共财政公报》(Bofip),收录了8804条官方税务注释,涵盖法律条款、生效日期、系列划分等结构化信息及原始内容。其核心研究问题在于如何利用指令引导的微调策略,使通用语言模型精准适应法律专业的语义复杂性与上下文依赖性。该数据集为法律NLP领域提供了高质量的领域语料,尤其推动了税务文本理解与生成任务的发展,对法国法律数字化具有重要示范意义。
当前挑战
该数据集面临的核心挑战包括领域问题与构建过程两方面。在领域问题层面,税务法律文本具有高度专业性、术语歧义性及频繁更新的特性,通用模型难以准确捕捉其隐含的法规逻辑与时效性差异,导致在表格问答、摘要生成等任务中易出现知识陈旧或解释偏差。构建过程中,数据清洗需处理跨文档的格式不统一(如HTML与纯文本混杂)、法律标识符的嵌套结构,以及法语法律语言特有的句法复杂性;同时,指令微调需人工设计高保真提示模板,以平衡模型对显式任务描述与隐性上下文线索的敏感度,这对标注质量与领域专家依赖性提出了严苛要求。
常用场景
经典使用场景
在自然语言处理与法律人工智能的交叉领域,louisbrulenaudet/bofip数据集以其丰富的法国税法文本资源,成为微调预训练语言模型以适配法律实务的经典素材。该数据集收录了法国《公共财政官方公报——税收》中的近九千份法律文件,涵盖类型、标题、生效日期、系列、分册、法律标识符、永久链接、文本内容及HTML格式等结构化字段,为指令微调范式提供了高质量的领域语料。研究者常利用其进行有监督的指令式微调,使模型在生成、摘要和表格问答等任务中精准响应法律语境,从而提升对复杂税法的理解与生成能力。
解决学术问题
该数据集有效回应了法学自然语言处理中领域知识迁移与指令对齐的学术挑战。传统预训练模型在税务法律文本上常出现语义模糊或上下文误判,而bofip通过规范化、可解释的指令模板,使模型能够从人类提供的任务描述中捕捉精细的领域知识,显著降低歧义输出。这解决了法律文本自动化处理中专业术语理解不足、逻辑链条断裂等核心痛点,为构建可解释、受控的法律语言模型奠定了数据基础,推动了指令微调在高度结构化法律领域的理论验证与方法创新。
衍生相关工作
该数据集催生了一系列围绕法律语言模型指令微调的开创性工作。研究者基于bofip开发了针对法国税法的专用微调框架,探索了不同指令格式对模型性能的影响,并衍生出跨领域法律知识迁移的基准测试。后续工作进一步结合检索增强生成技术,利用该数据集构建了税务问答系统,验证了指令微调在减少法律文本歧义与增强上下文感知方面的有效性。这些成果不仅丰富了法律NLP的实证研究,也为多语言法律模型的适应性提供了重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务