遇见数据集

Data-Gouv-FR/bofip-impots-publications-en-vigueur

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含法国公共财政官方公报(BOFiP)中关于税收的现行法规内容和最新动态。

This dataset contains the current regulatory content and latest developments regarding taxation from the Official Bulletin of Public Finances of France (BOFiP).

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/bofip-impots-publications-en-vigueur 数据集图片
构建方式
该数据集源自法国政府开放数据平台data.gouv.fr,以'BOFiP Impôts - publications en vigueur'为标识,汇集了法国公共财政公报-税收领域中具有实际效力的理论内容与新闻公告。构建过程中,每个data.gouv.fr数据集对应一个Hugging Face仓库,而原始表格资源则映射为一个Hugging Face子集或配置,每个子集包含一个名为'train'的分割。数据集以Parquet格式存储,采用'bofip-vigueur'配置,数据文件位于'data/bofip-vigueur.parquet',确保了结构化数据的紧凑与高效访问。
特点
本数据集的核心特点在于其官方性与时效性,内容直接源自法国财政部门发布的权威理论指导与现行新闻,涵盖了税收征收、税务管理及法律解释等关键领域。数据采用Parquet列式存储格式,支持高效的压缩与查询性能,同时兼容CSV格式的开放数据标准,便于跨平台分析。数据集以法语呈现,专为研究法国税收制度、政策分析及自然语言处理任务设计,其结构化分割方式简化了大规模数据集的管理与版本控制。
使用方法
使用者可通过Hugging Face的datasets库便捷地加载数据,具体操作为调用'load_dataset'函数,指定仓库名称'Data-Gouv-ML/bofip-impots-publications-en-vigueur'及配置'bofip-vigueur',即可获取'train'分割下的完整数据集。加载后,数据直接以Python数据结构呈现,支持与Pandas、NumPy等数据分析工具无缝集成,适用于文本分类、信息检索或知识图谱构建等下游任务。建议用户先行查阅原始官方元数据以了解许可条款,确保合规使用。
背景与挑战
背景概述
该数据集名为BOFiP Impôts - publications en vigueur,由法国数据开放平台data.gouv.fr于2023年7月发布,以法国公共财政总局(Direction Générale des Finances Publiques)的官方税收公报为基础,汇集了当前生效的税务规范性文件与最新动态。数据集旨在为研究人员、政策制定者及税收从业者提供结构化的、机器可读的税收法律资源,推动税务数据的透明化与可及性。其潜在影响力涵盖税收合规分析、自动化财税咨询系统开发及公开财政政策研究,为法国公共数据生态注入了关键的法律知识图谱元素。
当前挑战
该数据集面临的核心挑战包括:原始税收公报以非结构化文本形式存在,需解析为可计算的表格格式,但法律术语的模糊性与嵌套引用关系易导致语义丢失;数据时效性要求严格,法国税收法规频繁修订,而数据集更新频率与官方发布节奏需同步,否则将产生过时信息风险;跨语言与跨法律体系的标准化困难,例如法语特定税法概念难以映射至国际税务分类体系,限制了跨国比较研究。此外,构建过程中需处理PDF转换噪声、乱码文本及多版本冲突,对数据清洗与校验算法提出较高要求。
常用场景
经典使用场景
BOFiP Impôts - publications en vigueur数据集是法国税务领域的重要开放数据资源,汇集了法国公共财政公报(BOFiP)中关于税收的现行官方解释和最新动态。该数据集最经典的使用场景在于为税收法规研究提供结构化、可机读的原始文本资料,研究人员可借此构建税务知识图谱、开发税务文本检索系统,或进行税收政策演变的时间序列分析。其数据来源权威、内容涵盖广泛,使得学者和实务工作者能够快速获取法国税务制度的底层规范信息,并以此为基石开展深入的法规解析与比对工作。
衍生相关工作
围绕BOFiP数据集,学术界与工业界已衍生出若干具有代表性的工作。例如,有研究团队基于该数据集构建了法语税务领域的命名实体识别(NER)基准,用于抽取条款中的税种、税率、时效等关键要素;另有工作将其与法国法院税务判例数据集联合,形成法规-判例映射关系,支撑税务预测模型的训练。在开源社区中,该数据集被整合进法语法律NLP工具包,成为多任务学习框架的标准预训练数据之一。这些衍生工作不仅拓展了数据集的适用边界,也为欧洲其他法语国家税务数据的数字化提供了可复用的方法论借鉴。
数据集最近研究
最新研究方向
该数据集聚焦于法国公共财政与税务领域最新法规与行政解释的数字化整合,反映了政府开放数据运动下财务规则的透明化与机器可读性趋势。当前研究前沿集中于利用自然语言处理技术(如实体识别与文本分类)自动解析《公共财政公报——税收》中的法定条文与实务指导,以期构建动态更新的税务知识图谱。这一方向不仅推动了政务文档的语义化检索与智能问答系统的发展,还为跨国税务合规分析及法国财税政策的量化评估提供了标准化数据基础,对提升财政决策的可解释性和公共服务的智能化水平具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务