mayrop/sat-catalogos
收藏官方服务:
资源简介:
该数据集包含墨西哥税务和贸易相关的电子发票和扣税单数据,涵盖多个版本(如1.0、2.0、3.3、4.0)和补充模块(如运输和外贸)。数据以CSV文件形式组织,包括税务代码、国家、地区、支付方式、货币、错误矩阵等多个分类表。适用于税务合规性分析、电子发票验证和贸易数据处理等应用。
This dataset contains electronic invoice and tax withholding data related to Mexican taxation and trade, covering multiple versions (e.g., 1.0, 2.0, 3.3, 4.0) and supplementary modules (e.g., transportation and foreign trade). The data is organized in CSV files, including various classification tables such as tax codes, countries, regions, payment methods, currencies, and error matrices. It is suitable for applications like tax compliance analysis, electronic invoice validation, and trade data processing.
提供机构:
mayrop搜集汇总
数据集介绍

构建方式
在墨西哥财税数字化进程中,数据集的构建依托于官方税务服务局(SAT)发布的规范文件,以结构化CSV格式系统收录了电子发票与税务补充凭证所需的全部编目信息。该数据集按文档类型与版本号精细划分,涵盖Annex 20框架下电子发票的3.3及4.0版本、税务扣缴凭证的1.0及2.0版本,以及运输提单与外贸补充凭证的特定版本。每个子集对应一个独立的配置项,如产品服务代码、税率、海关编码等核心分类表,从而为不同税务场景提供精准的参考数据源。
特点
数据集最显著的特征在于其高度的权威性与结构化层级。所有数据均源于墨西哥政府正式公布的税收编目,确保了数据在商务合规应用中的法律效力。版本号的明确标注使得用户能够清晰追溯不同时期的税务规范变更,而细粒度的分类表覆盖从产品编码到联邦实体、货币种类乃至错误码矩阵等多元维度,为处理复杂税务单据提供了完整且一致的参照体系。这种设计极大地便利了跨系统校验与自动化数据处理。
使用方法
使用者可通过Hugging Face Datasets库便捷地加载该数据集。针对具体税务凭证类型及版本,选择对应的config_name参数即可获取所需的编目表格,例如加载电子发票4.0版本的产品服务代码表。加载后的数据可直接用于构建税务合规应用中的下拉选项、校验逻辑或作为机器学习模型训练的基础分类词典。鉴于其仅含训练集划分,建议结合业务规则进行数据整合,或与原始税务文档进行对照验证,以发挥数据在自动化财税处理中的最大价值。
背景与挑战
背景概述
sat-catalogos数据集由墨西哥税务管理局(SAT)创建,旨在系统化地整合与墨西哥电子发票(CFDI)及税务合规相关的官方目录数据。该数据集涵盖了从发票类型、支付方式、税收分类到国际贸易、运输和海关等多种编码体系,版本跨度从3.3到4.0,并包含错误矩阵等辅助文件。其核心研究问题在于如何将分散的、多版本的税务目录统一为结构化、可机器读取的格式,以支持自动化税务处理、合规性分析及跨境贸易研究。该数据集的发布对于拉丁美洲税务数据标准化、电子政府数据开放以及相关领域的学术研究具有重要推动作用,为研究人员和开发者提供了权威且全面的参考基准。
当前挑战
该数据集面临的领域挑战在于墨西哥税务体系本身的复杂性与动态性,例如多个税种(如增值税、所得税)、多种发票版本(3.3、4.0)以及不断更新的补充规范(如运输单据、外贸文件),要求数据集必须及时同步官方变更并维持版本间的一致性。构建过程中的挑战则包括:从不同官方渠道(如ANEXO 20、补充规范)爬取和整合数百个CSV文件,并处理编码、格式及命名规范的差异;确保跨版本(如发票格式从3.3到4.0)的字段映射准确无误;以及维护一个庞大、标准化且持续更新的错误矩阵,以辅助验证电子单据的合规性。
常用场景
经典使用场景
在墨西哥税务合规与电子发票(CFDI)研究领域,sat-catalogos数据集作为官方税务目录的数字化集合,其经典使用场景集中于构建与验证电子发票生成系统。研究者利用该数据集中包含的版本号、产品服务代码、计量单位、海关代码以及税制分类等结构化信息,对发票内容进行标准化映射与校验。例如,通过调用c_clave_prod_serv与c_clave_unidad等表格,系统能够精准地将交易商品或劳务归入对应的分类体系,从而确保生成的Comprobante Fiscal Digital por Internet(CFDI)符合墨西哥税务管理局(SAT)颁布的格式与法规要求。该过程不仅是自动化财税处理的核心环节,也是从异构业务数据向合规电子凭证转化的关键步骤。
解决学术问题
sat-catalogos数据集有效解决了电子发票领域两大核心学术难题:数据标准化与语义互操作。研究者长期面临墨西哥税务法规中频繁更新的目录代码(如版本从3.3至4.0的演变)与不同企业信息系统间数据格式割裂的困境。该数据集通过提供统一、可机读的官方目录,首次实现了对税务代码生命周期(新增、废弃与修改)的系统性追踪。这为实证研究发票数据质量、税基一致性以及跨国贸易中电子单据的语义对齐奠定了数据基础。其学术意义在于打破了税务数据因版本更迭而导致的碎片化困境,推动了计算会计学与税务合规自动化向更严谨、可复现的方向演进。
衍生相关工作
基于sat-catalogos数据集,学术界与工业界衍生出了一系列特色鲜明的经典工作。在开源领域,研究人员利用该数据集构建了如SatCFDIValidator等校验工具库,实现了对CFDI v4.0格式的自动批处理验证。在数据挖掘方向,有工作通过对c_regimen_fiscal与c_tipo_de_comprobante等目录的关联分析,揭示了墨西哥中小企业在不同税制下的开票行为模式,为税收征管策略的优化提供了数据视角。此外,迁移学习研究者将该数据集与西班牙等其他拉美国家的税务目录对齐,探索跨语种电子发票信息的语义映射方法。这些工作不仅深化了税务数据标准化的理论基础,也推动了拉丁美洲区域财税一体化研究的进程。
以上内容由遇见数据集搜集并总结生成



