Union Government Expenditure Dataset
收藏官方服务:
资源简介:
一个按财政年度分类的印度联邦政府支出开放数据集,按目的和部门细分,每个数字都引用自公开的政府文件。
创建时间:
2026-08-31
原始信息汇总
数据集概述
项目名称:whereismytaxmoney.com
数据集地址:https://github.com/ajinux/where-is-my-tax-money
数据集内容
该数据集涵盖2020-21至2025-26六个财政年度的印度联邦政府支出数据,按用途和部门进行细分,共有超过1,500条带来源索引的支出数据,来源于131份政府文件,涉及56个部委和11个用途类别。其中五个年度为已结算实际数据,2025-26年度为修订估算数据,所有数据均与财政部公布的总额精确对账至卢比。
数据可信度
- 不进行估算:每项金额均来自公开文件,并注明来源的报表和列号;任何推算数据都会附带方法和输入数据。
- 不掩盖分歧:当两份文件数据不一致时,构建流程会失败,而非选择其一,确保数据的严谨性。
- 层级求和校验:仅叶子记录带有金额,所有分类和总额均由下层数据汇总而成,且在每一层级都要求完全相等,校验失败即停止构建。
数据结构与文件
data/:数据集及其构建流程data/dataset/:人工编辑的原始数据(来源文件、词汇表、各部门各时期数据)data/wimtm_data/:数据处理流水线(加载→验证→解析)data/dist/:构建后的成品数据文件(dataset.v3.json),已提交供外部使用data/.cache/:下载的源PDF文件(不纳入版本控制)
web/:基于数据构建的网站前端(Astro + React,静态站点)
数据许可
- 数据部分(
data/dataset/及data/dist/):采用 CC BY 4.0 许可证,数据来源为印度政府公开记录,项目的用途分类和数据编排为项目自身工作。 - 代码部分(
data/wimtm_data/):采用 MIT 许可证。
数据来源与贡献
- 所有数据均来自印度财政部发布的联邦预算文件和支出概况报表,项目仅提取和整理,不产生原始数字。
- 项目欢迎贡献,尤其是数据更正,也支持添加财政年度、细分数据、描述预算科目等操作,所有贡献需通过自动化校验。
搜集汇总
数据集介绍

构建方式
该数据集由印度联盟政府财政支出数据构建而成,覆盖2020-21至2025-26六个财年,包含超过1500条可溯源至政府官方文件的财政数据。构建过程严谨,每一笔金额均标注来源文件的具体陈述与栏目,且所有数据经自动化验证确保分项合计与总额完全一致。数据以JSON格式存储于data/dataset目录,通过Python工具链进行校验与构建,最终生成可发布的data/dist/dataset.v3.json文件。
特点
该数据集的核心特点在于其高度的可信度与透明度。它严格遵循'不估算、不掩盖分歧'的原则,所有数据均来自政府发布的公开文件,并附带详细引用。数据模型强调可验证性,任何分项与总计不符都会导致构建失败,从而确保数据的一致性。此外,数据集独立于任何前端应用,具备自身Schema和许可协议,便于各类用户直接使用。
使用方法
用户可通过Python和uv工具链操作数据集,运行'uv run wimtm-data validate'进行规则校验,'uv run wimtm-data build'生成构建产物。如需下载源PDF文档,可执行'sources-fetch'命令。网站部分则基于Node.js,通过'npm run dev'或'npm test'进行开发与测试。数据集的许可为CC BY 4.0,允许用户自由使用,但需注明出处。
背景与挑战
背景概述
Union Government Expenditure Dataset 是由开源社区维护的印度联邦政府支出数据集,其核心网站为 whereismytaxmoney.com。该数据集旨在将印度纳税人的个人所得税缴纳额与联邦政府实际支出进行关联,并以直观的比例形式呈现。项目创建于近年,主要贡献者包括多位志愿者开发者,其核心研究问题在于如何将分散在数百页政府预算文件(如支出概况、需求拨款说明等)中的财政数据系统化、机器可读化,从而让普通公民能够理解税收去向。该数据集覆盖2020-21至2025-26共六个财年,包含超过1500条来源于131份政府文件的数据,涉及56个部门和11个支出类别,且所有数字均精确到卢比并附有文献引用。其影响力在于提升了政府财政透明度,为公民、记者和研究人员提供了可验证的公共财政分析工具,并促进了开源数据在财政领域的应用。
当前挑战
该数据集面临的挑战主要来自两方面。领域问题方面,印度政府财政数据以PDF格式发布,使用专业会计术语,缺乏统一结构,导致数据提取和整合极其困难;同时,不同政府文件间的数据经常不一致,需要严格的对账机制。构建过程中,项目团队必须确保每条数据都有精确文献引用,且任何部分的汇总必须与上级完全匹配,否则构建即失败,这要求对数百页文档进行细致阅读和人工录入,工作量巨大且易出错。此外,数据覆盖多个财年,需不断更新以保持时效性,而独立维护的网站与数据集之间的同步也需严格依赖一个唯一的生成文件,增加了版本控制的复杂度。已知空缺项(如部分州级拆分数据)也被如实记录,而非隐藏,这进一步增加了数据完整性的挑战。
常用场景
经典使用场景
该数据集作为印度联邦政府财政支出结构化解析的权威资源,其核心应用场景聚焦于跨年度(2020-21至2025-26财年)财政数据的细粒度与可验证性分析。通过将56个部委及11类目的支出明细,溯源至131份官方预算文件中的具体声明与栏目,并以卢比为单位实现与财政部公布总额的精确对账,该数据集为公共财政、政治经济学及公共政策研究提供了高度可信的定量基石。研究者既可借此剖析特定部门或功能类别的支出动态与优先级演变,亦能深入探究联邦转移支付与州际分配格局,从而在宏观财政框架与微观执行单元间建立精确且可复现的实证连接。
实际应用
在实际应用维度,该数据集的价值超越了单纯的学术研究范畴,深入至公共问责与公民监督的社会实践领域。其驱动下的网络平台,允许印度纳税人输入个人税额,继而直观理解其缴纳的款项在各部门间的分配比例,有效弥合了公民个体与国家财政预算之间的信息鸿沟。此举将抽象的宏观预算赤字、国防开支或教育投入等概念,转化为与纳税人生计直接相关的个性化篇章,极大地增强了财政透明度与公众参与度。此外,该数据集亦可作为新闻媒体、非政府组织及政策制定者的可靠工具,用于快速核查政府财政责任,促进基于证据的公共辩论与更加明智的政策评估。
衍生相关工作
该数据集的结构严谨性及对数据完整性的执着追求,催生了若干指向性明确的研究方向与方法论拓展。其不可妥协的对账机制及其开源可扩展的架构,为构建类似针对其他层级政府或国家的财政追踪数据库提供了可复制的范式蓝图。后续工作可能聚焦于将该数据集中的精细类别与微观家庭调查数据相融合,以评估特定支出对福利结果的边际影响;或利用其时间序列维度,探究财政支出结构变化与宏观经济指标间的动态关联。更重要的是,其对“所有数值均可溯源至原始文档”原则的坚守,为自动化文本挖掘工具从非结构化预算PDF中精确抽取财政事实提供了难能可贵的黄金标准训练语料,推动着智能财政分析领域的发展。
以上内容由遇见数据集搜集并总结生成



