遇见数据集

india-ias-officers

收藏
github2026-06-20 更新2026-06-26 收录
官方服务:

资源简介:

印度行政服务官员档案数据集,源自人事与培训部维护的SUPREMO IAS官员目录,包含官员的个人资料、教育背景、工作经验、培训详情、奖项和出版物等信息。

The dataset of Indian Administrative Service (IAS) officer profiles is sourced from the SUPREMO IAS Officer Directory maintained by India's Ministry of Personnel and Training. It encompasses comprehensive information about the officers, including personal details, educational backgrounds, work experiences, training specifics, awards and publications.

创建时间:
2026-06-20
原始信息汇总

数据集概述

  • 数据集名称: india-ias-officers
  • 描述: 印度行政服务(IAS)官员档案数据集,数据来源于印度人事与培训部(DoPT)维护的 SUPREMO IAS 官员目录(https://supremo.dopt.gov.in/knowyourofficerIAs.aspx)。

数据格式

数据集提供两种主要格式:

  • combined.jsonl: 一个自包含的嵌套文档文件,每位官员对应一行,采用 JSON Lines 格式。
  • combined.parquet: 相同结构的嵌套 Parquet 文件,包含列表/结构体列。

此外,数据还被拆分为一组规范化表格,所有表格均以官员的 identity_no 作为键:

  • officers.parquet(及对应的 CSV 压缩包): 每位官员一行,包含个人简介和中央借调总结。
  • education.parquet(及对应的 CSV 压缩包): 教育背景。
  • experience.parquet(及对应的 CSV 压缩包): 工作经历(岗位信息)。
  • mid_career_training.parquet(及对应的 CSV 压缩包): 中期职业培训详情。
  • in_service_training.parquet(及对应的 CSV 压缩包): 在职培训详情。
  • domestic_training.parquet(及对应的 CSV 压缩包): 国内培训详情。
  • foreign_training.parquet(及对应的 CSV 压缩包): 国外培训详情。
  • awards_publications.parquet(及对应的 CSV 压缩包): 获奖和出版物信息。

数据获取与探索

  • 原始数据集可在以下链接查看:https://hyparam.github.io/demos/hyparquet/?key=https%3A%2F%2Fraw.githubusercontent.com%2FVonter%2Findia-ias-officers%2Fmain%2Fdata%2Fcombined.parquet?raw=1
  • 也可以通过交互式网站探索数据:https://india-ias-officers.pages.dev

数据生成脚本

  • fetch.py: 从 SUPREMO IAS 官员目录抓取原始生物数据 HTML,存储到 raw/ 目录。
  • parse.py: 解析原始 HTML,生成 Parquet 和压缩 CSV 数据集。

许可证

本数据集采用开放数据库许可证(Open Database License, ODbL)1.0 版(http://opendatacommons.org/licenses/odbl/1.0/)。数据库中的部分个别内容版权归印度人事与培训部所有。

  • 允许: 复制、分发、使用数据库;基于数据库创作作品;修改、转换和构建数据库。
  • 必要条件: 署名(Attribution)、相同方式共享(Share-Alike)、保持开放(Keep open)。

致谢

  • 数据来源:DoPT SUPREMO(https://supremo.dopt.gov.in/knowyourofficerIAs.aspx)
  • 代码和文档借助 Claude AI 辅助编写。
搜集汇总
数据集介绍
india-ias-officers 数据集图片
构建方式
该数据集源自印度人事与培训部(DoPT)维护的SUPREMO IAS官员目录,通过自主研发的爬虫脚本(fetch.py)批量抓取印度行政官员的原始简历HTML页面,再经由解析脚本(parse.py)对原始数据进行结构化提取与清洗,最终生成包含嵌套格式与规范化表格在内的多格式数据文件,并以Parquet和压缩CSV等形式发布,所有记录均以官员唯一身份编号identity_no为键进行关联。
特点
数据集结构设计精巧,既提供每名官员完整信息的嵌套文档(combined.jsonl与combined.parquet),又拆分为官员基本信息、教育经历、工作经历、中期培训、在职培训、国内培训、国外培训、获奖与出版物等八个规范化子表,满足不同粒度的分析需求。数据全面覆盖官员履历的核心维度,且来源权威、许可开放(ODbL协议),便于学术研究与公共服务领域的数据挖掘。
使用方法
用户可通过GitHub直接下载原始Parquet或JSON Lines文件进行离线分析,亦可利用在线预览工具(如hyparquet)快速浏览嵌套数据。对于需要关联查询的场景,建议使用标准化子表,以identity_no为键进行多表连接。完整的数据处理流程支持复现:安装Python依赖后,依次运行fetch.py与parse.py即可从源头抓取并解析最新数据。
背景与挑战
背景概述
印度行政服务(IAS)官员数据集(india-ias-officers)由研究者Vonter于近期创建,旨在系统化整合印度政府人事与培训部(DoPT)SUPREMO官网收录的IAS官员公开档案。该数据集以每位官员为中心,构建了包含教育背景、任职经历、职业培训及获奖出版物等多维信息的嵌套文档,并同时提供标准化关系表,便于多角度分析。这一资源为公共管理研究、人才流动分析及政策评估提供了宝贵的结构化数据基础,填补了印度高级官僚体系量化研究的空白,对理解精英官僚的职业路径与治理效能具有显著推动作用。
当前挑战
该数据集面临的核心挑战在于两大层面。其一,领域问题层面,IAS官员信息的碎片化与离散性使得跨国、跨部门比较研究极为困难,缺乏统一、机器可读的数据源限制了行政科学、政治经济学等领域的深度分析;其二,构建过程中,从SUPREMO网站爬取非结构化HTML页面、解析繁杂的表格与段落文档、确保历史数据的时间一致性及字段准确性均存在技术难点,同时需在开放数据库许可(ODbL)框架下妥善处理政府公开版权内容,平衡数据可用性与合规性。
常用场景
经典使用场景
在公共管理与政治科学的交叉研究领域中,india-ias-officers数据集为剖析印度行政服务体系的运作机制提供了宝贵的数据基础。经典的使用场景聚焦于行政官员职业生涯轨迹的多维度分析,研究者可以借助该数据集中详尽的官员个人信息、教育背景、历任职位、国内外培训记录及获奖出版情况,构建官员晋升流动模型,探究教育资历、专业训练与晋升速度之间的内在关联,以及中央与地方间轮岗制度对行政效能的影响。
实际应用
在实际应用层面,该数据集为政府人事决策、人力资源评估及行政改革方案设计提供了实证支撑。政策制定者可基于官员过往任职效率与培训效果的分析,优化选拔机制与人才流动策略;公共管理咨询机构可利用职位经历与晋升数据,评估不同区域行政配置的合理性,提出跨部门协作与干部轮岗的优化建议。此外,该数据集也为新闻媒体与公民社会组织追踪官员履历、监督公共资源分配公平性提供了透明的数据依据。
衍生相关工作
围绕该数据集衍生出的一系列经典工作主要包括官员职业生涯建模、行政效能评估与人才培养路径分析三类。研究者基于官员的完整履历构建了时间序列赋值模型,用以预测特定背景官员的晋升概率与关键年龄节点;另有工作利用自然语言处理技术从培训记录与获奖描述中提取技能标签,绘制出行政官员的能力图谱。这些衍生研究不仅深化了对印度公务员系统的理解,也为其他发展中国家的官僚体制改革提供了可复制的分析范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务