遇见数据集

electricsheepasia/asia-ilo-emp-publ-sex-mts-nb-public-sector-employment-by-sex-and-marital-status

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的“按性别和婚姻状况划分的公共部门就业(千人)| 亚洲”数据。数据集涵盖32个亚洲国家,时间跨度为1997年至2025年,包含2,821个观测值,专注于一个指标:EMP_PUBL_SEX_MTS_NB(按性别和婚姻状况划分的公共部门就业,单位:千人)。数据通过ILOSTAT REST API获取,并经过亚洲国家代码过滤,采用国际劳工统计学家会议(ICLS)定义进行标准化。数据集包含多个列,如国家代码、国家名称、数据来源、指标、性别分类、婚姻状况分类、观测年份、观测值等,适用于表格分类、表格回归和时间序列预测等任务。数据以年度频率提供,并包含数据质量说明,如使用ILO选择的“最佳来源”和分类列的非空条件。

This dataset contains Public sector employment by sex and marital status (thousands) | Asia (ILOSTAT) data from the International Labour Organization (ILO) ILOSTAT database. It covers 32 Asian countries, spanning the years 1997 to 2025, with 2,821 observations, focusing on one indicator: EMP_PUBL_SEX_MTS_NB (Public sector employment by sex and marital status, in thousands). The data is pulled directly from the ILOSTAT REST API and filtered to Asia ISO3 country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes columns such as country code, country name, data source, indicator, sex disaggregation, marital status classification, observation year, observed value, etc., and is suitable for tasks like tabular classification, tabular regression, and time-series forecasting. The data is provided at annual frequency, with notes on data quality, such as the use of ILO-selected best source and non-null conditions for disaggregation columns.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-publ-sex-mts-nb-public-sector-employment-by-sex-and-marital-status 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接获取公开部门就业指标(EMP_PUBL_SEX_MTS_NB),并依据亚洲地区ISO3国家代码进行筛选过滤。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义,对原始调查微观数据进行统一协调处理,数据来源在source.label字段中予以标注,确保每一条观测值皆可追溯至其原始调查或行政记录。最终汇集为包含2,821条观测记录、覆盖32个亚洲国家、时间跨度从1997年至2025年的结构化表格数据,经Electric Sheep Asia重新打包为Parquet格式,适配机器学习流水线。
特点
该数据集的核心特色在于其精细的维度拆解能力。除了常规的时间序列与国家地理维度外,数据按性别(总、男、女)与婚姻状况进行分类呈现,为劳动经济学中的性别差异与家庭结构研究提供了稀缺的细粒度素材。模式设计遵循ILOSTAT标准化的元数据架构,包含ref_area、indicator、sex、classif1等字段,以及对应的英文标签列,极大降低了跨数据集联合分析的默示成本。此外,数据质量标识(obs_status)与注释字段(note_indicator、note_source)同步保留,协助用户识别序列断裂与方法修订等潜在偏差。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并借助to_pandas()方法转换为熟悉的DataFrame格式进行后续分析。推荐按国家代码(ref_area)筛选聚焦特定经济体的子集,或利用indicator字段锁定单一指标后,沿时间轴进行趋势可视化与预测建模。数据亦支持以pivot_table操作构建国家×年份的观测矩阵,便于面板数据分析或输入至时间序列预测模型。数据集同时兼容分类、回归与时间序列预测等任务类型,为劳动市场研究提供了灵活且即用的结构化数据入口。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)于2025年整理并发布,后经Electric Sheep Asia在HuggingFace平台上重新封装。核心研究问题聚焦于亚洲地区公共部门就业的性别与婚姻状况分布,旨在提供跨越1997至2025年、涵盖32个亚洲国家的2821条观测值。作为全球劳动统计领域权威来源ILOSTAT的子集,该数据集通过标准化指标(EMP_PUBL_SEX_MTS_NB),为分析公共部门劳动力结构、性别平等政策评估及跨国比较研究提供了可靠的数据基础,对劳动经济学、公共政策及可持续发展目标(SDG)监测具有重要支撑作用。
当前挑战
该数据集所解决的领域问题核心在于公共部门就业统计中性别与婚姻状况交叉维度的匮乏,传统劳动数据多仅关注总量,难以揭示婚姻状况对女性公共部门就业的差异化影响,从而限制了精准政策干预。构建过程中面临多重挑战:其一,亚洲各国统计体系差异显著,数据来源涵盖劳动力调查、行政记录等,需通过ILO协调实现跨国产出可比;其二,时间序列存在间断性(如标识‘Break in series’),因各国方法论修订导致时序一致性受损;其三,部分国家数据稀疏性突出(如仅17国贡献大部分观测),且年频数据无法捕捉季度或月度波动,削弱了高分辨率分析的可能。
常用场景
经典使用场景
该数据集汇集了亚洲32个国家1997年至2025年间公共部门就业的性别与婚姻状况细分数据,共计2821条观测记录。其最经典的使用场景在于支撑跨国比较视角下的劳动经济学实证研究,研究者可借助该数据剖析不同亚洲国家公共部门劳动力市场中性别与婚姻状态的交互效应。例如,通过时间序列分析揭示各国女性公共部门就业占比的演变轨迹,或利用面板数据模型探究婚姻状况对男性与女性公共部门入职率差异化的影响机制。数据集的年度频率与标准化分类变量为长期趋势分析与跨时段政策效果评估提供了坚实基础。
解决学术问题
该数据集有效回应了劳动经济学与发展经济学中若干悬而未决的学术论题。在性别经济学领域,它首次允许学者系统检验亚洲公共部门是否存在‘婚姻溢价’或‘婚姻惩罚’现象,揭示婚姻状态如何调节性别工资差距与职业晋升壁垒。在就业结构转型研究中,数据集为探讨公共部门作为女性就业缓冲器假说提供了关键证据,有助于阐明经济发展阶段与公共雇佣性别构成之间的非线性关系。此外,跨国比较框架助力解构文化规范、法律制度与公共就业政策之间的复杂联动,填补了非OECD国家公共部门劳动力动态研究的空白。
衍生相关工作
基于ILOSTAT相似结构的劳动统计数据集,学术界衍生出多项标志性工作。经典研究包括利用ILO数据库开展全球公共部门就业规模的跨国面板分析,揭示政府规模与经济社会发展阶段的协同演化规律。部分学者聚焦性别就业差距的跨国收敛机制,构建了融合制度变量与文化指标的综合解释模型。在方法论层面,研究者开发了针对ILOSTAT数据质量标识(如断点标志)的处理框架,改善了缺失值插补与异常值检测流程。更有工作团队以此类数据为基础,训练时间序列预测模型以提前预警劳动力市场的结构性失衡风险,推动了劳动统计与机器学习技术的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务