遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-ins-mts-nb-employees-by-sex-public-private-sector-and-marital

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲国家员工数据的表格型数据集,由国际劳工组织(ILO)的ILOSTAT数据库提供,并由Electric Sheep Asia重新打包发布。数据集核心内容为按性别、公共/私营部门和婚姻状况划分的员工数量(以千计)指标,覆盖32个亚洲国家,时间跨度为1997年至2025年,包含20,849条观察记录。数据通过ILOSTAT REST API获取,并经过亚洲国家代码过滤,采用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集包含多个维度列,如国家代码、性别、分类变量(如机构部门和婚姻状况)、年份、观测值及数据质量标志,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并包含来源和注释信息以确保可追溯性。

This dataset is a tabular dataset on employee statistics in Asian countries, sourced from the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Asia. It focuses on the indicator Employees by sex, public/private sector and marital status (thousands), covering 32 Asian countries from 1997 to 2025, with 20,849 observations. Data is pulled directly from the ILOSTAT REST API, filtered to Asia ISO3 country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes columns such as country code, sex, classification variables (e.g., institutional sector and marital status), year, observed value, and data quality flags, making it suitable for tabular classification, regression, and time-series forecasting tasks. Data is published at annual frequency, with source and annotation columns for traceability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-ins-mts-nb-employees-by-sex-public-private-sector-and-marital 数据集图片
构建方式
数据集构建根植于国际劳工组织统计部门(ILOSTAT)的权威数据体系,该部门长期致力于通过劳动力调查、家庭收入调查及行政记录等多源渠道采集并调和全球劳动统计数据。此数据集经由ILOSTAT公开的REST API直接抽取指标EES_TEES_SEX_INS_MTS_NB的原始记录,并借助ISO3国家代码筛选出亚洲地区32个国家的观测条目。所有底层微观数据均依据国际劳工统计学家会议(ICLS)标准进行统一调和,来源信息以source.label字段标注,最终由Electric Sheep Asia以机器学习就绪的Parquet格式重新打包发布,确保数据获取的便捷性与可追溯性。
特点
数据集以20,849条观测记录覆盖亚洲32个国家自1997年至2025年的年度雇员数据,聚焦性别、公共/私营部门及婚姻状况的多维交叉分类。架构设计兼顾描述性分析与时间序列建模需求,既包含性别(总数、男性、女性、其他)的细致划分,亦通过classif1和classif2字段提供机构部门与婚姻状态的聚合层次。每条记录附带来源标签、观测状态标识及方法学注释,便于评估数据质量与识别序列断点。相对庞大的时间跨度与地理覆盖,使得该数据集成为探究亚洲劳动力市场结构变迁的稀缺资源。
使用方法
使用该数据集可直接通过HuggingFace的datasets库加载,调用load_dataset函数指定数据集标识符即可获取训练集并转换为Pandas数据框。针对具体研究问题,用户可借助布尔索引筛选特定国家(如印度尼西亚),或对单一指标按年份排序以绘制时间序列趋势图。若需构建国家与年份的二维矩阵,可利用pivot_table方法重整数据布局,从而服务于跨国比较或面板回归分析。数据以年度频率发布,部分指标的月度或季度序列未包含在内,使用时应留意观测状态标识以规避不可靠数值。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与传播,其ILOSTAT数据库汇集了200余个经济体的劳动力市场指标,为政策制定与学术研究提供关键依据。亚洲作为全球劳动力最为密集且结构急剧变迁的区域,其就业形态受性别、公私部门属性及婚姻状况等多重因素交织影响。该数据集由Electric Sheep Asia于2025年从ILOSTAT REST API抽取并重新封装,涵盖1997至2025年间32个亚洲国家的20,849条雇员观测记录,以千人计值呈现按性别、机构部门与婚姻状况的细分数据。作为首个面向亚洲区域的ML-ready结构化劳动统计资源,它为探索性别就业差距、公私部门劳动参与差异以及婚姻状态对劳动力供给的调节效应提供了长时序、多维度的实证基础。
当前挑战
该数据集所应对的领域问题在于,长期以来亚洲区域缺乏统一、可机读且涵盖性别-部门-婚姻交叉维度的长时序雇员统计,既有研究多依赖碎片化国别调查或年度报告,难以支撑跨国的计量建模与预测任务。构建过程中面临数据异质性协调的挑战:ILOSTAT原始数据源自各国劳动力调查与行政记录,抽样设计、统计口径及ICLS定义应用程度不一,须经ILO统计局统一调和;部分国家年份缺失或来源切换导致序列断裂,观测值存在临时性、不可靠等状态标记;性别分类中包含SEX_O等非二元选项,而分类变量classif1与classif2的发布完整度随国家而异,造成多维交叉表稀疏。这些因素共同增加了时间序列建模与跨国比较分析的预处理复杂度。
常用场景
经典使用场景
在劳动经济学与性别研究的交汇处,该数据集为探究亚洲地区就业结构的性别差异提供了精细化的观测窗口。研究者常借助其按性别、公私部门及婚姻状况交叉分类的雇员人数时序数据,构建面板回归或时间序列模型,以识别女性在公共部门与私营部门中的就业份额演变轨迹,并检验婚姻状态对男女劳动参与模式的差异化影响。
解决学术问题
该数据集有效回应了劳动统计比较研究中长期存在的标准化不足与覆盖偏窄问题。通过ILO统一协调的ICLS定义及详尽的来源标注,它使跨国、跨时段的性别就业差距测度具备了统计一致性,为检验“公共部门女性庇护效应”假说、剖析婚姻状况与就业脆弱性的关联,以及评估亚洲各国劳动市场性别隔离的收敛或分化趋势,提供了扎实的经验基础。
衍生相关工作
基于该数据集,衍生出一系列聚焦亚洲劳动市场性别分层的比较研究,涵盖公共部门就业的女性化趋势、婚姻状况与就业稳定性的关联分析等主题。相关经典工作还将其与ILO其他指标(如工资、工时)链接,构建多维性别平等指数;部分研究利用其长时间跨度特征,检验经济周期对男女雇员人数波动的非对称冲击,丰富了劳动力市场弹性理论在亚洲情境下的实证内涵。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务