遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-ocu-geo-nb-employees-by-sex-occupation-and-rural-urban-areas

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲29个国家从1996年到2025年的42,478条观测数据,主要指标为按性别、职业和城乡地区划分的雇员数据(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖雇员统计信息,按性别(总计、男性、女性等)、职业分类和城乡地区进行细分。数据集以表格形式提供,包括国家代码、国家名称、数据来源、指标代码、性别分类、职业分类、城乡分类、观测年份、观测值、数据状态标志等列。数据适用于表格分类、回归和时间序列预测等机器学习任务,由Electric Sheep Asia重新打包为Parquet格式,便于使用HuggingFace的datasets库加载和处理。数据质量方面,为年度频率,ILO会选择最佳来源,且细分列仅在指标发布细分数据时非空。

This dataset contains 42,478 observations of Employees by sex, occupation and rural / urban areas (thousands) data across 29 Asia countries, spanning from 1996 to 2025. It is sourced from the International Labour Organization (ILO) ILOSTAT database, providing statistics on employees disaggregated by sex (total, male, female, etc.), occupation classification, and rural/urban areas. The data is presented in tabular format with columns such as country code, country name, source, indicator code, sex classification, occupation classification, area classification, observation year, observed value, and data status flags. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, repackaged by Electric Sheep Asia into Parquet format for easy loading via HuggingFaces datasets library. Data quality notes include annual frequency, use of ILO-selected best source for multiple sources, and non-null disaggregation columns only when breakdowns are published.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-ocu-geo-nb-employees-by-sex-occupation-and-rural-urban-areas 数据集图片
构建方式
在国际劳工组织致力于全球劳动力市场统计标准化的背景下,该数据集依托ILOSTAT中央统计数据库,通过REST API接口直接提取指标EES_TEES_SEX_OCU_GEO_NB的原始记录,并依据ISO3国家代码筛选出29个亚洲国家。原始调查微数据经国际劳工统计学家会议定义协调,来源信息以source.label字段标注,确保了数据的可追溯性与跨国可比性,最终形成覆盖1996至2025年的结构化时间序列。
特点
该数据集以四万余条观测值构建了亚洲地区雇员分布的多维截面,涵盖性别、职业及城乡区域等人口统计维度,年度频率与部分国家至2025年的前瞻性数据赋予其动态监测价值。每条记录附带观测状态标志与来源注释,如方法修订或可靠性提示,为劳动经济学研究提供了兼具广度与深度的面板数据基础。
使用方法
研究者可通过HuggingFace的load_dataset函数便捷加载数据集并转换为Pandas数据框,进而按国家代码或指标类型筛选子集。利用时间序列排序与交叉透视表功能,可分析单一国家雇员结构的时序演变,或构建国家与年份的矩阵以比较区域差异,满足分类、回归及预测等多类机器学习任务的输入需求。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的系统化收集与标准化工作,其ILOSTAT数据库作为全球劳动统计的权威来源,涵盖就业、失业、工资、工时及非正规经济等诸多维度。该数据集由Electric Sheep Asia于2025年从ILOSTAT REST API提取并重新封装,聚焦亚洲29个国家1996至2025年间按性别、职业及城乡区域划分的雇员数据,共计42,478条观测。其核心研究问题在于揭示亚洲地区劳动力市场中性别与职业结构的时空演变特征,为劳动经济学、发展研究及区域政策分析提供精细化数据支撑。该数据集以简洁的Parquet格式发布,显著降低了研究者获取与使用跨国劳动统计数据的门槛,对推动亚洲劳动力市场比较研究具有重要价值。
当前挑战
该数据集所回应的领域问题在于,跨国劳动力市场中性别、职业与城乡维度的交叉分析长期受限于数据碎片化与口径不一致,难以形成系统性比较。在构建层面,主要挑战包括:ILOSTAT原始数据经各国劳动调查汇总,统计口径与调查方法存在固有差异,虽经ICLS定义进行调和,仍难以完全消除异质性;部分国家或年份存在数据缺失,且观测状态标记揭示部分数值被判定为不可靠或系列中断,对时间序列建模的稳健性构成威胁;分类变量(如职业技能层级与城乡区域)仅在特定指标下发布非空值,导致有效样本进一步缩减,增加了多维度交互分析的复杂性。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交叉领域中,聚焦于性别与职业结构差异的量化分析始终占据核心地位。该数据集以亚洲29国为观测单元,系统记录了1996至2025年间按性别、职业类别及城乡地域划分的雇员数量(以千人为单位),为刻画亚洲劳动力市场的结构性变迁提供了难得的跨国面板资料。其最经典的使用场景在于构建多维度的时间序列与横截面矩阵,用以揭示不同国家在城乡二元经济背景下性别职业隔离的演化轨迹,并可通过差分回归或面板固定效应模型识别宏观经济波动、产业结构调整对女性就业参与率的异质性冲击。
实际应用
在政策制定与实务操作层面,该数据集可用于监测亚洲各国在实现联合国可持续发展目标中关于充分就业与体面工作、性别平等及城乡均衡发展等具体指标的进展。国际组织与国别规划部门可借助其细化至城乡与职业类别的雇员规模信息,评估技能培训计划、反歧视立法及农村非农就业促进政策的实施效果。企业人力资源战略部门亦可将其作为区域劳动力供给与结构变动的参照基准,辅助进行市场进入决策与人才储备规划。此外,该数据集经过规范化封装,支持通过load_dataset()接口快速加载,显著降低了数据工程门槛。
衍生相关工作
依托该数据集,Electric Sheep Asia已将其纳入亚洲统一机器学习就绪数据层,与同系列其他ILOSTAT指标数据集共同构成可横向联结的面板资源。由此衍生的经典工作包括亚洲性别就业差距的贝叶斯时空建模、城乡职业结构转型的聚类分析,以及基于梯度提升机与长短期记忆网络的雇员数量预测基准。部分研究进一步将其与亚洲开发银行、世界银行的宏观社会经济指标进行实体对齐,构建多模态劳动市场知识图谱,推动了可解释人工智能在劳动统计领域的应用探索,并为后续季度与月度高频数据的整合提供了参照架构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务