遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-eco-est-nb-employees-by-sex-economic-activity-and-establishme

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含99,533个观察值,覆盖26个亚洲国家,时间跨度为2000年至2025年,专注于“按性别、经济活动和机构规模划分的雇员(千人)”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过重新打包以适用于机器学习任务,包括按性别、经济活动和机构规模的细分维度,并提供了数据质量说明和使用示例。

This dataset contains 99,533 observations of Employees data across 26 Asia countries, spanning 2000–2025, covering 1 distinct indicator: Employees by sex, economic activity and establishment size (thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), repackaged for machine learning readiness, with disaggregation dimensions such as sex, economic activity, and establishment size, and includes data quality notes and usage examples.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-eco-est-nb-employees-by-sex-economic-activity-and-establishme 数据集图片
构建方式
该数据集源出于国际劳工组织(ILO)所维护的ILOSTAT中央统计数据库,系全球劳动统计领域最具权威性的数据来源之一。构建过程中,数据经由ILOSTAT REST API接口直接提取,并以亚洲ISO3国家代码为过滤条件筛选出26个亚洲国家之观测记录。原始调查微观数据依据国际劳工统计学家会议(ICLS)所确立的定义进行统一协调与标准化处理,来源信息以source.label字段加以标注,以确保数据之可追溯性与来源透明性。
特点
数据集涵盖99533条观测记录,覆盖26个亚洲国家,时间跨度为2000年至2025年,包含1项核心指标,即按性别、经济活动及机构规模分类之雇员人数(以千为单位)。数据以年度频率发布,并按照性别维度(总计、男性、女性)进行细分。源数据中同一国家与年份若存在多重来源,则采用ILO遴选之最佳来源。数据质量标注体系完备,对暂定值、不可靠值及序列断点均有明确标识。
使用方法
研究人员可通过HuggingFace datasets库以load_dataset()函数直接载入该数据集,并利用to_pandas()方法转换为数据框以便进一步分析。用户可依据ref_area字段筛选特定国家之数据,亦可针对单一指标按时间排序以构建时间序列并可视化。此外,通过透视表操作可将数据整理为国家与年份之交叉矩阵,便于开展跨国比较与趋势分析。该数据集适用于表格分类、表格回归及时间序列预测等多种机器学习任务。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与可比性。ILOSTAT作为其核心统计数据库,依托各国劳动力调查、住户收入调查及行政记录,构建了覆盖200余个经济体的劳动指标体 系。本数据集由Electric Sheep Asia于2025年重新封装发布,源自ILOSTAT REST API,聚焦亚洲26国2000至2025年间按性别、经济活动及机构规模分列的雇员数据,共计99,533条观测。该数据集为探究亚洲劳动力市场结构变迁、性别就业差异及企业规模与就业吸纳能力之间的关系提供了关键量化基础,对劳动经济学与区域发展研究具有重要参考价值。
当前挑战
该数据集所涉领域面临多重挑战。在领域问题层面,亚洲各国劳动统计体系成熟度参差不齐,非正规就业普遍、自雇与家庭帮工边界模糊,致使雇员定义在跨国比较中难以完全统一,机构规模分类亦缺乏全球一致标准,制约了跨境对标分析的可靠性。在构建过程中,数据源自各国调查与行政记录,抽样设计、覆盖范围及调查时点存在显著异质性,部分国家序列中断或年份缺失,加之ILO虽以'最佳来源'原则进行调和,但方法学修订、观测状态标记(如'不可靠')及来源切换所导致的序列断裂仍普遍存在,对时间序列建模与因果推断构成实质性障碍。
常用场景
经典使用场景
在劳动经济学与就业结构分析的领域中,该数据集凭借其按性别、经济活动分支及企业规模三维交叉的雇员人数统计,成为刻画亚洲劳动力市场分层特征的核心素材。经典使用场景包括构建国别面板数据以追踪就业结构的时序演变,或通过性别维度剖析不同经济部门中男女雇员比例的差异,进而揭示产业结构转型对性别就业格局的重塑作用。
解决学术问题
该数据集有效回应了劳动经济学中关于就业性别隔离与企业规模效应交互影响的学术追问。依托其涵盖26个亚洲国家、时间跨度逾二十五年的观测记录,研究者得以检验企业规模扩大是否伴随女性就业占比的系统性变化,并借助标准化分类框架克服跨国比较中统计口径不一致的固有障碍,为理解亚洲非正规经济部门的性别就业动态提供了可验证的数据基础。
衍生相关工作
围绕该数据集,已有研究将其与ILOSTAT其他指标如工资水平、工时数据相链接,构建多维就业质量指数,并催生了一系列针对亚洲性别就业差距的国别比较分析。部分机器学习工作以该表格数据为基准,训练预测模型以估计缺失年份的就业分布,亦有学者将其作为时间序列预测任务的基准数据集,评估不同算法对就业趋势的外推能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务