遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-age-jbc-nb-employees-by-sex-age-and-type-of-job-contract-thou

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲30个国家从1996年至2025年的员工数据,共有44,374个观测值,覆盖一个核心指标:按性别、年龄和劳动合同类型划分的员工数量(以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过处理,适用于表格分类、回归和时间序列预测等机器学习任务。数据集包括多个维度,如国家代码、性别、年龄分类、合同类型、观测年份和数值等,并提供了数据来源、质量说明和使用代码示例。

This dataset contains 44,374 observations of employee data across 30 Asia countries, spanning from 1996 to 2025, covering one key indicator: Employees by sex, age and type of job contract (in thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and processed for machine learning applications, including tabular classification, regression, and time-series forecasting. It includes dimensions such as country codes, sex, age classification, contract type, observation year, and values, along with source information, quality caveats, and usage code examples.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-age-jbc-nb-employees-by-sex-age-and-type-of-job-contract-thou 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口直接获取指标EES_TEES_SEX_AGE_JBC_NB的原始数据,并依据ISO3国家代码筛选出亚洲地区30个国家的记录。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查等微观数据进行标准化协调,确保跨国可比性。数据经Electric Sheep Asia重新打包为Parquet格式,保留来源标签以实现可追溯性,最终形成涵盖1996至2025年的44,374条观测。
特点
数据集聚焦亚洲地区雇员按性别、年龄及工作合同类型分类的就业规模(千人),涵盖30个国家,时间跨度近三十年。其核心特征在于多维度分解:性别维度包括总计、男性、女性及其他;年龄与合同类型通过classif1和classif2字段提供细分。数据以年度频率发布,包含来源、指标、观测值及质量标志等元数据,支持表格分类、回归及时间序列预测任务,体现了ILO统计体系的规范性与亚洲劳动力市场的异质性。
使用方法
研究人员可通过HuggingFace的datasets库调用load_dataset函数加载数据集,并转换为Pandas DataFrame进行灵活分析。典型操作包括按国家代码(如IDN)筛选子集、提取单一指标的时间序列以绘制趋势图,或利用pivot_table构建国家×年份矩阵以比较跨国差异。数据亦可直接用于机器学习建模,如预测就业合同类型分布或分析性别年龄组差异。使用时应关注obs_status标志及来源注释,以评估数据可靠性。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳工统计标准的制定与数据收集,其ILOSTAT数据库是劳动经济学领域最具权威性的跨国数据源之一。该数据集由Electric Sheep Asia于2025年重新封装发布,涵盖1996至2025年间30个亚洲国家44,374条观测记录,聚焦于按性别、年龄及就业合同类型分类的雇员人数。数据集源自各国劳动力调查等微观数据,经ILO按照国际劳工统计学家会议定义进行标准化调和,为探究亚洲劳动力市场结构变迁、非标准就业形态演变以及性别与年龄维度的就业差异提供了坚实的实证基础。
当前挑战
该数据集所面临的挑战具有多重维度。在领域问题层面,亚洲各国劳动力调查在抽样设计、问卷内容及合同类型定义上存在显著异质性,合同制就业与非正式就业的边界模糊,且部分国家数据存在序列中断或观测状态标记为“不可靠”的情形,这为跨国比较和时间序列分析带来了严峻的方法论挑战。在构建过程中,ILO虽采用统一分类标准进行事后调和,但原始数据收集频率不一、缺失值普遍存在,加之部分国家仅提供汇总数据而非微观记录,使得性别与年龄交叉分类下的细粒度分析受限,数据的完整性与一致性难以得到充分保障。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉研究中,该数据集最经典的使用场景在于刻画亚洲地区不同性别与年龄组别劳动者在劳动合同类型上的分布结构与动态演进。研究者常依托其长时段、跨国别的面板数据特征,构建按性别、年龄及合同类型(如长期合同、短期合同、临时性工作等)交叉分类的就业矩阵,进而通过时间序列分解或面板回归模型,揭示正规就业与非正规就业在性别与代际间的差异化路径。此类分析为理解亚洲劳动力市场分层机制提供了不可或缺的量化基础。
解决学术问题
该数据集有效回应了劳动统计领域长期存在的若干学术难题,包括跨国可比口径下非标准就业测量的不一致性、性别与年龄双重维度下合同类型数据缺失所导致的结构性盲区,以及亚洲地区非正规就业规模估算的偏差问题。借助国际劳工组织统一协调的统计定义与来源标注体系,该数据集使研究者得以在一致框架内检验职业隔离假说、生命周期劳动供给理论及制度变迁对合同形态的影响,从而显著提升了相关实证研究的内部效度与外部可推广性。
衍生相关工作
围绕该数据集及其源指标,学术界与数据科学社区衍生出一系列经典工作。劳动经济学者利用其构建亚洲非正规就业指数,并在此基础上发表多篇关于合同类型与工资溢价的跨国比较研究;机器学习研究者则将其作为表格回归与时间序列预测的基准数据集,用以检验梯度提升与深度学习模型在稀疏面板数据上的表现。此外,Electric Sheep Asia的标准化封装进一步推动了可复现研究实践,催生了若干数据论文与技术报告,拓展了该数据集在可解释人工智能与因果推断领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务