遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-edu-mts-nb-employees-by-sex-education-and-marital-status-thou

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲国家员工统计数据,具体指标为按性别、教育程度和婚姻状况统计的员工数量(千)。数据集涵盖32个亚洲国家,时间跨度为1970年至2025年,包含113,990条观察记录。数据通过ILOSTAT REST API获取,并经过协调处理,使用国际劳工统计学家会议(ICLS)定义。数据集包含详细的列结构,包括国家代码、数据来源、指标代码、性别分类、教育程度分类、婚姻状况分类、观测年份、观测值及数据质量标志等。该数据集适用于表格分类、表格回归和时间序列预测等任务。

This dataset contains employee statistics from the International Labour Organization (ILO) ILOSTAT database for Asian countries, specifically the indicator Employees by sex, education and marital status (thousands). It covers 32 Asian countries from 1970 to 2025, with 113,990 observations. Data is sourced via the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes detailed column structures such as country codes, data sources, indicator codes, sex classifications, education classifications, marital status classifications, observation years, observed values, and data quality flags. It is suitable for tabular classification, tabular regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-edu-mts-nb-employees-by-sex-education-and-marital-status-thou 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,采用其REST API接口直接抽取指标EES_TEES_SEX_EDU_MTS_NB的原始记录,并依据ISO 3166-1 alpha-3国家代码筛选出32个亚洲国家,时间跨度为1970年至2025年。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行标准化调和,对同一国家-年份存在多源数据的情形选取ILO认定的最佳来源,最终由Electric Sheep Asia重新封装为Parquet格式并发布。
特点
数据集涵盖113,990条观测,涉及32个亚洲国家,时间覆盖1970至2025年,提供按性别、教育程度和婚姻状况分组的雇员数量(千人)指标。数据以年度频率发布,包含国家、来源、指标、性别、分类变量、时间、观测值及各类状态与注释标签等字段,其中性别维度含总计、男性、女性和其他四类取值。部分观测附有数据质量标志,如临时性或不牢靠标记,以及教育水平非标准、序列中断等注释,为溯源与质量控制提供依据。
使用方法
使用者可通过HuggingFace的datasets库加载该数据集,调用load_dataset函数获取数据并转换为Pandas数据框进行后续分析。典型操作包括按ref_area字段筛选特定国家,按indicator字段提取单一指标的时间序列,或利用pivot_table将数据重塑为国家与年份的矩阵形式,以便开展表格分类、回归或时间序列预测等任务。数据集采用CC-BY-4.0许可,使用时需同时引用ILO原始来源与Electric Sheep Asia的再封装工作。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳工统计标准的制定与数据收集,其ILOSTAT数据库是劳动经济学领域最权威的跨国数据源之一。该数据集源自ILOSTAT,由Electric Sheep Asia于2025年重新打包发布,涵盖1970至2025年间32个亚洲国家约11.4万条雇员观测记录,按性别、教育程度和婚姻状况细分。其核心研究问题在于揭示亚洲劳动力市场中就业结构的长期演变,为性别平等、教育回报及家庭劳动供给等议题提供量化基础。该数据集的影响力在于填补了亚洲地区细分劳动统计的空白,支撑实证研究与政策评估。
当前挑战
该数据集所解决的领域问题在于刻画亚洲各国雇员在性别、教育与婚姻状态交叉维度上的分布动态,其挑战在于劳动统计概念(如雇员定义)的跨国可比性受各国调查方法差异影响。构建过程中,ILOSTAT虽采用国际劳工统计学家会议(ICLS)标准进行协调,但原始数据源自各国劳动力调查、家庭收入调查等异质来源,导致观测值存在序列中断、可靠性标记缺失等质量问题。此外,部分国家年份覆盖不连续,细分维度非全员发布,且观测值单位统一为千人但精度不一,这些因素均对趋势分析与跨国比较构成显著障碍。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域,该数据集为探究亚洲地区雇员规模的结构性差异提供了经典的分析样本。其核心使用场景在于,通过性别、受教育程度与婚姻状况的三重分类维度,对32个亚洲国家跨越半个多世纪(1970–2025年)的雇员数据(以千人为单位)进行面板分析与时间序列建模。研究者常以此构建多维分组比较框架,考察不同教育层级和婚姻状态下的男女劳动者参与率之差,或利用其年度频率特征,运用固定效应模型、双重差分法等计量工具,识别亚洲劳动力市场分层与性别不平等的历史演变轨迹。
衍生相关工作
基于此数据集,衍生了一系列聚焦亚洲劳动力市场性别差异与教育回报的经典研究。比较劳动经济学领域涌现出多篇利用该ILO面板数据剖析“教育-婚姻-就业”三元互动机制的论文,并推动了诸如亚洲性别就业差距分解、婚姻溢价与惩罚效应的跨国比较等后续工作。Electric Sheep Asia的标准化封装亦催生了面向机器学习的数据论文与基准,为表格分类、回归与时间序列预测任务提供了可复现的亚洲劳工统计基准。这些工作共同丰富了ILOSTAT数据在可计算社会科学中的方法论积累。
数据集最近研究
最新研究方向
在全球劳动力市场性别平等议题持续升温的背景下,该数据集依托国际劳工组织ILOSTAT权威统计框架,覆盖亚洲32国1970至2025年间逾十一万条雇员观测记录,为解析性别、教育程度与婚姻状况三重维度交织下的就业结构变迁提供了稀缺的跨国面板资源。当前前沿研究聚焦于运用时间序列预测与因果推断方法,考察女性高等教育回报率随婚姻状态异质性变化的长期趋势,以及亚洲经济体在产业结构转型中性别就业差距的收敛与分化机制。该数据集凭借其高粒度分类变量与跨半世纪的时间纵深,有力支撑了可持续发展目标中体面工作议程的量化监测,亦为劳动力经济学与性别研究交叉领域的方法论创新奠定了可复现的数据基座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务