遇见数据集

electricsheepasia/asia-ilo-emp-xtru-sex-age-mts-nb-time-related-underemployment-by-sex-age-and-marita

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲地区时间相关就业不足的统计数据集,由国际劳工组织(ILO)的ILOSTAT数据库提供,并由Electric Sheep Asia重新打包发布。数据集包含17,562个观测值,覆盖29个亚洲国家,时间跨度为1996年至2025年。数据聚焦于单一指标“EMP_XTRU_SEX_AGE_MTS_NB”,即按性别、年龄和婚姻状况划分的时间相关就业不足(以千人为单位)。数据集提供了详细的表格数据,包括国家代码、年份、观测值、数据来源、性别分类(总计、男性、女性)、年龄分类、婚姻状况分类以及数据质量标志(如可靠性状态)。数据来源于ILOSTAT的REST API,经过统一处理以符合国际劳工统计学家会议(ICLS)的定义,适用于表格分类、回归和时间序列预测等任务。数据集以CC-BY-4.0许可证发布,旨在支持机器学习和研究应用,特别是针对亚洲劳动力市场的分析。

This dataset is a statistical dataset on time-related underemployment in Asia, provided by the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Asia. It contains 17,562 observations across 29 Asian countries, spanning the years 1996 to 2025. The data focuses on a single indicator EMP_XTRU_SEX_AGE_MTS_NB, which represents time-related underemployment by sex, age, and marital status (in thousands). The dataset provides detailed tabular data including country codes, years, observed values, data sources, sex disaggregation (total, male, female), age classification, marital status classification, and data quality flags (e.g., reliability status). The data is sourced from the ILOSTAT REST API, harmonized according to International Conference of Labour Statisticians (ICLS) definitions, and is suitable for tasks such as tabular classification, regression, and time-series forecasting. Released under the CC-BY-4.0 license, it aims to support machine learning and research applications, particularly for analyzing labor markets in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-xtru-sex-age-mts-nb-time-related-underemployment-by-sex-age-and-marita 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接提取指标EMP_XTRU_SEX_AGE_MTS_NB的原始数据,并依据ISO3国家代码筛选出亚洲地区29个国家的记录。ILOSTAT对各国劳动力调查等微观数据进行统一协调,遵循国际劳工统计学家会议(ICLS)的定义标准,确保跨国可比性。Electric Sheep Asia对提取的数据进行重新封装,规范列名与格式,最终形成涵盖1996至2025年、共17,562条观测的结构化数据集。
特点
数据集聚焦于亚洲地区与时间相关的就业不足现象,覆盖29个国家,时间跨度近三十年,包含17,562条年度观测。数据按性别、年龄和婚姻状况等多维度进行 disaggregation,提供总计、男性、女性等分类。每一条记录包含国家代码、指标代码、观测值及质量标志等字段,便于追溯数据来源与可靠性。数据集以表格形式组织,适用于分类、回归及时间序列预测等任务,并遵循CC-BY-4.0开放许可。
使用方法
研究人员可通过Hugging Face的datasets库以load_dataset()函数加载数据集,并转换为Pandas DataFrame进行灵活分析。例如,可筛选特定国家(如印度尼西亚)的子集,或针对单一指标绘制时间序列趋势图。亦可利用透视表功能将数据重塑为国家与年份的矩阵,便于比较跨国差异。数据集支持直接用于统计建模与机器学习任务,使用时应遵循CC-BY-4.0许可,并同时引用ILO原始来源与Electric Sheep Asia的再封装工作。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与传播,其ILOSTAT数据库是劳动力市场研究的权威基石。在此背景下,Electric Sheep Asia于2025年对ILOSTAT原始数据进行重新封装,构建了涵盖1996至2025年、29个亚洲国家、共计17,562条观测的亚洲时间相关不充分就业数据集。该数据集聚焦于按性别、年龄和婚姻状况分类的就业不足问题,为探究亚洲劳动力市场脆弱性、评估体面劳动目标进展提供了高粒度、长时序的实证基础,对劳动经济学与区域发展研究具有显著支撑价值。
当前挑战
时间相关不充分就业的精准度量本身即构成劳动统计领域的核心难题,其定义依循国际劳工统计学家会议(ICLS)标准,需在各国差异化的调查框架中实现概念对齐与口径统一,这直接关系到跨国比较的有效性。数据集构建过程中,原始微观数据的稀缺性与非连续性、各国劳动力调查方法论的历时修订、婚姻状况与年龄分类的非标准化,均导致序列断裂与观测缺失,而部分观测值因来源可靠性不足被标记为‘不可靠’,进一步加剧了数据质量的不确定性。此外,对于非正式就业普遍、调查能力薄弱的亚洲经济体,抽样偏差与覆盖不足问题尤为突出,使得推断区域就业不足的真实动态面临方法论与实证层面的双重考验。
常用场景
经典使用场景
在劳动经济学与就业研究的宏阔视域下,该数据集最经典的使用场景在于刻画亚洲地区与时间相关的劳动力不充分就业的时空演变轨迹。研究者可借助其涵盖29个亚洲国家、逾17500条观测记录的年度面板数据,按性别、年龄组与婚姻状况等维度进行交叉分层,从而精细识别不同人口群体在就业质量上的脆弱性差异。该数据集亦常被用于构建国别时间序列模型,以揭示经济周期波动、产业结构转型与不充分就业水平之间的动态关联。
实际应用
在政策制定与社会治理层面,该数据集为亚洲各国劳动主管部门、国际发展机构及社会组织提供了量化决策依据。借助分性别、分年龄与婚姻状况的不充分就业数据,政策分析者能够精准定位就业质量洼地,设计面向青年、女性及特定家庭角色群体的就业促进与社会保障干预措施。同时,该数据集可用于监测可持续发展目标中体面劳动相关指标的落实进展,为区域劳动力市场治理提供循证支撑。
衍生相关工作
围绕该数据集及其同源ILOSTAT系列,学界与数据科学社区衍生出若干经典工作。例如,Electric Sheep Asia将其规范化为机器学习就绪的Parquet格式,推动了亚洲劳动数据的可复现研究与自动化分析流程。相关研究进一步将此类面板数据与贸易、移民、教育等数据集进行链接,构建起多维度劳动力市场分析框架,亦有工作利用其时间序列结构开展不充分就业预测建模与政策情景模拟,拓展了劳动统计数据的二次利用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务