遇见数据集

electricsheepasia/asia-ilo-emp-5tru-sex-age-nb-time-related-underemployment-by-sex-and-age-19th-i

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别和年龄划分的时间相关就业不足——第19届ICLS(千计)| 亚洲(ILOSTAT)”,是一个表格型数据集,专注于劳动力统计领域。它包含1,126个观测值,覆盖21个亚洲国家(如韩国、新加坡、日本等),时间跨度为2014年至2025年。数据集的核心指标是“时间相关就业不足”,具体通过ILOSTAT指标代码EMP_5TRU_SEX_AGE_NB表示,该指标按性别(总计、男性、女性)和年龄(15岁及以上)进行细分,单位为千计。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,整合了来自劳动力调查、家庭收入调查等多种数据源。数据通过ILOSTAT REST API获取,并过滤到亚洲国家,使用第19届国际劳工统计学家会议(ICLS)的定义进行标准化处理。数据集的结构包括多个列:国家代码(ref_area)、国家名称(ref_area.label)、数据来源(source和source.label)、指标代码和名称(indicator和indicator.label)、性别细分(sex和sex.label)、年龄分类(classif1和classif1.label)、年份(time)、观测值(obs_value)、观测状态(obs_status和obs_status.label)以及相关注释(note_classif、note_indicator、note_source等)。数据质量方面,为年度频率数据,当同一国家×年份有多个来源时,使用ILO选择的“最佳来源”,细分列仅在指标提供时非空。该数据集适用于表格分类、表格回归和时间序列预测等任务,可用于研究亚洲地区的就业不足趋势。数据集由Electric Sheep Asia重新打包,以方便机器学习研究使用,并遵循cc-by-4.0许可证。

The dataset is titled "Time-related underemployment by sex and age -- 19th ICLS (thousands) | Asia (ILOSTAT)" and is a tabular dataset focused on labour statistics. It contains 1,126 observations across 21 Asia countries (e.g., South Korea, Singapore, Japan), spanning the years 2014 to 2025. The core indicator is "Time-related underemployment," represented by the ILOSTAT indicator code EMP_5TRU_SEX_AGE_NB, which is disaggregated by sex (total, male, female) and age (15 years and above), measured in thousands. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, a leading global source for labour statistics that compiles indicators from various sources such as labour force surveys and household income surveys. Data is pulled directly from the ILOSTAT REST API, filtered to Asia ISO3 country codes, and harmonised using definitions from the 19th International Conference of Labour Statisticians (ICLS). The dataset schema includes columns such as country code (ref_area), country name (ref_area.label), source information (source and source.label), indicator code and name (indicator and indicator.label), sex disaggregation (sex and sex.label), age classification (classif1 and classif1.label), year (time), observed value (obs_value), observation status (obs_status and obs_status.label), and related notes (note_classif, note_indicator, note_source, etc.). In terms of data quality, it is annual frequency data; when multiple sources exist for the same country×year, the ILO-selected best source is used, and disaggregation columns are non-null only when the indicator publishes that breakdown. This dataset is suitable for tasks like tabular classification, tabular regression, and time-series forecasting, enabling research on underemployment trends in Asia. It has been repackaged by Electric Sheep Asia for machine learning readiness and is released under the cc-by-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-5tru-sex-age-nb-time-related-underemployment-by-sex-and-age-19th-i 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下核心统计数据库ILOSTAT,聚焦于亚洲地区按性别与年龄划分的与时间相关的就业不足指标(第19届ICLS标准,单位:千人)。数据通过ILOSTAT的REST API接口直接抽取,筛选出21个亚洲国家的ISO3代码,并利用ICLS定义对原始调查微观数据进行标准化处理。数据集由Electric Sheep Asia团队重新封装,以Parquet格式发布,确保研究人员能够通过load_dataset()方法迅速调用,共计收录1126条观测记录,时间跨度覆盖2014年至2025年。
使用方法
使用该数据集极为便捷,可通过Hugging Face的datasets库中的load_dataset函数一键加载,并直接转换为Pandas DataFrame进行后续分析。用户可依据国家代码(ref_area)筛选特定国家的时间序列,或利用指标代码对obs_value进行透视,构建国家×年份的矩阵以供回归或分类任务应用。数据集本身支持时间序列预测与表格分类/回归任务,其结构化的分类变量(sex、classif1)可自然融入特征工程,便于在机器学习工作流中处理劳动经济学相关预测问题。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经由Electric Sheep Asia团队封装于HuggingFace平台。数据源自ILO核心统计数据库ILOSTAT,涵盖2014至2025年间亚洲21个国家的1,126条观测记录,聚焦于“与时间相关的不充分就业”指标,并依据第19届国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据的核心研究问题在于揭示亚洲地区劳动力市场中劳动者工作时间不足的规模与结构特征,通过性别、年龄等维度进行细粒度分解,为劳动经济学、发展经济学及国际比较研究提供了关键数据支撑。ILOSTAT作为全球劳动统计的权威来源,其数据被广泛用于联合国可持续发展目标(SDGs)中的体面工作指标监测,该数据集对理解亚洲新兴经济体与非正规就业形态的演变具有重要的学术与政策价值。
当前挑战
该数据集所解决的领域问题核心在于量化与监测劳动力市场中隐性失业现象,即劳动者虽有工作但工作时长低于其意愿水平的状况,这对于评估就业质量与福利水平至关重要。在数据构建过程中,挑战首先来自跨国家、跨时期数据的一致性与可比性,需调和各国不同调查方法、问卷设计及统计口径之间的差异,ILOSTAT通过ICLS定义进行标准化处理,但数据源中仍存在方法变更或断裂点(如“Break in series”标记)的挑战。其次,数据覆盖范围的局限性显著,21个亚洲国家中部分经济体的观测年份稀疏或数据可靠性标记为“不可靠”,导致样本不均衡与潜在偏差。此外,多源数据融合时需处理同一国家—年份组合下多个来源的选择问题,仅保留ILO认定的“最佳来源”,这一决策可能引入信息损失。最后,时间序列的年度频率限制了对季节性波动与短期经济冲击的捕捉能力,而性别与年龄等分类维度的非完全覆盖进一步提高了分析模型的复杂性。
常用场景
经典使用场景
该数据集聚焦于亚洲21个国家2014至2025年间按性别与年龄划分的与时间相关的就业不足情况,涵盖1126条观测记录。在劳动经济学与社会统计学领域,研究者常将其作为面板数据,用于分析亚洲各国劳动力市场中就业不足的时空演变特征。通过按性别与年龄分层的数据结构,学者能够深入探讨不同人口群体在非充分就业状态下的异质性表现,例如青年与成年劳动者、男性与女性在就业质量上的差异。此外,该数据集支持时间序列分析,便于构建预测模型以评估经济波动对劳动力市场韧性的影响,成为研究亚洲劳动供给动态的重要实证基础。
解决学术问题
该数据集的核心学术价值在于填补了亚洲区域层面高粒度就业不足数据的空白。传统劳动力研究常受限于宏观总量数据,难以捕捉按人口特征细分的结构性失衡。利用该数据集,学者能够验证性别工资差异与就业不足之间的关联机制,检验年龄分层对劳动力市场摩擦的调节效应,并评估国际劳工组织(ILO)统计标准在跨国比较中的适用性。其所解决的学术问题包括:识别亚洲各国就业不足的长期趋势与周期性模式、量化劳动力市场政策对弱势群体的覆盖效果,以及构建跨文化比较框架以揭示区域经济发展不平衡的微观基础。这些研究对完善发展经济学与劳动社会学理论具有直接影响。
实际应用
在实际应用层面,该数据集为国际组织、国家统计部门及政策智库提供了可靠的数据支撑。例如,国际劳工组织可借助其监测亚洲各国对可持续发展目标(SDGs)中体面劳动指标的达成进度,特别是与时间相关就业不足相关的目标8.5.2。政府劳动部门能够利用性别与年龄分层数据,精准设计针对青年失业者或女性劳动力的技能培训与就业促进计划。在商业领域,人力资源咨询机构可结合该数据集进行区域劳动力市场风险评估,指导跨国企业在亚洲的投资选址与用工配置。此外,非政府组织在倡导劳动权益改善时,可引用这些量化证据推动政策改革。
数据集最近研究
最新研究方向
基于ILOSTAT框架的亚洲时间相关不充分就业数据集为区域劳动力市场研究注入了新的活力,尤其在性别与年龄维度上揭示了非典型就业形态的结构性特征。当前前沿方向聚焦于利用该数据集的高频时间序列特性,结合机器学习模型(如LSTM或Transformer)预测亚洲新兴经济体在后疫情时代的就业恢复轨迹,并量化政策干预如灵活用工制度对不充分就业率的动态冲击。此外,该数据集与ILO发布的《世界就业与社会展望》中关于非正规就业与兼职工作的交叉分析形成互补,助力学者深入探讨数字经济条件下零工经济对传统工时统计指标的挑战,为可持续发展目标(SDG 8)中体面劳动的监测提供了精准的区域级实证支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务