遇见数据集

electricsheepeurope/europe-ilo-emp-xtru-sex-age-mts-nb-time-related-underemployment-by-sex-age-and-marita

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲19个国家从1991年至2025年期间的时间相关就业不足数据,共有24,628条观测记录,涵盖1个具体指标(EMP_XTRU_SEX_AGE_MTS_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过过滤仅包含欧洲国家。数据集提供了按性别、年龄和婚姻状况细分的就业不足统计信息(以千人为单位),包括国家代码、年份、观测值、数据来源和质量标志等字段。数据以年度频率发布,经过ILO根据国际劳工统计学家会议(ICLS)定义进行标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Europe重新打包,采用CC-BY-4.0许可证发布。

This dataset contains 24,628 observations of Time-related underemployment data across 19 Europe countries, spanning 1991–2025, covering 1 distinct indicators. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and filtered to European ISO3 country codes. It provides disaggregated statistics on underemployment by sex, age, and marital status (in thousands), including fields such as country code, year, observed value, data source, and quality flags. The data is annual in frequency, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions, and is suitable for tabular classification, regression, and time-series forecasting tasks. The dataset is repackaged by Electric Sheep Europe and released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-xtru-sex-age-mts-nb-time-related-underemployment-by-sex-age-and-marita 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口(https://rplumber.ilo.org/data/indicator?id=EMP_XTRU_SEX_AGE_MTS_NB)直接抽取原始数据,并依据ISO3国家代码筛选出19个欧洲国家。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查等微观数据进行标准化调和,数据来源在source.label字段中标注以保证可追溯性。最终由Electric Sheep Europe统一架构、封装为Parquet格式并发布。
特点
数据集涵盖1991至2025年19个欧洲国家的24,628条观测记录,聚焦于与时间相关的就业不足指标,并按性别、年龄和婚姻状况进行多维 disaggregation。字段设计规范,包含国家代码、来源、指标编码、性别分类、年龄分类、婚姻状况分类、年份、观测值及状态标志等,且对数据质量附有详细注释(如序列中断、数据不可靠等),便于用户评估数据适用性。
使用方法
用户可通过Hugging Face的datasets库以load_dataset()函数快速加载数据集,并转换为Pandas DataFrame进行灵活分析。典型用法包括:筛选特定国家(如df[df['ref_area']=='DEU'])、提取单一指标的时间序列(如按年份排序后绘图)、或透视生成国家×年份矩阵以观察跨地区趋势。数据集支持表格分类、回归及时间序列预测等任务,适用于劳动经济学研究与政策评估。
背景与挑战
背景概述
在全球劳动力市场监测体系中,国际劳工组织(ILO)始终扮演着核心枢纽角色。其维护的ILOSTAT数据库依托各国劳动力调查与住户收入调查等多元数据来源,系统性地汇编了就业、失业、工资及体面劳动等关键指标。在此背景下,与时间相关的就业不足(Time-related underemployment)作为衡量劳动力未充分利用程度的重要维度,长期受到学界与政策制定者的高度关注。该数据集由Electric Sheep Europe于2025年基于ILOSTAT REST API重新封装发布,覆盖19个欧洲国家、时间跨度自1991年至2025年,共计24,628条观测记录,按性别、年龄及婚姻状况进行多维细分。其核心研究问题在于揭示欧洲地区劳动力时间利用不足的结构性差异与演变趋势,为劳动经济学、社会政策评估及可持续发展目标(SDG)中体面劳动议程的量化分析提供可机读的高质量数据基础。
当前挑战
该数据集所面临的挑战具有双重维度。在领域问题层面,时间相关就业不足的测度本身即存在概念界定与跨国可比性难题——各国对“非自愿兼职”与“工作时间不足”的统计口径受制于国际劳工统计学家会议(ICLS)决议的本地化实施差异,导致同一指标在不同国家间可能蕴含异质性含义,进而影响面板数据回归与时间序列预测的稳健性。在构建过程中,数据来源于ILO精选的“最佳来源”策略,当同一国家-年份存在多源数据时需进行优先级取舍,这虽提升了数据一致性,却也引入来源切换导致的序列断裂风险;此外,部分国家观测年份不连续、分类维度非全覆盖、观测状态标注为“不可靠”或“临时性”的样本均需在建模时谨慎处理。性别、年龄与婚姻状况的多重交叉分类进一步加剧了稀疏性问题,对统计推断与机器学习方法的适用性构成实质性考验。
常用场景
经典使用场景
在劳动经济学与就业政策研究领域,时间相关不充分就业(time-related underemployment)是衡量劳动力市场健康程度的关键指标,特指劳动者工作时间低于其意愿且愿意并能够从事额外工作的状态。该数据集凭借其跨越1991至2025年、覆盖19个欧洲国家、囊括性别与年龄及婚姻状况等多重维度的24,628条观测记录,成为刻画欧洲劳动力市场结构性变迁的经典面板数据来源。研究者常利用其构建国家—年份二维矩阵,通过时间序列分解与面板回归模型,系统考察经济周期波动、产业结构转型及劳动力市场制度改革对不充分就业率的动态影响,并据此开展跨国比较分析。
解决学术问题
该数据集有效回应了劳动经济学中长期存在的若干学术难题,包括不充分就业的性别差异与年龄梯度如何随经济周期演变、婚姻状况作为社会人口学变量对劳动供给不足的调节效应,以及跨国制度差异在解释不充分就业持续性中的作用。其基于国际劳工组织统一协调的ICLS定义与标准化分类框架,显著缓解了以往跨国研究中因指标口径不一致所导致的可比性困境。数据集所标注的来源标签与观测状态标志,亦为评估数据质量与识别序列断点提供了透明依据,从而增强了实证结论的稳健性与可复现性。
衍生相关工作
围绕该数据集及其源出的ILOSTAT体系,学界与政策研究机构衍生出一系列经典工作。国际劳工组织定期发布的《世界就业与社会展望》系列报告,即以这类标准化指标为基石,系统评估全球与区域不充分就业趋势。比较政治经济学文献中,关于劳动力市场灵活化改革与就业质量关系的跨国计量研究,亦频繁援引该数据集进行稳健性检验。在方法论层面,基于该数据开发的面板协整与贝叶斯层次模型,推动了小样本跨国时间序列分析技术的演进,并为后续纳入教育程度、行业分类等更细颗粒度维度的扩展数据集奠定了范式基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务