遇见数据集

electricsheepeurope/europe-ilo-emp-xtru-sex-edu-mts-nb-time-related-underemployment-by-sex-education-and

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含13,202个观测值,涉及18个欧洲国家从1991年至2025年的时间相关就业不足数据,按性别、教育程度和婚姻状况细分(单位:千人)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Europe重新打包,以提供机器学习就绪的格式。数据集涵盖一个核心指标(EMP_XTRU_SEX_EDU_MTS_NB),包含国家代码、年份、观测值、数据来源、分类变量(如性别、教育、婚姻状况)和质量标志等列。适用于表格分类、回归和时间序列预测任务,数据以年度频率提供,并经过ILO的标准化处理以确保国际可比性。

This dataset contains 13,202 observations of Time-related underemployment data across 18 Europe countries, spanning 1991 to 2025, disaggregated by sex, education, and marital status (in thousands). Sourced from the International Labour Organization (ILO) ILOSTAT database and repackaged by Electric Sheep Europe for ML-ready use. It includes one core indicator (EMP_XTRU_SEX_EDU_MTS_NB) with columns for country codes, year, observed values, data sources, classification variables (e.g., sex, education, marital status), and quality flags. Suitable for tabular classification, regression, and time-series forecasting tasks, with annual frequency data harmonized by ILO for international comparability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-xtru-sex-edu-mts-nb-time-related-underemployment-by-sex-education-and 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其官方REST API接口直接获取指标EMP_XTRU_SEX_EDU_MTS_NB的原始数据,并依据ISO 3166-1 alpha-3国家代码筛选出18个欧洲国家。ILOSTAT采用国际劳工统计学家会议(ICLS)标准定义对各国劳动力调查等微观数据进行统一协调,确保跨国可比性,Electric Sheep Europe在此基础上对字段进行规范化命名与Parquet格式封装,最终形成覆盖1991至2025年的13202条观测记录。
特点
数据集聚焦于欧洲地区与时间相关的就业不足现象,以千人为单位记录按性别、教育程度和婚姻状况交叉分类的统计数值。核心特征包括多维 disaggregation 维度(性别含总计、男、女;教育程度与婚姻状况各含聚合层级),并附有来源标签、观测状态标识及详细的分类注释,便于追溯数据质量与断裂点。年度频率、时间跨度长、国家覆盖面广,为劳动经济学与时序分析提供了结构化的面板数据基础。
使用方法
研究者可通过Hugging Face datasets库以一行代码加载数据并转换为Pandas DataFrame,进而按国家代码(如DEU)筛选子集、按指标代码提取单一时序、或利用透视表构建国家×年份矩阵以开展跨国比较与趋势可视化。数据集亦适用于表格分类、回归及时间序列预测等机器学习任务,使用时需注意聚合层级字段仅在对应细分发布时非空,并应遵循CC BY 4.0许可协议同时引用ILO原始来源与Electric Sheep Europe的再封装工作。
背景与挑战
背景概述
在全球劳动力市场结构性变迁的背景下,国际劳工组织(ILO)长期致力于构建跨国可比的核心劳动统计指标体系。ILOSTAT作为其中央统计数据库,依托各国劳动力调查与行政记录,经国际劳工统计学家会议(ICLS)定义协调后发布。该数据集由Electric Sheep Europe于2025年重新封装,覆盖18个欧洲国家、1991至2025年间13,202条观察记录,聚焦按性别、教育程度和婚姻状况分类的时间相关不充分就业指标,旨在为劳动经济学、社会政策比较研究及欧洲劳动力市场一体化分析提供高质量、可直接加载的机器学习就绪数据层。
当前挑战
时间相关不充分就业的测度本身即面临概念界定与跨国可比性的固有难题,各国对“非自愿兼职”与“工时不足”的统计口径差异显著,且教育、婚姻状况等交叉分类维度加剧了样本稀疏性。该数据集构建过程中,原始调查微数据存在缺失年份、断点及不可靠标记,需依赖ILO最佳来源筛选与调和规则,然而部分国家序列仍出现方法修订导致的断点,加之部分分类维度非全覆盖,对时序预测与跨国面板建模构成实质性挑战。
常用场景
经典使用场景
在劳动经济学与就业统计研究领域,该数据集最经典的使用场景在于构建欧洲多国时间相关不充分就业的时间序列面板,用以刻画1991至2025年间不充分就业规模随经济周期的动态演变。研究者常以性别、教育程度与婚姻状况为分层维度,借助表格回归与时序预测模型,识别不同人口群体在劳动力市场波动中的差异化暴露,进而揭示就业质量的结构性变迁。
解决学术问题
该数据集为劳动经济学中关于不充分就业测量与比较的学术难题提供了可靠的经验基础。其通过ILO统一协调的ICLS定义,缓解了跨国统计口径不一致所导致的比较偏误,使研究者得以检验教育溢出假说、性别分割理论以及婚姻状况对劳动供给约束的调节效应,对理解非自愿兼职与工时不足的成因具有实质性推进意义。
衍生相关工作
围绕该数据集已衍生出若干经典研究路径,包括基于ILOSTAT指标的欧洲不充分就业收敛性分析、性别与教育交互效应的分解研究,以及将本数据与欧盟劳动力调查微观数据链接的验证性工作。Electric Sheep Europe的标准化封装亦促进了可复现研究范式在劳动统计领域的传播,为后续跨国比较与机器学习建模提供了基准数据资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务