遇见数据集

electricsheepeurope/europe-ilo-emp-5tru-sex-age-nb-time-related-underemployment-by-sex-and-age-19th-i

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于“按性别和年龄划分的时间相关就业不足——第19届国际劳工统计学家会议(千)”的数据,覆盖33个欧洲国家,时间跨度为2014年至2025年。数据来自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过REST API获取并过滤为欧洲国家代码。数据集包含4,109个观察值,涉及1个独特指标(EMP_5TRU_SEX_AGE_NB),提供按性别和年龄的细分。数据结构包括国家代码、国家名称、来源代码、指标代码、性别分类、年龄分类、观察年份、观察值、观察状态和相关注释等列。数据为年度频率,并经过ILO的协调处理,以确保定义的一致性。数据集适用于表格分类、表格回归和时间序列预测等任务,并遵循cc-by-4.0许可证。

This dataset contains data on Time-related underemployment by sex and age -- 19th ICLS (thousands) across 33 European countries from 2014 to 2025. The data is sourced from the International Labour Organization (ILO)s central statistics database, ILOSTAT, retrieved via REST API and filtered to European country codes. It includes 4,109 observations with one distinct indicator (EMP_5TRU_SEX_AGE_NB), providing breakdowns by sex and age. The schema comprises columns such as country code, country name, source code, indicator code, sex classification, age classification, observation year, observed value, observation status, and related notes. The data is annual frequency and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. It is suitable for tabular classification, tabular regression, and time-series forecasting tasks, and is released under the cc-by-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-5tru-sex-age-nb-time-related-underemployment-by-sex-and-age-19th-i 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Europe团队重新封装整合。数据通过调用ILOSTAT REST API接口,获取了与时间相关的不充分就业指标(EMP_5TRU_SEX_AGE_NB)的原始观测值,并依据ISO 3166-1 alpha-3国家代码筛选出覆盖33个欧洲国家的子集。团队对原始数据进行标准化处理,统一模式为Parquet格式,并保留了包括性别、年龄、来源、观测状态在内的完整元数据字段,确保数据的可追溯性和国际可比性。
特点
本数据集汇聚了2014年至2025年间33个欧洲国家共计4109条时间相关不充分就业观测记录,展现了欧洲劳动力市场的独特微观图景。其核心特色在于多维度数据分层,涵盖按性别(总、男、女)及年龄等分类变量的细致拆解,以及观测值质量标记(如可靠性、序列中断注释)。数据集还整合了来源标签、指标定义等上下文信息,为研究者提供了丰富的辅助分析维度,便于开展跨国别、跨时期的比较研究与时间序列建模。
使用方法
数据集的使用极为便捷,适用于时间序列预测、分类与回归等任务。用户可通过HuggingFace Datasets库的load_dataset函数一键加载,并转换为Pandas DataFrame进行后续分析。推荐的操作包括按国家代码过滤单一国别数据、针对特定指标进行时间序列可视化,以及通过数据透视表构建国家×年份的观测矩阵。开发者可直接利用obs_value字段进行预测模型训练,或借助sex、classif1等字段进行群体细分研究。
背景与挑战
背景概述
在劳动经济学与时间利用研究领域,与时间相关的就业不足(Time-related underemployment)作为衡量劳动力市场闲置产能的关键指标,长期受到国际劳工组织(ILO)的高度关注。该数据集由国际劳工组织统计部门(ILOSTAT)于2025年发布,并由Electric Sheep Europe在HuggingFace平台重新整理封装,聚焦欧洲33个国家在2014至2025年期间、按性别与年龄划分的就业不足数据(依据第19届国际劳动统计学家会议定义)。其核心研究问题在于揭示欧洲区域劳动力隐性失业的时空演化模式,为跨国比较与政策评估提供高粒度统计基础。作为ILOSTAT旗舰指标之一的衍生数据集,它填补了欧洲劳动力市场细分分析中时序一致、按性别与年龄分类的公开数据空缺,对宏观经济建模、社会政策研究及国际可持续发展目标监测具有重要支撑价值。
当前挑战
该数据集面对的首要挑战是解决劳动力隐性闲置的精准量化难题——传统的失业率指标难以捕捉那些希望工作更长时间但受限于市场条件而无法实现的实际工时不足状态,而该指标通过严格定义(如第19届ICLS标准)将这一复杂现象转化为可跨国比较的统计口径,实现了对劳动力市场疲软程度更全面的刻画。构建过程中遭遇的关键挑战包括:多国来源调查数据在调查设计、问卷措辞与抽样框架上的异质性,ILO通过统一数据协调方法(如选择每国每年‘最佳来源’)予以规范;性别与年龄维度的细粒度拆分常因样本量不足导致部分观察值标注为‘不可靠’(Unreliable),数据质量标记体系(如obs_status列)即为应对这一困难而设计;此外,不同调查之间的时序衔接断点(如方法论修订标注为‘Break in series’)亦需通过元数据字段(note_indicator.label)进行显式记录,以保障时间序列分析的可靠性。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,时间相关未充分就业率是衡量劳动力市场闲置程度的关键指标之一。该数据集聚焦于欧洲33个国家2014至2025年间按性别与年龄分层的时间相关未充分就业数据,为跨国比较与时间序列分析提供了标准化、高质量的观测基础。研究者可借此构建面板数据模型,精准刻画不同国家、性别及年龄组在未充分就业水平上的演变轨迹与结构性差异。经典使用场景包括利用线性混合效应模型或固定效应模型识别经济周期、制度政策对未充分就业的冲击效应,亦可结合聚类分析探索欧洲各国劳动力市场的异质性模式,从而为理解欧洲一体化背景下劳动力市场的动态变迁提供实证支撑。
衍生相关工作
该数据集是ILOSTAT庞大指标体系的子集,其衍生工作主要围绕劳工统计的协调化与自动化展开。Electric Sheep Europe的重新包装工作展示了如何将官方API原始数据转化为机器学习友好的格式,这一流程启发了后续类似数据管道的搭建,例如将更多ILOSTAT指标按统一Schema打包为时间序列数据集。在学术层面,基于此数据的相关研究可能将未充分就业与失业率、劳动力参与率等指标联合分析,构建劳工市场闲置的综合指数,或利用性别与年龄分层特征训练预测模型,探索未充分就业的社会决定因素。此外,该数据集的引用规范与可复现性实践——提供完整的HuggingFace加载示例及BibTeX引用——为开放科学背景下的劳动数据共享树立了典范,推动了跨国时间序列经济社会数据的标准化与可发现性。
数据集最近研究
最新研究方向
在欧洲劳动力市场结构性变革的背景下,基于ILOSTAT官方数据重构的时序性就业不足数据集,正成为精准刻画非充分就业形态异质性的关键工具。该资源覆盖2014至2025年33个欧洲国家的4,109条观测值,按性别与年龄维度细化分类,并遵循第19届国际劳动统计学家会议(ICLS)的最新定义框架,为跨时期、跨国别的比较研究提供了规范化基础。当前研究前沿聚焦于利用该时间序列数据构建劳动力利用不足的动态监测模型,结合性别差异与代际更迭视角,解析新冠疫情后欧洲弹性就业扩张与边缘劳动群体脆弱性之间的复杂关联。该数据集的发布推动了劳动经济学向精细化的微观宏观衔接分析发展,尤其支持了关于工时匹配效率、隐性失业以及制度性就业包容度的实证评估,对于欧盟实施《欧洲就业权利宣言》与监测可持续发展目标(SDG)体面工作指标具有显著的政策支撑价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务