遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-age-nb-employment-outside-the-formal-sector-by-sex-and-ag

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲34个国家2003年至2025年期间,按性别和年龄划分的正式部门外就业人数(以千计)的统计数据。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖43,671个观测值,涉及一个核心指标(EMP_PIFL_SEX_AGE_NB)。数据集包含国家代码、年份、性别分类、年龄组、观测值及数据来源注释等信息,适用于表格分类、回归和时间序列预测等任务。

This dataset contains statistics on employment outside the formal sector by sex and age (in thousands) for 34 European countries from 2003 to 2025. Sourced from the International Labour Organizations ILOSTAT database, it includes 43,671 observations and focuses on one key indicator (EMP_PIFL_SEX_AGE_NB). The dataset features country codes, years, sex disaggregation, age groups, observed values, and source notes, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-age-nb-employment-outside-the-formal-sector-by-sex-and-ag 数据集图片
构建方式
该数据集以国际劳工组织(ILO)的ILOSTAT中央统计数据库为数据源,通过其REST API接口直接提取指标EMP_PIFL_SEX_AGE_NB的原始记录,并依据ISO3国家代码筛选出覆盖欧洲34国的观测数据。ILOSTAT基于各国劳动力调查、家庭收入调查及行政记录等微观数据,依照国际劳工统计学家会议(ICLS)标准进行 harmonization 处理,并标记数据来源以确保可追溯性。数据集经Electric Sheep Europe重新打包为Parquet格式,最终形成43,671条记录,涵盖2003至2025年间的非正规部门就业估计。
特点
该数据集聚焦于欧洲非正规经济领域的就业状况,以千人计量单位呈现按性别和年龄组分列的就业人数。其涵盖34个欧洲国家,时间跨度自2003年至2025年,包含43,671条年度观测记录。数据提供多维度的分类变量,如性别(总计、男性、女性)及年龄分类,并附有观测状态标志、来源注释等质量说明字段。所有记录均采用标准化的ISO国家代码和指标编码,便于跨国比较与时间序列分析,同时以CC-BY-4.0许可开放,支持学术研究与政策分析的自由使用。
使用方法
研究者可通过Hugging Face的datasets库以load_dataset函数直接加载该数据集,并转换为Pandas数据框进行后续分析。典型用法包括:筛选特定国家(如df[df['ref_area']=='DEU'])以获取国别时间序列;针对指标EMP_PIFL_SEX_AGE_NB按时间排序后绘制趋势图;或利用pivot_table将数据重塑为国家×年份矩阵,以支持面板数据分析。此外,数据可便捷地应用于表格分类、回归及时间序列预测等机器学习任务,为劳动经济学与非正规就业研究提供结构化基础。
背景与挑战
背景概述
非正规部门就业长期构成全球劳动力市场的重要议题,国际劳工组织(ILO)始终致力于通过标准化统计框架刻画其规模与结构。该数据集由Electric Sheep Europe于2025年基于ILOSTAT官方API重新封装发布,覆盖34个欧洲国家、2003至2025年间43,671条观测,按性别与年龄细分呈现非正规部门外就业人数(千人)。其核心研究问题在于揭示欧洲非正规就业的性别与年龄分布特征及时间演变趋势,为劳动经济学、社会政策比较研究以及可持续发展目标下的体面劳动评估提供高质量的跨国面板数据基础。
当前挑战
在领域问题上,非正规就业的界定与测算长期受制于各国劳动统计口径差异、抽样调查覆盖范围不一致以及非正规经济活动的隐蔽性,跨时跨国可比性面临天然约束。在构建过程中,原始数据需经ILOSTAT依据国际劳工统计学家会议(ICLS)标准进行统一协调,但部分国家年份存在序列中断、数据标识为不可靠或仅含非标准年龄分组,且多源数据合并时须依赖ILO选定的最佳来源,导致部分单元观测值缺失或口径漂移,对时间序列建模与跨国比较分析的稳健性构成显著挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集凭借其覆盖三十四国、跨越二十余载的纵向观测,成为刻画欧洲非正规部门就业规模与结构变迁的核心素材。研究者惯常将其用于按性别与年龄维度进行分组比较,构建国别面板数据,以探究非正规就业在总就业中的占比演变,并借助时间序列建模识别趋势转折与周期性波动,从而揭示不同人口群体在经济周期中的脆弱性差异。
衍生相关工作
围绕该数据集,学界衍生出一系列经典研究,包括非正规就业与贫困陷阱的跨国比较分析、性别差异在非正规部门中的长期演化研究,以及基于合成队列的年龄—时期—世代分解。这些工作不仅拓展了非正规经济理论的经验检验边界,也推动了ILOSTAT指标在机器学习预测与政策模拟中的再利用,形成从描述性统计到因果推断的递进式研究链条。
数据集最近研究
最新研究方向
在全球非正规经济治理与体面劳动议程深化的背景下,该数据集为解析欧洲非正规部门就业的性别与年龄分化提供了长时序、跨国别的微观证据基础。近期研究聚焦于运用其2003至2025年间的四万余条观测,结合机器学习与因果推断方法,刻画非正规就业的周期性波动与结构性变迁,尤其关注青年与女性群体在非正规经济中的脆弱性集聚。相关热点与欧盟应对非典型就业扩张的政策辩论、后疫情时代劳动力市场韧性评估及可持续发展目标第八项进展监测紧密关联。该数据集的贡献在于以标准化跨国面板支撑比较制度分析,为识别非正规就业的决定因素与政策干预效应提供可复现的实证基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务