遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-eco-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲34个国家在2003年至2025年期间的非正规经济数据,共有32,856个观测值,聚焦于一个核心指标:按性别和经济活动划分的非正规部门就业占比(%)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API直接获取并过滤至欧洲国家。数据集涵盖了国家代码、指标代码、性别分类(总计、男性、女性)、年份、观测值及其状态标志等字段,并提供了数据质量说明,如年度频率、最佳来源选择原则等。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究欧洲劳动力市场非正规就业情况提供机器学习就绪的数据支持。

This dataset contains 32,856 observations of informal economy data across 34 European countries, spanning 2003 to 2025, focusing on one key indicator: the share of employment outside the formal sector by sex and economic activity (%). The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved directly via API and filtered to European country codes. It includes fields such as country codes, indicator codes, sex disaggregation (total, male, female), year, observed values, and status flags, with notes on data quality like annual frequency and best-source selection. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, providing ML-ready data for studying informal employment in European labor markets.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-eco-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
在国际劳工组织统计数据库的框架下,该数据集通过ILOSTAT REST API直接提取原始指标数据,并筛选欧洲ISO3国家代码以限定地理范围。原始调查微数据依照国际劳工统计学家会议定义进行标准化调和,来源信息在source.label列中标注以便溯源。整套数据经Electric Sheep Europe重新打包为Parquet格式发布于HuggingFace平台,覆盖34个欧洲国家、2003至2025年共32856条观测记录,构成单一非正规部门就业占比指标的长时间序列面板。
特点
数据集聚焦于非正规经济领域,以非正规部门就业占比为核心指标,按性别与经济活动部门双重维度进行分解。数据结构涵盖国家代码、来源编码、指标标识、性别分类及时间与观测值等字段,并提供观测状态标志和分类注释以保证数据质量。年度频率的时间序列跨越二十余年,空间上覆盖欧洲主要经济体,样本量逾三万条,为比较劳动经济学与非正规就业研究提供了层次分明的结构化基础。
使用方法
研究人员可借助datasets库的load_dataset接口快速加载该数据集,并转换为Pandas数据框进行后续分析。通过布尔索引可筛选特定国家或性别子样本,利用排序与绘图函数可生成单一指标的时间趋势图,亦可使用透视表功能将数据重塑为国家与年份的二维矩阵。指标代码与分类标签的完整注释支持精细化筛选,便于开展跨国比较、面板回归或时间序列预测等定量研究。
背景与挑战
背景概述
非正规经济部门就业规模的测度,历来是劳动经济学与发展经济学关注的焦点议题。国际劳工组织(ILO)自二十世纪七十年代起持续推动非正规就业统计的标准化工作,其ILOSTAT数据库整合了各国劳动力调查、家庭收入调查及行政记录等多源数据,依据国际劳工统计学家会议(ICLS)定义进行跨国调和。本数据集由Electric Sheep Europe于2026年从ILOSTAT REST API抽取并重新封装,覆盖34个欧洲国家、2003至2025年间共计32,856条观测记录,以性别与经济 activity 为分类维度,呈现正规部门之外就业占比的长期演变。该数据集为比较劳动制度、非正规经济规模及其性别差异提供了精细化的面板数据基础。
当前挑战
非正规就业的界定与测度本身即构成该领域长期存在的核心挑战,不同国家对“非正规部门”的操作化定义存在显著差异,ILO虽以ICLS标准加以调和,但各国调查工具、抽样框架与数据收集年份的不一致仍导致跨国可比性受限。数据集构建过程中,原始微数据向统一指标体系的转换需依赖来源标记与注释字段追溯方法变更,诸如“系列断裂”“不可靠”等观测状态提示数据质量在时空维度上并不均匀。此外,性别与经济 activity 交叉分类下部分国家年份存在数据缺失,给时序建模与因果推断带来结构性困难,要求研究者在利用该数据时必须审慎处理异质性与缺失机制。
常用场景
经典使用场景
在非正规经济就业测度的实证研究中,该数据集通常被视为刻画欧洲劳动力市场非正规化程度的标准化面板数据源。研究者依托其按性别与经济部门细分的时间序列结构,构建跨国比较分析框架,用于量化非正规就业比例的演变轨迹,并借助面板回归、时间序列分解等方法识别其长期趋势与周期性波动。数据涵盖三十四个欧洲国家、二〇〇三至二〇二五年间的三万余条观测,为宏观劳动经济学与区域发展研究提供了结构清晰、口径统一的基准素材。
解决学术问题
该数据集主要回应了非正规就业跨国比较中长期存在的数据碎片化与口径不一致问题。通过采用国际劳工组织基于国际劳工统计学家会议定义的协调框架,它将各国差异显著的劳动力调查与家庭收入调查数据统一为可比的指标形式,从而缓解了既有研究因测量标准分歧而难以开展稳健横向比较的困境。其意义在于为检验非正规就业与性别差距、经济结构转型、社会保障覆盖之间的理论假设提供了可靠的经验基础,对发展经济学与劳动社会学均具参考价值。
衍生相关工作
围绕该数据集及国际劳工组织非正规经济系列指标,学界逐步形成了若干延伸性研究脉络。一类工作将非正规就业比例与人均产出、部门结构、教育水平等变量整合,构建跨国面板以探讨非正规性的决定因素;另一类研究则将其与微观家户调查链接,考察非正规就业对收入不平等与贫困代际传递的影响。亦有学者利用该数据校准宏观劳动力市场模型,或将其作为机器学习任务中的目标变量,推动表格数据预测与政策仿真方法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务