遇见数据集

electricsheepeurope/europe-ilo-cld-xsna-sex-age-rt-share-of-children-engaged-in-economic-activity-by

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于欧洲22个国家儿童劳动数据的759个观测值,时间跨度为1995年至2025年,涵盖1个独特指标:按性别和年龄划分的从事经济活动的儿童比例(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接获取,并经过欧洲国家ISO3代码过滤。数据集包括多个维度,如国家、年份、性别(总计、男性、女性)和年龄分类,并提供了数据质量说明,例如年度频率、最佳来源选择和分解列的非空条件。数据集旨在支持表格分类、回归和时间序列预测等任务,适用于研究欧洲儿童劳动趋势。

This dataset contains 759 observations on child labor data across 22 European countries, covering the period from 1995 to 2025, and includes one unique indicator: the percentage of children engaged in economic activities disaggregated by gender and age. The data is directly retrieved from the ILOSTAT database of the International Labour Organization (ILO) via REST API, and filtered using ISO3 codes of European countries. The dataset includes multiple dimensions such as country, year, gender (total, male, female) and age group, and provides data quality descriptions including annual frequency, optimal source selection and non-null conditions for disaggregated columns. This dataset is designed to support tasks such as table classification, regression and time series forecasting, and is suitable for research on child labor trends in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-cld-xsna-sex-age-rt-share-of-children-engaged-in-economic-activity-by 数据集图片
构建方式
该数据集由Electric Sheep Europe基于ILOSTAT官方REST API直接获取原始数据,过滤至欧洲22个国家的ISO3编码区域后整理而成。ILOSTAT作为国际劳工组织的核心统计数据库,依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行标准化处理,确保指标口径的统一性与跨国可比性。数据集以Parquet格式打包,保留了原始来源标签以追踪数据溯源,共收录759条观测记录,覆盖1995年至2025年的时间跨度,聚焦于儿童经济参与率的单一核心指标。
特点
此数据集以精细的维度划分为显著特点,按性别(总计、男性、女性)和年龄组(如15-17岁)进行分层统计,提供了多维度的比较视角。数据来源的透明性是其关键优势,每条记录均标注了具体调查类型(如劳动力调查)及观测状态(如临时性、不可靠性),便于研究者评估数据质量。此外,数据集整合了来自22个欧洲国家的长时段序列,最密集的国家(如斯洛文尼亚、匈牙利)拥有超过80个时点观测,为时间序列分析和跨国比较研究奠定了坚实基础。
使用方法
使用者可通过HuggingFace的datasets库便捷加载数据,只需运行`load_dataset("electricsheepeurope/europe-ilo-cld-xsna-sex-age-rt-share-of-children-engaged-in-economic-activity-by")`即可获取训练集。加载后可将数据转换为pandas DataFrame进行分析,支持按国家编码筛选特定区域数据,或针对特定指标(如CLD_XSNA_SEX_AGE_RT)进行时间序列可视化。高级用户还可通过透视表操作将数据重塑为国家×年份矩阵,便于进行面板数据分析或构建预测模型。数据以Parquet格式存储,兼顾了存储效率与读取速度。
背景与挑战
背景概述
童工问题作为全球劳动市场治理的核心议题之一,长期受到国际劳工组织(ILO)及各国政策制定者的密切关注。该数据集由Electric Sheep Europe于2025年基于ILOSTAT数据库重新整理发布,聚焦22个欧洲国家1995至2025年间儿童参与经济活动的性别与年龄分布比例,共计759条观测记录。ILOSTAT作为ILO的中央统计数据库,以国际劳动统计学家会议(ICLS)定义为基础,对各国劳动力调查微观数据进行统一协调,为研究欧洲区域童工现象的时空演变提供了标准化、可纵向比较的数据基础。该数据集弥补了欧洲层面儿童劳动长期序列数据的结构化整合空白,有助于推动劳动经济学、发展社会学和公共政策领域对童工驱动因素、性别差异及治理效果的实证分析。
当前挑战
该数据集面临的挑战主要体现在三个方面:首先,在领域问题层面,儿童经济活动的界定在不同国家法律与文化语境中存在差异,ILO虽通过ICLS统一标准,但各国调查问卷设计与执行口径的细微偏差仍可能导致统计可比性下降,进而影响跨区域推断的稳健性。其次,数据构建过程中遭遇了来源异构性的难题,数据源涵盖劳动力调查、家庭收入调查及行政记录,不同来源的抽样方案、误差结构与时间频率各异,ILO虽选择'最佳来源'进行插补,但断点、标记不可靠(如obs_status为'U')及方法修订(如note_indicator.label所示)等问题依然存在。此外,部分国家观测年份稀疏(如波兰仅2021-2025年),短时间序列限制了对长期趋势分析及因果推断的应用效能。
常用场景
经典使用场景
在欧洲劳工统计的宏大版图中,童工问题始终是关乎社会公正与儿童权益的核心议题。该数据集聚焦于1995至2025年间22个欧洲国家儿童参与经济活动的比例,按性别与年龄进行细致分层,提供了759条高质量观测记录。其最常见的应用方式是基于ILOSTAT权威指标“CLD_XSNA_SEX_AGE_RT”构建时间序列模型,利用Python中的pandas库灵活按国家、性别或年龄段筛选数据,进而绘制趋势曲线以揭示童工现象的长期演变规律。研究者亦可将其重塑为国家-年份矩阵,通过面板数据分析比较不同政策环境下的差异,成为评估欧洲各国儿童劳动保护成效的基础性工具。
解决学术问题
该数据集精准回应了发展经济学与劳动社会学中一个艰深命题:如何在宏观统计中准确刻画童工这一敏感且隐蔽的社会现象。由于缺乏标准化、跨国的长时序数据,以往研究常受限于个案调查或短期截面分析,难以捕捉童工率随经济发展、立法变革及教育普及而波动的动态机制。此数据集通过ILO官方公布的统一方法论,消除了国别调查口径不一致的障碍,使学者得以量化分析欧盟扩大、社会保障制度改革、义务教育年限延长等政策冲击对童工现象的抑制效果,为证实“收入效应”与“替代效应”的经典假说提供了翔实的数据支撑。
衍生相关工作
围绕这一核心数据集,学界已衍生出多项具有典范意义的延展性研究。一方面,有学者将其与欧洲各国GDP增长率、教育公共支出占预算比重等宏观经济指标进行匹配融合,构建因果推断模型以识别经济发展对童工现象的缓解路径。另一方面,基于其按性别分列的特性,涌现出大量探讨性别不平等与童工参与率关联性的比较社会学实证论文。此外,在计算社会科学领域,该数据集被用作时间序列预测模型(如Prophet、LSTM)的基准测试素材,检验算法对低频、间歇性社会指标的预报能力。这些衍生工作共同构建了一个围绕童工问题的跨学科知识网络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务