遇见数据集

electricsheepeurope/europe-ilo-cld-xgpb-sex-age-geo-rt-share-of-children-in-child-labour-general-producti

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、年龄和城乡地区划分的童工儿童比例——欧洲(ILOSTAT)”,是一个表格型数据集,用于分类、回归和时间序列预测任务。它包含1,141个观测值,覆盖17个欧洲国家(如奥地利、瑞士、匈牙利等),时间跨度为1995年至2025年。核心指标为“CLD_XGPB_SEX_AGE_GEO_RT”,表示按性别、年龄和城乡地区划分的童工儿童比例(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过官方API获取,并经过欧洲Electric Sheep项目重新打包和标准化处理。数据集结构包括国家代码、指标代码、性别分类(总计、男性、女性)、年龄分组、城乡类型、观测年份、观测值以及数据质量标志等列。它适用于分析欧洲童工趋势、进行跨国比较或构建机器学习模型。数据集以CC-BY-4.0许可证发布,使用时需引用ILO原始来源和Electric Sheep Europe的重新打包版本。

This dataset, titled "Proportion of Child Laborers by Sex, Age, and Urban-Rural Region – Europe (ILOSTAT)", is a tabular dataset designed for classification, regression, and time series forecasting tasks. It contains 1,141 observations, covering 17 European countries including Austria, Switzerland, Hungary, and others, with a time span ranging from 1995 to 2025. The core indicator is "CLD_XGPB_SEX_AGE_GEO_RT", which denotes the percentage of child laborers categorized by sex, age group, and urban-rural region. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, obtained via its official API, and repackaged and standardized by the European Electric Sheep project. The dataset includes columns such as country code, indicator code, sex category (total, male, female), age group, urban-rural type, observation year, observed value, and data quality flag. It can be used to analyze trends in child labor in Europe, perform cross-country comparisons, or develop machine learning models. The dataset is released under the CC-BY-4.0 license, and users are required to cite both the original ILO source and the repackaged version by Electric Sheep Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-cld-xgpb-sex-age-geo-rt-share-of-children-in-child-labour-general-producti 数据集图片
构建方式
童工现象是国际劳工组织长期关注的核心议题,精准的统计数据是制定有效政策的基础。该数据集由Electric Sheep Europe从ILOSTAT官方REST API直接拉取,涵盖1995年至2025年间17个欧洲国家的儿童劳动参与率数据。原始数据源自各国劳动力调查、家庭收入调查等微观数据,经ILO依据国际劳工统计学家会议定义进行统一标准化处理。数据经过过滤,仅保留欧洲ISO3国家代码,并通过‘source.label’列明确标注每个观测值的数据来源,确保可追溯性。最终呈现的1,141条观测记录以Parquet格式存储,便于机器学习应用。
特点
该数据集的核心特点在于其精细的多维分类与权威来源。关键指标‘CLD_XGPB_SEX_AGE_GEO_RT’提供了按性别、年龄组及城乡划分的儿童劳动参与比例,其中sex列包含总、男、女三个类别,classif1列则涵盖15-17岁等具体年龄段,classif2列可标识国家或区域范围。17个欧洲国家的覆盖范围横跨三十年,形成了可供时间序列分析的长周期视图。每一观测值附有obs_status标记,用以区分数据质量(如是否可靠),为研究者提供了清晰的数据可信度标识,增强了分析的严谨性。
使用方法
通过Hugging Face Datasets库,用户可一键加载该数据集并转换为Pandas DataFrame进行深入分析。针对单一国家的分析,可通过过滤ref_area列实现;若需观察特定指标的时间趋势,可筛选indicator列并对time列排序后直接绘图。对于跨国家的对比研究,推荐使用pivot_table方法构建以年份为行、国家为列的观测矩阵。此外,sex、classif1等分类列支持用户对数据做更细粒度的切片,以便探究特定人口子群或区域形态下的童工现象演变规律。
背景与挑战
背景概述
童工问题作为全球劳动力市场的痼疾,长期受到国际劳工组织(ILO)的高度关注。该数据集由ILO统计局于2025年通过其ILOSTAT数据库构建,并经Electric Sheep Europe重新封装,聚焦欧洲地区按性别、年龄及城乡划分的儿童劳动参与率。数据涵盖1995至2025年间17个欧洲国家的1141条观测记录,采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一化处理。该数据集为研究欧洲童工现象的时空演变、评估各国劳动政策成效及追踪可持续发展目标(SDGs)中体面工作指标提供了关键量化基础,在劳动经济学、公共政策及社会统计学领域具有重要的实证价值。
当前挑战
数据集所解决的领域挑战在于,欧洲童工现象常被发达经济体表象掩盖,缺乏跨国别的系统性量化工具,该数据通过标准化指标揭示了不同年龄、性别及城乡背景下的劳动参与差异。构建过程中的挑战主要体现在三方面:一是多源异构数据的融合,需整合各国劳动力调查、家庭收入调查及行政记录等不同来源,并通过ILO统一的最佳来源选择机制消除数据冲突;二是时序数据的完整性保障,早期年份(如1995年)的观测稀疏性与部分国家数据频繁缺失(如乌克兰仅2015年记录)增加了分析难度;三是分类维度的复杂性,性别、年龄组及地理区域的交叉分解导致部分格点观测值被标注为不可靠(obs_status = 'U'),需要研究者谨慎处理信噪比问题。
常用场景
经典使用场景
在欧洲社会政策与劳动经济学研究中,该数据集被广泛用于估计不同性别、年龄及城乡区域的儿童劳动参与率,分析其随时间演变的趋势。研究者可基于1,141条观测记录,构建面板数据模型,探究国家间儿童劳动现象的异质性,或结合宏观经济指标,揭示经济发展水平与儿童劳动现象的关联。时间跨度覆盖1995至2025年,为纵向比较提供了坚实的数据基础。
衍生相关工作
该数据集的发布催生了若干衍生性研究成果与工具。基于该数据的时间序列特征,学者开发了预测模型,利用机器学习方法对欧洲各国未来童工率进行推估。另有工作将其与ILO其他劳动指标数据集整合,构建了多维度劳动市场监测体系。Electric Sheep Europe团队对数据的规范化与Parquet格式封装,也启发了针对欧洲社会数据的标准化处理流程,促进了跨数据集的联合分析生态。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲地区儿童劳动参与率的性别、年龄及城乡维度解构,为国际劳工组织(ILO)统计体系下的前沿议题——童工现象的时空演变与结构性差异——提供了关键实证基础。结合近年来全球对可持续发展目标(SDG)第8.7条(消除童工)的加速推进,以及欧盟《2030年反童工战略》等热点政策动向,研究者可利用1995至2025年间17个欧洲国家的1141条观测记录,通过时间序列分析与分类回归模型,揭示经济转型、移民潮与教育普及对童工率的差异化影响。该数据集的精良规范化(CC-BY-4.0许可)与ML就绪格式,显著降低了跨国比较门槛,有望催生基于机器学习的社会指标预警系统,助力政策制定者精准识别高风险地域与年龄组,推动从描述性统计向预测性干预的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务