遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-age-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲33个国家从1994年至2025年的150,663个观测值,聚焦于工作时间主题,具体指标为按性别、年龄和职业划分的就业人员实际平均每周工作时间。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的主要来源,涵盖就业、失业、工资、工作时间、童工、非正规经济、社会保障、职业伤害和可持续发展目标体面工作指标等。数据通过ILOSTAT REST API获取,并过滤到亚洲国家,使用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集包含多维列,如国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、年龄分类、职业分类、观测年份、观测值、观测状态等,支持表格分类、表格回归和时间序列预测等任务。数据以年度频率发布,部分指标可能包含月度或季度序列,但本数据集未包括。当同一国家×年份有多个数据来源时,使用ILO选择的最佳来源。数据由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、机器学习就绪的数据层。

This dataset contains 150,663 observations across 33 Asia countries from 1994 to 2025, focusing on the Hours of work topic, with the specific indicator Mean weekly hours actually worked per employed person by sex, age and occupation. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, the leading global source for labour statistics, covering indicators across employment, unemployment, wages, working time, child labour, informal economy, social protection, occupational injuries, and SDG decent work targets. Data is pulled directly from the ILOSTAT REST API and filtered to Asia ISO3 country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes multi-dimensional columns such as country code, country name, data source, indicator code, indicator name, sex disaggregation, age classification, occupation classification, observation year, observed value, observation status, etc., supporting tasks like tabular classification, tabular regression, and time-series forecasting. Data is published at annual frequency; some indicators may have monthly or quarterly series, which are not included here. When multiple sources exist for the same country×year, the ILO-selected best source is used. The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-age-ocu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
在劳动统计学领域,亚洲地区的工时数据对于评估劳动力市场动态与区域经济发展至关重要。该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Asia团队利用REST API从原始数据接口抽取并精心重封装而成。构建过程中,数据首先被限定为亚洲33个国家的ISO3国家代码,随后依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调标准化,确保跨国可比性。最终数据集包含150,663条观测记录,涵盖1994年至2025年的时间跨度,以结构化的Parquet格式存储,便于机器学习场景下的高效加载。
特点
此数据集的核心特色在于其精细的多维分解结构。不仅提供了按性别(总计、男性、女性、其他)分类的周工时均值,还融入了年龄组与职业技能等级两个分类维度,使得用户能够深入挖掘不同人口与职业群体的劳动时间异质性。数据集收录了源自劳动力调查、家庭收入调查等多元官方渠道的时序数据,并附带了来源标记与数据质量标识(如观测状态是否可靠),增强了研究的可追溯性与透明度。此外,其覆盖的33个亚洲经济体从韩国到阿富汗,横跨不同发展阶段,为比较区域劳动市场提供了宝贵资源。
使用方法
研究人员可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,并转换为Pandas DataFrame进行后续分析。典型用法包括按国家代码过滤单一经济体数据以绘制时间序列趋势,或针对核心指标'每周实际工作小时数'按年份与国别进行透视,生成面板数据结构。用户亦可利用sex、classif1等分类列进行分组聚合,比较不同性别或年龄段群体的工时分布。鉴于数据以年度频率呈现,操作时需注意季节性波动特征的缺失,并优先使用ILO官方标记的'最佳来源'记录以确保分析准确性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年创建,经Electric Sheep Asia团队从ILOSTAT数据库中重新整理并封装,专注于亚洲地区33个国家1994至2025年间按性别、年龄和职业划分的就业人员平均每周实际工作小时数。ILOSTAT作为全球劳动统计的权威来源,其数据源自各国劳动力调查、家庭收入调查及行政记录,并通过国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集的核心研究问题在于揭示亚洲劳动力市场中不同类型劳动者的工作时间分布模式,为劳动经济学、人口统计学及社会政策研究提供细粒度的量化依据。其对相关领域的影响体现在:一方面填补了亚洲区域劳动时间精细化数据的空白,另一方面通过提供标准化的多维分类结构(性别、年龄、职业),支持跨国家、跨时期的比较分析,进而推动发展经济学中关于工作条件、性别平等及人力资本利用的实证研究。
当前挑战
该数据集构建与使用中面临多重挑战。首先,所解决的领域问题涉及亚洲劳动力市场的复杂性:各国在劳动时间统计口径、调查方法及数据质量上存在显著差异,例如部分国家依赖劳动力调查而其他国家使用行政记录,这可能导致可比性问题;同时,因ILO在不同来源中选择“最佳来源”作为代表,可能引入系统性偏差。其次,构建过程中遇到的挑战包括:数据整合需跨越1994至2025年间的多源异构数据,ILOSTAT API中不同国家观测数差异悬殊(如韩国有12,605条而小国仅数百条),导致数据稀疏性;性别、年龄和职业等分类维度存在大量缺失值(仅当指标发布该细分时非空),增加了统计建模的难度;此外,数据标注了“不可靠”(U状态)的观测值需谨慎处理,且未包含月度或季度高频序列,限制了时间序列分析的粒度。
常用场景
经典使用场景
该数据集承载了国际劳工组织(ILO)ILOSTAT数据库中关于亚洲33个国家1994至2025年间劳动者每周实际工作小时数的年度观测值,共计逾15万条记录。其经典使用场景聚焦于劳动经济学领域中的工作时间差异分析,研究者可借助性别、年龄组别以及职业分类等维度,对亚洲各国劳动者的工作时长模式展开横向比较与时序追踪。例如,通过分组聚合与面板数据建模,可以揭示女性与男性在周工时上的结构性差异,或探究青年群体与成年劳动力在工作强度上的分布特征。该数据集的结构化设计使其天然适用于表格分类、回归预测以及时间序列分析任务,为后续的统计推断与机器学习建模提供了干净且标准化的基础。
实际应用
在实际应用层面,该数据集为国际组织、政府机构及私营部门的政策制定与商业决策提供了量化依据。国际劳工组织可据此监控亚洲各国在促进性别平等就业和减少过度劳动方面的进展,为修订劳工标准提供证据支撑。国家统计部门能够利用该数据校准本国劳动力调查结果,识别与其他亚洲经济体之间的差异,从而优化就业政策。此外,跨国企业在进行区域人力成本评估与排班规划时,也可借助周工时数据判断不同国家劳动力市场的活跃程度与合规风险,辅助人力资源战略区域化布局。数据集的公开许可与便捷加载方式进一步降低了应用门槛,加速了从数据到洞察的转化。
衍生相关工作
围绕该数据集所承载的区域劳动统计资源,已衍生出若干具有影响力的扩展性工作与研究脉络。在数据工程层面,Electric Sheep Asia将其与ILOSTAT其他指标(如薪资水平、失业率)进行了跨表关联封装,形成了面向亚洲的统一劳动力数据层,便于多变量联合分析。在学术方面,早期基于类似ILOSTAT工时数据的研究已产出了关于亚洲女性劳动供给的跨国民调论文,以及探讨非正规就业与工作时长关系的计量经济学模型。此外,该数据集作为时序基准,常被用于验证季节性分解算法与动态面板回归工具的性能表现。这些衍生工作不仅深化了对亚洲劳动市场的理解,也为未来结合机器学习进行劳动力行为预测的研究铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务