遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,主题为工作时间。具体而言,它提供了亚洲24个国家(如菲律宾、柬埔寨、越南等)从1997年至2025年间每个就业人员按性别(总计、男性、女性)、公共/私营部门和城乡划分的平均每周实际工作时间的观测值。数据集共有5,112个观测值,覆盖1个主要指标(HOW_TEMP_SEX_INS_GEO_NB)。数据通过ILOSTAT REST API获取,并经过和谐化处理以符合国际劳工统计学家会议(ICLS)定义。数据集包含多个列,如国家代码、国家名称、数据来源、指标代码、性别分类、分类变量、观测年份、观测值、观测状态等,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并包含数据质量说明,例如使用最佳来源和分类列的非空条件。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、机器学习就绪的数据层。

This dataset contains statistics from the International Labour Organization (ILO) ILOSTAT database on hours of work. Specifically, it provides observations of the mean weekly hours actually worked per employed person, disaggregated by sex (total, male, female), public/private sector, and rural/urban areas, across 24 Asian countries (e.g., Philippines, Cambodia, Vietnam) from 1997 to 2025. The dataset includes 5,112 observations covering one main indicator (HOW_TEMP_SEX_INS_GEO_NB). Data is pulled from the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions. It features columns such as country code, country name, data source, indicator code, sex classification, classification variables, observation year, observed value, observation status, etc., and is suitable for tasks like tabular classification, regression, and time-series forecasting. The data is published at an annual frequency and includes quality caveats, such as the use of the best source and non-null conditions for disaggregation columns. Repackaged by Electric Sheep Asia, it aims to provide a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于亚洲地区平均每周实际工作小时数这一关键劳动指标。数据通过ILOSTAT的REST API接口直接获取,并依据ILO基于国际劳工统计学家会议(ICLS)定义的标准化方法,对原始调查微观数据进行协调与整合,最终筛选出覆盖24个亚洲国家的观测记录。构建流程保障了数据来源的透明性,每个观测值均标注了原始调查来源,便于追溯与验证。
特点
数据集涵盖1997至2025年间5,112条观测,包含性别(男性、女性、总和)、公共/私营部门以及城乡地域等多维细分维度。每个观测条目均提供国家代码、指标代码、观测值及状态标记等丰富元数据,允许研究者按性别、部门或地域进行精细化分析。此外,数据还标记了序列中断等质量备注,以警示潜在的方法论变更,为严谨的时间序列分析奠定了坚实基础。
使用方法
借助HuggingFace的datasets库,研究者可通过一行代码加载整个数据集并转换为Pandas DataFrame,快速开展探索性分析。通过筛选特定国家代码(如IDN),可便捷地聚焦于单一国家的劳动工时趋势。结合时间与观测值列,可绘制指标的时间序列并观察其演进规律。利用透视表功能,还能构建以年份为行、国家为列的矩阵视图,便于进行跨区域横向比较与缺口分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过ILOSTAT数据库整理发布,并由Electric Sheep Asia在HuggingFace平台上重新封装。其核心研究问题聚焦于亚太地区24个国家1997至2025年间按性别、公共/私营部门及城乡区域划分的就业者每周实际平均工时。作为劳动力统计领域的权威数据源,ILOSTAT整合了各国劳动力调查与行政记录,为分析亚洲劳动力市场结构性变化、性别差异以及区域发展不均提供了关键指标。这一数据集填补了亚洲地区高分辨率工时数据的空白,对劳动经济学、国际发展研究及政策制定具有显著影响力。
当前挑战
该数据集所解决的领域挑战在于:亚太地区劳动力市场中,工时数据的长期跨国产出往往因调查方法、统计定义差异而难以直接比较,且缺乏统一的性别与地域维度分层。在构建过程中,面临的挑战包括:从ILOSTAT多源异构数据(如抽样调查与行政记录)中筛选并标准化为年度频率的指标;处理因国家间数据可用性不均衡导致的稀疏性问题(如部分国家仅覆盖数年,而柬埔寨覆盖时间跨度达26年);同步各来源观测状态标志(如‘序列中断’‘暂定值’),确保时间序列的连续性与可比性。此外,不同分类变量(如性别、行业)的缺失值与维度对齐也是关键难点。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中关于亚洲24个国家1997年至2025年间受雇人员每周实际工作小时数的权威统计资料,并依据性别、公共/私营部门及城乡地域进行了精细分层。其经典用途在于支撑劳动经济学领域的跨国比较研究,例如通过时间序列分析与面板数据模型,揭示亚洲各国劳动供给模式的动态演变、性别差异在劳动时长上的固化趋势,以及公共与私营部门间工作强度的结构性分化。
衍生相关工作
围绕该数据集已衍生出多类具有影响力的经典工作,包括利用面板数据分析模型探讨亚洲各国劳动时长收敛性假说的实证研究,以及结合宏观经济变量(如GDP增长率、失业率)构建的劳动时长预测模型。此外,基于性别与部门维度的结构性分解方法被广泛用于量化劳动时长变迁的驱动因素,如女性劳动参与率上升对总体工时的贡献度。这些工作不仅推动了劳动经济学方法论的发展,也为后续研究者提供了可复用的基准分析框架与对照结果。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区劳动者实际周均工作时间的性别、部门及城乡差异,为劳动经济学与可持续发展研究提供了高粒度的时间序列数据。在劳动时间与工作质量议题备受关注的当下,研究者可借助该数据集追踪后疫情时代亚洲多国工时模式的结构性变迁,剖析非正规就业、性别工资差距及区域劳动力市场韧性等前沿问题。此外,结合ILOSTAT的标准化统计框架,数据为跨国比较与政策模拟提供了可靠基础,对评估《2030年可持续发展议程》中体面劳动目标的实现进程具有重要实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务