遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-ocu-ins-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含31,362个观测值,涉及30个亚洲国家,时间跨度为1997年至2025年,覆盖1个独特指标。数据主题为“工作时间”,具体指标是“按性别、职业和公共/私营部门划分的雇员实际平均每周工作小时数”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过处理,仅包含亚洲国家。数据集包括国家代码、年份、观测值、数据来源、性别分组、职业分类、机构部门分类等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 31,362 observations of Hours of work data across 30 Asia countries, spanning 1997 to 2025, covering 1 distinct indicator. The indicator is Mean weekly hours actually worked per employee by sex, occupation and public/private sector. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via API and filtered to Asia countries. It includes columns such as country code, year, observed value, data source, sex disaggregation, occupation classification, and institutional sector classification, and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-ocu-ins-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集由Electric Sheep Asia团队从国际劳工组织(ILO)的ILOSTAT REST API中直接抽取原始指标代码HOW_XEES_SEX_OCU_INS_NB对应的数据,并依据ISO 3166-1 alpha-3代码筛选出亚洲30个国家的时间序列观测值。原始数据源自各国劳动力调查、家庭收支调查及行政记录等,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一标准化处理,最终整合为包含31,362条记录的表格数据集,以Parquet格式封装并发布于HuggingFace平台。
特点
数据集聚焦于亚洲区域,覆盖1997至2025年间30个国家的雇员周均实际工作小时数,按性别、职业技能等级及公共/私营部门进行细分。除核心观测值外,每条记录附有来源标识、观测状态标记及数据序列中断等质量注释,便于用户评估数据可靠性。数据集同时提供性别的四种分类(总计、男性、女性及其他),并采用年度频率,兼顾了劳动统计的细粒度与时间跨度的完整性。
使用方法
用户可通过HuggingFace的datasets库一行命令加载数据集,并直接转换为pandas DataFrame进行后续分析。典型应用包括按国家过滤数据以聚焦特定区域,按时间序列绘制单一指标的趋势图,或通过透视表构建国家×年份的矩阵面板。数据集同时开放了基于Python的代码示例,支持快速探索性别、职业等维度的交互作用,适用于回归、分类及时间序列预测等机器学习任务。
背景与挑战
背景概述
由国际劳工组织(ILO)统计数据库ILOSTAT于2025年发布并经Electric Sheep Asia重新打包的这一数据集,聚焦于亚洲30个国家1997至2025年间按性别、职业及公共/私营部门划分的雇员实际周均工时。ILOSTAT作为全球劳动统计的核心权威,通过整合劳动力调查、家庭收入调查等多元来源并遵循国际劳工统计学家会议(ICLS)定义进行标准化,为区域劳动市场研究提供了关键数据基础。该数据集涵盖了31,362条观测,丰富的分类维度使其在分析亚洲各国劳动力利用效率、性别就业差异及非正规部门特征等议题中具有重要价值,成为连接宏观政策与微观劳动行为的关键桥梁。
当前挑战
该数据集面临的核心挑战在于如何从高度异质的国家统计体系中提取一致且可靠的信息。不同国家在调查方法、采样周期及职业分类上的差异导致时序数据存在断裂(如注释'Break in series'所指示),而同一指标的多源冲突虽经ILO‘最佳来源’筛选,但仍需关注数据质量标志(如‘不可靠’标签)。此外,部分国家数据稀疏或覆盖时间短(如蒙古仅2019-2024年),限制了跨国家长期趋势的稳健估计。构建中还需处理缺失分类维度(如性别或职业分类仅适用于部分指标)以及年频数据与月度/季度高频波动间的信息损失,这些均在推动数据融合与插补方法的创新。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中亚洲30个国家1997至2025年间按性别、职业及公私部门划分的雇员平均实际周工时观测值,共计31,362条记录。在劳动经济学与时序预测领域,它常被用于构建面板数据模型,以分析亚洲各国工作时间的演变趋势及其与宏观经济变量之间的关联。研究者可借助该数据集开展跨国比较研究,探究不同性别和职业群体在工时上的差异格局,为理解亚洲劳动力市场的结构性特征提供坚实的数据基础。
衍生相关工作
基于该数据集,学界与业界已衍生出一系列代表性工作。在方法论上,研究者利用其丰富的分类维度发展了异质性处理效应模型与非参数匹配方法,以更严谨地识别工时差异的来源。在应用研究中,有经典工作结合该时序数据与宏观经济面板,揭示了全球化冲击与技术进步对亚洲不同职业群体工时的非对称影响。此外,部分公共政策研究借助该数据集构建了预测模型,模拟最低工资调整或社会保障改革对雇员工作时间的影响路径,为相关领域的跨学科协作提供了范例。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲30个国家1997至2025年间雇员周实际工作时间的性别、职业及公私部门差异,为劳动经济学与时间利用研究提供了高颗粒度的面板数据。结合国际劳工组织近年来推动的体面劳动议程,该数据可支撑后疫情时代灵活就业形态下的工时弹性分析、性别工资差距中的劳动供给行为建模,以及区域间职业分层与制度比较的前沿探索。其规范的分类维度与多源标注机制,尤其适用于时间序列预测与多层级回归模型的实证检验,为评估亚洲劳动力市场结构变迁与社会政策干预效果提供了可靠的经验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务