遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-eco-mts-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是关于亚洲地区按性别、经济活动和婚姻状况划分的就业人口平均每周实际工作小时数的ILOSTAT数据。它包含93,353个观测值,覆盖31个亚洲国家,时间跨度为1997年至2025年,聚焦于一个独特指标:平均每周实际工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并经过处理,涵盖了就业、工作时间等劳动统计主题。数据集包括国家代码、数据来源、指标代码、性别分类、经济活动和婚姻状况分类、观测年份、观测值及其状态等字段,适用于表格分类、回归和时间序列预测等任务。

Mean weekly hours actually worked per employed person by sex, economic activity and marital status | Asia (ILOSTAT) dataset containing 93,353 observations across 31 Asian countries from 1997 to 2025, covering one indicator on hours of work. The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, and includes fields such as country codes, data sources, indicator codes, sex disaggregation, economic activity and marital status classifications, observation year, observed values, and status flags, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-eco-mts-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接抽取指标为HOW_TEMP_SEX_ECO_MTS_NB的原始数据,并依据ISO3国家代码筛选出亚洲地区31个国家的观测记录。在构建过程中,ILO依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查微观数据进行统一协调,同时保留了source.label字段以溯源数据来源,确保了统计口径的一致性与数据的可追溯性。
特点
数据集涵盖1997年至2025年间93,353条观测记录,聚焦于亚洲31个国家按性别、经济活动及婚姻状况划分的受雇人员每周实际平均工作小时数。其显著特点在于多维度的分类体系,包括性别(男、女、总计及其他)、经济活动部门及婚姻状态,使研究者能够进行精细化的交叉分析。此外,数据状态标记(如obs_status)明确标注了数据的可靠性等级,为后续分析中的质量控制提供了有力支撑。
使用方法
用户可通过HuggingFace Datasets库中的load_dataset()函数一键加载该数据集,将其转换为Pandas DataFrame后即可进行灵活的数据操作。例如,可依据ref_area字段筛选特定国家的数据,利用indicator字段聚焦单一指标的时间序列分析,或通过pivot_table方法构建国家与年份的矩阵视图,从而便捷地展开跨国比较与趋势研究。推荐在学术引用时同时标注ILO原始数据来源及Electric Sheep Asia的二次封装信息。
背景与挑战
背景概述
劳动力市场研究长期受困于高质量、细颗粒度时序数据的匮乏,尤其是涉及工作时长这一核心指标时,区域性与跨性别、跨经济活动的数据整合更显不足。为此,国际劳工组织(ILO)统计司依托ILOSTAT数据库,系统搜集并协调各国劳动力调查、家计调查及行政记录,于1997年启动了工作时长指标的持续监测。该数据集由Electric Sheep Asia于2025年重新整理并发布在HuggingFace平台,聚焦亚洲31国,收录93,353条观测,覆盖1997至2025年间按性别、经济活动及婚姻状况分层的每周实际工作时长均值。数据严格遵循国际劳工统计学家会议(ICLS)定义,并通过ISO代码对接实现跨国产出可直接比较。作为ILOSTAT亚洲子集的首个ML-ready版本,该数据集不仅填补了亚洲区域精细劳动统计的公共数据空白,更为发展经济学、性别平等评估及时间利用研究提供了标准化、可复现的基准参照。
当前挑战
该数据集所应对的领域问题在于揭示亚洲劳动力市场的结构性差异与非正规就业对工作时长的影响,传统国家统计常忽视性别与经济活动的交互效应,且跨国可比性极为薄弱。构建过程中则面临多重挑战:其一,原始数据源自各国异质性调查(劳动调查、家计调查、机构普查),需通过ILO的'最佳来源'规则进行冲突消解与权重校准;其二,分类体系差异(如经济活动的行业编码与婚姻状况聚合层级)需统一映射至ILOSTAT的标准化维度;其三,时间序列存在间断与观测质量标记(如不可靠标识'U'),要求谨慎处理缺失值与异常波动;其四,多源数据整合后需保留用于溯源的source.label与note_source字段,在保障102列元数据透明性的同时维持极端稀疏维度的可计算性。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇地带,该数据集为分析亚洲劳动力市场的结构性特征提供了宝贵的时间序列资料。其经典使用场景在于揭示不同性别、经济活动部门及婚姻状况下就业人员每周实际工作小时数的演化轨迹。研究者可借助这一跨度为1997至2025年、涵盖31个亚洲国家的面板数据,构建多维度回归模型,精细刻画亚洲各国工作时间的长期趋势与周期性波动,并比较各国在性别平等、产业转型以及家庭结构变迁对劳动供给差异的影响。这一数据集特别适合用于验证工作—闲暇替代弹性理论在亚洲情境下的适用性,以及评估经济危机或政策干预对工作时间分布的异质性冲击。
实际应用
在实际应用层面,该数据集为政府决策、国际组织评估及企业人力资源规划提供了量化依据。劳工部门可借此监测各国劳动时间是否超限,从而制定或调整工作中位数时数与加班时长上限的法规,推动体面劳动目标的实现。跨国企业在进行亚洲市场部署时,可依据不同性别与行业的工时基准,优化劳动力配置与排班策略,提升劳动效率与合规水平。此外,社会保障机构能通过分析不同婚姻状况人群的工时模式,设计更具针对性的育儿假政策或退休制度改革方案,缓解亚洲国家普遍面临的老龄化与劳动力短缺压力。经济模型开发者还可将该数据作为输入参数,改进劳动市场模拟预测的精度。
衍生相关工作
该数据集及其背后的ILOSTAT指标体系已衍生出一系列具有影响力的经典工作。在方法创新层面,研究者基于此类数据开发了估算非正规就业工人工作时间的隐马尔可夫模型,并构建了考虑多重插补的跨国工时面板,大幅提升了数据覆盖率与可比性。在理论应用层面,有学者利用亚洲各国工时数据检验了“收入效应与替代效应”在经济发展不同阶段的动态变化,提出了适应新兴经济体的劳动供给理论修正框架。此外,该数据集支撑了若干聚焦性别不平等的计量研究,其中一项经典工作通过分性别回归揭示了婚姻状态如何系统性地扩宽男女工时的差距,为倡导家庭友好型劳动政策提供了有力证据。这些衍生工作共同构筑了亚洲劳动市场研究的知识壁垒。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务