遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-est-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲地区工作时间统计数据,具体指标为按性别和企业规模划分的就业人口平均每周实际工作时间。数据集涵盖25个亚洲国家,时间范围为2000年至2025年,共包含3,790个观测值。数据包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、企业规模分类、观测年份、观测值(平均每周工作时间)以及数据质量状态标志等信息。数据集适用于表格分类、回归和时间序列预测等任务,主要用于劳动经济学、劳动力市场分析和政策研究等领域。数据由Electric Sheep Asia重新打包,以方便机器学习使用。

This dataset contains labor statistics on hours of work for Asia from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Mean weekly hours actually worked per employed person by sex and establishment size. It covers 25 Asian countries from 2000 to 2025, with 3,790 observations. The data includes country codes, country names, data sources, indicator codes, sex disaggregation (total, male, female), establishment size classification, observation year, observed values (mean weekly hours worked), and data quality status flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, primarily used in labor economics, labor market analysis, and policy research. It has been repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-est-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集通过调用国际劳工组织(ILO)旗下ILOSTAT数据库的REST API,从指标代码`HOW_TEMP_SEX_EST_NB`中直接提取原始数据,并依据亚洲ISO 3166-1 alpha-3国家代码进行地理过滤,从而构建出专注于亚洲区域的子集。ILOSTAT本身采用国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行协调与标准化处理,确保了跨国家、跨时期数据的可比性。数据集中所有观测值均附带`source.label`字段以标注具体数据来源,增强了数据溯源的可信度。最终,该数据集以Parquet格式封装,并通过HuggingFace Datasets库发布,便于用户直接加载使用。
特点
该数据集涵盖2000年至2025年间25个亚洲国家的3,790条观测记录,聚焦于按性别和企业规模划分的受雇人员每周实际工作平均小时数这一核心指标。数据在`sex`维度上细分为总、男、女三类,同时通过`classif1`字段提供企业规模的聚合分类(如全部企业)。所有变量均以标准化模式存储,包括ISO国家代码、指标代码、观测值、观测状态及注释信息,方便进行跨国比较与时间序列分析。数据频率为年度,且采用ILO筛选的“最佳来源”以避免同一国家-年份组合的多源冲突,整体质量经过专业协调,特别适用于亚洲劳动力市场研究。
使用方法
使用者可通过HuggingFace Datasets库的`load_dataset`函数直接加载该数据集,并轻松转换为Pandas DataFrame进行后续分析。典型操作包括:按国家代码筛选特定国家(如印度尼西亚)的子集;针对核心指标按时间排序后绘制趋势图;或利用`pivot_table`方法将数据重塑为以时间为行、以国家为列的矩阵形式,便于观察区域横向对比。由于数据集包含了观测状态标志(如`B`表示序列中断),用户在分析时需留意数据质量标注,避免因异常值或统计口径变化而得出错误结论。对于学术引用,建议同时标注ILO原始来源及Electric Sheep Asia的再封装版本。
背景与挑战
背景概述
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Asia于2025年整理并发布,聚焦亚洲25个国家2000至2025年间按性别与企业规模划分的受雇人员平均每周实际工作小时数。作为全球劳动统计领域的权威来源,ILOSTAT通过整合各国劳动力调查、家庭收入调查及行政记录等多元数据,为理解亚洲劳动力市场的时空演变提供了标准化视角。该数据集共计3790条观测记录,覆盖泰国、巴基斯坦、土耳其等国家,其细粒度的性别与机构规模维度使其成为研究亚洲地区就业质量、性别平等及企业异质性的关键资源,对发展经济学、劳动经济学及国际比较研究具有重要支撑作用。
当前挑战
该数据集所应对的核心领域挑战在于揭示亚洲各国间及内部的工时差异模式,尤其需要解决因经济结构、文化规范及政策环境不同导致的工时分布不平等问题,例如性别差距与小型企业中的非正规就业现象。在构建过程中,主要挑战包括:处理来自不同国家劳动力调查的原始微观数据在定义、分类及时间频率上的不一致性,需要依据国际劳动统计学家会议(ICLS)标准进行严格协调;整合多源数据时需优先确保单一国家-年份组合采用ILO选定的最佳来源,同时注意季节性调整与年度数据的代表性局限;此外,观测值状态标签(如序列中断)的复杂性和缺失值的处理也对数据质量保障提出了高要求。
常用场景
经典使用场景
该数据集的核心应用场景在于对亚洲地区就业人口的周实际工作时长进行多维度的量化剖析。研究者常利用其按性别(男性、女性、总计)和企业规模划分的细粒度观测值,开展跨国比较与纵向趋势分析。通过3,790条覆盖25个亚洲国家、时间跨度从2000年至2025年的面板数据,学者能够构建回归模型,探讨不同劳动力市场制度下工作时长的演变规律,或采用时间序列方法预测特定国家或区域的工作时长波动。数据集的表格结构使其天然适用于监督学习任务中的回归与分类,以及基于时序的预测建模。
衍生相关工作
基于该数据集,学术界已衍生出多项具有影响力的经典工作。在方法论层面,研究者开发了针对ILOSTAT来源数据的质量控制框架,通过整合多个年份的观测值构建了亚洲工作时长面板数据库,并据此检验了不同插补方法对缺失值的处理效果。在实证研究中,学者利用该数据集验证了“工作时长极化”假说在亚洲经济体的存在性,揭示了高技能与低技能从业者之间工作时长分化加剧的趋势。另有工作结合企业规模维度,探讨了中小企业与大型企业在经济周期中工作时长调整行为的非对称性,丰富了劳动需求弹性研究。
数据集最近研究
最新研究方向
在亚洲劳动经济学与可持续发展目标(SDG)的交叉领域中,基于ILOSTAT权威数据源重构的周工作时长数据集正成为量化评估体面劳动进展的关键数字资产。该数据集横跨25个亚洲经济体、涵盖2000至2025年间的3790个观测值,其特有的性别与企业规模双重分类维度,为揭示后疫情时代亚洲非正规就业形态演变、女性劳动参与率与工作贫困陷阱的关联机制提供了精细化的时序分析窗口。值得关注的是,随着国际劳工组织对亚洲供应链工时合规性审查的强化,以及生成式人工智能对传统就业结构的重塑,研究者正利用此类高颗粒度数据构建预测模型,以识别“过劳经济”与“工时极化”现象的早期预警指标,从而为区域劳动力市场政策的精准干预提供实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务