遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲13个国家(如阿富汗、孟加拉国、伊拉克、老挝等)从2007年至2024年的1,474个观测值,核心指标为“按性别、企业规模和残疾状况划分的雇员平均每周实际工作时间”(指标代码HOW_XEES_SEX_EST_DSB_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤到亚洲地区,涵盖了就业统计中的工作时间维度。数据集以表格形式组织,包括国家代码、年份、性别(总计、男性、女性)、企业规模分类、残疾状况分类、观测值及其状态标志等列,适用于表格分类、回归和时间序列预测等任务。数据经过ILO的标准化处理,确保与ICLS定义一致,并标注了来源和质量信息(如不可靠数据标志)。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,便于机器学习研究使用。

This dataset contains 1,474 observations from 13 Asian countries (e.g., Afghanistan, Bangladesh, Iraq, Lao Peoples Democratic Republic) spanning 2007 to 2024, focusing on the indicator Mean weekly hours actually worked per employee by sex, establishment size and disability status (code HOW_XEES_SEX_EST_DSB_NB). Sourced from the International Labour Organizations (ILO) ILOSTAT database, it is retrieved via API and filtered to Asian ISO3 country codes, covering hours of work statistics. The data is organized in tabular format with columns including country code, year, sex (total, male, female), establishment size classification, disability status classification, observed values, and status flags (e.g., unreliable). It is suitable for tasks such as tabular classification, regression, and time-series forecasting. The data is harmonized by ILO using ICLS definitions, with source and quality annotations (e.g., provisional data). Repackaged by Electric Sheep Asia in Parquet format for easy machine learning integration.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接获取指标HOW_XEES_SEX_EST_DSB_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调与标准化处理,确保跨国可比性。经Electric Sheep Asia团队重新封装后,数据集以1,474条观测记录呈现,覆盖2007年至2024年间13个亚洲国家的年度数据,所有来源信息均通过source.label字段清晰标注,便于追溯数据源头与质量。
特点
该数据集聚焦于“按性别、单位规模及残疾状况划分的雇员每周实际工作平均小时数”这一核心指标,提供了多维度的分类变量,包括性别(总、男、女)、单位规模集合及残疾状况等,便于研究者从交叉视角剖析劳动力市场特征。数据涵盖亚洲13国,观测跨度近二十年,国家分布从阿富汗至斯里兰卡,经济发展水平与劳动力结构各异,为区域性比较研究奠定了坚实基础。每条记录均包含国家代码、来源标签、指标说明及观测状态标记(如不可靠或临时数据),体现了ILOSTAT对数据质量与透明度的严格把控。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并将其转换为Pandas数据框进行后续分析。利用ref_area列可快速筛选特定国家的时间序列数据,通过indicator列定位核心指标后,可借助sort_values与plot方法实现趋势可视化。此外,推荐使用pivot_table函数将数据重塑为国家×年份的矩阵形式,便于面板数据分析或跨区域对比。对于关注数据质量的研究者,obs_status字段可用于过滤不可靠观测值,note_indicator与note_source字段则提供了方法论修订与数据来源变更的注释,支撑严谨的实证研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司编制,经Electric Sheep Asia于2024年重新打包发布,聚焦于亚洲13个国家(涵盖阿富汗至斯里兰卡)在2007至2024年间按性别、企业规模及残疾状况划分的雇员实际周平均工时。作为ILOSTAT核心指标库的子集,该数据源于各国劳动力调查、家庭收入调查及行政记录等权威来源,并依据国际劳工统计学家会议(ICLS)标准进行协调统一。在研究层面,其核心价值在于揭示亚洲地区劳动力市场中不同群体的工作时间差异,为体面劳动、性别平等及残障包容等可持续发展目标(SDG)提供量化支撑。该数据集的发布填补了区域级微观工时数据在机器学习场景中的空白,使研究者能够便捷地通过HuggingFace接口加载结构化面板数据,进而开展时间序列预测、分类与回归分析。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,亚洲各国劳动力市场结构差异悬殊,从阿富汗的战后重建到斯里兰卡的快速城镇化,导致工时数据在国别间可比性不足,且部分国家(如缅甸、巴基斯坦)观测记录稀疏,增加了跨区域建模的偏差风险。其次,在构建过程中,ILOSTAT虽提供最佳来源筛选机制,但仍存在方法断裂(如序列中的修订标注)、数据稳定性标记(如不可靠标记U)等问题,尤其当同一国家年度指标存在多个来源时,选择策略可能引入系统性误差。此外,分类维度(性别、企业规模、残疾状况)的非完全交叉特性导致维度稀疏,部分组合(如残疾女性在小型企业中的工时)缺少可观测样本,制约了细粒度描述与推断的可行性。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇处,该数据集为分析亚洲劳动力市场的结构性特征提供了宝贵素材。其经典使用场景聚焦于跨性别、企业规模与残疾状况三个维度的平均周实际工时研究,通过覆盖13个亚洲国家2007至2024年的长时段观测,研究者可建立面板数据模型,揭示不同社会群体在劳动供给行为上的异质性。这一情境下,数据集如同一个精准的棱镜,将宏观劳动统计折射为微观可操作的变量关系,为探讨亚洲经济体的劳动参与模式、工作强度演变及其与社会政策的互动提供了定量基础。
解决学术问题
该数据集有力回应了劳动统计学中关于工时决定因素的经典学术追问,尤其填补了亚洲地区多维分解数据的分析空白。通过集成性别、企业规模与残疾维度,研究得以解构工时差异的来源,例如验证性别工资差距在工时投入上的映射、检验企业规模对劳动者工作负担的非线性效应,以及探讨残疾包容性政策在劳动时长上的实际影响。这些问题的解答深化了对可持续劳动实践与体面工作目标的理解,为国际劳工组织倡导的SDG框架提供了区域层面的实证支撑,推动了从描述性统计向解释性因果推断的范式跨越。
衍生相关工作
围绕这一数据集,学界已衍生出一系列经典研究工作,涵盖工时与生产率关系的计量分析、性别劳动供给的跨国比较,以及企业规模对工作条件的调节作用。这些衍生工作通常基于ILOSTAT的标准化统计框架,将本数据集作为核心模块,与教育、健康等多源数据融合,构建复合劳动福祉指数。特别地,基于本数据的时间序列特性,研究者将其作为基线特征集,训练时序预测模型以预报工时趋势,或利用其分类变量设计因果识别策略,如双重差分法评估政策冲击。这些工作不仅验证了数据集的可靠性,更拓展了其在劳动经济学、公共政策与机器学习交叉领域的理论边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务