遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ins-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲30个国家从1997年至2025年间,按性别和公共/私营部门划分的就业人员实际平均每周工作小时数(ILOSTAT指标HOW_TEMP_SEX_INS_NB)的2,258个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过亚洲国家筛选,涵盖了劳动统计中的工作时间主题。数据集以表格形式提供,包含国家代码、年份、指标值、性别分类等维度,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 2,258 observations of mean weekly hours actually worked per employed person by sex and public/private sector (ILOSTAT indicator HOW_TEMP_SEX_INS_NB) across 30 Asia countries, spanning 1997–2025. Data is sourced from the International Labour Organizations ILOSTAT database via its REST API, filtered to Asian countries, and focuses on hours of work statistics. It is provided in a tabular format with columns for country codes, years, indicator values, sex disaggregation, and other dimensions, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ins-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集由Electric Sheep Asia团队基于国际劳工组织(ILO)的ILOSTAT数据库构建,通过REST API直接拉取指标HOW_TEMP_SEX_INS_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤。ILOSTAT作为全球劳动统计的权威来源,其数据经ILO统计部门采用国际劳工统计学家会议(ICLS)定义进行统一协调与标准化,原始来源信息在source.label列中予以标注,确保数据可追溯。最终整合为包含2,258条观测值、覆盖30个亚洲国家、时间跨度从1997年至2025年的结构化表格数据集。
特点
数据集集中呈现‘按性别和公共/私营部门划分的受雇人员每周实际工作平均小时数’这一单一核心指标,但提供了丰富的维度细粒度。关键特征包括:涵盖性别分类(总、男、女、其他)以及制度部门分类(如总体、公共、私营等),且支持按国家、年份、来源等多字段筛选。数据以年度频率发布,采用ILO选定的最佳来源以避免同一国家年份的多源冲突,观测值伴随状态标记(如序列中断)以提示数据质量。地理覆盖均衡,包含菲律宾、伊朗、柬埔寨等长时间序列国家,便于进行跨国比较与时间序列分析。
使用方法
数据集可通过HuggingFace的datasets库直接加载,使用load_dataset("electricsheepasia/asia-ilo-how-temp-sex-ins-nb-mean-weekly-hours-actually-worked-per-employed-per")将数据读取为Pandas DataFrame即可开展分析。典型应用场景包括:按国家过滤进行局部劳动市场研究,如筛选ref_area为‘IDN’获取印尼数据;对特定指标按时间排序绘制趋势图,揭示劳动时长演变;亦可通过透视表将数据重塑为国家×年份矩阵,便于面板数据分析或机器学习建模。数据采用CC-BY-4.0许可,使用时需同时引用原始ILO数据及Electric Sheep Asia的再打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)发布,经Electric Sheep Asia于2025年重新整理并托管于HuggingFace平台,聚焦亚洲30个国家1997至2025年间按性别和公共/私营部门划分的就业者周均实际工作小时数。作为ILOSTAT数据库的子集,它承载了劳动力市场研究中至关重要的“工作时间”指标,为跨国比较与时间序列分析提供了标准化、可复现的数据基础。该数据集在劳动经济学、社会发展及国际政策评估等领域具有显著影响力,尤其适用于分析亚洲地区劳动力参与模式的性别差异及经济结构变迁对工作时长的影响。
当前挑战
该数据集面临的核心挑战在于多源异构数据的整合与质量控制。一方面,亚洲各国统计体系差异显著,劳动力调查方法、年份覆盖、数据评估标准(如是否包含非正规部门)及观测状态标志(如序列中断)均不一致,导致跨国可比性受限;另一方面,数据集仅提供年频观测,缺少月度或季度高频率数据,难以捕捉短期经济波动对工作时间的影响。此外,部分国家因调查缺失或来源变更造成数据稀疏与断裂,构建连续、无偏的时间序列需谨慎处理缺失值、代理变量选择及序列断裂对齐等问题。
常用场景
经典使用场景
在劳动经济学与宏观政策研究领域,该数据集被广泛用于分析亚洲各国劳动者实际周工时的长期变动趋势。研究者可基于‘性别’与‘公共/私营部门’两大维度,系统对比不同国家、不同时期的工作强度差异。通过时间序列建模,能够揭示工时动态与经济发展阶段、劳动力市场制度变革之间的内在关联,为跨国比较研究提供标准化的量化基础。
实际应用
在实际应用中,该数据集为国际组织、政府智库及企业人力资源部门提供了决策支持。例如,国际劳工组织可依据工时变化评估‘体面劳动’目标的实现进展;政府部门可结合性别与部门维度设计差异化的劳动保护政策;跨国企业则能借此基准化亚太地区的工作强度,优化全球劳动力配置策略,提升运营合规性与员工福祉。
衍生相关工作
该数据集衍生出一系列经典工作,包括基于混合效应模型构建的亚洲工时预测系统、融合国民账户数据的劳动生产率耦合分析,以及利用可解释机器学习方法识别非正规就业时长的隐性特征。此外,它还被集成到多个多源劳动统计知识图谱中,作为验证与校准依据,极大推动了区域劳动经济学的计量方法创新与跨学科融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务