遇见数据集

skill-scarcity-index

收藏
Hugging Face2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

Datamata技能稀缺指数是一个衡量技术技能招聘难度的数据集。它通过分析从公开公司招聘页面和招聘网站抓取的活跃职位列表,为每个技能构建每日综合稀缺分数。该分数综合了三个关键信号:最近关闭的职位列表中位数开放天数(反映招聘时长)、披露薪资相对于类别中位数的溢价百分比、以及职位因招聘失败而重新发布的比例。数据集每日更新,包含1635行数据,涵盖数据、工程、产品、开发运维、安全和人工智能等职位类别。每个数据点包含技能名称、需求数量、需求百分比、中位数开放天数、薪资溢价百分比、重发率和0-100分的稀缺分数(分数越高表示越难招聘)。该数据集适用于分析劳动力市场趋势,例如识别导致职位长期空缺的技能、具有薪资溢价的技能、招聘失败率高的技能,以及评估AI技能涌入对技能稀缺性的影响。数据集采用CC BY 4.0许可证。需要注意的是,完整数据集包含综合分数,而更深层次的分析(如公司采用情况、技能组合堆栈、按角色和资历划分的招聘时长)仅在网站上以交互形式提供。

Datamata Skill Scarcity Index is a dataset that measures the difficulty of hiring for technical skills. It constructs a daily composite scarcity score for each skill by analyzing active job listings scraped from public company career pages and job boards. The score integrates three key signals: median days open for recently closed job listings (reflecting hiring duration), percentage premium of disclosed salaries relative to category medians, and proportion of jobs reposted due to hiring failures. The dataset is updated daily and contains 1635 rows, covering job categories such as data, engineering, product, DevOps, security, and AI. Each data point includes skill name, demand count, demand percentage, median days open, salary premium percentage, repost rate, and scarcity score on a 0-100 scale (higher scores indicate harder-to-hire skills). It is suitable for analyzing labor market trends, such as identifying skills causing prolonged job vacancies, skills with salary premiums, skills with high hiring failure rates, and assessing the impact of AI skill influx on skill scarcity. The dataset uses the CC BY 4.0 license. Note that the full dataset includes composite scores, while deeper analysis (e.g., company adoption, skill stack combinations, hiring duration by role and seniority) is only available interactively on the website.

创建时间:
2026-07-12
原始信息汇总

数据集概述:Datamata Skill Scarcity Index

该数据集由 Datamata Studios 提供,是一个每日更新的技术技能稀缺性指数,用于衡量哪些技术技能最难招聘。

  • 最新快照:2026-07-15
  • 数据行数:1635
  • 更新频率:每日
  • 许可证CC BY 4.0(可自由使用和改编,包括商业用途,需注明出处)
  • 来源与方法论:https://www.datamatastudios.com/datasets/skill-scarcity-index

可回答的问题

  • 哪些技能的空缺岗位持续时间最长,以及这种差距是否在扩大。
  • 哪些技能的薪资溢价高于其类别中位数。
  • 哪些技能雇主反复招聘失败(重发率)。
  • 随着 AI 技能涌入岗位要求,稀缺性如何变化。

数据列说明

列名 类型 描述
snapshot_date string 快照的 UTC 日期(YYYY-MM-DD)。
category string 工作类别:data、engineering、product、devops、security、ai。
skill_name string 来自提取分类的标准技能名称。
demand_count number 快照日期提及该技能的活跃招聘信息数量。
demand_pct number demand_count 占该类别所有活跃招聘信息的百分比。
median_days_open number 最近关闭的包含该技能的招聘信息中位数开放天数。低于样本门槛则为空。
salary_premium_pct number 包含该技能的招聘信息中位披露薪资与该类别中位数的百分比差异。低于样本门槛则为空。
repost_rate_pct number 该技能招聘信息中,重发之前相同职位的比例(招聘失败信号)。
scarcity_score number 0-100 加权百分位排名综合得分(基于三个维度),在类别内计算。分数越高越难招聘。

构建方法

每天从公司职业页面和招聘网站抓取所有活跃招聘信息,使用分类标准提取技能,然后为每个技能组合三个难招聘信号:已关闭招聘信息的中位开放时间(填补时间)、中位披露薪资与类别中位数的对比、以及重发相同职位的比例。分数为类别内加权百分位排名综合得分,因此不同类别的分数可以相互比较。完整方法和已知限制参见:https://www.datamatastudios.com/methodology

未包含在本文件中的数据(在网站交互式提供)

  • 公司采纳动态:每家公司首次为某项技能招聘的日期(例如“本季度 47 家公司将 Iceberg 加入工作要求”):https://www.datamatastudios.com/datasets/skill-scarcity-index
  • 技能组合:哪些技能三元组(例如 AWS + dbt + Snowflake)会同时出现在招聘信息中,按月统计。
  • 按职位和资历划分的填补时间:按职位而非技能划分的同一生命周期指标。

快速开始

python import pandas as pd

df = pd.read_csv("hf://datasets/datamatastudios/skill-scarcity-index/skill-scarcity-index.csv")

latest = df[df.snapshot_date == df.snapshot_date.max()] print( latest[latest.category == "data"] .sort_values("scarcity_score", ascending=False) [["skill_name", "scarcity_score", "median_days_open", "salary_premium_pct"]] .head(10) )

或使用 Hugging Face datasets 库:

python from datasets import load_dataset

ds = load_dataset("datamatastudios/skill-scarcity-index")

引用

Datamata Studios. "Datamata Skill Scarcity Index." 2026-07-15. https://www.datamatastudios.com/datasets/skill-scarcity-index. Licensed under CC BY 4.0.

搜集汇总
数据集介绍
skill-scarcity-index 数据集图片
构建方式
该数据集的构建依托于对公开公司招聘页面及求职网站的实时抓取,每日获取活跃职位列表。通过精密的分类体系提取其中提及的各项技能,并针对每项技能整合三重衡量稀缺性的信号:已关闭职位的平均开放时长(即填补时间)、雇主提供的薪资相较于该类别中位数的溢价比例,以及同一职位因未能成功招聘而重复发布的比率。最终,将这些信号在各自类别内进行加权百分位排名,合成一个0至100的复合稀缺性指数,使得不同技能类别间的得分具备可比性。
使用方法
用户可通过Python的Pandas库直接从HuggingFace Hub流式读取数据集,无需繁琐下载。典型用法包括筛选最新快照以识别特定类别中稀缺性最高的技能,或历史分析某一技能随时间的稀缺趋势。数据集同样支持使用HuggingFace的`datasets`库加载,便于与现有深度学习或数据分析流水线集成。用户可据此探究哪些技能职位开放时间最长、薪资溢价显著,以及雇主反复招聘失败的领域,从而洞察市场变化,如AI技能涌入对职业格局的冲击。
背景与挑战
背景概述
Datamata Skill Scarcity Index数据集由Datamata Studios于2026年创建,旨在量化技术技能在劳动力市场中的稀缺程度。该数据集通过每日抓取上市公司招聘页面及求职平台上的活跃职位信息,结合职位开放时长(time-to-fill)、薪资溢价(salary premium)以及职位重复发布率(repost rate)三大指标,构建了一个0-100的复合稀缺度评分(scarcity score)。数据集覆盖数据、工程、产品、DevOps、安全、人工智能六大职业类别,聚焦于理解哪些技能真正难以招募,为人力资源分析、劳动力经济学及技术趋势研究提供了量化基础。其影响力体现在为招聘策略优化、技能投资决策及劳动力市场动态监测提供了实时、可比较的指标,弥补了传统劳动力数据在技能粒度上的不足。
当前挑战
该数据集所解决的领域问题在于,传统劳动力市场指标(如职位空缺数)无法区分技能的真实稀缺性,而Skill Scarcity Index通过复合评分直接量化了招聘难度。构建过程中面临的主要挑战包括:1)跨平台数据整合与去重——需从众多公开职业页面和求职平台抓取海量职位,并确保同一职位在不同渠道不被重复计算;2)技能提取的标准化——需维护一个精选的术语库,将非结构化的职位描述转化为规范化的技能名称,应对同义技能(如“Python”与“python”)及新兴技能的涌现;3)样本阈值的设定——对中位数开放天数和薪资溢价等指标,需在数据不足时合理留空,避免小样本导致的偏差;4)每日快照的时效性与计算成本——维持每天全量快照并实时更新稀缺度评分,对数据管道的稳健性和计算资源提出了高要求。
常用场景
经典使用场景
在劳动力市场分析与人力资源研究的广袤领域中,Datamata Skill Scarcity Index数据集独辟蹊径,为量化技术人才的稀缺性提供了全新标尺。其最经典的使用场景在于,通过整合职位空缺时长(time-to-fill)、薪资溢价(salary premium)以及职位重复发布率(repost rate)三个核心维度,构建出一个每日更新的综合稀缺性评分。研究者得以精准刻画特定技能在当下市场中的招聘难度,例如识别出哪些数据工程或人工智能领域的技能岗位长期悬而未决,以及雇主为招揽这些人才所付出的超额薪资成本。这一复合指标超越了单一维度衡量方法的局限性,为理解技能供需动态提供了多维视角。
解决学术问题
该数据集直击了劳动经济学与技能匹配研究中的核心难题——如何科学界定和测量‘技能稀缺性’。传统研究往往依赖问卷调查或宏观统计,难以捕捉真实市场中的微观动态与实时变化。此数据集通过每日从公开公司招聘页面和求职平台抓取的活跃职位信息,构建了可复现、细颗粒度的量化框架,使学者能够分析技能稀缺性在时间序列上的演变趋势,尤其是在AI技能大规模涌入需求端后引发的结构性变化。其意义在于,为研究技能错配、工资溢价形成机制以及招聘效率影响因素等经典学术问题,提供了可靠的数据基础与实证锚点。
实际应用
在实际应用中,该数据集成为企业人力资源战略制定与个人职业规划的重要参考工具。企业招聘团队可据此动态监控市场中的稀缺技能分布,优化人才引进策略与薪资预算分配,例如针对评分高企的稀缺技能提前布局内部培训或定向猎聘。对于求职者与教育机构而言,该指数揭示了哪些技能岗位的竞争格局最为紧张,从而指导技能投资方向与课程设计。此外,政策制定者亦能利用该数据洞察区域劳动力市场的结构性短板,为职业教育改革和人才引进政策提供数据驱动的决策支持。
数据集最近研究
最新研究方向
当前,全球技术人才市场正经历前所未有的结构性变迁,特别是在人工智能技能快速渗透岗位需求的背景下,企业招聘的摩擦成本与技能稀缺性成为劳动经济学与人力资源领域的研究焦点。Datamata Skill Scarcity Index数据集应运而生,它通过整合岗位在线时长、薪资溢价及重复发布率三个核心信号,构建了一个每日更新的技能稀缺性复合评分体系,精准量化了数据、工程、DevOps、安全等类别中真正难以招募的技术技能。这一前沿研究方向不仅揭示了哪些技能导致招聘周期延长、薪资溢价攀升,更通过追踪AI技能涌入对人才市场造成的动态冲击,为劳动力市场预测、企业招聘策略优化及职业教育课程设计提供了可实时观测的证据基础,其影响力正随着技术迭代与人才争夺的加剧而持续深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务