遇见数据集

ai-requirements-index

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

Datamata AI 需求指数数据集是一个用于追踪人工智能技能在科技职位招聘中成为需求的速度的时序数据集。它记录了按时间、技能层级(生成式AI vs 经典机器学习)、职位类别(数据、工程、产品、开发运维、安全、AI)和资历级别(全部、初级、中级、高级、主管、未知)划分的活跃科技职位列表中提及AI技能的比例。数据集每日更新,包含1377行数据,每行代表一个特定日期、类别、资历和技能层级的聚合快照。关键指标包括提及AI技能的职位列表数量、总职位列表数量、占比以及作为硬性要求的职位数量。该数据集适用于分析AI技能需求趋势、比较不同技能层级的增长速率、评估各职位类别对AI技能的采纳速度以及研究不同资历级别的需求差异。数据来源于对公开公司职业页面和招聘网站的每日抓取,并通过一个精心策划的分类法从职位描述文本中提取技能。数据集采用CC BY 4.0许可证,允许商业使用和改编,需注明出处。

The Datamata AI Demand Index dataset is a time-series dataset that tracks the rate at which AI skills are becoming required in tech job postings. It records the proportion of active tech job listings mentioning AI skills, segmented by time, skill tier (generative AI vs. classic machine learning), job category (data, engineering, product, DevOps, security, AI), and seniority level (all, entry, mid, senior, lead, unknown). The dataset is updated daily and contains 1,377 rows, each representing an aggregated snapshot for a specific date, category, seniority, and skill tier. Key metrics include the number of job listings mentioning AI skills, total job listings, proportion, and number of jobs requiring AI skills as a hard requirement. It is suitable for analyzing trends in AI skill demand, comparing growth rates across skill tiers, evaluating adoption speed across job categories, and studying demand variations by seniority level. Data is sourced from daily crawls of public company career pages and job boards, with skills extracted from job description text using a curated taxonomy. The dataset is licensed under CC BY 4.0, allowing commercial use and adaptation with attribution.

创建时间:
2026-07-11
原始信息汇总

数据集概述:Datamata AI Requirements Index

该数据集追踪了AI技能成为技术岗位招聘要求的增长速度,提供了随时间变化的活跃技术岗位招聘信息中提及AI技能的占比数据,并按技能层级、职位类别和资历级别进行划分。

  • 数据集名称:Datamata AI Requirements Index
  • 数据集提供方:Datamata Studios
  • 最新快照日期:2026-07-11
  • 当前发布版本行数:1377
  • 更新频率:每日更新
  • 许可证:CC BY 4.0(可自由使用、改编,包括商业用途,需注明出处)
  • 来源与方法论:https://www.datamatastudios.com/datasets/ai-requirements-index

数据内容与用途

该数据集可用于回答以下问题:

  • 目前技术岗位招聘信息中提及AI技能的占比,以及该占比的增长速度。
  • 生成式AI技能(tier = genai)与经典机器学习技能(tier = ml)的增长速度对比。
  • 初级岗位对AI技能的要求情况(通过资历级别维度分析)。
  • 不同职位类别(如数据、工程、产品、DevOps、安全)对AI技能需求的速度差异。
  • AI技能是硬性要求还是加分项(通过required_countlistings_with_ai字段分析)。

数据列说明

列名 类型 描述
snapshot_date 字符串 快照的UTC日期(YYYY-MM-DD格式)
category 字符串 职位类别:data(数据)、engineering(工程)、product(产品)、devops(DevOps)、security(安全)或 ai(AI)
seniority 字符串 资历级别:all(全部)、entry(入门)、mid(中级)、senior(高级)、lead(领导)或 unknown(未知)
tier 字符串 AI技能层级:genai(生成式AI,如RAG和微调)、ml(经典ML,如PyTorch和scikit-learn)或 any_ai(任意AI)
listings_with_ai 数值 提及至少一种该层级技能的有效招聘信息数量
total_listings 数值 该快照日期下,该职位类别/资历级别组中的全部有效招聘信息数量
pct 数值 listings_with_aitotal_listings 的百分比
required_count 数值 将该层级技能列为硬性要求(非加分项)的招聘信息数量。部分历史行此字段为空

数据构建方法

每天,数据集会抓取来自公开公司招聘页面和招聘网站的所有有效招聘信息,使用精心设计的分类体系从招聘文本中提取技能,并记录每个AI技能层级下提及至少一种技能的招聘信息占比。占比是基于每条招聘信息计算的,即一条招聘信息中提及五种AI技能也仅计为一次。完整方法论及已知局限性请参阅:https://www.datamatastudios.com/methodology。

引用格式

Datamata Studios. "Datamata AI Requirements Index." 2026-07-11. https://www.datamatastudios.com/datasets/ai-requirements-index. Licensed under CC BY 4.0.

搜集汇总
数据集介绍
ai-requirements-index 数据集图片
构建方式
该数据集由Datamata Studios构建,通过每日从公开企业招聘页面及职位公告板中抓取活跃职位列表,并利用精心编纂的技能分类体系对职位文本进行技能提取。构建过程中,首先将AI技能划分为生成式AI(genai)与经典机器学习(ml)两大层级,继而统计每个层级中至少提及一项技能的职位数量。每项职位仅计一次,即便其罗列了多项AI技能,最终以该数量占该类别与资历组别总职位数的百分比呈现,形成按时间推移的技能需求趋势指标。
特点
数据集具备多维度细粒度划分特性,涵盖职位类别(数据、工程、产品、运维、安全及AI专项)、资历层级(入门、中级、高级、主管及未知)以及技能层级(生成式AI、经典ML或任意AI),可交叉分析各细分市场对AI技能的需求演变。此外,数据集区分了硬性要求与锦上添花项,通过required_count字段追踪将AI技能列为必备条件的职位数量,为洞察招聘趋势的真实刚性提供了量化依据。
使用方法
用户可通过Python的Pandas库直接从HuggingFace Hub流式加载数据,无需本地下载,例如使用pd.read_csv('hf://datasets/datamatastudios/ai-requirements-index/ai-requirements-index.csv')。同时,也可借助HuggingFace的datasets库以load_dataset('datamatastudios/ai-requirements-index')方式加载。加载后,可按snapshot_date、category、seniority及tier字段进行筛选,例如分析数据类职位中任意AI技能提及率的时序变化,或比较生成式AI与经典ML在入门级职位中的需求增速,以支持招聘趋势研究与劳动力市场分析。
背景与挑战
背景概述
在人工智能技术迅猛发展并深度渗透各行各业的时代,理解劳动力市场对AI技能的需求动态已成为学术界与产业界共同关注的核心议题。为此,Datamata Studios于2026年发布了Datamata AI Requirements Index数据集,该数据集通过每日抓取企业官网和招聘平台的活跃职位公告,系统性地追踪AI技能在技术岗位招聘信息中的提及比例,覆盖生成式AI与传统机器学习两大技能层级,并依据岗位类别与资历水平进行细分。这一跨时空的量化观测框架,为研究AI技能需求的结构性变迁提供了前所未有的精确数据支撑,对劳动力经济学、技术扩散研究及教育规划产生了深远影响。
当前挑战
该数据集面临的首要挑战在于准确界定与抽取招聘文本中复杂多样的AI技能表述,尤其是区分硬性要求与锦上添花的能力,这需要高度精细的技能本体库与自然语言处理技术。构建过程中,如何确保覆盖全球范围内动态更新的企业招聘信息,同时规避重复计数及不同招聘平台表达风格带来的噪声,成为数据质量的关键瓶颈。此外,技能层级的划分(如生成式AI与经典ML)需随时间演进不断调整以反映技术迭代,这为保持数据集时效性与一致性带来了长期挑战。
常用场景
经典使用场景
在劳动力市场与技能需求演变的交叉研究领域,该数据集被广泛用于追踪人工智能技能在技术岗位招聘中的渗透轨迹。研究者可基于每日更新的快照数据,按时间序列分析不同AI技能层级(如生成式AI与经典机器学习)在职位描述中的出现频率,同时结合职位类别(数据、工程、产品等)与资历层级(入门、中级、高级)进行细粒度透视。这一经典用法尤其适用于量化AI技能从高端岗位向全行业蔓延的速度与模式。
衍生相关工作
该数据集已衍生出一系列聚焦AI技能需求的实证研究工作。部分研究在此基础上构建了AI技能需求预测模型,利用时间序列方法预测不同岗位类别的技能渗透率拐点;另一些工作则将其与薪资数据、教育背景数据融合,分析AI技能要求对岗位薪酬与候选人背景的影响。此外,该数据还被用于刻画生成式AI与经典ML技能需求的地域与行业异质性,为区域人才政策制定提供了数据支撑。
数据集最近研究
最新研究方向
该数据集聚焦于追踪人工智能技能在技术岗位招聘要求中的渗透率变化,通过细粒度的时间序列数据,揭示生成式AI与传统机器学习技能在企业需求中的分化趋势。当前前沿研究方向集中于利用该指数量化AI招聘信号的行业异质性,例如数据、工程与安全等不同职能领域对AI技能的采纳速度差异,以及初级职位是否被迫提前嵌入AI素养要求。其与“AI重塑劳动力市场”这一热点事件紧密相连——随着大语言模型部署的激增,数据集提供的硬性要求占比(required_count)指标,为研究技能需求从附加项向准入门槛的转变提供了实证基础。这一动态监测能力,不仅帮助学者验证技术扩散的经济学理论,更为政策制定者在教育体系与职业再培训规划中提供了实时数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务