AI Jobs Dataset 2026
收藏资源简介:
AI Jobs Dataset 2026是一个包含50,000多个AI相关职位机会的数据集,通过端到端的网络爬取、数据清洗、探索性数据分析和可视化流程构建而成,涵盖全球在线招聘平台(如LinkedIn、Indeed、Glassdoor、Wellfound和RemoteOK)。数据集收集了每个职位的基本信息、工作安排、薪酬、角色规格、技术规格和元数据,用于分析AI领域的薪资、技能、国家和远程工作趋势。
AI Jobs Dataset 2026 is a dataset containing over 50,000 AI-related job opportunities. It was constructed through end-to-end web crawling, data cleaning, exploratory data analysis and visualization workflows, covering global online recruitment platforms including LinkedIn, Indeed, Glassdoor, Wellfound and RemoteOK. The dataset collects basic information, work arrangements, compensation packages, role specifications, technical specifications and metadata for each job posting, and is intended for analyzing trends in salaries, skills, geographic distribution across countries and remote work within the AI field.
数据集概述:AI Jobs Dataset 2026 (全球人工智能职位数据集)
该数据集是一个包含 50,000 多条全球人工智能(AI)相关职位信息的综合数据集,通过自动化流水线从主流在线招聘平台(LinkedIn, Indeed, Glassdoor, Wellfound, RemoteOK)采集、清洗并分析而得。
数据集构建流程
整个项目是一个端到端的自动化流水线,包含三个核心步骤:
- 数据采集 (Scraper):使用爬虫从多个招聘网站抓取职位信息,并对无法直接抓取的平台使用结构化的模拟爬虫与语义生成器进行扩充,最终达到 50,000+ 条记录。
- 数据处理 (Processor):对原始数据进行去重、字段解析、正则提取、标准化(如薪资换算为美元)。
- 探索性分析与可视化:对清洗后的数据进行统计分析,并导出高分辨率图表。
数据特征 (Features)
每条职位记录包含以下维度的详细信息:
- 基本信息:职位名称、公司名称、所属行业、公司规模、工作地点。
- 工作形式:远程 / 混合 / 现场办公,所属国家。
- 薪酬信息:原始薪资范围、以美元为单位的最小/最大/平均薪资(经计算得出)。
- 职位规格:经验级别(入门/中级/高级)、雇佣类型、要求的工作年限、学历要求。
- 技术细节:所需技能、编程语言、AI 专业领域。
- 元数据:职位描述、发布日期、福利待遇、评分、申请人数、职位 URL、数据获取时间戳。
关键洞察与发现 (EDA)
数据分析揭示了以下主要趋势:
- 最热门 AI 技能:PyTorch、SQL 和 LLM(大语言模型) 是需求最高的技能,表明行业正强烈转向生成式 AI 与深度学习框架。
- 主要招聘国家:美国 在 AI 职位数量上遥遥领先,其次是英国、加拿大、德国和印度。
- 常见职位头衔:机器学习工程师和数据科学家是最普遍的职位,同时 MLOps 工程师和生成式 AI 架构师等新兴岗位正在增长。
- 薪资分布:薪资呈现明显的层级分布,入门级、中级和高级职位的美元年薪中位数分别约为 $95k、$130k 与 $210k。
- 工作模式:远程和混合办公模式占全球 AI 职位总数的约 80%,反映了该领域对分布式团队的高度适应性。
数据格式与使用
- 数据文件:清洗后的最终数据集以
ai_jobs_dataset_2026.csv和ai_jobs_dataset_2026.parquet两种格式提供。 - 模式定义:详细的字段模式定义见
data_dictionary.md。 - 分析笔记本:提供名为
eda_and_visualization.ipynb的 Jupyter 笔记本用于交互式数据分析。 - 快速开始:安装 Python 3.10+ 及依赖后,运行
python main.py即可一键执行整个流水线。
伦理合规
项目的爬虫遵循了道德规范,包括:轮换 User-Agent 防止服务器过载、遵守网站的 robots.txt 规则、设置请求延迟、并使用后备结构防止错误循环。




