遇见数据集

tech-job-postings-salary-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集提供了超过 390,000 条来自美国及欧盟科技公司的技术职位发布信息,数据直接从 Greenhouse、Lever、Ashby、Workable 和 SmartRecruiters 等公共 ATS 端点收集。每条记录包含结构化的薪资范围(已解析的最低/最高薪资、货币和周期)、资历级别、远程政策以及提取的技术栈标签。数据还包含每条记录的数据来源 URL 和收集时间戳。数据集分为三个规模层级:S(约 35,417 条)、M(约 19,311 条)和 L(约 394,300 条),以 Parquet 格式提供。适用于 HR 科技创始人进行薪资范围基准测试、风险投资和量化团队跟踪招聘速度作为替代增长信号、研究人员研究劳动力市场趋势、以及招聘机构识别特定领域积极招聘的公司。该数据集基于 CC BY-NC 4.0 许可证发布,学术和个人使用免费,商业使用需获得 DataForge 商业许可证。

创建时间:
2026-08-08
原始信息汇总

数据集概述

数据集名称:390,000+ Tech Job Postings with Parsed Salaries — Monthly Snapshot

数据集链接:https://huggingface.co/datasets/zalizedata/tech-job-postings-salary-dataset


1. 数据集简介

该数据集包含超过 390,000 条科技行业职位招聘信息,数据直接采集自美国及欧盟科技公司的公开 ATS(申请人追踪系统)端点(包括 Greenhouse、Lever、Ashby、Workable、SmartRecruiters)。数据集提供了结构化的薪资范围、资历级别和技术栈字段,并以干净的 CSV/Parquet 格式交付。

该数据集是 DataForge 开放数据计划的一部分,完整数据包免费供学术和个人使用。


2. 数据规模与配置

配置名称 数据文件路径 说明
S data/S/jobs-*.parquet 小型数据集
M data/M/jobs-*.parquet 中型数据集
L data/L/jobs-*.parquet 大型数据集(完整数据)

规模类别:100K < n < 1M


3. 数据包清单

数据包 级别 行数 大小
jobs-tier1-S-2026-08-01.zip S 35,417 4.5 MB
jobs-tier1-M-2026-08-01.zip M 19,311 2.4 MB
jobs-tier1-L-2026-08-01.zip L 394,300 38.5 MB

4. 数据集内容与字段

  • 390,000+ 条职位招聘信息,来自 6,500+ 家公司
  • 结构化薪资字段(已解析的最小/最大薪资、货币、薪资周期)
  • 资历级别、远程办公政策、技术栈标签
  • 每条记录包含来源 URL 和采集时间戳(数据溯源)
  • 包含完整的数据字典、数据说明文档(来源、方法、已知限制)和许可证

5. 应用场景

  • HR 科技创业者:按职位、技术栈和地域基准化薪资范围
  • VC 与量化团队:追踪招聘速度,作为替代增长信号
  • 研究人员:使用时间点职位数据研究劳动力市场趋势
  • 招聘机构:识别在特定领域积极招聘的公司

6. 数据来源与方法论

数据采集自公开的 ATS 招聘公告板(Greenhouse、Lever、Ashby、Workable、SmartRecruiters),并对结构化字段进行解析。


7. 许可协议

  • 学术/个人使用:采用 CC BY-NC 4.0 许可证,需注明出处并回链至 https://data.zalize.com
  • 商业使用:需要 DataForge 商业许可证
  • 上游许可证条款仍适用于底层数据

8. 引用方式

text DataForge (data.zalize.com) — https://data.zalize.com/datasets/tech-job-postings-salary-dataset

DOI(Zenodo 镜像):10.5281/zenodo.21813354 · GitHub Release 镜像:https://github.com/wookat/dataforge-pipelines/releases/tag/open-data-tech-jobs


9. 使用方法(Python 示例)

python from datasets import load_dataset

ds = load_dataset("zalizedata/tech-job-postings-salary-dataset", "S", split="train") print(ds[0])

可用配置:SML


10. 相关数据集

完整目录(25 个数据集):https://data.zalize.com/open-data

搜集汇总
数据集介绍
tech-job-postings-salary-dataset 数据集图片
构建方式
该数据集依托公开申请者追踪系统(ATS)端点进行系统性采集,覆盖Greenhouse、Lever、Ashby、Workable与SmartRecruiters等主流招聘平台,面向美国及欧洲科技企业。采集过程以自动化方式抓取职位公告原始文本,继而解析出结构化薪资区间、资历层级、远程政策与技术栈标签等字段,并为每条记录保留来源URL与采集时间戳。数据按规模划分为S、M、L三个层级,以Snappy Parquet格式发布,确保高效读取与版本可追溯。
特点
数据集的核心优势在于其薪资字段的完整性与结构化程度,涵盖解析后的最低与最高薪资、币种及计薪周期,弥补了同类资源普遍缺失薪资信息的短板。全部职位均附带资历等级、远程工作政策与提取的技术栈标签,且每条记录具备来源可追溯性。数据规模逾三十九万条,源自六千五百余家公司招聘板,同时提供数据字典、数据说明书及许可证,为学术与个人使用提供充分透明度。
使用方法
使用者可通过HuggingFace数据集库便捷加载,指定配置名称S、M或L并选择训练分割即可获取对应层级数据,示例代码为load_dataset("zalizedata/tech-job-postings-salary-dataset", "S", split="train")。亦可直接下载原始zip包获取CSV、Parquet及配套文档。该数据适用于薪资基准分析、招聘速度追踪、劳动力市场趋势研究及垂直领域招聘识别等场景,使用须遵循CC BY-NC 4.0许可并注明来源。
背景与挑战
背景概述
伴随数字经济浪潮的汹涌推进,科技行业劳动力市场的薪酬透明度与招聘动态日益成为学术研究与产业决策的焦点议题。在此背景下,DataForge机构于2026年8月构建并发布了tech-job-postings-salary-dataset,该数据集直接采集自Greenhouse、Lever、Ashby、Workable及SmartRecruiters等六大申请人跟踪系统(ATS)的公开端点,覆盖美国与欧洲逾6,500家企业,包含超过39万条带有解析后薪资区间、职级与技能栈标签的科技职位发布记录。其核心研究问题在于弥合传统薪酬调查数据滞后且粒度粗糙的缺陷,为劳动经济学、计算社会科学及量化投资领域提供时点精确、溯源清晰的替代性数据源,从而支撑薪酬基准测试、招聘速度追踪与劳动力市场趋势分析等多元应用场景。
当前挑战
该数据集所应对的领域问题在于科技招聘市场中薪资信息的结构性缺失与异构性——多数职位发布并未以统一格式披露薪酬,且不同ATS平台的字段语义、币种与薪酬周期差异显著,致使跨平台、跨地域的薪酬比较长期缺乏可靠的数据基础。构建过程中,研究团队面临多重技术挑战:其一,从异构ATS端点持续采集数据需应对反爬机制、接口变更与数据噪声;其二,薪酬区间的语义解析涉及非结构化文本抽取、币种归一化与周期换算,准确性高度依赖自然语言处理模型的鲁棒性;其三,职级与技能栈标签的自动生成需在覆盖广度与标注精度之间取得平衡;其四,维护月度快照的时间一致性与来源可追溯性,对数据管道工程提出了严苛要求。
常用场景
经典使用场景
在计算劳动经济学与人力资源分析领域,该数据集最经典的使用场景是薪酬基准分析与职位需求建模。研究者可直接利用其结构化薪资字段(解析后的最低/最高薪资、币种与支付周期),结合资历层级、远程政策及技术栈标签,按角色、技能组合与地理区域进行薪酬分布比较。相较于传统依赖问卷或政府统计的滞后数据,该数据集提供了来自Greenhouse、Lever等主流ATS的即时招聘信息,使研究者能够以高频、细粒度的方式刻画技术劳动力市场的薪酬动态与需求结构。
解决学术问题
该数据集有效回应了劳动市场研究中长期存在的若干学术难题。其一,传统薪酬数据多源于年度调查,存在时滞与报告偏差,难以捕捉快速变化的技术岗位薪酬;其二,职位描述中的薪资信息常为非结构化文本,难以直接量化。本数据集通过从公开ATS端点采集并解析薪资区间,提供了带有来源URL与采集时间戳的逐条溯源记录,使研究者能够构建准实验设计,分析资历、技能与地理因素对薪酬的因果影响,并检验远程工作政策对薪资溢价的作用,从而提升劳动市场实证研究的内部效度与可重复性。
衍生相关工作
围绕该数据集,已衍生出一系列相关经典工作。其同系列开放数据包括技术职位薪资样本数据集以及美国工作签证与薪资披露数据集(涵盖H-1B、PERM、LCA),共同构成了劳动市场与移民政策交叉研究的资源基础。研究者基于此类数据开展了技术岗位薪酬预测、招聘需求时空演化分析以及技能标签与薪资关联的文本分类与回归任务。此外,该数据集在Zenodo与GitHub上的镜像发布,促进了数据管线的透明化与可复现研究实践,推动了开放劳动市场数据生态的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务