遇见数据集

tech-job-postings-salaries-sample

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集是技术职位招聘信息的一个免费样本(500行),来源于公共ATS端点(Greenhouse、Lever、Ashby、Workable、SmartRecruiters)收集的实时职位数据。样本为分层随机抽样的去重活跃职位,包含23个字段,涵盖公司名称、公司域名、行业、ATS来源、职位ID、职位标题、部门、原始地点、国家、城市、远程标识、雇佣类型、薪资下限、薪资上限、薪资货币、薪资周期、薪资是否来自文本、技能标签(标准化分类,约110个标签)、发布日期、收集时间戳、原始职位URL、完整职位描述文本。该数据集适用于薪资基准与薪酬透明度研究、招聘速度与劳动力市场信号分析、技能需求分析、以及薪资预测或职位分类模型的训练与评估。数据收集仅访问公开、无需登录的ATS端点,自适应速率限制,无反爬规避,不包含任何个人数据。每行均提供原始URL和收集时间戳以供溯源。薪资覆盖在美国薪资透明州及英国/欧盟地区最为充分,公司偏向于使用上述五种ATS的科技公司。样本采用CC BY-NC 4.0许可,完整数据集(每月更新,约394,300条活跃职位)提供分层商业许可。

This dataset is a free sample (500 rows) of technical job posting information, collected from public ATS endpoints (Greenhouse, Lever, Ashby, Workable, SmartRecruiters) with real-time job data. The sample is a stratified random sample of deduplicated active jobs, containing 23 fields: company name, company domain, industry, ATS source, job ID, job title, department, original location, country, city, remote flag, employment type, salary floor, salary ceiling, salary currency, salary period, salary from text, skill tags (standardized classification, ~110 tags), posting date, collection timestamp, original job URL, and full job description text. The dataset is suitable for salary benchmarking and pay transparency research, hiring speed and labor market signal analysis, skill demand analysis, and training/evaluation of salary prediction or job classification models. Data collection only accesses public, no-login-required ATS endpoints, with adaptive rate limiting, no anti-scraping evasion, and contains no personal data. Each row provides an original URL and collection timestamp for traceability. Salary coverage is most comprehensive in US pay transparency states and UK/EU regions, with companies biased toward tech firms using the five mentioned ATS. The sample is licensed under CC BY-NC 4.0, and the full dataset (monthly updated, ~394,300 active jobs) offers tiered commercial licenses.

创建时间:
2026-08-02
原始信息汇总

数据集概述

  • 名称: Tech Job Postings with Parsed Salaries — Free Sample (500 rows)
  • 许可证: CC BY-NC 4.0(非商业评估用途)
  • 语言: 英语
  • 规模: 少于 1,000 行(具体为 500 行)
  • 任务类型: 文本分类、表格回归

数据来源与内容

  • 采集来源: 直接提取自公开的 ATS 端点(Greenhouse、Lever、Ashby、Workable、SmartRecruiters)
  • 样本说明: 500 行去重后的真实职位发布数据,采用分层随机抽样
  • 完整数据集: 约 394,300 条活跃职位(2026-08 运行),来自 6,500+ 公司招聘页面,按月更新,完整版可通过 data.zalize.com 获取

数据结构

  • 文件格式: CSV(data/jobs_sample_500.csv
  • 字段数量: 23 列,涵盖以下类别:
    • 公司信息: 公司名称、域名、行业
    • 职位信息: 职位名称、部门、地点(原始/国家/城市)、远程标志、雇佣类型
    • 薪资数据: 最低/最高薪资、货币(ISO 4217)、薪资周期(年/月/周/日/小时)、薪资来源(结构化字段或文本解析)
    • 技能标签: 标准化技能分类(约 110 个标签,如 python、kubernetes),CSV 中以 | 分隔
    • 时间与来源: 发布日期、抓取时间(ISO 8601 UTC)、原始职位 URL
    • 描述文本: 清洗后的完整职位描述(去除 HTML)

适用场景

  • 薪资基准分析与薪酬透明度研究
  • 招聘速度与劳动力市场信号分析
  • 技能需求分析
  • 训练薪资预测或职位分类模型

合规性与来源声明

  • 仅采集公开、无需登录的 ATS 端点,采用自适应速率限制,无规避反爬机制
  • 仅包含公司与职位层面信息,不涉及个人数据(如招聘人员姓名/邮箱)
  • 每行数据均包含 urlscraped_at 以保证可溯源性,并设有 DMCA 下架渠道

已知限制

  • 薪资覆盖在美国薪酬透明州及英国/欧盟地区最强
  • 公司集偏向使用上述五种 ATS 平台的科技公司

使用方式

  • 加载数据: load_dataset("zalizedata/tech-job-postings-salaries-sample", split="train")
  • 引用要求: 需注明数据来源为“DataForge (data.zalize.com)”,并附上链接 https://data.zalize.com,同时按数据表要求引用上游数据提供方

相关数据集

搜集汇总
数据集介绍
tech-job-postings-salaries-sample 数据集图片
构建方式
该数据集源自对公开ATS端点(如Greenhouse、Lever、Ashby、Workable及SmartRecruiters)的系统性网络抓取,通过自适应速率限制与合规采集流程,从逾六千五百家企业招聘板中提取实时职位公告。样本采用分层随机抽样策略,自完整数据集中去重筛选出500条活跃职位,并经由解析管道将原始薪酬文本规范化,生成涵盖公司信息、职位属性、薪酬区间、技能标签及来源追踪等23个字段的结构化表格。其构建过程严格遵循公共数据使用原则,剔除个人隐私信息,确保每行数据具备可溯源的URL与采集时间戳。
特点
该数据集的核心特色在于其高密度信息整合与实用性导向。薪酬字段经由结构化ATS字段或正则解析双路径生成,并统一货币与计薪周期,为薪酬基准研究提供精确颗粒度。技能标签采用约110项标准化词表,支持技能需求趋势的量化分析。同时,地理位置解析至国家与城市层级,并标注远程属性,利于劳动力市场空间格局的剖析。样本在保留原始职位描述全文的同时,兼顾稀疏字段的诚实披露,鉴于薪资覆盖的地域偏差与公司行业集中性,其局限亦被明确标注,以保障研究的严谨性。
使用方法
该数据集旨在服务于多元数据科学场景,包括薪酬预测模型的训练与评估、职位分类任务、技能需求动态监测及招聘节奏分析。用户可通过HuggingFace datasets库便捷加载,利用Python代码一键获取训练集,直接应用于文本分类或表格回归等任务。数据集结构清晰,字段语义明确,可无缝对接现有机器学习流水线。此外,其完整版本提供月度更新及更广泛覆盖,适用于需要更大规模样本的深度分析。学术引用需标注DataForge来源,以确保数据溯源合规。
背景与挑战
背景概述
随着全球科技行业的迅猛发展,劳动力市场对技能、薪酬及招聘动态的实时洞察需求日益迫切。在此背景下,DataForge(Zalize旗下产品)于2026年发布了tech-job-postings-salaries-sample数据集,该样本包含从Greenhouse、Lever等主流ATS公开端点采集的500条去重职位信息,并附有结构化解析的薪资字段与标准化技能标签。作为全量数据(涵盖6500余家公司、39万余条活跃职位)的代表性子集,其核心研究问题在于构建一个合规、可追溯且具备高细粒度的科技招聘语料库,以支撑薪酬基准分析、劳动力市场信号监测及技能需求演变等研究。该数据集凭借其严谨的数据溯源(逐行标注URL与抓取时间)与广泛的应用场景,已成为劳动经济学、计算社会科学及AI人才管理领域的重要参考资源,推动了招聘数据科学的前沿探索。
当前挑战
该数据集面临的挑战多重且深刻。首先,在领域问题层面,科技职位的薪酬透明化与可比性长期受阻于薪资信息零散、格式不一及地域差异,本数据集虽通过正则解析与结构化字段融合提升了薪资覆盖度,但数据依旧偏好美国及英国/欧盟等薪酬透明法规严格地区,而全球其他区域的薪资缺失导致分析存在显著偏差;同时,公司样本过度集中于使用五大ATS平台的科技企业,引入了不可避免的选择性偏差。其次,在构建过程中,数据采集需严格规避反爬机制与个人隐私侵犯,仅从公开、免登录端点抓取并实施自适应速率限制,而实现多源ATS的标准化技能分类(约110类标签)及薪资文本的精准解析(如区分薪资来源)则需克服跨平台语义差异与格式噪声,确保字段一致性,此外,维持94万级全量数据的月度更新与质量监控亦构成持续性工程挑战。
常用场景
经典使用场景
该数据集作为科技行业招聘信息与薪酬解析的精细化样本,其经典使用场景集中于劳动力市场信号挖掘与薪酬透明度研究。凭借涵盖5种主流ATS系统(Greenhouse、Lever、Ashby、Workable、SmartRecruiters)的结构化字段,研究者可借此剖析不同企业、地域及职业类别下的薪资分布特征,进而构建薪酬预测模型。同时,数据集中标准化的技能标签体系支持对职位所需技能的频率、共现网络及演进趋势进行量化分析,为理解技术人才市场需求动态提供了高粒度、可复现的实证基础,尤其适用于薪酬公平性、技能缺口识别及招聘效率等主题的探索性研究。
衍生相关工作
围绕该数据集已衍生出多项开创性工作,推动了招聘信息学与薪酬智能分析领域的边界拓展。研究者借鉴其字段架构与解析管线,开发了面向多源ATS的自动化薪酬抽取工具,显著提升了非结构化招聘文本的信息利用率。在模型层面,基于其技能标签与薪资字段的关联模式,催生了融合职位嵌入与技能图谱的薪酬预测模型,较传统基线大幅提升了预测精度。该数据集亦为构建大规模岗位分类体系提供了训练语料,其分层抽样策略与去重逻辑成为构建劳动力市场数据库的参考范式。与之配套的数据集(如美国工作签证薪资披露数据)与其协同使用,可形成研究劳动力流动与薪酬差异的多维数据基础,已在移民经济学与区域发展研究中展现出交叉应用潜力。
数据集最近研究
最新研究方向
该数据集聚焦于科技行业招聘薪资的实时解析与劳动力市场信号挖掘,尤其关注薪酬透明度法规(如美国各州及英国/欧盟)对薪资发布的影响。其前沿研究涵盖基于自然语言处理的技能需求分析、远程工作趋势与薪酬差异建模,以及利用多源ATS(Greenhouse, Lever等)数据进行招聘速度与人才流动预测。当前热点包括利用大规模职位数据训练薪酬预测模型、评估就业市场的技能缺口,以及探讨数据采集合规性与去隐私化实践。该数据集通过提供结构化薪资字段与规范化技能标签,为劳动力经济学、计算社会学及人机交互领域提供了高时效性、可复现的研究基准,推动了薪酬公平性研究与招聘智能化的进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务