遇见数据集

us-work-visa-salary-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集包含美国工作签证(H-1B LCA 和 PERM)的官方薪资披露记录,数据来源于美国劳工部(DOL)和 USCIS。总计约 1450 万条记录,涵盖 2008 财年至最新财年。每条记录包括雇主信息、职位名称、工资水平、工作地点和案件状态。数据集分为四个表格:employer_profiles(雇主档案,约 183 万行)、filings(申请记录,约 1178 万行)、uscis_h1b_employers(USCIS H-1B 雇主数据,约 82.7 万行)、wage_benchmarks(工资基准,约 9.6 万行)。数据以 Parquet 格式提供,并包含 CSV/JSONL 副本。该数据集适用于薪酬基准分析、人才市场研究、移民政策分析以及雇主招聘情报等场景。许可协议为 CC BY-NC 4.0,学术和个人使用免费,需注明出处并链回数据来源;商业使用需获取商业许可。

This dataset contains official salary disclosure records for U.S. work visas (H-1B LCA and PERM), sourced from the U.S. Department of Labor (DOL) and USCIS. It contains approximately 14.5 million records covering fiscal years 2008 to the latest fiscal year. Each record includes employer information, job title, wage level, work location, and case status. The dataset is divided into four tables: employer_profiles (approximately 1.83 million rows), filings (approximately 11.78 million rows), uscis_h1b_employers (approximately 827,000 rows), and wage_benchmarks (approximately 96,000 rows). Data is provided in Parquet format with CSV/JSONL copies. The dataset is suitable for salary benchmarking, talent market research, immigration policy analysis, and employer recruitment intelligence. Licensed under CC BY-NC 4.0, free for academic and personal use with attribution and link back to the data source; commercial use requires a commercial license.

创建时间:
2026-08-08
原始信息汇总

数据集概述

US Work Visa & Salary Disclosures (H-1B, PERM, LCA) 是一个包含约 14.5M 条工资披露记录的数据集,数据来源于美国劳工部(DOL)和 USCIS 的官方签证申请文件,涵盖 H-1B LCA 和 PERM 申请,时间跨度为 FY2008 至最近财年。数据集由 DataForge 开源数据项目提供,适用于学术和个人用途。

数据组成

数据集包含四个配置(表),均以 Parquet 格式存储:

配置名称 行数 Parquet 分片数 大小
employer_profiles 1,836,381 1 96.2 MB
filings 11,776,395 2 651.0 MB
uscis_h1b_employers 826,943 1 41.2 MB
wage_benchmarks 95,888 1 3.4 MB

数据内容与字段

每条记录包含雇主信息、职位名称、工资水平、工作地点和案件状态等字段。数据包内附带数据字典(DATA-DICTIONARY.md)、数据说明(DATASHEET.md)和 QA 报告。

可用数据包

数据包名称 层级 行数 大小
visa_salaries-tier1-S-2026-08-02.zip S(加州快照) 1,814,772 212.8 MB
visa_salaries-tier1-M-2026-08-02.zip M(最新年份全项目) 915,005 109.2 MB
visa_salaries-tier1-L-2026-08-02.zip L(纵向完整包,FY2008+) 14,535,607 1.68 GB

使用场景

  • 薪酬基准对比(Compensation benchmarking)
  • 人才市场研究(Talent-market research)
  • 移民数据分析(Immigration analytics)
  • 雇主招聘情报(Employer hiring intelligence)

数据来源与方法

数据来源于美国劳工部外国劳工认证办公室(OFLC)的披露文件以及 USCIS 的 H-1B 数据。

许可证

  • 学术/个人使用:遵循 CC BY-NC 4.0 许可,需注明出处并提供指向 https://data.zalize.com 的反向链接。
  • 商业使用:需获得 DataForge 商业许可证。
  • 上游数据为美国政府公共领域作品(17 U.S.C. §105)。

引用方式

text DataForge (data.zalize.com), built from official US DOL/USCIS disclosure files — https://data.zalize.com/datasets/us-work-visa-salary-dataset

DOI(Zenodo 镜像):10.5281/zenodo.21812582

主要链接

  • 数据集中文页面:https://data.zalize.com/datasets/us-work-visa-salary-dataset
  • 开放数据目录:https://data.zalize.com/open-data
  • 机器可读索引:https://dl.zalize.com/open-data
  • GitHub Release 镜像:https://github.com/wookat/dataforge-pipelines/releases/tag/open-data-visa-salaries
搜集汇总
数据集介绍
us-work-visa-salary-dataset 数据集图片
构建方式
该数据集汇聚了美国劳工部与公民及移民服务局官方披露的签证申请记录,涵盖H-1B LCA与PERM等类别,时间跨度自2008财年至今。数据经过精细清洗与结构化处理,划分为雇主档案、申请记录、H-1B雇主名录及薪资基准四个核心表,并依据数据规模提供S、M、L三种压缩包,其中L级包含超过1450万条完整记录,辅以数据字典与质量报告。
使用方法
用户可通过HuggingFace Datasets库便捷加载,支持employer_profiles、filings、uscis_h1b_employers及wage_benchmarks四种配置,亦可使用Pandas、Polars或DuckDB直接读取远程Parquet文件。压缩包内附数据字典与数据说明书,便于快速理解字段语义。该数据集遵循CC BY-NC 4.0许可,适用于学术与个人研究,商用需另获授权。
背景与挑战
背景概述
该数据集由DataForge开放数据计划于2026年发布,整合了美国劳工部与公民及移民服务局的官方披露档案,涵盖H-1B、PERM及LCA签证申请中的薪酬记录,时间跨度自2008财年至最新财年,总计逾1450万条。其构建旨在为劳动经济学、移民政策研究及人力资源分析提供系统性的量化基础,突破了以往数据分散、口径不一的研究困境。数据集涵盖雇主概况、申请案卷、雇主名单及薪资基准四类表格,极大便利了跨国劳动力市场的比较分析与趋势追踪,已成为相关领域实证研究的重要数据源。
当前挑战
该数据集面临多重挑战。领域层面,美国工作签证薪酬披露数据涉及敏感个人信息与复杂法律条款,如何在合规前提下保障数据完整性与隐私安全是长期难题;同时,跨国薪酬对比需克服汇率波动、地区生活成本差异及职业分类不统一等干扰因素。构建层面,数据来源分散于多个联邦机构,格式与语义差异显著,需投入大量精力进行清洗与标准化;此外,年度更新频率与历史数据的追溯性维护,对数据管线的稳定性和资源投入提出了严苛要求。
常用场景
经典使用场景
该数据集汇集了美国劳工部及移民局官方披露的H-1B、PERM及LCA签证申请记录,涵盖雇主信息、职位名称、薪资水平与工作地点等关键字段,时间跨度自2008财年至最新财年。其经典应用场景在于劳动力经济学与移民政策研究,研究者可借此剖析不同行业、地域及雇主规模下的薪资分布特征,追踪外籍劳工薪酬的动态演变,并评估签证审批政策对劳动力市场的影响。此外,该数据亦为薪酬基准分析提供了坚实基础,助力人力资源咨询机构构建行业薪酬指数,以及学术机构开展基于实证数据的人才流动与工资溢价研究。
解决学术问题
此数据集有效解决了外籍劳工薪酬数据长期碎片化、非公开化的难题,为学术界提供了统一、结构化且规模庞大的微观数据源。它使得研究者能够深入探究移民劳动力市场的薪资形成机制,验证人力资本理论、歧视经济学及区域经济差异等假设,并量化签证政策变动对雇主招聘行为与薪资定价的因果效应。通过长周期追踪,该数据还填补了关于外籍人才留存、职业流动及薪资增长路径的实证空白,为劳动经济学、公共政策及管理学研究提供了可靠的经验证据,推动了相关领域的理论深化与政策评估方法创新。
实际应用
在实际应用层面,该数据集广泛服务于企业薪酬策略制定、人才招聘与保留决策,以及移民咨询行业的服务优化。人力资源部门可借助详尽的薪资披露数据,进行跨地域、跨行业的薪酬对标,调整外籍员工薪酬包以增强市场竞争力;人才招聘平台则能基于历史趋势生成职位薪资预测,辅助求职者与雇主进行合理预期管理。此外,政府机构与非营利组织可利用该数据监控劳动力市场公平性,识别薪资歧视模式,并为签证政策制定提供数据支持,从而促进移民劳动力市场的透明化与高效运转。
数据集最近研究
最新研究方向
该数据集汇聚了美国劳工部及USCIS官方披露的逾千万条H-1B、PERM及LCA签证薪资记录,为劳动力市场与移民政策的交叉研究提供了前所未有的数据富矿。当前前沿研究方向聚焦于利用此庞大数据集进行精细化的薪酬基准分析,以揭示行业、地域及雇主间的薪资差异;同时,结合时间序列数据,学者们正深入探究技术人才流动趋势与移民政策变动对本土劳动力市场的动态影响。该数据集在人工智能伦理与公平性研究中也扮演关键角色,用于训练和验证薪酬预测模型,防范算法偏见。其公开可及性与详尽字段设计,不仅赋能学术探索,更为企业制定全球化人才战略和政策制定者评估签证项目效能提供了实证基础,成为连接微观个体职业决策与宏观劳动力市场演变的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务