遇见数据集

OpenIntern

收藏
github2026-07-16 更新2026-07-17 收录
数据链接:
官方服务:

资源简介:

OpenIntern是一个面向技术实习(软件工程、数据、AI/ML、量化、硬件、产品管理)的开放数据层,提供免费的结构化列表、公共API、无账户公告板和社区公司注册表。它通过轮询公共招聘板API收集数据,并每日提供JSON/CSV数据转储,数据集永久免费。

OpenIntern is an open data layer targeting technical internships including software engineering, data, AI/ML, quantitative trading, hardware, and product management. It provides free structured listings, a public API, an account-free bulletin board, and a community company registry. It collects data by polling public job board APIs, and offers daily JSON/CSV data dumps. The dataset is permanently free.

创建时间:
2026-07-10
原始信息汇总

数据集概述:OpenIntern

OpenIntern 是一个面向技术实习岗位(如软件工程、数据科学、AI/ML、量化、硬件、产品管理等)的开源实习数据集,提供结构化的岗位列表、公共 API 以及免费访问的职位看板。

核心特性

特性 说明
数据集 永久免费,每日提供 JSON/CSV 格式的数据导出
公共 API 提供 GET /api/v1/jobs/companies/health 等接口,支持按角色、地区、学期、时长等参数查询
职位看板 无需注册即可浏览和筛选岗位,支持按角色、地区、学期、时长过滤
申请记录 仅存储在用户本地浏览器(localStorage)中
公司注册 开放社区公司注册,通过 PR 提交 YAML 文件即可添加公司
数据来源 从 Greenhouse、Lever、Ashby、Workable、SmartRecruiters、Recruitee、Rippling、BambooHR 等主流招聘平台公开 API 获取,不爬取 LinkedIn、不出售邮箱

数据获取方式

  • 每日数据导出:提供稳定的 JSON 和 CSV 格式完整数据集:
  • 公共 API:可通过 https://openintern.dev/api/v1/jobs 端点按角色、地区、学期、时长等参数查询,响应按职位系列分组,支持分页。
  • 本地部署:可通过源码自建,使用 pnpm dump 命令生成数据导出。

API 查询参数

/api/v1/jobs 端点支持以下参数:

参数 说明 示例
q 搜索关键词 q=software
company 公司标识 company=google
role 角色系列 role=software
region 地区(remote/us/canada/europe/other) region=canada
season 学期(summer/fall/winter,spring 映射为 summer) season=fall,winter
duration_months 时长(支持重叠匹配) duration_months=4,6
posted_after 发布日期之后 posted_after=2024-01-01
page 页码 page=1
limit 每页数量(默认 27,最大 100) limit=50

许可协议

  • 采用 Apache-2.0 开源许可。
搜集汇总
数据集介绍
OpenIntern 数据集图片
构建方式
OpenIntern数据集构建于对多家主流招聘管理系统(ATS)的公开API进行系统化轮询之上,涵盖Greenhouse、Lever、Ashby、Workable等平台。通过自动化的数据采集管道,每日生成结构化的JSON与CSV文件快照。同时,社区通过向GitHub仓库提交YAML形式的公司注册信息,以PR方式参与数据集的扩充与维护。整个流程拒绝爬取LinkedIn、兜售邮箱或设置付费门槛,确保数据的开放性与合规性。
特点
该数据集的核心特征在于其完全开放、无需注册的使用模式,以及永久免费的数据获取承诺。提供每日更新的JSON/CSV批量导出文件,并配备限速的公开RESTful API,支持按角色、地区、季节、实习时长等多维度精确筛选。查询结果按岗位族(role family)智能聚合,同时保留每条岗位信息的独立访问能力,确保了数据检索的灵活性与粒度控制。
使用方法
使用者可通过两种主要途径消费该数据集。对于轻量级查询,推荐直接调用分页API接口,如使用cURL命令按角色或地区检索岗位列表。对于大规模数据分析,建议下载每日发布的完整数据快照(jobs.json或jobs.csv),避免密集轮询线上API。此外,整个项目支持本地Docker化部署,开发者可通过运行`pnpm ingest`等命令自行构建完整的采集与索引环境,实现完全自托管的可用性。
背景与挑战
背景概述
OpenIntern数据集诞生于科技行业实习信息碎片化与不透明化的背景之下,由dnexdev团队于近期创建并维护。该项目旨在构建一个开源、免费且结构化的技术实习岗位语料库,涵盖软件工程、数据科学、人工智能、量化分析、硬件及产品管理等多个领域。其核心研究问题在于如何通过开放数据层与公共API,打破传统招聘平台的信息壁垒,实现实习岗位的透明化、可访问性与可复用性。自发布以来,OpenIntern凭借其无账户浏览、每日JSON/CSV转储及社区驱动的公司注册机制,迅速在开放数据与求职领域引起关注,为研究者与求职者提供了一个规范、可编程的实习数据集,对推动劳动力市场数据民主化具有开创性意义。
当前挑战
OpenIntern所面临的领域挑战主要在于解决科技实习信息分散、付费门槛高及数据格式不一的问题,其目标是通过标准化接口聚合来自Greenhouse、Lever等多个ATS平台的实时职位。在构建过程中,团队遭遇了多重技术与非技术挑战:首先,不同ATS系统的API数据结构与更新频率各异,需要设计统一的数据抽取与清洗管道;其次,确保数据实时性与准确性,同时避免因频繁轮询导致IP封禁或速率限制;此外,社区驱动的公司注册机制需要维护严格的质量审核流程,防止虚假信息;同时,项目明确排除LinkedIn爬取、简历抓取等灰色地带,严格限定数据范围,增加了数据覆盖的完整性与合规性之间的平衡难度。
常用场景
经典使用场景
OpenIntern作为一个开源的科技实习信息语料库,其最经典的使用场景在于为求职者、教育机构及研究团队提供结构化的、无付费墙的实习岗位数据。通过其公开的RESTful API与每日更新的JSON/CSV数据转储,研究者与开发者可便捷地获取涵盖软件工程、数据科学、人工智能、量化分析、硬件及产品管理等领域的实习岗位信息。该数据集凭借对Greenhouse、Lever等主流招聘系统(ATS)的持续轮询机制,确保了数据的实时性与可靠性,从而在劳动力市场分析、实习机会区域差异化研究以及岗位需求趋势预测等场景中发挥关键作用。
解决学术问题
该数据集有效解决了科技实习信息分散、非标准化及获取成本高昂的学术研究困境。长期以来,由于缺乏统一的开放数据源,针对实习市场的结构性分析、区域分布规律及季节波动模式等研究常受限于样本偏差与数据时效性不足。OpenIntern通过结构化字段(如角色、地区、季节、持续时间)与标准化分类逻辑,为精准的时空对比分析奠定了数据基础,推动了劳动力经济学、教育政策评估以及职业路径偏好建模等领域的实证研究进展。其开源性亦保障了研究结果的可复现性,降低了学科交叉研究的门槛。
衍生相关工作
围绕OpenIntern数据集已衍生出多项有价值的后续工作。社区贡献的YAML格式企业注册文件形成了可扩展的公司名录,为行业生态画像与雇主品牌分析提供了基础。基于其API构建的区域性实习看板与个性化推送服务,验证了轻量级数据分发架构的实用性。此外,数据集在跨平台招聘信息归一化(如不同ATS系统的字段映射)与岗位分类算法优化中的反复应用,催生了一批可复用的开源工具链,例如针对角色族(Role Family)的智能分组模块与持续集成的数据流水线,显著降低了同类项目的数据采集与清洗成本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务