遇见数据集

JobHop v2

收藏
arXiv2026-07-13 更新2026-07-15 收录
数据链接:
官方服务:

资源简介:

JobHop v2是由根特大学AIDA-IDLab团队构建的大规模公开职业轨迹基准数据集,作为原始JobHop数据集的增强版本。该数据集包含从36.1万份匿名简历中提取的167万条工作经历记录,每条记录均映射至ESCO职业分类体系,并具备季度级时间标注和五级教育水平注释。其构建过程采用基于推理控制的大型语言模型从非结构化多语言简历中进行高质量信息抽取,显著提升了数据质量和模式丰富度。该数据集旨在支持职业路径推荐系统的研究与评估,为解决劳动力市场分析、个性化职业建议及技能缺口预测等实际问题提供高质量基准数据。

JobHop v2 is a large-scale open career trajectory benchmark dataset constructed by the AIDA-IDLab team at Ghent University, serving as an enhanced version of the original JobHop dataset. This dataset encompasses 1.67 million work experience records extracted from 361,000 anonymous resumes, with each record mapped to the ESCO occupational classification system, and equipped with quarterly-level temporal annotations and five-tiered education level annotations. Its construction pipeline leverages inference-controlled large language models to perform high-quality information extraction from unstructured multilingual resumes, substantially improving data quality and pattern richness. This dataset aims to support research and evaluation of career path recommendation systems, providing high-quality benchmark data for addressing practical problems including labor market analysis, personalized career advice, and skill gap prediction.

创建时间:
2026-07-13
原始信息汇总

数据集概述

基本信息

  • 数据集名称: JobHop v2
  • 发布平台: Hugging Face Hub
  • 数据集地址: https://huggingface.co/datasets/aida-ugent/JobHop
  • 相关项目: STEP(职业路径推荐模型)和 JobHop v2(信息提取流水线)

数据来源

  • 原始简历语料库为私有数据(由弗拉芒公共就业服务局 VDAB 提供的假名化人力资源数据),未包含在公开数据集中。
  • 公开数据集中的示例/固定数据均为合成数据。

数据内容

  • 基于 LLM 的信息提取流水线,将原始的多语言简历转换为 ESCO 编码的职业轨迹数据。
  • 包含数据集构建和评估的代码。

相关论文

  • STEP: https://arxiv.org/abs/2607.11722
  • JobHop: https://arxiv.org/abs/2607.11715

许可证

  • MIT 许可证
搜集汇总
数据集介绍
JobHop v2 数据集图片
构建方式
JobHop v2 源自弗拉芒公共就业服务机构 VDAB 提供的约 40 万份经过伪匿名化处理的多语言简历。与原始版本相比,v2 版本采用高推理强度的 openai/gpt-oss-120b 大语言模型进行受控推理提取,并引入重试机制以确保 100% 的 JSON 解析成功率。提取架构不仅扩充了字段模式(涵盖标准化职位、工作安排、合同类型及技术技能),还将原有的二元高等教育标志升级为包含无学历、中学、学士、硕士和博士的精细五级教育分类体系。随后,经过多步骤的清洗与规范化流程——包括以非对称置信阈值分配 ESCO 职业代码、多语言时间与教育等级映射,以及合并相邻岗位以消除简历格式造成的碎片化——最终生成了 355,315 条独特的职业轨迹,并按 80/10/10 比例划分为训练集、验证集与测试集。
特点
作为目前规模最大的公开职业轨迹基准之一,JobHop v2 在多个维度上实现了显著提升。其轨迹均源自真实且未经结构化处理的简历文本,并统一映射至 ESCO v1.1.2 分类体系,覆盖了从管理层到初级岗位的广泛职业分布。该数据集独树一帜地同时提供了以季度为粒度的精确时间注释与精细化的五级教育程度信息,使得对职业演进中时间跨度和教育影响的建模成为现实。与原始 JobHop 相比,v2 版本通过受控推理提取显著提升了数据质量,彻底消除了提取失败案例,并凭借更丰富的字段模式支持更加深入的评估。数据集的多样性体现在其多语言特性(以荷兰语为主,兼有法语与英语),以及轨迹长度从 1 到 20 余项的广泛变化范围。
使用方法
JobHop v2 专为基于 ESCO 分类的职业路径推荐与下一职位预测研究而设计。使用时,每条职业轨迹可视为按时间排序的职位序列,可选配包含年间间隔与最高教育程度等辅助信号。研究人员可直接利用 ESCO 职位描述作为检索目标,在 3,007 个叶节点职位构成的候选空间上进行预测。该数据集特别适合用于评估时间感知型序列模型与教育信息融合技术:时间编码可采用时间衰减 GRU 等架构,而教育程度则可通过特征级线性调制等机制引入。数据集已公开发布于 HuggingFace 平台,用户可基于预设的数据划分开展实验,从而确保结果的可重复性,并可将代码与模型在相同的数据集上直接进行比较与评估。
背景与挑战
背景概述
职业路径编码了数十年的技能习得、角色转变与教育投资,对其大规模理解构成了劳动力规划、劳动市场政策与职位推荐的核心基础。简历作为职业轨迹的丰富载体,详尽记录了工作经验、教育与技能信息,但其非结构化、异构且多语言的天然特性长期阻碍了系统性的规模化分析。2026年,由比利时根特大学AIDA-IDLab实验室的Iman Johary等人提出的JobHop v2数据集,显著拓展了此前同为该团队发布的JobHop数据集。该数据集源自约40万份经佛兰德斯公共就业服务署(VDAB)提供的脱敏简历,通过推理控制型大语言模型(GPT-OSS-120B)进行结构化提取,并采用多步标准化与清洗流程,最终生成了355,315条独特的职业轨迹。相较于前作,JobHop v2在抽取质量、提取模式丰富度以及教育水平标注精细化(引入五级教育分类)方面实现了质的飞跃,为时序与教育信号在职业轨迹建模中的结合提供了首个大规模、公开可用的基准。该数据集的出现,直接推动了作者所提出的STEP(Sequential Trajectory of Employment Prediction)推荐系统的性能评估——在下一代职业预测任务中,STEP凭借其时序注意力机制与教育条件调制,在JobHop v2上取得了41.1%的Recall@10,显著超越现有基线。
当前挑战
JobHop v2数据集所需解决的领域核心挑战在于:面对庞大且异质的职业空间(ESCO分类体系定义了3,007个叶节点职业),如何从非结构化的历史职业序列中精准预测个体的下一项职业。这一问题超越了传统的图像分类或文本分类,其预测空间不仅维度极高(需从数千候选职业中排序),且职业轨迹的序列长度、时间间隔、技能跨度及教育背景的复杂交织均对模型提出了严苛的时序建模与语义泛化要求。在数据集构建过程中,研究团队遭遇了多重困难:首先,源简历为多语言混合(荷兰语、法语、英语)的脱敏文本,包含<MASK>标记与异构格式,且因隐私协议无法使用云端推理服务,迫使所有大规模LLM抽取任务必须在本地基础设施上完成;其次,初步提取时常出现JSON解析失败(约12.6%的初始失败率),不得不设计包含重算逻辑与扩展生成空间的容错机制,最终实现了100%的解析成功率;此外,日期归一化、教育等级映射、连续职位合并(因排版碎片化导致的约19,432条虚假拆分)等繁琐的清洗步骤,共同构成了将非结构化简历转化为高质量结构化轨迹数据的核心构建壁垒。
常用场景
经典使用场景
在劳动力市场分析与职业路径规划的研究领域中,JobHop v2数据集作为首个大规模、多语言、端到端从非结构化简历中提取的公开职业轨迹基准,为下一代职业预测模型的开发提供了坚实的数据基石。该数据集包含逾35万条真实职业轨迹,每条轨迹均配备了季度级时间戳、五级教育程度标注以及映射至ESCO职业分类体系的标准化职位编码,这使得研究者能够精准地模拟个体职业发展中的时序依赖与教育背景耦合效应。其经典使用场景聚焦于下一职位预测任务,即基于已观测的职业序列,预测个体即将从事的下一个标准化职位,从而为职业推荐系统的评估与优化提供标准化的测试平台。
解决学术问题
JobHop v2数据集的核心贡献在于破解了职业轨迹研究中长期存在的公开数据稀缺难题。过往研究多依赖LinkedIn等商业平台的私有数据或小规模调查样本,导致实验结果难以复现且泛化能力受限。该数据集提供了大规模、高质量且附带丰富元数据的公开基准,使学术界能够系统性地探索时序建模、教育背景调制以及跨语言职业表示学习等关键问题。其深远影响在于,它使得研究者得以摆脱对专有数据的依赖,从而推动职业路径预测领域向可复现、可比较的科学范式演进,并为后续STEP等时序注意力模型的诞生提供了不可或缺的训练与评估基础。
衍生相关工作
JobHop v2数据集的发布催生了一系列具有代表性的衍生研究工作,其中最为核心的当属STEP模型。STEP创新性地融合了时间衰减门控循环单元与基于特征线性调制的教育程度条件机制,在职业路径推荐任务上取得了领先性能。此外,与之配套的ROUTE表示学习流程通过无监督去噪自编码与引导式对比微调的两阶段策略,显著提升了职业嵌入向量的质量。这些工作共同构建了一个从数据构建、表示学习到顺序预测的完整技术栈,为后续研究者在职业轨迹建模、序列推荐算法以及多模态劳动市场分析等方向开辟了新的探索空间。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务