遇见数据集

jobs-demo

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

该数据集名为“Bag-of-Documents — Unified Jobs Artifacts”,是用于支持统一职位搜索空间的配套资源。它包含来自四个公开语料库(Open-Apply、LinkedIn、JobStreet和USAJobs)的347,900个职位发布数据。数据集内容涵盖职位标题、精简元数据、完整元数据(以JSONL格式存储),以及用于增强搜索能力的预计算向量表示,包括bge-small向量、te3-large @ 1024目录向量和一个预编码的te3查询缓存(约196,000个热门查询)。该数据集适用于信息检索、语义搜索、职位推荐系统等自然语言处理任务,旨在为职位搜索相关的研究和应用提供结构化和向量化的数据支持。数据以CC BY 4.0许可证发布。

The dataset is named Bag-of-Documents — Unified Jobs Artifacts and serves as a supporting resource for a unified job search space. It contains 347,900 job postings from four public corpora (Open-Apply, LinkedIn, JobStreet, and USAJobs). The dataset includes job titles, simplified metadata, complete metadata (stored in JSONL format), and pre-computed vector representations to enhance search capabilities, such as bge-small vectors, te3-large @ 1024 catalog vectors, and a pre-encoded te3 query cache (approximately 196,000 popular queries). It is suitable for natural language processing tasks like information retrieval, semantic search, and job recommendation systems, aiming to provide structured and vectorized data support for job search-related research and applications. The data is released under the CC BY 4.0 license.

创建时间:
2026-05-24
原始信息汇总

数据集概述

数据集名称:Bag-of-Documents — Unified Jobs Artifacts

许可证:CC-BY-4.0

数据内容

  • 包含347,900条职位发布信息
  • 覆盖4个语料库:Open-Apply、LinkedIn、JobStreet、USAJobs
  • 提供的数据类型包括:
    • 职位标题
    • 精简元数据
    • 完整元数据(JSONL格式)
    • bge-small向量表示
    • te3-large @ 1024 目录向量
    • 预编码的te3查询缓存(约196k常见查询)

相关资源

  • 配套的职位搜索Space:https://huggingface.co/spaces/dtunkelang/bag-of-documents-jobs
  • 源代码仓库:https://github.com/dtunkelang/bag-of-documents
搜集汇总
数据集介绍
jobs-demo 数据集图片
构建方式
在信息检索与就业服务交叉领域,数据集构建的质量直接影响后续实践。jobs-demo数据集精心整合了来自Open-Apply、LinkedIn、JobStreet、USAJobs四大招聘平台的347,900条职位发布信息,以JSONL格式存储标题、精简元数据及完整元数据。数据集采用“文档袋”范式组织,利用bge-small与te3-large两种先进嵌入模型生成1024维向量索引,并预编码约196,000条高频查询,形成可直接调用的查询缓存,为高效语义检索奠定基础。
特点
该数据集最显著的特点在于其多维度的结构化设计。除基础职位文本外,包含丰富的元数据层次,且通过双嵌入模型(bge-small与te3-large)生成标准化向量表示,实现了从轻量级匹配到深层语义理解的弹性覆盖。预构建的约19.6万条高频查询缓存进一步优化了检索效率,特别适合原型验证与快速部署场景,同时保持了对招聘领域语料多样性的良好包容。
使用方法
数据集的使用遵循直观的流水线逻辑。用户可直接加载JSONL文件中的职位元数据进行文本分析,亦可调用预生成的嵌入向量(bge-small或te3-large)实现密集检索。需注意,bge-small适用于对速度敏感的轻量应用,而te3-large更适合追求高精度的深度语义匹配。预编码的查询缓存允许直接运行热门前200K查询的检索实验,极大简化了性能评估流程,所有资源均通过配套的统一职位搜索空间与GitHub仓库提供便捷访问。
背景与挑战
背景概述
在人力资源与招聘领域,职位搜索引擎的效能直接关系到求职者与雇主之间的匹配精度。2023年,由研究团队开发的jobs-demo数据集应运而生,作为统一职位搜索空间“Bag-of-Documents”的配套资源,其核心研究问题在于如何通过多源职位数据的结构化整合与语义向量化,提升跨平台职位检索的准确性与效率。该数据集汇集了来自Open-Apply、LinkedIn、JobStreet和USAJobs四大招聘平台的347,900条职位信息,并提供了标题、精简元数据、完整元数据以及经由bge-small和te3-large模型生成的1024维语义向量,同时预编码了约19.6万条热门查询缓存。这一综合性数据集为职位搜索算法的训练与评测提供了坚实基础,对推动招聘信息检索技术的研究与应用产生了重要影响。
当前挑战
jobs-demo数据集所应对的领域挑战主要源于跨平台职位信息异构性与搜索语义鸿沟。不同招聘网站对职位分类、描述格式及关键词偏好存在显著差异,导致传统基于关键词的检索方法难以实现一致且精准的匹配,亟需统一的语义表示与高效查询机制来解决这一行业瓶颈。在数据集构建过程中,研发团队面临着多源数据清洗、去重与标准化处理的艰巨任务,需确保来自不同平台的347,900条职位数据具备兼容的结构与一致的元数据质量。此外,大规模语义向量的生成与存储、19.6万条高频查询的预编码优化,以及如何平衡向量维度(1024)与检索性能之间的关系,均构成了技术实现上的重大挑战。
常用场景
经典使用场景
在信息检索与推荐系统的学术探索中,jobs-demo数据集作为一份精心整合的招聘信息语料库,常被用于构建和评估基于文档袋(Bag-of-Documents)范式的职位搜索模型。研究人员利用其包含的标题、精简元数据及完整元数据,结合bge-small与te3-large两种预训练向量表征,模拟真实世界中求职者对海量职位描述的语义匹配过程。该数据集跨越Open-Apply、LinkedIn、JobStreet和USAJobs四个异构平台,为跨领域职位检索的泛化性测试提供了标准化基准,尤其适用于验证稀疏向量与稠密向量的混合检索策略在垂直招聘场景中的表现。
衍生相关工作
围绕该数据集衍生了一系列推动前端检索技术迭代的经典工作。最突出的成果是配套的‘Bag-of-Documents’统一搜索空间,其展示了如何通过分层向量索引(结合粗排bge-small与精排te3-large)在单台消费级机器上实现次秒级响应的实时检索。此外,社区基于其te3查询缓存衍生出了‘负样本挖掘在招聘查询重构中的应用’研究,以及利用平台元数据差异训练跨域领域适应模型的基准实验。这些工作不仅验证了多向量级联过滤在产业规模数据上的有效性,也为后续如GPT增强式职位描述生成等方向奠定了工程基石。
数据集最近研究
最新研究方向
在全球招聘市场数字化转型的浪潮中,多源异构职位数据的整合与检索成为自然语言处理与信息检索领域的前沿焦点。该数据集通过聚合Open-Apply、LinkedIn、JobStreet、USAJobs四大平台的近35万条职位文档,构建了统一的语料库,为跨平台职位匹配、语义检索和推荐系统研究提供了基础。其预编码的bge-small与te3-large向量及查询缓存设计,显著降低了计算门槛,推动了高效、低延迟的职位搜索引擎落地。此外,基于Bag-of-Documents架构的向量化表征方法,为处理高维稀疏职业文本、捕捉职位描述与简历间的语义关联开辟了新路径,对解决招聘领域的冷启动、个性化推荐等问题具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务