遇见数据集

uk-ai-job-hunter-dev

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集是英国IT和AI职位招聘信息的精选集合,专为语义去重和高匹配候选人识别设计。数据通过混合管道从多个来源聚合:Adzuna API覆盖英国IT岗位的广泛市场,JSearch/RapidAPI针对高科技和AI岗位进行定向搜索,JobSpy直接抓取Indeed和LinkedIn列表。数据通过GitHub Actions每日收集,并存储在Hugging Face上的版本化存档中。预处理流程包括:使用all-MiniLM-L6-v2或BGE-large-en-v1.5嵌入模型基于语义相似性进行去重;利用LLM(Gemini/Llama)根据高级云/DevOps/AI标准评估职位描述,识别高匹配候选人;自动提取技术技能(如AWS、Kubernetes、Terraform)和安全许可级别(如SC、DV)。数据集包含10个字段:title(职位名称)、company(公司)、location(英国城市/地区)、source(来源API)、job_url(申请链接)、date_posted(发布日期)、isHighMatch(AI确定的高相关标志)、tags(提取的技术关键词)、clearance(安全许可要求)、description(职位描述片段)。该数据集旨在用于本地LLM的监督微调,以自动分类职位、通过比较用户简历与isHighMatch标签预测匹配概率,并基于tags和description生成高转化率的求职信。

This dataset is a curated collection of UK IT and AI job postings, designed for semantic deduplication and high-match candidate identification. The data is aggregated from multiple sources via a hybrid pipeline: Adzuna API for broad UK IT job market coverage, JSearch/RapidAPI for targeted searches on high-tech and AI positions, and JobSpy for direct scraping of Indeed and LinkedIn listings. Data is collected daily via GitHub Actions and stored in a versioned archive on Hugging Face. Preprocessing includes: deduplication based on semantic similarity using all-MiniLM-L6-v2 or BGE-large-en-v1.5 embedding models; evaluation of job descriptions using LLMs (Gemini/Llama) against senior cloud/DevOps/AI criteria to identify high-match candidates; automatic extraction of technical skills (e.g., AWS, Kubernetes, Terraform) and security clearance levels (e.g., SC, DV). The dataset contains 10 fields: title, company, location (UK city/region), source (API), job_url, date_posted, isHighMatch (AI-determined high relevance flag), tags (extracted technical keywords), clearance (security clearance requirement), and description (job description snippet). The dataset is intended for supervised fine-tuning of local LLMs to automatically classify job postings, predict match probability by comparing user resumes with isHighMatch labels, and generate high-conversion cover letters based on tags and description.

创建时间:
2026-08-27
原始信息汇总

数据集概述

数据集名称与用途

UK AI Job Hunter Dataset 是一个针对英国境内 IT 与人工智能(AI)职位发布的精选数据集,旨在支持语义去重以及高匹配候选人的识别。该数据集可作为训练本地大语言模型(LLM)的黄金标准数据,用于职位自动分类以及基于专业简历(CV)的匹配概率预测。


数据来源与采集方式

数据通过混合型流水线从多个来源汇总:

  • API01 (Adzuna):提供英国 IT 岗位的广泛市场覆盖。
  • API02 (JSearch/RapidAPI):针对高科技与 AI 岗位的定向搜索。
  • API03 (JobSpy):直接抓取 Indeed 与 LinkedIn 上的职位信息。

数据每日通过 GitHub Actions 采集,并以版本化归档形式存储在 Hugging Face 上。


预处理与 AI 处理流程

  1. 语义去重:使用 all-MiniLM-L6-v2(或升级版 BGE-large-en-v1.5)嵌入模型,基于语义相似性(而非精确文本匹配)识别跨平台的重复职位信息。
  2. AI 标注:通过基于 LLM(Gemini/Llama)的评估方法,将职位描述与“高级云/DevOps/AI”标准进行比对,从而识别高匹配候选人。
  3. 标签提取:自动提取技术技能(如 AWS、Kubernetes、Terraform 等)以及安全许可等级(如 SC、DV)。

数据模式(Schema)定义

字段 类型 描述
title 字符串 官方职位名称。
company 字符串 招聘组织名称。
location 字符串 英国的城市/地区。
source 字符串 来源 API(Adzuna、JobSpy、JSearch)。
job_url 链接 职位申请页面的直接链接。
date_posted 日期 发布时间(ISO 格式)。
isHighMatch 布尔值 AI 判定的高相关性标识。
tags 列表 提取出的技术关键词。
clearance 字符串 安全许可要求(例如 SC、eDV)。
description 字符串 职位描述片段。

预期用途:面向 LLM 训练

该数据集计划用于本地大语言模型的监督微调(Supervised Fine-Tuning, SFT),具体应用方向包括:

  • 无需外部 API 调用,即可自动完成职位分类。
  • 通过将用户 CV 与 isHighMatch 标签进行比对,预测“匹配概率”。
  • 基于 tagsdescription 生成高转化率的求职信(cover letter)。
搜集汇总
数据集介绍
uk-ai-job-hunter-dev 数据集图片
构建方式
该数据集通过混合管道汇集英国IT与AI领域的职位信息,由三大数据源协同构建:Adzuna API提供广泛的市场覆盖,JSearch/RapidAPI聚焦高科技与AI岗位的精准检索,JobSpy则直达Indeed与LinkedIn实现深度抓取。数据经由GitHub Actions每日自动采集,并存储于Hugging Face的版本化归档中,确保时序完整性与可追溯性。预处理环节采用前沿的语义去重技术,依托all-MiniLM-L6-v2或BGE-large-en-v1.5嵌入模型,超越文本表面相似度,精准识别跨平台重复职位;随后利用Gemini/Llama等大语言模型进行AI标注,依据高端云/DevOps/AI标准判定高匹配候选人,并自动提取技能标签与安全等级,形成结构化、高质量的金标准数据集。
使用方法
该数据集专为本地LLM的监督微调(SFT)而设计,研究人员可将其转化为训练语料,使模型掌握职位自动分类能力,摆脱对外部API的依赖。具体而言,利用isHighMatch标签构建监督样本,训练模型输入CV与职位描述,输出匹配概率预测;同时,基于tags与description字段,可微调模型生成高转化率的求职信。数据格式规范,字段语义清晰,便于直接加载至Hugging Face Transformers框架进行训练与评估。建议用户依据实际需求划分训练验证集,并可采用该数据集作为基准,测试模型在职位语义理解与匹配决策上的表现,推动招聘智能化的本地化部署。
背景与挑战
背景概述
该数据集由uk-ai-job-hunter-dev于近期创建,旨在应对英国IT与AI领域招聘信息碎片化、平台异构性强的痛点。研究团队通过融合Adzuna、JSearch/JobSpy等多源API,构建了一套自动化采集、语义去重及AI标注的流水线,并基于Hugging Face平台进行版本化存储与分享。其核心研究问题聚焦于如何利用语义相似度与大型语言模型(LLM)实现招聘信息的精准归类,以及基于职业履历(CV)的候选人与职位匹配概率预测。该数据集作为监督微调(SFT)的金标准,为本地化LLM在招聘场景中的细粒度分类与匹配能力提供了高质量训练素材,对推动人才筛选自动化与智能招聘系统的发展具有实证价值。
当前挑战
构建此类数据集面临双重挑战:领域层面,英国IT/AI职位描述术语多样、技能要求动态更新,且安全审查(如SC、DV)条件隐含,对语义理解与知识库的时效性提出了严苛要求;跨平台数据存在重复、格式不统一及实时性差异,导致语义去重需在全局上下文下权衡误判与遗漏的风险。构建过程中,需协调多来源API的异构数据模型,经清洗与标准化后仍难以完全消除噪声;标签标注依赖LLM的判别能力,其主观性与潜在偏差会影响高匹配标签(isHighMatch)的可靠性;持续采集依赖自动化流程的稳定性,还需兼顾隐私合规与版权边界,版本控制与数据溯源机制需周密设计。
常用场景
经典使用场景
该数据集作为面向英国IT与人工智能领域的招聘信息语料库,其核心应用场景在于语义级去重与高匹配候选人识别。基于嵌入模型对跨平台抓取的岗位描述进行表征,从而精准剔除形式相异但内涵一致的重复职位,同时利用大语言模型依据预定义的资深云/DevOps/AI标准,对候选人与岗位的契合度进行自动化评估。此类场景为招聘平台的智能化升级提供了数据基石,亦为人力资本匹配研究开辟了新颖的实证路径。
解决学术问题
此数据集有效回应了劳动经济学与计算社会学中关于职位信息冗余与匹配效率的核心议题。传统文本匹配技术难以捕捉语义等价的岗位信息,导致数据噪声高企;而此数据通过嵌入模型实现语义去重,弥补了该领域对高质量招聘语料的稀缺性。同时,其所标注的‘高匹配’标签为研究人岗匹配的预测模型提供了可靠的监督信号,有助于探析技能需求与职业流动之间的复杂关联,从而推动智能招聘系统的科学化进程。
实际应用
在产业实践中,该数据集直接赋能招聘平台的智能升级与求职者的个性化服务。企业人力资源部门可借此构建岗位分类与人才推荐引擎,自动过滤重复发布并筛选高度契合的申请者,显著削减筛选时间与成本。对求职者而言,依托此数据训练的本地化大语言模型,能够依据个人简历实时预测匹配概率,并依据关键词与岗位详情生成定制化的求职信,从而大幅提升求职效率与成功率。此外,该数据的每日动态更新特性亦为劳动力市场监测提供了实时数据支撑。
数据集最近研究
最新研究方向
面向局部大语言模型微调的动态招聘数据蒸馏与语义去重研究。该数据集通过整合多源API(Adzuna、JSearch、JobSpy)的日级采集流程,构建了英国IT与AI职位的基准语料库。利用all-MiniLM-L6-v2及BGE-large-en-v1.5嵌入模型实现跨平台语义去重,并借助Gemini/Llama等大模型对职位描述进行“高匹配候选”标注及技能标签提取,为监督微调提供了高质量训练样本。其研究前沿聚焦于利用自动化流水线优化数据质量,促进本地化LLM在职位分类、匹配概率预测及求职信生成等方面的应用,对提升招聘效率与个性化求职体验具有显著意义,同时为多源异构招聘数据的整合与标注树立了范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务