candidate-matching-synthetic
收藏资源简介:
这是一个大规模高质量的合成数据集,专为简历-职位匹配和候选人检索任务设计。数据集包含10,000份合成简历、2,500份职位发布和2,500份真实匹配记录,适用于训练和评估候选人-职位匹配系统。数据集具有大规模(10,000+高质量简历)、真实数据(资历级别与工作经验年限对齐)、丰富特征(结构化技能和资历+非结构化摘要和项目符号)、真实匹配(基于技能的匹配,60%阈值验证)、多样覆盖(24个角色、10个行业、73个独特技能)和可用于生产(无缺失值,已验证完整性)等特点。数据集结构包括简历、职位和匹配记录三部分,涵盖了24个独特角色、10个行业(如金融科技、电子商务、SaaS、医疗保健、教育科技等)、3个资历级别(初级、中级、高级)和73个独特技能。数据集还提供了详细的数据统计、匹配算法、验证方法、使用案例、快速开始指南、探索性数据分析、数据生成方法、示例应用、数据集卡片、贡献指南、引用信息、致谢、联系方式和版本历史等内容。
This is a large-scale, high-quality synthetic dataset specifically designed for resume-job matching and candidate retrieval tasks. The dataset contains 10,000 synthetic resumes, 2,500 job postings, and 2,500 real matching records, suitable for training and evaluating candidate-job matching systems. The dataset features multiple advantages: large scale (over 10,000 high-quality resumes), real-world alignment (seniority levels aligned with years of work experience), rich features (structured skills and seniority attributes plus unstructured summaries and bullet points), authentic matching (skill-based matching validated with a 60% threshold), diverse coverage (24 distinct job roles, 10 industries, 73 unique skills), and production readiness (no missing values, verified completeness). The dataset structure includes three core components: resumes, job postings, and matching records, covering 24 unique job roles, 10 industries (e.g., fintech, e-commerce, SaaS, healthcare, edtech, etc.), three seniority levels (entry-level, mid-level, senior-level), and 73 unique skills. Additionally, the dataset provides comprehensive supporting resources, including detailed data statistics, matching algorithms, validation methodologies, use cases, quick start guides, exploratory data analysis, data generation methods, sample applications, dataset cards, contribution guidelines, citation information, acknowledgments, contact information, and version history.
数据集概述:Candidate-Job Matching Synthetic Dataset
基本信息
- 数据集名称:Candidate-Job Matching Synthetic Dataset
- 发布者:Michael Ozon
- 发布日期:2026年1月 (v1.0.0)
- 许可证:MIT License
- 语言:英语 (en)
- 任务类别:文本分类、句子相似性、信息检索
- 标签:招聘、职位匹配、简历筛选、语义搜索、嵌入、合成数据
- 数据规模:10K < n < 100K
数据集内容与规模
- 简历数据:10,000 条合成简历记录。
- 职位数据:2,500 条合成职位发布记录。
- 匹配数据:2,500 条地面真实匹配记录,包含 75,000 个职位-简历对。
- 数据分割:所有数据均位于
train分割中。
数据结构
1. 简历 (Resumes)
每条记录包含以下字段:
resume_id:简历唯一标识符。role:职位角色(共24种唯一角色)。seniority:资历级别(Junior, Mid, Senior)。years_experience:工作经验年限。industry:行业(共10个行业,如FinTech, E-commerce, SaaS等)。education:教育背景。skills:技能列表(共73种唯一技能)。summary:简历摘要。experience_bullets:经验要点列表。
2. 职位 (Jobs)
每条记录包含以下字段:
job_id:职位唯一标识符。job_title:职位标题。seniority:要求的资历级别。industry:行业。must_have_skills:必备技能列表。nice_to_have_skills:附加技能列表。description:职位描述。responsibilities:职责列表。requirements:要求列表。
3. 匹配 (Matches)
每条记录包含以下字段:
job_id:职位标识符。relevant_resume_ids:相关简历ID列表(平均每个职位30份简历)。
关键特征与质量
- 规模大:包含超过10,000份高质量合成简历。
- 真实性:工作经验年限与资历级别对齐。
- 特征丰富:结合了结构化(技能、资历)和非结构化(摘要、要点)特征。
- 地面真实:基于技能的匹配,经过60%阈值验证。
- 覆盖多样:涵盖24种角色、10个行业、73种独特技能。
- 生产就绪:无缺失值,已验证完整性。
- 数据质量:无缺失值、无重复记录、引用完整性100%、经验分布符合现实。
匹配算法与验证
- 匹配阈值:必备技能重叠度 ≥ 60%。
- 每职位候选人数:平均30份相关简历。
- 技能覆盖:供需之间技能100%重叠。
- 验证:基于技能的匹配,并针对资历和角色对齐进行了验证。
主要用途
- 语义职位-简历匹配:训练嵌入模型,基于语义相似性匹配候选人与职位发布。
- 候选人检索系统:构建生产就绪的检索系统(如密集嵌入、混合搜索、重排序模型)。
- 技能差距分析:分析就业市场中的技能供需情况。
- 经验水平预测:基于简历内容预测资历级别。
- 多模态匹配:结合结构化特征(技能、年限)与非结构化文本(摘要、要点)。
数据生成方法
- 基础模型:Qwen/Qwen2.5-0.5B-Instruct。
- 生成方法:批量生成。
- 硬件:Tesla T4 GPU (Google Colab)。
- 质量控制:结构化提示、技能池控制、经验验证、匹配逻辑。
- 可重复性:种子为42,生成时间约1.5小时,回退率约15-20%。
引用格式
bibtex @dataset{candidate_matching_synthetic_2026, author = {Michael Ozon}, title = {Candidate-Job Matching Synthetic Dataset}, year = {2026}, publisher = {HuggingFace}, url = {https://huggingface.co/datasets/michaelozon/candidate-matching-synthetic} }
快速统计摘要
| 指标 | 数值 |
|---|---|
| 简历总数 | 10,000 |
| 职位总数 | 2,500 |
| 匹配总数 | 75,000 对 |
| 独特角色 | 24 |
| 行业 | 10 |
| 独特技能 | 73 |
| 平均技能/简历 | 6.5 |
| 平均技能/职位 | 5.0 |
| 数据完整性 | 100% |
| 技能重叠度 | 100% |




