遇见数据集

CareerCorpus : A Comprehensive Dataset of Annotated Resumes

收藏
Mendeley Data2026-04-18 收录
官方服务:

资源简介:

CareerCorpus is a comprehensive dataset of 302 annotated resumes spanning six occupational categories designed for natural language processing research in automated recruitment and human resource analytics. DATASET COMPOSITION: - Total resumes: 302 - Categories: Teacher (50), Finance (50), Apparel (50), Accountant (51), Banking (50), Research Assistant (51) - Format: Single Excel file (.xlsx) containing all six categories - Annotation: Dual expert annotations preserved for all resumes DATA SOURCES: Resumes collected from (1) Kaggle dataset (LiveCareer.com professionally crafted resumes) for five categories, and (2) LinkedIn public profiles for Research Assistant category. HTML-formatted resumes processed via ChatGPT (GPT-5) for text extraction and standardization. EXPERT ANNOTATION: Each resume independently annotated by two domain experts: - Financial categories (Finance, Accountant, Banking): Certified accountants with 5+ years experience and ICMAB certifications - Apparel: Textile/fashion industry practitioners - Academic categories (Teacher, Research Assistant): University lecturers with teaching and research experience Dual annotations preserved to support soft-label training, annotation confidence modeling, and disagreement-aware evaluation metrics. DATA PREPROCESSING: - HTML-to-text conversion via AI-assisted summarization - PII removal and anonymization (names, emails, phone numbers replaced with placeholders) - Text normalization and standardization - Duplicate elimination - Format standardization across all categories FILE STRUCTURE: Single Excel workbook containing: - All 302 resumes across six occupational categories - Anonymized resume text - Dual annotation scores from independent experts - Category labels - Resume metadata - Organized in tabular format for easy access and analysis INTER-ANNOTATOR AGREEMENT: Pearson correlations range from 0.35-0.89 across categories (Finance: 0.68, Banking: 0.38, Accountant: 0.35, Apparel: 0.89, Teacher: 0.56, Research Assistant: 0.67). Overall mean correlation: 0.59, mean MAE: 0.106, indicating moderate agreement with low scoring error. RESEARCH APPLICATIONS: - Resume classification and categorization models - Automated recruitment system development - Skill extraction algorithms - Job-candidate matching systems - NLP benchmark evaluation - Recruitment bias and fairness research - Annotation quality and human-AI collaboration studies ASSOCIATED PUBLICATION: This dataset supports the Data in Brief article "CareerCorpus: A Comprehensive Dataset of Annotated Resumes" by Md Sagor Chowdhury, Adiba Fairooz Chowdhury, Ayesha Banu, and Riad Hossain (2025). LICENSE: Released under CC-BY-4.0 for open research use with appropriate citation. CONTACT: For questions: riad.h@eastdelta.edu.bd Institution: Department of Computer Science and Engineering, East Delta University, Chattogram, Bangladesh

CareerCorpus是一款涵盖六大职业类别的综合性标注简历数据集,共包含302份简历,旨在为自动化招聘与人力资源分析领域的自然语言处理(Natural Language Processing,NLP)研究提供支撑。 数据集构成: - 简历总数:302份 - 职业类别:教师(Teacher)50份、金融(Finance)50份、服饰(Apparel)50份、会计(Accountant)51份、银行(Banking)50份、研究助理(Research Assistant)51份 - 格式:单Excel文件(.xlsx),整合全部六大类简历 - 标注:所有简历均保留双专家标注结果 数据来源: 简历采集自两大渠道:(1) 五个类别的简历源自Kaggle数据集(LiveCareer.com专业制作的简历);(2) 研究助理类别的简历取自LinkedIn公开个人主页。HTML格式的简历通过ChatGPT(GPT-5)完成文本提取与标准化处理。 专家标注: 每份简历均由两名领域专家独立完成标注: - 金融相关类别(Finance、Accountant、Banking):由拥有5年以上从业经验且持有ICMAB认证的注册会计师进行标注 - 服饰类别(Apparel):由纺织/时尚行业从业者完成标注 - 学术相关类别(Teacher、Research Assistant):由具备教学与研究经验的高校讲师完成标注 保留双标注结果可用于软标签训练、标注置信度建模以及支持感知标注分歧的评估指标研发。 数据预处理: - 通过AI辅助摘要完成HTML到纯文本的转换 - 移除并匿名化个人可识别信息(Personally Identifiable Information,PII):将姓名、邮箱、电话号码替换为占位符 - 文本归一化与标准化处理 - 重复简历去重 - 统一所有类别的数据格式 文件结构: 单个Excel工作簿包含以下内容: - 覆盖六大职业类别的全部302份匿名化简历文本 - 两位独立专家给出的双标注得分 - 类别标签 - 简历元数据 - 整体采用表格形式组织,便于访问与分析 标注者间一致性: 各分类的皮尔逊相关系数区间为0.35~0.89(金融:0.68、银行:0.38、会计:0.35、服饰:0.89、教师:0.56、研究助理:0.67)。整体平均相关系数为0.59,平均绝对误差(Mean Absolute Error,MAE)为0.106,表明标注一致性处于中等水平,且评分误差较低。 研究应用场景: - 简历分类与归类模型研发 - 自动化招聘系统开发 - 技能提取算法研究 - 职位-候选人匹配系统研发 - 自然语言处理基准评测 - 招聘偏见与公平性研究 - 标注质量及人机协作研究 关联出版物: 本数据集支撑《Data in Brief》刊发的论文《CareerCorpus: A Comprehensive Dataset of Annotated Resumes》,作者为Md Sagor Chowdhury、Adiba Fairooz Chowdhury、Ayesha Banu及Riad Hossain(2025年)。 许可协议: 本数据集以CC-BY-4.0协议发布,可在规范引用的前提下用于开放研究。 联系方式: 咨询邮箱:riad.h@eastdelta.edu.bd 所属机构:孟加拉国吉大港东三角洲大学计算机科学与工程系

创建时间:
2025-12-05
二维码
社区交流群
二维码
科研交流群
商业服务