Resume Categorization Dataset
收藏资源简介:
该数据集用于自动分类简历。数据集包含四个列:ID、Resume_str、Resume_html和Category。Category列有24个不同的类别。数据集经过预处理后,使用BERT模型进行训练和分类。
This dataset is utilized for automated resume classification. It comprises four columns: ID, Resume_str, Resume_html, and Category. The Category column includes 24 distinct categories. Following preprocessing, the dataset is employed for model training and classification using the BERT model.
数据集概述
简介
该数据集旨在自动分类简历。数据集包含一个CSV文件,其中包含三个特征列:resume_str、resume_html 和目标列 category。经过预处理后,使用了BERT模型进行训练,并在验证集上达到了80%的准确率和召回率。
数据预处理
数据集包含四列:ID、Resume_str、Resume_html 和 Category。目标列 Category 包含24个不同的类别,并被编码为整数值。由于HTML标签不提供语义意义,仅保留了 Resume_str 列作为特征。
预处理步骤
- 忽略
Resume_html:HTML标签仅表示设计和结构,不提供语义意义,因此被忽略。 - 分词:使用BERT的分词器对
Resume_str列进行分词,BERT的分词器(Word piece)有助于处理词汇外单词,并帮助模型识别实际内容和填充内容。 - 数据分割:将数据集分为训练集、验证集和测试集,并在分词前将其转换为Hugging Face数据集格式。
模型选择
选择了BERT-base-uncased模型进行训练。BERT模型在处理NLP任务时表现出色,能够捕捉文本中的上下文关系。
选择BERT模型的原因
- BERT在文本分类任务中表现出色。
- BERT能够理解单词在句子中的上下文。
- BERT经过大规模语料库(如维基百科)的训练,能够理解语法和常见语言模式。
- BERT能够处理长文本,适合处理简历数据。
模型微调
对BERT模型进行了微调,使用了自定义的超参数,包括5个epochs、学习率2e-5、批量大小16和权重衰减0.01。
评估指标
使用准确率、F1分数、精确率和召回率来评估模型性能。
使用说明
提供了一个 script.py 文件,可以在本地机器上运行以进行预测。需要安装 torch 和 transformers 等库,并按照说明运行脚本。
使用步骤
- 下载
model.pt、script.py和Requirements.txt文件。 - 安装依赖项:
pip install -r Requirements.txt。 - 运行脚本:
python script.py /path to folder,其中/path to folder是包含PDF格式简历的文件夹路径。
script.py 功能
该脚本接受一个包含PDF格式简历的文件夹作为输入,对每个简历进行预测,并将结果存储为CSV文件和按类别分类的文件夹。




