遇见数据集

中文学术图书作者消歧模型的Precision–Recall曲线与PR-AUC评估结果

收藏
Zenodo2026-07-24 更新2026-08-01 收录
官方服务:

资源简介:

本资源是论文《中文学术图书作者消歧方法研究》的补充实验材料。该研究面向中文学术图书作者署名与现实学者身份之间的链接消歧问题,通过整合大规模中文图书数据与学者数据,构建图书作者—候选学者匹配记录,并融合人口与机构特征、出版特征、合作者特征和研究内容语义特征建立消歧模型。 考虑到实验数据中的正样本比例较低,仅使用准确率和ROC-AUC可能无法充分反映模型对真实匹配样本的识别效果,本资源进一步提供Precision–Recall曲线及PR-AUC评价结果。曲线展示模型决策阈值变化时精确率与召回率之间的权衡关系,PR-AUC用于综合评价模型在类别高度不平衡条件下识别正样本的能力。 该资源可用于补充验证论文中的模型性能,辅助分析不同决策阈值对误判与漏判的影响,并为图书作者链接、候选排序和人工审核场景中的阈值选择提供依据。 研究将图书作者记录与同名候选学者之间的匹配判断建模为监督二分类任务。模型输出候选对属于同一现实人物的预测概率或一致性得分。通过连续调整分类决策阈值,分别计算各阈值下的精确率和召回率,并据此绘制Precision–Recall曲线。 PR-AUC表示Precision–Recall曲线下的面积,用于衡量模型在不同召回水平下保持较高精确率的综合能力。相较于准确率和ROC-AUC,PR-AUC对少数类正样本的识别质量更为敏感,因此更适合评价本文正负样本高度不平衡的作者消歧任务。 曲线和指标均基于独立测试集计算。训练集、验证集和测试集按照作者姓名簇进行划分,避免同一姓名及其相关候选记录同时出现在训练集和测试集中。

提供机构:
Zenodo
创建时间:
2026-07-24
二维码
社区交流群
二维码
科研交流群
商业服务