遇见数据集

专家发现数据集

收藏
arXiv2020-04-08 更新2024-06-21 收录
官方服务:

资源简介:

专家发现数据集是由里昂大学创建的一套用于科学领域专家发现的数据集,包含四个子集,分别从科学出版物网络和三个问答网站中提取。数据集大小不一,涉及的专家和文档通过作者关系和响应关系(如引用或回答)相连接。这些数据集旨在通过文档查询的方式,评估和改进专家发现算法,应用于自动搜索科学评审、问答网站专家用户推荐及职业招聘等领域。

The Expert Discovery Dataset is a collection developed by the University of Lyon for scientific domain expert discovery. It comprises four subsets extracted separately from a scientific publication network and three question-and-answer (Q&A) websites. The sizes of these subsets vary, and the involved experts and documents are connected through author relationships and response relationships, such as citations and answers. These datasets are intended to evaluate and optimize expert discovery algorithms via document queries, with applications in automatic scientific peer review retrieval, expert user recommendation for Q&A websites, professional recruitment, and other relevant fields.

提供机构:
里昂大学
创建时间:
2020-04-08
搜集汇总
数据集介绍
专家发现数据集 数据集图片
构建方式
该数据集源自科学引文网络与三个科研问答社区(Academia、Mathoverflow、Stats)的数据萃取。在DBLP子集中,依据人工标注的7个领域专家及114篇文档查询构建,通过两位标注者独立标注并取一致性标签。在问答社区数据中,筛选出投票数超过10的问题与答案,以标签作为专业领域,并根据用户获得高票答案的标签标注专家。最终形成包含作者-文档二分网络与文档间引用或回答关系网络的四组数据集。
特点
该数据集具备多层次异质性:涵盖候选者与文档间的作者关系、文档间的引用或回答关系,以及专家与文档的多标签标注。与传统的仅以主题词查询不同,本数据集采用文档查询方式,使评估更贴近真实应用场景。此外,数据集规模从DBLP的数百候选者与千余文档到Mathoverflow的七千余候选者与三万八千文档不等,标签粒度从7个宽泛领域到98个精细标签,为算法鲁棒性提供了多维度测试基础。
使用方法
使用该数据集时,以文档作为查询输入,算法需在无监督条件下对候选者进行排序。可采用基线方法如P@noptic、投票模型或传播模型,亦可应用文档网络嵌入方法(如TADW、GVNR-t、G2G、IDNE)通过预聚合或后聚合策略扩展至异质网络。评估指标包括AUC、P@10和平均精度,通过计算所有文档查询上的均值与标准差来衡量算法稳定性。数据集及预处理代码已公开,便于复现与扩展。
背景与挑战
背景概述
在科学文献呈指数级增长的背景下,精准识别特定领域的专家已成为一项日益严峻的挑战。2020年,来自法国里昂第二大学ERIC实验室的Robin Brochier、Antoine Gourru、Adrien Guille与Julien Velcin联合构建了“专家发现数据集”,旨在解决异构文献网络中专家检索的评估瓶颈。该研究团队从DBLP学术引用网络与Stack Exchange平台下的Academia、Mathoverflow、Stats三个科学问答社区中提取数据,构建了四个标注数据集,涵盖从信息提取到伽罗瓦表示等多样化的专业领域。这些数据集不仅为无监督专家发现算法提供了标准化评估框架,更推动了文档网络嵌入方法在专家检索任务中的应用,对学术评审自动推荐、问答社区专家匹配及人才检索等场景具有重要影响。
当前挑战
该数据集面临的核心挑战体现在两个层面:其一,专家发现任务本身具有复杂性,需在异构网络(包含作者-文献隶属关系与文献间引用/回答关系)中,根据文档查询精准排序候选专家,而传统方法常因领域标签稀疏或查询粒度不足导致评估偏差。其二,构建过程中遭遇多重困难,包括从DBLP中仅保留114篇经人工一致性标注的论文(Cohen's Kappa系数0.718),以及从问答网站筛选高投票问题与答案以获取可靠专家标注。更具挑战性的是,文档网络嵌入算法无法直接应用于含候选节点的二分图,需设计预聚合与后聚合方案,但实验表明这些朴素适配方法在专家排序性能上显著弱于传播模型,暴露出嵌入方法在保留节点中心性与长程依赖关系方面的固有局限。
常用场景
经典使用场景
专家发现数据集为学术搜索引擎与科研社交平台提供了关键的评估基准。在科学文献爆炸式增长的背景下,该数据集通过整合DBLP引文网络与Stack Exchange问答社区(如Academia、MathOverflow、Stats)的异构数据,模拟了从文档查询中自动识别领域专家的经典场景。研究者可基于作者-文档二分图与文档间引用或回答关系,构建无监督的专家排序模型,从而在无需人工标注的情况下,高效匹配查询文档与候选专家的专业知识领域。这一设定尤其适用于自动审稿人推荐、问答社区专家用户推荐等现实任务。
实际应用
在实际应用中,该数据集驱动的专家发现技术已渗透至多个关键场景。例如,学术期刊与会议可利用传播模型自动筛选匹配论文主题的审稿人,显著缩短审稿周期;问答平台如Stack Overflow可借助投票模型与嵌入表示,向提问者精准推荐高活跃度且专业对口的回答者,提升用户满意度。此外,企业招聘系统可基于候选人发表的论文或回答记录,构建其专业知识图谱,从而快速定位与岗位需求契合的顶尖人才。这些应用均依赖于数据集提供的异构网络结构与细粒度标签,实现了从理论模型到工程落地的桥梁作用。
衍生相关工作
该数据集催生了一系列延伸性研究,推动了文档网络嵌入与专家发现的交叉融合。例如,后续工作借鉴了TADW、GVNR-t、Graph2Gauss和IDNE等嵌入方法,并探索了更精细的候选-文档交互建模,如引入注意力机制或图神经网络来捕获异构语义。同时,数据集提供的标准化评估框架被用于验证新型无监督算法(如基于随机游走的实体检索模型)的鲁棒性,并启发了对传播模型中长程依赖偏差的修正研究。这些衍生工作不仅深化了对专家发现任务本质的理解,也为构建更鲁棒、可扩展的科研知识服务系统奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务