遇见数据集

NeuML/wikipedia-celebrity-similarity

收藏
Hugging Face2026-07-04 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是从标记为名人的维基百科文章中随机抽取的样本,旨在用于训练向量相似性模型。它还包括一个与BEIR兼容的test分割版本,可用于评估基于此数据训练的向量模型的准确性。

This dataset consists of randomly sampled entries from Wikipedia articles labeled as celebrity pages, and is designed for training vector similarity models. It also includes a BEIR-compatible test split version that can be used to evaluate the accuracy of vector models trained on this dataset.

提供机构:
NeuML
搜集汇总
数据集介绍
NeuML/wikipedia-celebrity-similarity 数据集图片
构建方式
该数据集源自Wikipedia articles的随机采样,专注于标记为'celebrity'的条目。通过从Wikipedia-20260401数据集中提取相关文本片段,构建了适用于向量相似性模型训练的数据样本。同时,数据集的测试集提供了与BEIR框架兼容的版本,便于评估模型性能。
使用方法
用户可将数据集直接用于训练向量相似性模型,通过加载'celebrity'标签的文本样本进行特征学习。对于测试阶段,利用BEIR兼容的测试集评估模型在名人文本检索任务中的表现。数据加载可通过HuggingFace数据集API实现,支持灵活的批处理和预处理操作。
背景与挑战
背景概述
近年来,围绕维基百科等大规模结构化知识库开展的语义相似性研究已成为自然语言处理领域的重要方向。在此背景下,wikipedia-celebrity-similarity数据集由NeuML团队创建,于近期发布在HuggingFace平台上,旨在为向量相似性模型提供训练和评估资源。该数据集从维基百科2026年4月1日版本中采样了标注为‘名人’的文章,聚焦于名人群体的信息表示与相似性度量。核心研究问题在于如何精准建模高维语义空间中名人实体间的关联程度,从而推动检索、推荐等下游应用的发展。该数据集因其与BEIR框架的兼容性而具备较高的实用价值,为向量模型的准确性评估提供了标准化基准。
当前挑战
该数据集所应对的领域挑战主要来自名人实体语义相似性度量的复杂性,包括名人之间多维度特征(如职业、成就、时代背景)的非线性关系,以及语料中高频出现的歧义性与个体独特性,给向量模型带来泛化和细粒度区分的双重考验。在构建过程中,挑战主要体现在三个方面:一是从海量维基百科文章中准确识别并筛选出‘名人’标签的样本,避免分类偏差;二是保证采样随机性的同时维持数据集的代表性与平衡性;三是构建符合BEIR标准的测试划分,确保评测流程的兼容性与可复现性。
常用场景
经典使用场景
维基百科名人相似度数据集(Wikipedia Celebrity Similarity)专注于构建名人实体间的语义关联,其经典使用场景在于训练向量相似度模型。研究者可利用该数据集中的维基百科文章样本,通过对比学习或度量学习方法,将名人文本描述映射为高维嵌入向量,从而量化不同名人之间的语义相似程度,为后续的信息检索与知识图谱构建奠定基础。
解决学术问题
该数据集有效地解决了名人实体语义可比性的学术难题。在自然语言处理领域中,传统的命名实体识别虽能定位名人,却难以衡量其内在关联。此数据集通过标注的名人样本及其余弦相似度基准,推动了对比学习与向量表示学习的发展,为跨领域的名人知识图谱对齐、语义搜索排序等研究提供了标准化的评估平台,显著提升了模型对名人实体细微语义差异的捕捉能力。
实际应用
在实际应用层面,该数据集支持构建高效的名人相似度搜索引擎,广泛应用于娱乐产业中的人物推荐系统、社交媒体上的名人标签聚合与自动化内容策划。此外,它还可赋能数字营销领域的品牌代言人匹配,通过计算候选名人与品牌代言历史中成功案例的语义相近程度,辅助决策者筛选最佳合作对象,从而提升商业推广的精准度与影响力。
数据集最近研究
最新研究方向
该数据集聚焦于名人维基百科文章的向量相似度建模,为前沿的语义检索与表征学习研究提供了基准。结合大模型时代对细粒度实体关联的迫切需求,该数据集可用于训练和评估基于嵌入的相似度模型,特别是在BEIR框架下衡量模型在名人实体检索任务中的准确性。其研究意义在于推动向量模型从通用语义匹配向特定实体领域深化,支撑如名人关系图谱构建、个性化推荐系统等热点应用,并助力解决大规模知识库中实体消歧与相关性排序的关键挑战。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务