遇见数据集

SIRIS-Lab/topic-modeling-maps

收藏
Hugging Face2026-06-04 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为主题建模参考地图,是一个预保存的主题建模地图集合,专为配合topic-modeling Python包设计。每个地图包含一个保存的BERTopic模型、其2-D UMAP投影器和一个精炼后的标签CSV文件。用户可以将新文档直接投影到这些地图上,以预测主题和2-D坐标,而无需重新训练模型。数据集中的地图基于SPECTER嵌入和KMeans聚类构建,例如eu_map_60_topics地图包含60个主题,并提供了精炼的标签和高级聚类信息。数据集适用于主题建模、科学计量学等任务,支持离线使用和自定义路径加载。

The dataset is named Topic-modelling reference maps and consists of pre-saved topic-modelling maps for use with the topic-modeling Python package. Each map includes a saved BERTopic model, its 2-D UMAP projector, and a refined-labels CSV file. It allows users to drop new documents onto a map to predict topics and 2-D coordinates without retraining. The maps are built using SPECTER embeddings and KMeans clustering, with examples like eu_map_60_topics featuring 60 topics, refined labels, and higher-level clusters. It is designed for applications in topic modeling and scientometrics, supporting offline usage and custom path loading.

提供机构:
SIRIS-Lab
搜集汇总
数据集介绍
SIRIS-Lab/topic-modeling-maps 数据集图片
构建方式
该数据集为预训练的主题建模参考地图,基于欧洲联盟(ESPON/EU)的研究语料库构建而成。构建过程中,采用SPECTER作为嵌入模型,通过sentence-transformers/allenai-specter自动加载文本表征。随后利用KMeans聚类算法,将语料划分为60个主题,并以BERTopic模型保存。同时,通过UMAP降维技术生成了二维投影器,确保新文档能够映射至同一空间。最终辅以人工精炼的主题标签与层级聚类信息,形成完整的参考地图。
特点
该数据集的核心特色在于其即用性与泛化能力,用户无需重新训练即可将新文档投射至预定义的二维主题地图上。它集成了BERTopic模型、UMAP投影器与精炼标签CSV,支持主题预测、坐标计算与可视化探索。数据集按层级组织,涵盖60个细粒度主题及其聚类归属,标签经过人工校对,语义清晰。通过Python包加载时,自动下载并缓存,降低使用门槛。
使用方法
用户可通过topic-modeling Python包中的load_pretrained_map函数加载该数据集,默认从HuggingFace仓库下载并缓存。加载后的模型支持对包含标题与摘要的DataFrame进行推断,输出主题编号、名称、精炼标签、聚类归属、距离及二维坐标。借助build_explorer方法可生成交互式探索界面,便于直观分析。此外,支持本地路径加载以应对离线场景,私有仓库则需传递HF_TOKEN进行认证。
背景与挑战
背景概述
在科学计量学与主题建模领域,如何高效地将海量文献映射至可解释的语义空间一直是研究热点。由ESPON与欧盟相关研究机构联合开发的topic-modelling-maps数据集于近年发布,旨在通过预训练的BERTopic模型与UMAP降维投影,提供可直接使用的主题参考地图。其核心研究问题在于能否让研究者无需重复训练模型,即可将新文档投影至预先构建的欧盟研究主题空间,从而实现跨语料库的语义对齐。该数据集基于SPECTER嵌入与KMeans聚类生成60个细粒度主题,并辅以人工精炼标签,显著提升了主题建模的可复现性与实用性,对科学计量学、政策评估及研究前沿探测等领域产生了重要影响。
当前挑战
当前数据集面临的核心挑战涵盖领域问题与技术构建两方面。在领域层面,主题建模长期受困于标签可解释性不足与跨语料迁移性差,研究者难以将已有主题结构应用于新文档;该数据集虽通过预训练投影器部分解决此问题,但主题映射的鲁棒性仍受限于源语料分布与目标域之间的语义漂移。在构建过程中,主要挑战包括:SPECTER嵌入对长文本语义的捕获能力有限,导致部分跨学科主题边界模糊;UMAP超参数选择高度依赖人工调优,影响投影的全局保真度;此外,从60个主题中提炼出高层级聚类簇需要大量领域专家介入,既耗费人力又难以保证一致性。
常用场景
经典使用场景
在科学计量学与政策分析领域,主题建模地图为研究者提供了一种将大规模文本语料库转化为可探索的二维知识图谱的优雅途径。该数据集的核心用途在于加载预训练的BERTopic模型与UMAP投影器,将新文档投射到已构建好的主题空间中,从而快速获得其所属主题类别及二维坐标。这种“即插即用”的特性使得研究者无需重复训练模型,即可将欧盟研究项目等语料映射至同一参考框架下,便于进行跨语料库的主题对比与演化分析。
衍生相关工作
该数据集的发布催生了一系列围绕预训练主题模型可迁移性与可视化解释性的后续研究。相关工作包括:基于SPECTER嵌入的跨领域主题泛化能力评估,探讨预训练地图在自然科学与社会科学语料间的适用边界;融合层级聚类标签精炼方法的主题命名自动生成技术,提升地图语义可读性;以及将2-D投影空间与图神经网络结合,实现主题关系推理与新兴趋势预测。这些衍生工作共同丰富了科学知识图谱的构建范式,使得主题建模地图从静态参考工具逐步演化为动态的知识演化分析平台。
数据集最近研究
最新研究方向
在当前科学计量学与自然语言处理交叉领域的前沿研究中,topic-modeling-maps数据集为无需重新训练的跨语料主题对齐与可视化提供了创新解决方案。其核心突破在于将预训练的BERTopic模型、二维UMAP投影器与精炼标签体系打包为可复用映射,使得新文档能够直接投射至欧盟研究项目的主题空间,无需重复计算嵌入与聚类。这一设计正契合了大规模文献计量分析中高效模型迁移与增量推理的迫切需求,尤其伴随欧洲研究区(ERA)政策评估与科研合作网络追踪等热点事件,该工具实现了从静态主题建模到动态知识图谱构建的范式跃迁。通过SPECTER嵌入保留论文语义深度的同时,借助层次化聚类完成从细粒度60主题到宏观簇的语义归并,显著提升了跨领域研究者对复杂科研格局的直觉认知效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务