遇见数据集

aggs-arxiv

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

AGGS arXiv 引用图数据集包含了 arXiv 论文的元数据、解析后的参考文献文本、作者标识符以及 arXiv 论文之间的引用边。该数据集不包含 arXiv 电子预印本或 PDF 文件。数据以基础快照(base snapshot)和增量更新(daily/monthly deltas)形式提供。截至 2026 年 7 月 31 日,数据集包含 2,686,087 篇论文和 26,214,986 条引用边,压缩后大小为 9.89 GB。该数据集适用于引用网络分析、学术知识图谱构建、论文影响力评估等研究任务。数据集的许可遵循适用的 arXiv 元数据条款。

The AGGS arXiv citation graph dataset contains metadata of arXiv papers, parsed reference text, author identifiers, and citation edges between arXiv papers. The dataset does not include arXiv e-prints or PDF files. Data is provided as a base snapshot with daily/monthly delta updates. As of July 31, 2026, the dataset includes 2,686,087 papers and 26,214,986 citation edges, with a compressed size of 9.89 GB. The dataset is suitable for research tasks such as citation network analysis, academic knowledge graph construction, and paper impact evaluation. The dataset license follows the applicable arXiv metadata terms.

创建时间:
2026-08-17
原始信息汇总

AGGS arXiv引文图数据集概述

数据集简介

AGGS arXiv引文图数据集是一个用于agent-guided-graph-search任务的科学论文引文网络数据集,覆盖约268万篇论文2621万条引用边

数据内容

  • 包含arXiv论文元数据、解析后的参考文献文本、作者标识符以及arXiv论文间的引用关系
  • 不包含arXiv全文或PDF文件
  • 数据集仅包含图元数据,不涉及原始源码文件

数据规模

项目 数值
覆盖至日期 2026-07-31
论文总数 2,686,087
引用边数 26,214,986
压缩后大小 9.89 GB

文件结构

  • manifest.json:包含工件字节数、SHA-256校验值、表统计和模式版本
  • base/arxiv_graph_2026-07-31.dump.xz:基础快照文件
  • deltas/:包含每日和每月增量更新文件,均以SQL压缩格式存储

更新机制

  • 通过bnbcode research install --arxiv命令恢复基础数据集
  • 通过bnbcode research update命令验证并应用增量更新

许可信息

  • 图元数据遵循适用的arXiv元数据条款
  • 源存档和论文文件不在本数据集中重新分发
搜集汇总
数据集介绍
aggs-arxiv 数据集图片
构建方式
该数据集为学术文献引用网络领域的专项资源,以arXiv预印本平台为依托,精炼提炼了论文元数据、解析后的参考文献文本、作者标识符及论文间引用关联。其构建采用分层架构,基础快照压缩包聚合了截至特定日期的海量信息,辅以日度与月度增量文件,便于后续动态更新。同时,通过清单文件记录归档字节数、哈希校验值及模式版本,保障数据完整性与可追溯性。值得注意的是,原始预印本全文并不包含在内,仅聚焦于结构化元数据与引用关系。
特点
该数据集特色鲜明,规模宏大,涵盖逾268万篇论文及超过2621万条引用边,彰显了其在文献计量分析中的厚重基础。增量更新机制使数据保持时新性,并通过校验与水位线标记确保同步的准确性。此外,其许可证遵循arXiv元数据条款,不涉及原文分发,规避了版权争议。对研究者而言,该数据集是进行引文网络剖析、学术趋势探测及知识图谱建构的理想试验田,其结构化的设计便于高效查询与算法应用。
使用方法
使用时,研究者可通过bnbcode研究工具链中的安装命令恢复基础快照,继而执行更新操作以应用增量子集。该流程自动校验数据并整合新近变更,确保分析所依据的数据集时效性。针对定制化需求,Deltas文件支持手工加载,适用于构建特定时窗的定制数据集。数据布局清晰,附有的manifest文件解析了内部结构,便于二次开发与集成至自定义引用网络分析流程中。
背景与挑战
背景概述
AGGS arXiv citation graph数据集由bnbcode研究团队于2026年构建,旨在为agent-guided graph search(AGGS)提供结构化的科学文献引文图谱。该数据集整合了arXiv的论文元数据、参考文献文本、作者标识及论文间的引用关系,覆盖至2026年7月31日,包含2,686,087篇论文与26,214,986条引用边,压缩后体积约9.89 GB。其核心研究问题在于支撑大规模知识图谱上的智能检索与推理,推动科学文献的自动化分析。作为开源资源,它对信息检索、科学计量学及AI辅助科研领域具有显著影响力,为算法验证提供了标准化基准。
当前挑战
该数据集面临的挑战包括:领域内,科学文献数量呈指数级增长,引文图高度复杂,现有模型难以高效捕捉文献间的细粒度语义关联;同时,引文网络存在时滞与噪声,影响下游任务的鲁棒性。构建中,需处理arXiv海量非结构化元数据,确保跨时间的一致性,并同步每日增量更新,而压缩传输与校验(如SHA-256)在近10GB规模下对存储和计算资源提出了严苛要求。此外,遵循arXiv的许可条款,避免重新分发原始全文,仅保留图结构,也增加了数据合规与可用性的平衡难度。
常用场景
经典使用场景
AGGS arXiv引文图数据集为学术文献计量与科学学领域的研究提供了坚实的数据基石。该数据集囊括逾268万篇论文及2600余万条引用关系,凭借其纯净的元数据结构与日度增量更新机制,成为剖析学科演进脉络、识别知识扩散路径及探索学术协作模式的理想媒介。研究者可据此构建大规模引文网络,运用图神经网络、社区发现等前沿算法,揭示学科交叉融合规律与科研生产力分布格局。其时间跨度延伸至2026年,使得长期动态分析成为可能,为预测新兴研究前沿与评估科研影响力提供了翔实且具时效性的数据支撑。
衍生相关工作
围绕着该数据集的丰富语义结构,一系列开创性工作得以展开。它已成为图机器学习研究基准测试的重要来源,助推了引文预测、论文影响力排序及学术知识图谱嵌入等算法的迭代优化。基于其日度更新的“增量”设计,催生了一批关于图流学习、连续时间动态网络分析的方法论探索。此外,借助其中完整的作者消歧信息,学者们可以重构科研合作网络,进而衍生出一系列关于团队构成、科学生产率及跨机构合作模式的研究。这些工作不仅深化了对科学事业自身运行规律的理解,也有力地拓展了网络科学与人工智能在知识计量领域的交叉应用疆界。
数据集最近研究
最新研究方向
在学术图谱与智能检索的交汇前沿,AGGS arXiv引文图数据集为科研知识发现开辟了崭新路径。该快照囊括逾268万篇论文与2621万条引文链接,其基于智能体引导的图搜索范式,正推动引文网络从静态存储迈向动态推理。当前研究聚焦于利用该数据集的时空增量与元数据完整性,构建可自我更新的学术知识图谱,以支撑科研趋势预测、影响力评估及跨学科桥梁识别。特别是在大规模语言模型驱动的自动化科研浪潮中,此数据集成为训练引文感知型Agent的关键基石,助力实现从文献检索到假设生成的认知闭环,对计量学与人工智能的深度融合具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务