arxiv-ai-entity-graph
收藏资源简介:
arXiv AI实体图谱是一个结构化知识图谱数据集,专门从arXiv计算机科学(CS)研究论文的标题和摘要中提取并规范化人工智能实体。其核心目标是将海量、非结构化的学术文本转化为一个可查询的分析数据库,用于追踪研究社区中AI模型、框架、基准和数据集的实际使用与采纳趋势。数据集覆盖从2024年1月至今的23个CS类别(如cs.CL、cs.LG、cs.CV等),并每日更新。数据内容经过精心处理,每个实体提及(例如GPT-4、gpt4)都被规范化为唯一的规范名称,并附带了丰富的元数据,包括实体类型(模型、框架、基准、数据集)、提供者(如OpenAI、Meta、Alibaba)、模型家族(如GPT、Llama、Qwen)、模型类型(如llm、vlm、image_gen)、置信度分数以及所属论文信息。核心数据表为`entities`,关联论文元数据表`papers`以及其他辅助表(如authors、citations)。数据集规模方面,在示例时间窗口(2024年1月至2026年6月)内,包含约65,000个模型实体、55,000个框架实体、15,000个基准实体和4,000个数据集实体。该数据集适用于研究情报分析、AI生态趋势监测、科技政策研究以及构建基于实体的学术检索或推荐系统等任务。用户可以通过提供的DuckDB文件(免费样本)或订阅完整数据集进行访问。
The arXiv AI Entity Graph is a structured knowledge graph dataset that specifically extracts and normalizes artificial intelligence entities from the titles and abstracts of arXiv computer science (CS) research papers. Its core objective is to transform massive, unstructured academic text into a queryable analytical database for tracking the actual usage and adoption trends of AI models, frameworks, benchmarks, and datasets within the research community. The dataset covers 23 CS categories (e.g., cs.CL, cs.LG, cs.CV) from January 2024 to the present, with daily updates. The data content is meticulously processed, with each entity mention (e.g., GPT-4, gpt4) normalized to a unique canonical name and enriched with extensive metadata, including entity type (model, framework, benchmark, dataset), provider (e.g., OpenAI, Meta, Alibaba), model family (e.g., GPT, Llama, Qwen), model type (e.g., llm, vlm, image_gen), confidence scores, and associated paper information. The core data table is `entities`, linked to the paper metadata table `papers` and other auxiliary tables (e.g., authors, citations). In terms of scale, within the example time window (January 2024 to June 2026), the dataset contains approximately 65,000 model entities, 55,000 framework entities, 15,000 benchmark entities, and 4,000 dataset entities. This dataset is suitable for tasks such as research intelligence analysis, AI ecosystem trend monitoring, science and technology policy research, and building entity-based academic search or recommendation systems. Users can access it via the provided DuckDB file (free sample) or by subscribing to the full dataset.
数据集概述
arXiv AI Entity Graph 是一个从 arXiv 计算机科学论文中提取的结构化实体数据集,专门聚焦于人工智能领域。它将论文标题和摘要中提及的 AI 模型、框架、基准测试和数据集,标准化为带有提供者(Provider)、家族(Family)和置信度(Confidence)元数据的规范名称。
核心特点
- 结构化与标准化: 将论文中的实体提及(如
GPT-4、gpt4、GPT-4-turbo)统一映射到同一规范条目,消除别名歧义。 - 每日更新: 覆盖 2024 年 1 月至今的 arXiv CS 论文,并持续更新。
- 分析型数据库: 旨在回答“研究人员实际使用哪些模型?”、“DeepSeek R1 何时成为主流?”等分析性问题,而非作为检索基准或语料库。
关键发现(2024年1月 – 2026年6月)
- GPT 持续主导: 在整个周期内被 5,652 篇论文引用。
- 阿里 Qwen 家族崛起: Qwen3、Qwen2.5 和 Qwen 合计在 2026 年引用量(4,723 篇)与 OpenAI 总影响力相当。
- DeepSeek R1 增速最快: 从 2025 年 1 月的 3 篇论文激增至 2 月的 48 篇(月增长 16 倍),此后维持在每月 50–90 篇。
- o1 进入前 20: 被 620 篇论文引用,表明推理模型已成为主流研究基础设施。
- cs.CL 超越 cs.LG: 语言研究(27,452 个实体行)的论文产出已超过纯机器学习(20,040 个实体行)。
- Stable Diffusion 稳固: 被 884 篇论文引用,图像生成已成为与 LLM 并行的严肃研究分支。
数据集架构
核心表为 entities,包含以下主要字段:
| 字段 | 类型 | 描述 |
|---|---|---|
paper_id |
varchar | arXiv 论文 ID |
entity_type |
varchar | 实体类型:model、framework、benchmark、dataset |
entity |
varchar | 规范化的实体名称 |
confidence |
double | 置信度分数:1.0(已确认)、0.2(模糊匹配)、0.1(可能误报) |
family |
varchar | 模型家族(如 GPT、Llama、Qwen) |
provider |
varchar | 提供者(如 OpenAI、Meta、Alibaba) |
model_type |
varchar | 模型类型(如 llm、reasoning_llm、vlm、image_gen) |
此外还有 papers、authors、citations、categories、versions、links 等辅助表。
数据覆盖
- 时间范围: 2024年1月至今(每日更新)。
- 覆盖类别: 涵盖 23 个 CS 子类别,包括 cs.LG, cs.CL, cs.CV, cs.AI, cs.NE, cs.CR, cs.SE, cs.DC 等。
- 实体数量(2024年1月 – 2026年6月):
- 模型:约 65,000 个实体行,100+ 种唯一实体
- 框架:约 55,000 个实体行,40+ 种唯一实体
- 基准:约 15,000 个实体行,50+ 种唯一实体
- 数据集:约 4,000 个实体行,30+ 种唯一实体
访问与定价
提供免费样本(3×10天窗口数据,DuckDB 格式)、一次性快照($49,完整历史数据 Parquet 格式)和订阅服务($29/月,包含每日增量更新)。数据通过 AWS S3 同步获取。
许可协议
元数据(标题、摘要、作者、类别)源自 arXiv,遵循 CC0 1.0 公共领域贡献。实体提取、标准化、置信度评分及架构为原创工作,采用 CC BY 4.0 许可。




