beatless-ai/polaris-ccf
收藏资源简介:
Polaris CCF AI Papers是一个经过精心整理、交叉验证和丰富增强的数据集,包含来自11个CCF顶级AI会议的155,652篇论文,时间跨度为1982年至2026年。数据集由Polaris管道构建,涵盖论文、作者、链接、知识图谱、嵌入向量等多种数据,适用于文本检索、特征提取、文本分类等NLP任务。具体包括:155,652篇论文,169,407位去重作者,712,010条作者链接,1,029,924条URL链接,92.2%的摘要覆盖率,使用all-MiniLM-L6-v2模型生成的384维嵌入向量,以及59,121个知识图谱三元组。数据集文件包括主表、作者表、论文-作者关联表、链接表、知识图谱文件、趋势分析文件等,并支持快速加载为DataFrame或HuggingFace Dataset,以及语义搜索功能。
--- language: - 英语 license: CC BY 4.0 pretty_name: "Polaris CCF AI论文集" size_categories: - 100000<n<1000000 task_categories: - 文本检索 - 特征提取 - 文本分类 tags: - 学术 - 论文 - 科学 - 引用 - 知识图谱(Knowledge Graph) - 检索增强生成(Retrieval-Augmented Generation,RAG) - 嵌入(Embeddings) - AI研究 - 中国计算机学会(CCF) configs: - config_name: 论文集 data_files: "tables/ai_ccf_a_db_export_v2.csv" - config_name: 作者 data_files: "tables/ai_authors.csv" - config_name: 论文-作者关联 data_files: "tables/ai_paper_authors.csv" - config_name: 论文链接 data_files: "tables/ai_paper_links.csv" --- # Polaris CCF AI论文集 本数据集为精选、交叉验证且经过丰富增强处理的155652篇AI论文集合,涵盖11个经中国计算机学会(CCF)分级的顶级AI学术会议,时间跨度为1982年至2026年,由[Polaris](https://github.com/20bytes/Polaris)流水线框架构建完成。 | | | |---|---| | **论文总数** | 155,652 | | **严格CCF-A类会议** | AAAI · NeurIPS · ACL · CVPR · ICCV · ICML · IJCAI(共7个) | | **高价值扩展会议** | ICLR(未分级) · ECCV(CCF-B类) · EMNLP(CCF-B类) · CHI(CCF-A类,人机交互领域)(共4个) | | **时间覆盖范围** | 1982–2026 | | **去重作者总数** | 169,407名 | | **作者关联记录数** | 712,010条 | | **URL链接总数** | 1,029,924条 | | **摘要覆盖率** | 92.2% | | **嵌入模型** | `all-MiniLM-L6-v2`(384维) | | **知识图谱三元组** | 覆盖80,807篇论文(占比51.9%),共计59,121条三元组 | ## 文件 本数据集保留了流水线的原始目录结构。使用`--local-dir outputs/ai_ccf_a/`即可直接下载至Polaris仓库预期的布局中。 | 文件名 | 大小 | 描述 | |---|---|---| | `tables/ai_ccf_a_db_export_v2.csv` | 380 MB | **主表**。每一行对应一篇论文,共50列。 | | `tables/ai_authors.csv` | 11 MB | 去重后的作者表(共169k行)。 | | `tables/ai_paper_authors.csv` | 56 MB | 论文与作者的多对多关联表,包含作者顺序信息(共712k行)。 | | `tables/ai_paper_links.csv` | 225 MB | 单篇论文的9类URL链接(共1.03M行)。 | | `tables/ai_audit_report.md` | 3 KB | 数据质量审核总结报告。 | | `knowledge/ai_paper_chunks.jsonl` | 254 MB | 单篇论文的文本分块(标题+作者+摘要+会议信息),每行对应一篇论文。 | | `knowledge/ai_paper_embeddings.npy` | 229 MB | 稠密嵌入矩阵,形状为`(155652, 384)`,与`ai_paper_chunks.jsonl`按行一一对应。 | | `knowledge/ai_embedding_id_map.json` | 4.1 MB | 嵌入行号到`paper_id`的映射表。 | | `knowledge/ai_knowledge_manifest.json` | 1 KB | 嵌入索引的构建元数据。 | | `kg/knowledge_graph.json` | 16 MB | 从标题和摘要中抽取的「方法×数据集×任务」三元组。 | | `kg/kg_summary.json` | 3 KB | 三元组计数与实体覆盖情况统计。 | | `trends/trend_analysis.json` | 85 KB | 50主题聚类结果,包含热门/新兴/衰退主题分类。 | | `trends/trend_report.md` | 6 KB | 可读的研究趋势分析报告。 | | `trends/topic_centers.npy` | 76 KB | 聚类质心矩阵,形状为`(50, 384)`。 | | `trends/topic_labels.npy` | 609 KB | 单篇论文的主题标签,形状为`(155652,)`。 | ## 快速加载 ### 以DataFrame形式加载(论文表) python import pandas as pd df = pd.read_csv("tables/ai_ccf_a_db_export_v2.csv") print(df.shape) # (155652, 50) print(df["conference"].value_counts()) ### 以Hugging Face数据集形式加载 python from datasets import load_dataset ds = load_dataset("20bytes/polaris-ccf", "papers", split="train") ### 基于嵌入的语义检索 python import numpy as np, json from sentence_transformers import SentenceTransformer emb = np.load("knowledge/ai_paper_embeddings.npy") # (155652, 384) chunks = [json.loads(l) for l in open("knowledge/ai_paper_chunks.jsonl")] model = SentenceTransformer("sentence-transformers/all-MiniLM-L6-v2") q = model.encode("代码领域的检索增强生成") scores = emb @ q / (np.linalg.norm(emb, axis=1) * np.linalg.norm(q)) top = scores.argsort()[::-1][:10] for i in top: print(scores[i], chunks[i]["title"]) ## 主表结构(共50列) ### 身份标识与溯源 - `paper_id`, `canonical_paper_id` — 主键与去重锚点 - `dblp_key`, `identity_status`, `identity_match_method`, `identity_confidence` - `source_host`, `source_sites_json`, `matched_both_sites` ### 文献著录 - `conference`, `year`, `title`, `normalized_title` - `authors_text`, `authors_json`, `author_count` - `group_name_raw`, `presentation_type`, `track_name`, `paper_type` - `is_main_track`, `is_ccf_countable_paper`, `group_confidence`, `main_track_status` ### 链接信息 - `openreview_url`, `arxiv_url`, `paper_url`, `pdf_url`, `doi` - `best_url`, `best_pdf_url` ### 内容与增强信息 - `abstract`, `abstract_source` - `semantic_scholar_paper_id`, `s2_corpus_id`, `s2_url`, `s2_status` - `s2_match_method`, `s2_match_confidence` - `citation_count`, `influential_citation_count`, `reference_count` - `fields_of_study_json`, `tldr` ### CCF分级信息 - `ccf_rank`, `ccf_category`, `ccf_area_name` - `ccf_official_name`, `ccf_official_url`, `scope` ## 构建流程 本数据集的构建流水线托管于[Polaris](https://github.com/20bytes/Polaris)仓库,大致流程如下: 1. **采集**:从开放会议论文集(CVF开放获取平台 · ACL文集 · OpenReview · PMLR)进行标题级交叉验证采集; 2. **锚定**:以DBLP作为标准身份基准,通过DOI、arXiv ID、OpenReview ID或标题+第一作者信息完成去重; 3. **增强**:通过Semantic Scholar获取引用信息、TLDR摘要、研究领域等元数据,通过OpenAlex获取备用摘要,通过arXiv获取PDF链接; 4. **标准化**:通过40条规则映射表规范会议分会场名称与组别; 5. **嵌入**:使用`all-MiniLM-L6-v2`对每篇论文的标题、作者、会议信息组合文本生成稠密嵌入; 6. **聚类**:使用MiniBatchKMeans将论文聚类为50个主题,并按年份划分研究趋势; 7. **抽取**:通过模式匹配从文本中抽取「方法×数据集×任务」三元组。 ## 来源与归因 | 来源 | 许可协议 | 贡献内容 | |---|---|---| | [DBLP](https://dblp.org/) | CC0(公共领域) | 标准身份标识键、会议系列信息 | | [Semantic Scholar API](https://api.semanticscholar.org/) | 受[S2 API条款](https://www.semanticscholar.org/product/api)约束 | 引用计数、TLDR摘要、研究领域 | | [OpenAlex](https://openalex.org/) | CC0 | 备用摘要与元数据 | | [arXiv](https://arxiv.org/) | arXiv服务条款 | PDF链接与标识符 | | [中国计算机学会(CCF)](https://www.ccf.org.cn/) | 仅作为元数据引用 | 会议层级分级(CCF-A类) | | CVF开放获取平台 · ACL文集 · OpenReview · PMLR | 公开会议页面 | 标题与作者元数据 | 本数据集整合了上述来源的元数据。摘要优先取自官方会议论文集,缺失时以OpenAlex作为备用。**本数据集未分发任何完整PDF全文。** ## 许可协议 本数据集采用**[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)**协议发布。您可在注明来源的前提下使用、分享和改编本数据集。在引用或使用本数据集时,请同时遵循上述上游来源各自的许可协议。 ## 引用格式 bibtex @misc{polaris_ccf_ai_2026, title = {Polaris CCF AI Papers: a cross-validated dataset of 155K papers from 11 top AI conferences in CCF rankings}, year = {2026}, url = {https://huggingface.co/datasets/20bytes/polaris-ccf}, note = {Pipeline: https://github.com/20bytes/Polaris} } ## 局限性与说明 - **摘要缺失**:约7.8%的论文无可用摘要,主要为2010年之前的文献,或未被Semantic Scholar/OpenAlex覆盖的研讨会/演示文稿赛道; - **引用时效性**:引用计数为2026年5月通过Semantic Scholar获取的快照,仅可作为相对参考指标,而非绝对数值; - **作者消歧**:基于标准化姓名进行消歧,同名作者可能存在混淆,可通过`s2_author_id`字段进行交叉验证; - **知识图谱**:通过人工整理的实体词汇表(约200个方法×100个数据集×80个任务)的模式匹配抽取,精度较高,但不同子领域的召回率存在差异; - **时间覆盖范围**:2010年之后的覆盖密度较高,2010年之前的覆盖为尽力而为,不同会议的覆盖情况存在差异。 ## 更新日志 - **v0.1.0(2026年5月)**:初始发布,覆盖11个会议,时间跨度为1982–2026年。




