遇见数据集

ArXivSignals

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

ArXivSignals是一个持续更新、按日期分区的数据集,收录了arXiv预印本平台中人工智能、机器学习及相关领域的学术论文。该数据集的核心价值在于提供了由大型语言模型(LLM)生成的增强信号,旨在辅助研究人员快速筛选和理解论文。数据集包含两个主要配置:1)papers配置(默认),为每篇论文提供完整的元数据(如标题、摘要、作者、分类)以及LLM衍生的丰富信息,包括0-100分的兴趣度与信号评分、一句话核心摘要、论文贡献类型(如新方法、数据集、综述)、所属机构标签、主题关键词以及部分论文的详细Markdown总结。2)thumbnails配置,提供每篇论文的ID及其首页渲染的缩略图。数据来源分为两部分:论文的文献目录信息(标题、摘要、作者等)来自arXiv(CC0许可),而所有增强字段(评分、标签、摘要等)则由ArXivSignals项目通过LLM分析生成,并以CC-BY-4.0许可发布。数据集每日更新(通常为周日至周四),覆盖范围侧重于AI/ML类别,并非arXiv的完整镜像。它适用于文本分类、信息检索、文本摘要、特征提取等任务,可作为论文推荐、研究趋势分析或快速文献调研的开放资源。

ArXivSignals is a continuously updated, date-partitioned dataset that collects academic papers in artificial intelligence, machine learning and related fields from the arXiv preprint platform. The core value of this dataset lies in providing augmented signals generated by large language models (LLMs), aiming to assist researchers in quickly screening and understanding papers. The dataset includes two main configurations: 1) The `papers` configuration (default) provides complete metadata for each paper (such as title, abstract, authors, categories) and rich LLM-derived information, including an interest and signal score ranging from 0 to 100, a one-sentence core summary, paper contribution types (such as new methods, datasets, reviews), affiliation tags, topic keywords, and detailed Markdown summaries for some papers. 2) The `thumbnails` configuration provides the ID of each paper and its homepage-rendered thumbnails. The data sources are divided into two parts: the bibliographic information of the papers (title, abstract, authors, etc.) comes from arXiv (CC0 license), while all augmented fields (scores, tags, summaries, etc.) are generated by the ArXivSignals project through LLM analysis and released under the CC-BY-4.0 license. The dataset is updated daily (usually Sunday to Thursday), and its coverage focuses on AI/ML categories rather than being a complete mirror of arXiv. It is applicable to tasks such as text classification, information retrieval, text summarization, and feature extraction, and can serve as an open resource for paper recommendation, research trend analysis, or rapid literature review.

创建时间:
2026-06-13
原始信息汇总

数据集名称:ArXivSignals — Daily arXiv Papers with LLM Signal & Summaries

数据集链接: https://huggingface.co/datasets/taesiri/ArXivSignals

许可协议: CC-BY-4.0

语言: 英语

任务类别: 文本分类、文本检索、摘要、特征提取

数据规模: 1K < 样本量 < 100K


数据集简介

这是一个持续更新的、按天分区的arXiv论文数据集(涵盖AI/ML及相关类别),通过大语言模型(LLM)进行富化,为每篇论文提供0–100的重要性评分、主题/实验室标签、一行总结,并为部分论文提供详细的全文摘要。该数据集用于驱动 arxivsignals.io 服务,并作为开放研究资源发布。


数据集配置(Configs)

  • papers (默认):每行代表一篇论文,包含参考文献信息、LLM富化结果及标签。
  • thumbnails:包含 paper_id 和论文第一页的渲染图像(PIL图片格式)。

两个配置均按 announce_date 进行分区(路径格式:data/papers/date=YYYY-MM-DD/…),可直接使用Parquet读取器读取指定日期。每个配置仅包含一个名为 corpus 的拆分,代表全量数据,无训练/测试划分。


主要字段说明(papers 配置)

字段名 类型 来源 说明
paper_id 字符串 arXiv 去掉版本的arXiv规范ID
versioned_id 字符串 arXiv 带版本后缀的arXiv ID
announce_date 日期 arXiv 分区键
title, abstract 字符串 arXiv 论文标题和摘要
author_names 列表[字符串] arXiv 作者显示名称
authors_json 字符串 arXiv 完整的作者结构(JSON格式)
categories 列表[字符串] arXiv 论文类别,如["cs.CV","stat.ML"]
primary_category 字符串 arXiv 主要类别
page_count 整数 arXiv 论文页数
one_liner 字符串 ArXivSignals(LLM) 不超过20个单词的核心总结
contribution_type 字符串 ArXivSignals(LLM) 贡献类型(如新方法、数据集、综述等)
affiliations 列表[字符串] ArXivSignals(LLM) 从论文中提取的机构信息
interest_score 整数 ArXivSignals(LLM) 提取时的兴趣估计分数(0–100)
interest_reason 字符串 ArXivSignals(LLM) 兴趣分数的简短理由(≤15词)
releases_code, claims_sota 布尔值 ArXivSignals(LLM) 是否发布代码、是否声称SOTA
signal_score 整数 ArXivSignals(LLM) 排名信号,基于固定规则评分的0–100分数
signal_reason 字符串 ArXivSignals(LLM) 该分数给出的原因
signal_model 字符串 ArXivSignals 生成 signal_score 的模型
summary_long 字符串 ArXivSignals(LLM) 详细的Markdown格式摘要(仅部分论文有)
summary_graph_json 字符串 ArXivSignals(LLM) 结构化的架构图(JSON格式),可能为null
summary_model 字符串 ArXivSignals 生成摘要的模型
extraction_model 字符串 ArXivSignals 生成标签和一行总结的模型
enriched_at 字符串 ArXivSignals 富化时间戳
keyword_slugs / keyword_labels 列表[字符串] ArXivSignals(LLM) 规范化的主题标签
lab_slugs / lab_labels 列表[字符串] ArXivSignals(LLM) 识别出的实验室/机构
free_keywords 列表[字符串] ArXivSignals(LLM) 自由形式的特定术语

数据来源与许可

  • 参考文献字段(标题、摘要、作者、类别等)来源于arXiv,遵循 CC0 许可协议。
  • 富化字段(信号评分、标签、摘要、一行总结)为ArXivSignals原创分析结果,采用 CC-BY-4.0 许可协议。

数据集中不包含PDF或LaTeX源码,仅包含元数据、富化结果及低分辨率的第一页缩略图。如需移除某篇论文的缩略图或富化结果,可在数据集讨论区提出。


注意事项

  • 富化结果由模型生成,信号评分、摘要和标签可能存在错误或偏差,仅作为快速筛选的参考,不应视为绝对真理。每行数据中通过 *_model 字段记录了生成模型的来源。
  • 覆盖范围偏向于ArXivSignals追踪的AI/ML类别,并非arXiv的完整镜像。
  • 数据在管道运行的大部分日期(约周日到周四)更新,当有新的摘要添加到较早的论文时,某些日期可能在提交历史中重新出现。

引用方式

bibtex @misc{arxivsignals_dataset, title = {ArXivSignals: Daily arXiv Papers with LLM Signal and Summaries}, author = {ArXivSignals}, url = {https://arxivsignals.io}, note = {Hugging Face dataset} }

搜集汇总
数据集介绍
ArXivSignals 数据集图片
构建方式
ArXivSignals以arXiv平台每日更新的AI/ML及相关领域论文为基底,构建了一个持续迭代的开放研究资源。其构建流程引入大规模语言模型(LLM),为每篇论文生成多维度的丰富信号:包括0至100的重要性评分、主题/实验室标签、单行要点,并针对精选子集生成详实的全页摘要。数据以日期为分区键(announce_date)进行组织,支持流式加载或直接通过Parquet读取器访问特定日期的内容。该数据集包含两个配置:papers存储元数据与LLM增强信息,thumbnails提供论文首页的低分辨率缩略图,从而在轻量化与信息密度间取得了平衡。
特点
ArXivSignals的独特之处在于其由LLM驱动的多层次标注体系。每篇论文不仅包含传统的书目字段,还拥有超过十种衍生信号:interest_score反映提取时的兴趣估值,signal_score基于锚定评分规则提供排序依据,one_liner以不超过20词的表述精炼核心贡献。contribution_type区分方法、数据集、综述等类型,releases_code与claims_sota则标识代码发布与SOTA声称。此外,JSON格式的summary_graph_json结构化描绘实验架构,keyword_slugs与lab_slugs实现规范化的主题与机构标记。所有LLM输出的来源模型均被记录,确保可追溯性与透明度。
使用方法
研究者可通过Hugging Face的datasets库便捷地加载数据:使用load_dataset("taesiri/ArXivSignals", "papers", split="corpus")获取全量论文元数据及增强信号,指定streaming=True可实现流式读取以避免完整下载。缩略图配置通过load_dataset("taesiri/ArXivSignals", "thumbnails", split="corpus")加载,返回PIL图像数据。由于数据集是参考目录而非ML基准,其未划分训练/测试集,仅包含单一corpus分割。用户亦可利用Parquet的日期分区特性,直接以文件系统路径按需读取某日论文,灵活适配论文推荐、文本分类、特征提取与摘要生成等研究场景。
背景与挑战
背景概述
ArXivSignals数据集由ArXivSignals团队创建于近期,旨在应对人工智能与机器学习领域学术论文数量激增所带来的信息过载问题。该数据集每日从arXiv平台收集AI/ML及其相关领域的论文,并利用大语言模型(LLM)对每篇论文进行深度增强处理,生成0–100的重要性评分(signal_score)、主题标签、单行摘要及长篇总结,从而为研究者提供高效的论文筛选和推荐工具。数据集以开放研究资源的形式发布,支持文本分类、摘要生成和特征提取等任务,其创新性在于将LLM的语义理解能力与传统学术元数据结合,为信息过载问题提供了自动化解决方案,对科学文献的发现与利用产生了积极影响。
当前挑战
该数据集所解决的领域核心挑战在于如何在海量学术论文中快速识别高价值内容,传统基于引文或关键词的方法难以捕捉论文的深层贡献和创新性。在构建过程中,数据集面临多重挑战:首先,LLM生成的信号分数、标签和摘要可能存在偏差或错误,需要记录模型来源以保证可追溯性;其次,数据覆盖范围局限于AI/ML领域,无法反映arXiv全学科图景;此外,数据集每日更新,但更新频率受限于管道运行时间(约周日至周四),且部分旧论文可能在后续被补充摘要,导致数据版本一致性难以保证;最后,论文的元数据虽来源于arXiv的CC0协议,但增强部分以CC-BY-4.0发布,需妥善处理知识产权问题。
常用场景
经典使用场景
ArXivSignals数据集的核心价值在于其为人工智能与机器学习领域的研究者提供了一个持续更新的、经大语言模型增强的每日论文索引。该数据集最经典的用途是作为高效的论文发现与筛选工具,研究者可借助LLM自动生成的0-100重要性评分(signal_score)、核心摘要(one_liner)和主题标签(keyword_labels)来快速定位高价值文献,从而在大规模预印本海洋中实现精准的学术信息检索。
实际应用
在实际应用中,ArXivSignals数据集已被部署于arxivsignals.io论文推荐平台,为研究人员提供每日个性化的论文推送服务。其应用场景涵盖学术前沿监控、竞争情报分析及课题灵感启发——科研团队可借此系统性地追踪特定实验室(lab_labels)或细分领域(keyword_slugs)的最新进展;企业研发部门可基于signal_score快速筛选技术突破;而教育机构则能利用其结构化摘要(summary_long)构建课程案例库。数据集的流式加载功能(streaming=True)更支持对实时更新论文进行低延迟处理。
衍生相关工作
ArXivSignals的出现已催生多项衍生研究,特别是在基于元学习的论文重要性预测领域。学术界可将其LLM生成的评分作为弱监督标签,训练专属的论文排序模型,从而构建定制化的学术推荐系统。此外,数据集中的结构化架构图(summary_graph_json)为跨论文方法比较提供了机器可读的范式,有望推动自动文献综述生成工具的发展。其按日期分区的存储格式(announce_date)也为时序分析(如研究热点演变建模)提供了标准化基准,未来或可支撑更多可解释性的学术演化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务