遇见数据集

BioTender · AI×Biology Corpus

收藏
github2026-07-06 更新2026-07-15 收录
官方服务:

资源简介:

一个精心整理的语料库,包含3,722篇机器学习和生物学交叉领域的论文,发表于2010年至2026年的ICLR、ICML和NeurIPS会议。

A meticulously curated corpus consisting of 3,722 papers at the intersection of machine learning and biology, published in the ICLR, ICML, and NeurIPS conferences between 2010 and 2026.

创建时间:
2026-07-06
原始信息汇总

数据集概述:BioTender · AI×Biology Corpus

核心定位:一个经过人工筛选的语料库,包含 3,722 篇发表于 ICLR、ICML 和 NeurIPS 三大顶级机器学习会议(2010-2026 年)的 AI×生物学交叉领域论文。

基本信息

项目 数值
论文总量 3,722
覆盖会议 ICLR (2,181) · NeurIPS (895) · ICML (646)
覆盖年份 2010 – 2026(17 年,34 个会议-年份组合)
过滤器召回率 95.9%(在 ICML 2026 人工真值集的 315 篇论文上验证)
数据来源 OpenReview · PMLR · papers.nips.cc
代码许可 MIT
数据许可 CC-BY-4.0
维护方 BioTender

数据格式

  • 交互式浏览biotender-ai-bio-corpus.html(单文件、零依赖、本地可运行)
  • 原始数据corpus/papers_master.json(8.2 MB)和 corpus/papers_master.csv(1.3 MB)
  • 网站源文件:位于 site/ 目录,包括 HTML、CSS、JS 及 data/papers.jsondata/stats.json

数据模式(字段说明)

字段 说明
title, abstract, authors 已验证,来自上游源
paper_page, pdf_url 已验证,指向原文链接
venue, year 已验证,源自源 URL
_tags 衍生字段,通过关键词+上下文规则推断
_filter_reason 审计轨迹,说明论文被保留的原因

内容规模与趋势

时间分布(增长拐点)

年份 ICLR ICML NeurIPS 总计
2010 10 10
2018 4 21 25
2020 75 13 42 130
2023 217 39 141 397
2024 264 73 195 532
2025 501 134 274 909
2026 887 348 - 1,235

关键拐点

  • 2018 → 2019:25 → 60(2.4 倍),ICLR 加入。
  • 2019 → 2020:60 → 130(2.17 倍),AlphaFold1 后上升。
  • 2022 → 2023:220 → 397(1.80 倍),AlphaFold2 影响 ICML/NeurIPS。
  • 2024 → 2025:532 → 909(1.71 倍),基础模型浪潮(scGPT, GenomicFM, BioFM 等)。
  • 2025 → 2026(仅 ICLR + ICML):909 → 1,235。

主题分布(TOP 10 标签频率)

标签 论文数
molecule 1,005
protein 925
clinical 925
neuro 916
genomics 480
medical_imaging 465
single_cell 401
md_structbio 286
oncology 188
immuno 91

主题增长轨迹示例

  • protein:2018 年 2 篇 → 2026 年 294 篇(指数级增长)。
  • genomics:2022 年 19 篇 → 2025 年 148 篇(DNA 基础模型驱动)。
  • single_cell:2018 年 2 篇 → 2026 年 125 篇(后期爆发)。

方法论概要

  • 阶段 1 — 抓取:三个爬虫从 OpenReview API v3、PMLR HTML、papers.nips.cc HTML 获取标题、摘要和作者。
  • 阶段 2 — 预过滤:44 个术语的关键词列表,淘汰超过 85% 的非生物论文。
  • 阶段 3 — 完整过滤:v3 过滤器将候选论文分类到 19 个分支(强生物命中、化学/分子、健康/医学、神经科学等)。
  • 阶段 4 — 合并与标签:规范化和去重后,给论文分配主题标签。

验证结果:最终过滤器与人工真值集(ICML 2026 的 315 篇论文)重叠率为 95.9%(302/315)。保留了 46 篇非真值集中的额外论文,均被认定为合法的 AI×生物学论文。

已知限制

  1. ICML 2018–2023 计数为下限,实际估计高约 10%。
  2. NeurIPS 2026 尚未举行,未包含该年论文。
  3. 编辑主观性,4.1% 的召回率差距源于维护方的包含/排除决定。
  4. 仅收录被接受的论文,被拒绝或撤回的投稿未包含。
  5. 静态快照,基于 2026.07.06 版本。
搜集汇总
数据集介绍
构建方式
在人工智能与生物学交叉研究日益繁荣的背景下,BioTender · AI×Biology Corpus应运而生。该数据集通过严密的四阶段流水线构建而成:首先,利用定制爬虫从OpenReview、PMLR及papers.nips.cc三大权威源站获取ICLR、ICML和NeurIPS三大顶会自2010年至2026年间的论文元数据;其次,依靠44个精简关键词对标题进行预过滤,快速筛除超过85%的非生物相关论文以提升效率;随后,部署锁定版本V3的过滤脚本,通过19个精细分支对候选论文进行全文分类,涵盖强生物命中、化学分子、医学健康等维度,并专门设置了假阳性陷阱以排除干扰项;最后,合并多来源数据并完成去重,同时自动推断主题标签,形成一份包含3,722篇论文的高质量语料库,其过滤召回率经ICML 2026人工真值集验证高达95.9%。
特点
该数据集兼具系统性与动态洞察力两大鲜明特质。从系统性看,它横跨17年、涵盖34个会议年度组合,忠实记录了AI×生物学从萌芽到爆发的完整轨迹,AlphaFold系列突破与基础模型浪潮等关键拐点均清晰可辨。从洞察力看,数据集内置了颗粒度丰富的主题标签体系,molecule、protein、clinical等标签数量从数百到上千不等,用户可一键追踪各子领域随时间演化的热度曲线,例如protein标签从2018年的2篇激增至2026年的294篇,生动诠释了计算结构生物学的指数级增长。此外,所有元数据均经过上游源站验证,衍生标签与过滤依据均有透明审计追踪,确保了研究的可复现性与可靠性。
使用方法
为满足不同用户需求,数据集提供了分层递进的使用路径。偏好直观浏览的研究者可直接双击`biotender-ai-bio-corpus.html`文件,一个零依赖、离线可用的交互式网站即刻呈现,所有过滤、搜索与分页功能皆可独立运行。欲进行深度定制的开发者,可转入`site/`目录,通过修改CSS调色板或为`app.js`增添新功能来构建个性化界面。追求数据分析的学者则可直接加载`corpus/papers_master.json`或CSV格式的原始语料,利用Python或pandas进行元分析、趋势挖掘或训练数据构建。对于追求完全复现的严谨团队,`scripts/`目录下的爬取与过滤脚本仅依赖`requests`与`beautifulsoup4`,配合`docs/METHODOLOGY.md`的详细说明,整个流水线可一键重现。
背景与挑战
背景概述
随着人工智能与生物学的交叉研究蓬勃发展,顶级机器学习会议(ICLR、ICML、NeurIPS)中涌现出大量相关论文。为系统性追踪这一领域的演进脉络,BioTender团队于2026年创建了AI×Biology语料库。该数据集由机构主导,精心筛选了2010至2026年间三大会议共计3,722篇论文,覆盖蛋白质、基因组学、单细胞、医学影像等前沿主题。通过高精度的关键词过滤与多源爬取,语料库实现了95.9%的召回率,为研究者提供了全面、可复现的文献分析基础。此数据集不仅揭示了该领域从AlphaFold到基础模型的指数级增长轨迹,更成为洞察AI驱动生物学研究范式变革的核心资源,对后续计量分析与趋势预测具有重要影响力。
当前挑战
构建该语料库面临多重挑战。领域问题方面,AI与生物学交叉论文定义模糊,需设计细化且精准的过滤策略,以区分纯生物、化学相关、医学影像及神经科学等子领域,避免泛化或错误归类。构建过程中,需从OpenReview、PMLR、papers.nips.cc等异构源爬取数据,面对站点结构差异、部分年份摘要缺失等困难,早期ICML数据仅依靠标题预过滤,召回率约89%。人力验证浩繁,仅对ICML 2026的315篇真值集即耗费大量精力,且主观性导致的4.1%召回率缺口主要源于边界案例的取舍。此外,语料库为静态快照,无法纳入2026年晚些公布的NeurIPS论文,且仅收录被接收稿件,排除了投稿与工作坊内容,构建流水线的可复现性亦需严格维护。
常用场景
经典使用场景
在人工智能与生物学的交叉研究领域,研究者常面临文献浩如烟海、主题散布难寻的困境。BioTender·AI×Biology Corpus正是为解决这一痛点而生,其最经典的使用场景在于为研究者提供一个经过严格筛选、主题标注清晰且覆盖长达十七年的文献索引系统。借助内置的交互式网页或原始JSON/CSV数据,用户可便捷地按年份、会议来源或标签(如蛋白质、基因组学、单细胞等)进行多维检索与统计分析,从而快速锁定某一细分方向的核心论文,支撑其文献综述撰写或研究脉络梳理。
解决学术问题
该数据集直击学术界长期存在的信息碎片化与筛选低效问题,首次以系统化、可复现的方式梳理了三大顶级机器学习会议中所有与生物学深度相关的论文。通过构建高达95.9%召回率的分类流水线,它精准刻画了AI×生物学领域从2018年至今的爆发式增长轨迹与主题迁徙规律,为学科演进提供了量化证据。这一工作不仅降低了学者跨领域研究的入门门槛,更推动了计算生物学方法论的系统性评估,成为衡量研究热点变迁与评估技术成熟度不可或缺的基准资源。
衍生相关工作
基于该语料库已衍生出多项具有影响力的学术工作:以BioTender命名的持续性内容项目正依据此语料持续产出中文深度学习与生物学工具综述;其用于ICML 2026的初始子集被独立归档,成为验证文献检索算法召回率的事实标准。研究者利用其标签系统探索了从AlphaFold2冲击波后蛋白质方向十六倍增长,到DNA基础模型驱动基因组学方向翻倍等量化趋势,催生了关于AI×生物学领域知识结构变迁的专题分析。这些衍生工作共同构建了一个围绕该核心语料的开放研究生态系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务