遇见数据集

awesome-brain-fm

收藏
github2026-05-14 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精选的资源合集,主题为脑科学基础模型,收录了相关的建模论文、数据集、实验论文、代码库和基准测试。合集覆盖了神经科学中预训练基础模型、经典机器学习与统计模型、大规模神经活动实验记录与成像、神经与行为数据的基准测试与开源平台等多个领域,旨在为研究人员提供全面的资源索引。

This is a curated collection of resources focused on foundational models for neuroscience. It includes relevant modeling papers, datasets, experimental papers, code repositories, and benchmarks. The collection covers multiple domains in neuroscience, including pretrained foundational models, classical machine learning and statistical models, large-scale neural activity experimental recordings and imaging techniques, as well as benchmarks and open-source platforms for neural and behavioral data. It aims to provide researchers with a comprehensive resource index.

创建时间:
2025-04-07
原始信息汇总

Awesome Foundation Models for the Brain 数据集详情

该资源库是一个精心策划的专业列表,涵盖了脑科学领域的基础模型相关论文、数据集、实验论文、代码仓库和基准测试。

核心内容概览

该仓库收录并整理了以下四类核心资源:

  • 预训练基础模型论文:神经科学中预训练基础模型的最新工作(含可用代码)。
  • 机器学习与统计模型论文:经典的神经数据机器学习与统计模型(按受试者、记录方式、行为任务排序,含可用代码)。
  • 大规模实验记录/成像数据集:大规模神经活动实验记录和成像数据,特别是Neuropixel和宽场成像(含可用数据和代码)。
  • 综述与观点:关于大规模神经数据分析的观点和评论文章。
  • 基准与工具:神经和行为数据的基准、Python库和开源数据平台。
  • 教程与其他资源:脑基础模型相关的教程和其他资源。

论文与预训练模型(共12篇)

包含12篇提供预训练模型的开创性论文,覆盖小鼠、非人灵长类、人类等多种受试者,以及电生理、钙成像、fMRI、iEEG等多种记录方式,涉及视觉、决策、运动、工作记忆、疾病等多种任务。

代表性论文示例:

论文名称 发表平台/年份 受试者 记录方式 任务
NEDS ICML 2025 spotlight 小鼠 电生理 决策
POYO+ ICLR 2025 spotlight 小鼠 钙成像 视觉
Foundation model of neural activity... Nature 2025 小鼠 钙成像 视觉
BrainLM ICLR 2024 人类 fMRI 疾病
Brant NeurIPS 2023 人类 iEEG -
Neural Data Transformer 2 NeurIPS 2023 人类 / 非人灵长类 电生理 运动
CEBRA Nature 2023 非人灵长类 / 小鼠 电生理 / 钙成像 运动 / 视觉

数据集与工具(17项)

收录了多个关键的数据集和工具包,主要包括:

  • 数据档案库

    • DANDI Archive:发布和共享神经生理学数据(电生理、光生理、行为时间序列、免疫染色图像)。
    • 国际脑实验室(IBL)数据
    • Janelia研究园区的数据集。
    • OpenNeuro:验证和共享BIDS兼容的MRI、PET、MEG、EEG、iEEG数据的开放平台。
  • Python数据处理与分析工具

    • temporaldata:处理多模态、多分辨率时间序列数据的数据结构和方法。
    • brainsets:将神经数据处理为标准化格式的包。
    • NeMoS:系统神经科学的统计建模框架(侧重广义线性模型GLM)。
    • CaImAn:大规模钙成像数据分析工具箱。
    • pynapple:神经生理学数据分析的轻量级库。
    • torch_brain:神经科学深度学习模型库。
    • plenoptic:基于模型的感知刺激合成库。
    • lfads-torch:基于动态系统的潜在因子分析的模块化实现。
  • 行为分析与可视化工具

    • DeepLabCut:动物姿态估计软件包。
    • SLEAP:Social LEAP Estimates Animal Poses。
    • B-SOiD:自发行为发现的无监督算法。
    • Keypoint-MoSeq:通过关键点追踪解析行为。
    • OpenPose:实时多人关键点检测系统。
  • 神经数据可视化与基准

    • neurosift:专注于NWB文件的可视化浏览器工具,支持DANDI和OpenNeuro的交互式探索。
    • fastplotlib:Python快速原型设计绘图库,适合大规模科学可视化。
    • Brain-Score:旨在产生准确、可执行的脑功能计算模型的综合基准。

其他相关论文(共188篇,重点推荐28篇)

该部分进一步归类了大量相关研究论文:

机器学习与统计模型(73篇,重点推荐11篇)

按分析数据类型细分:

  • 电生理分析(40篇,重点6篇):涵盖动态状态空间模型、细胞类型与脑区分类、神经计算个体变异性、潜在扩散模型、高斯状态空间模型等。
  • 光学生理分析(19篇,重点5篇):主要涉及钙成像数据分析。
  • iEEG分析(2篇)。
  • EEG和fMRI分析(12篇)。

大规模实验记录与成像(85篇,重点推荐12篇)

按数据类型细分:

  • 电生理记录(25篇,重点7篇)。
  • 光学成像(28篇,重点5篇)。
  • 连接组与转录组(32篇)。

观点与综述(27篇,重点推荐5篇)

基准与分类约定

资源库使用了标准化的关键词约定,便于快速识别论文的受试者、记录方式和任务类型:

  • 受试者:人类、非人灵长类、大鼠、小鼠、斑马鱼、果蝇。
  • 记录方式:电生理、钙成像、fMRI、EEG、iEEG(含ECoG和sEEG)。
  • 任务类型:视觉、听觉、语言、躯体感觉、嗅觉、运动、决策、工作记忆、空间导航、社交行为、睡眠、疾病。
搜集汇总
数据集介绍
awesome-brain-fm 数据集图片
构建方式
在计算神经科学与人工智能交叉领域蓬勃发展的背景下,该数据集以GitHub仓库为载体,系统性地整合了脑科学领域的基础模型资源。其构建方式采用专业策展模式,通过人工筛选与持续更新,汇集了涵盖预训练基础模型、经典机器学习与统计模型、大规模神经活动实验记录等四大类别的论文、数据集、代码库及基准测试平台。每项资源均标注了实验对象、记录方式与行为任务等元数据标签,并特别强调代码与数据的公开可及性,从而构建出一个结构化、可检索的知识体系。
特点
该资源库的核心特色在于其全景式的覆盖范围与精细化的标注体系。它不仅囊括了从电生理记录到钙成像、从fMRI到iEEG等多种神经数据模态,还跨越了小鼠、非人灵长类、人类等多个物种层级。尤为突出的是,其针对每篇论文与数据集均提供了实验对象、记录技术与行为范式的三重标签,并高亮标注了跨脑区记录与多模态分析等前沿方向,使得研究人员能够迅速定位与其研究问题高度匹配的资源,极大提升了文献与工具的检索效率。
使用方法
使用者可通过仓库内结构化的目录与关键词标签体系进行高效导航。首先,根据研究兴趣在'预训练模型论文'、'经典模型'、'大规模数据集'等核心板块中定位相关资源,随后利用实验对象、记录方式与行为任务等彩色徽章进行二次筛选。每项资源均附有指向原始论文、代码仓库、模型权重及数据集的直接链接,用户可据此快速获取并复现相关研究成果,或将其作为自身研究的基准与起点。
背景与挑战
背景概述
在计算神经科学与人工智能的交叉领域,预训练基础模型正以前所未有的方式重塑我们对大脑神经活动规律的理解。由多所国际顶尖研究机构联合发起的awesome-brain-fm项目,于2023年前后开始系统性地整理面向脑科学的基础模型文献、数据集与基准测试平台。该项目聚焦于利用大规模神经数据(如Neuropixel电生理记录与宽场钙成像)构建可泛化的预训练模型,旨在解决从感觉编码到运动决策等多层次脑功能的核心研究问题。通过整合人类、非人灵长类、啮齿类等多种模式动物的神经记录数据,该项目不仅推动了神经编码与解码理论的发展,更为脑机接口、神经疾病生物标志物检测等应用领域奠定了方法论基础,在学术界产生了广泛而深远的影响。
当前挑战
该领域当前面临的核心挑战首先在于神经数据的高度异质性与低信噪比。不同物种、脑区、记录模态(如电生理、钙成像、fMRI)产生的数据在时空分辨率和统计特性上差异悬殊,使得构建统一的预训练框架异常困难。其次,跨任务泛化能力不足构成了关键瓶颈:现有模型往往在特定行为范式(如视觉刺激或运动任务)上表现优异,但难以迁移至全新刺激类型或自然行为场景。此外,构建过程中还面临着数据标准化缺失、标注成本高昂、以及计算资源需求巨大等实际问题。如何设计既能捕捉跨物种共性神经表征,又能保留个体差异的架构,仍是亟待突破的难题。
常用场景
经典使用场景
在计算神经科学与人工智能的交叉领域中,awesome-brain-fm 数据集汇聚了面向大脑的基础模型(Foundation Models)相关的前沿研究资源,尤其适用于神经活动预测、跨任务解码以及多模态神经数据表征学习等场景。研究者可利用该数据集中收录的预训练模型,如 NEDS、POYO+ 和 BrainLM,在电生理记录、钙成像或功能磁共振成像数据上执行编码与解码任务,从而实现对不同刺激类型、行为范式乃至脑区间动态交互的精确建模。这一资源极大地降低了神经科学研究者进入深度学习领域的门槛,同时为构建通用型神经活动理解框架提供了标准化基准。
实际应用
在实际应用层面,该数据集所涵盖的模型与工具已在脑机接口(BCI)、神经疾病生物标志物检测以及行为分析等领域展现出显著潜力。例如,NDT3 等运动解码器可直接用于人类与非人灵长类的运动意图预测,助力康复外骨骼或假肢控制系统的开发;BrainLM 则可基于静息态功能磁共振成像数据识别精神疾病相关的脑网络异常模式。此外,结合 DeepLabCut 等姿态估计工具,研究人员能够同步分析神经活动与精细行为,实现从实验室基础研究到临床辅助诊断的无缝衔接。
衍生相关工作
该数据集催生了一系列具有深远影响的衍生工作,涵盖了从自监督表征学习到扩散生成模型的多个方向。代表性成果包括 BrainBERT 在颅内脑电图上的自监督预训练范式,CEBRA 在联合行为与神经嵌入学习方面的突破,以及 LDNS 将潜在扩散模型应用于神经尖峰数据的创新尝试。这些工作不仅在方法论上推动了神经数据建模的边界,还催生了如 torch_brain、brainsets 等标准化工具库,促进了社区内可复现研究的生态建设。同时,基于该数据集收录的基准测试(如 Brain-Score),研究者得以系统性地评估模型与生物视觉系统之间的对齐程度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务