遇见数据集

GADES2

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集为GADES 2.0论文的配套基准矩阵,用于GPU加速稀疏单细胞矩阵距离计算。包含四个子集:1) GeneratedDense:17个稠密CSV矩阵(70MB),覆盖不同对象数与特征数组合,用于稠密基准测试和精度对比;2) GeneratedSparse:75个稀疏Matrix Market格式矩阵(3.6GB),按形状分组,密度水平从0.5到0.99,用于研究稀疏度对算法的影响;3) Real:22个真实Matrix Market格式矩阵(3.2GB),涵盖单细胞测序(scRNA-seq/scATAC-seq)和推荐系统交互数据,密度跨度三个数量级;4) HugeDatasets:10个大型AnnData格式矩阵(.h5ad),包括单细胞图谱和其他领域数据集,支持分批读取。每个矩阵的出处、许可和引用要求均详细说明。该资源可用于复现论文中的计时和精度实验,并适用于单细胞分析、推荐系统等领域的距离计算基准测试。

This dataset is the accompanying benchmark matrices for the GADES 2.0 paper, used for GPU-accelerated distance computation on sparse single-cell matrices. It contains four subsets: 1) GeneratedDense: 17 dense CSV matrices (70MB) covering different combinations of number of objects and features, for dense benchmarking and precision comparison; 2) GeneratedSparse: 75 sparse Matrix Market format matrices (3.6GB), grouped by shape, with density levels from 0.5 to 0.99, for studying the impact of sparsity on algorithms; 3) Real: 22 real Matrix Market format matrices (3.2GB), including single-cell sequencing (scRNA-seq/scATAC-seq) and recommendation system interaction data, with densities spanning three orders of magnitude; 4) HugeDatasets: 10 large AnnData format matrices (.h5ad), including single-cell atlases and other domain datasets, supporting batch reading. The provenance, license, and citation requirements for each matrix are detailed. This resource can be used to reproduce the timing and precision experiments in the paper, and is suitable for distance computation benchmarking in fields such as single-cell analysis and recommendation systems.

创建时间:
2026-09-22
原始信息汇总

GADES 2.0 benchmark matrices 数据集总结

基本信息

  • 数据集地址:https://huggingface.co/datasets/lab-medvedeva/GADES2
  • 许可证:GPL-3.0(mixed-see-dataset-card)
  • 数据规模:1B < n < 10B
  • 标签:single-cell、scATAC-seq、scRNA-seq、distance-matrices、gpu-benchmark、recommender-systems
  • 用途:伴随 GADES 2.0 论文发布,用于稀疏单细胞矩阵的 GPU 加速距离计算研究,包含计时和精度实验所用的全部矩阵,以便复现论文报告的数据。

数据组成

数据集包含四个集合。

1. GeneratedDense

  • 17 个稠密矩阵,CSV 格式,总计 70 MB。
  • 对象数(objects)为 10、100、1000、10000,特征数(features)为 10、100、1000、10000、100000 的网格组合;超出设备显存容量的组合被省略。
  • 文件命名模式:<objects>_cells_<features>_features.csv。
  • 用途:支撑稠密基准测试以及与参考实现的精度比较。

2. GeneratedSparse

  • 75 个稀疏矩阵,Matrix Market 格式,总计 3.6 GB,按形状分为 15 个目录。
  • 目录命名模式:<objects>_cells_<features>_features。
  • 每个目录内的文件名即密度水平:0.5.mtx、0.75.mtx、0.9.mtx、0.95.mtx、0.99.mtx,数字代表零元素比例。
  • 稀疏度是算法最关键变量,该集合是论文中标度曲线的主要来源。

3. Real

  • 22 个真实矩阵,Matrix Market 格式,总计 3.2 GB,分为单细胞测定和推荐系统交互数据两部分。
  • 单细胞部分涵盖人和小鼠组织的 scRNA-seq 与 scATAC-seq;推荐系统部分提供形状和密度分布差异很大的矩阵。
  • 填充率跨越三个数量级,从 BeerAdvocate 的 0.07% 到 Jester 的 72.7%(后者是面板中唯一实际稠密的矩阵)。
矩阵 领域 来源
PBMC_all, B_T, B_CD8T scRNA-seq,人类免疫细胞 10x Genomics PBMC reference
PBMC5K, TCells, CellLines, HSC scATAC-seq 已发布的基准集合
Camp, Chen scRNA-seq,类器官与下丘脑 原始研究
FibrocardRNA 直接重编程时间序列 原始研究
HLCA_marrow, HLCA_aorta, HLCA_lung 多器官图谱 accession GSE109774
MovieLens20M 电影评分 GroupLens, Harper and Konstan 2015
LastFM 艺术家收听计数 HetRec 2011
Jester 笑话评分 Goldberg et al. 2001
BeerAdvocate, RateBeer 啤酒评论 McAuley and Leskovec 2013
Anime, ModCloth, Pinterest, TaFeng 社区评分、服装反馈、图片 pin、杂货购物篮 见论文

4. HugeDatasets

  • 10 个大型矩阵,AnnData 格式(.h5ad),其中 5 个单细胞图谱和 5 个其他领域数据,支持分批读取而无需将整个矩阵加载到内存。
  • TabulaSapiensV1 为完整的人类 Tabula Sapiens 图谱 1.0 版;TabulaMuris 为 Tabula Muris Senis 的 3 月龄小鼠数据;MouseAtlas 为小鼠 sci-ATAC-seq 染色质可及性图谱;FibrocardATAC 为成人心脏单核染色质可及性(GEO accession GSE165837)。
文件 细胞数 特征数 非零元素数
TabulaSapiensV1.h5ad 483,152 58,870 1,271,192,991
TabulaMuris.h5ad 90,120 17,983 214,912,538
MouseAtlas.h5ad 81,173 436,206 421,971,103
FibrocardATAC.h5ad 79,515 287,415 138,840,495
AIDA.h5ad 1,058,909 35,240 2,145,186,863
NYTimes.h5ad 300,000 documents 102,660 words 69,679,427
Netflix.h5ad 480,189 users 17,770 movies 100,480,507
Pokec.h5ad 1,632,803 users 1,632,803 users 30,622,564
BookCrossing.h5ad 278,858 users 271,379 books 1,031,175
AmazonVideoGames.h5ad 2,766,656 users 137,249 products 4,555,500

HugeDatasets 各矩阵说明

  • AIDA:亚洲免疫多样性图谱(Asian Immune Diversity Atlas)原始计数矩阵,发布在 CZ CELLxGENE Discover(数据集 c51e913d-832a-44a1-8f43-d20c51a1799f);矩阵取自源文件的 raw/X,丢弃细胞元数据,保留细胞条形码和基因标识符作为名称。原始数据以 CC BY 4.0 分发,复用需引用 AIDA 联盟。其非零元素数 2,145,186,863 略低于 32 位索引上限 2,147,483,647。
  • TabulaSapiensV1:Tabula Sapiens 1.0 版原始计数(The Tabula Sapiens Consortium, Science 2022, doi 10.1126/science.abl4896),取自 figshare 项目 doi 10.6084/m9.figshare.14267219.v5 的 TabulaSapiens.h5ad。源文件有四个同形状矩阵(X 归一化值、raw/X 与 raw_counts 层原始计数、decontXcounts 层环境 RNA 校正计数),仅保留 raw_counts 层。包含 10x(456,101 个)和 Smart-seq2(27,051 个)细胞。
  • TabulaMuris:Tabula Muris Senis 3 月龄小鼠原始计数(raw/X),发布在 CZ CELLxGENE Discover(数据集 4e0a8071-1b1d-49d0-a5ac-6f4f5c01e99f;Tabula Muris Consortium, Nature 2020, doi 10.1038/s41586-020-2496-1),共 90,120 个细胞,其中 45,602 个来自 10x,44,518 个来自 Smart-seq2。两个来源均以 CC BY 4.0 分发,复用需引用相应联盟。
  • NYTimes:来自 UCI Bag of Words 集合的《纽约时报》文章词计数,文档按原始顺序命名为 doc1 起,词取自集合词表。
  • Netflix:Netflix Prize 训练集评分,用户连续重新编号并保留原始标识符作为名称(如 user6),电影保留原始编号(movie1 至 movie17770),值为 1 至 5 的评分。
  • BookCrossing:Book-Crossing 社区评分(Ziegler et al., 2005),形状遵循原始发布的用户与图书目录,因此省略了 118,605 条对应书目缺失 ISBN 的评分。原始数据中评分 0 表示隐式交互,稀疏矩阵无法与空单元区分,故所有评分偏移 1:隐式交互变为 1,显式评分 1 至 10 变为 2 至 11。用户命名为 user 加原始标识符,书籍用 ISBN。
  • AmazonVideoGames:Amazon Reviews 2023 电子游戏类评分(Hou et al., ACL 2026),构建自 Hugging Face 版本 2b6d039ed471f2ba5fd2acb718bf33b0a7e5598e(SHA-256 7bde9e0a039bdb321e993bfe78a6c7d438fb1504b1ad152c0cb6a33a8b7cb26a)的 raw/review_categories/Video_Games.jsonl。产品用 parent_asin 标识,值为 1 至 5 的评分,同一用户多次评论同一产品时保留最新评论。用户和产品保留原始标识符作为名称。
  • Pokec:SNAP 集合中斯洛伐克社交网络 Pokec 的友谊图,图为有向图,第 i 行列出用户 i 称为朋友的用户,条目值为 1。

HugeDatasets 格式约定

  • 每个文件遵循 AnnData 约定:X 为按细胞×特征的 CSR 矩阵,第一维始终是细胞。仓库其他处的矩阵以特征×细胞存储,因此这些图谱在转换时被转置。
  • obs 含 n_nonzero 列,记录每个细胞的非零元素数;var 含 n_cells 列,记录每个特征非零的细胞数。
  • FibrocardATAC 保留原始细胞条形码和峰坐标(写作 chr:start-end);TabulaSapiensV1、TabulaMuris 和 AIDA 保留来源的细胞与基因标识符;MouseAtlas 源矩阵无名称,因此细胞和特征按位置命名(cell0、feature0 等)。
  • 文件可用 anndata.read_h5ad 打开(包括 backed="r" 模式),也可用 GADES 附带的流式读取器,通过缓存的 indptr 一次读取一个细胞切片。每个文件在上传前都针对源矩阵在随机样本上逐细胞校验过。

来源、许可与下架

  • 此处的每个矩阵都是已发布数据集的处理形式,原始来源的条款适用。完整引用见论文及其补充表。
  • BeerAdvocate 和 RateBeer:不再由原持有者分发,因论文报告其计时数据以保持可核查性而包含,复用者应先咨询原作者。
  • Netflix Prize:数据已被 Netflix 从公开分发中撤回,因论文报告其计时数据而保留,不应作为原始发布的替代品复用。
  • Amazon Reviews 2023:发布时无声明许可证,作者描述其主要用于研究目的,此处仅用于研究复现。
  • MovieLens-20M:由 GroupLens 在限制再分发的条款下分发,此处副本为处理后的交互矩阵,用于复现报告计时,并非从 GroupLens 获取数据集的替代品。
  • 若权利持有人反对仓库中的任何矩阵,可联系实验室将其移除。

引用要求

  • 使用这些矩阵需引用 GADES 2.0 论文以及所触及每个矩阵的原始来源。仅引用本仓库是不够的:底层数据归其产生的研究所有。
搜集汇总
数据集介绍
GADES2 数据集图片
构建方式
面向GPU加速稀疏单细胞矩阵距离计算的基准需求,GADES 2.0基准矩阵集以可复现论文计时与精度实验为目标,系统整合多源数据。其构建从人工合成与真实场景两个维度展开:合成部分通过规则网格生成稠密与稀疏矩阵,覆盖对象数与特征数的多量级交叉,并以零元素比例刻画稀疏程度;真实部分则采集单细胞转录组、染色质可及性及推荐系统交互数据,统一转换为CSR格式的AnnData文件,并保留原始细胞与特征标识。数据来源涵盖10x Genomics、CZ CELLxGENE Discover、UCI及GroupLens等公开资源,经随机抽样逐单元核验,确保与源矩阵一致。
使用方法
使用者可通过anndata.read_h5ad直接读取超大矩阵,并启用backed="r"模式实现按需访问,或采用GADES随附的流式读取器经缓存的indptr逐片读取细胞。合成矩阵与真实矩阵均以标准格式分发,可直接载入距离计算流程,用于GPU加速算法的计时与精度对比。各矩阵在存储时统一为细胞×特征的CSR布局,若需特征×细胞的传统布局,可在读取后转置。引用时须同时标注GADES 2.0论文与每个矩阵的原始来源,并遵循各源数据许可条款。
背景与挑战
背景概述
单细胞测序技术的迅猛发展催生了海量高维稀疏矩阵,对距离计算等下游分析提出了严峻的性能挑战。GADES 2.0基准矩阵数据集由相关研究团队创建,旨在为GPU加速稀疏单细胞矩阵距离计算提供可复现的评测基准。该数据集汇集了涵盖scRNA-seq、scATAC-seq及推荐系统交互数据在内的多种真实与合成矩阵,其核心研究问题在于系统评估不同稀疏度、规模及数据分布下距离算法的效率与精度。该基准的建立为单细胞分析社区提供了标准化的性能对比平台,对推动GPU加速计算在生物信息学中的落地具有重要影响力。
当前挑战
在领域问题层面,单细胞数据规模已突破千万细胞量级,传统CPU距离计算面临内存瓶颈与计算延迟,而现有基准缺乏对稀疏结构、数据异质性及跨领域场景的系统覆盖;构建过程中,挑战体现为多源数据整合时的内存与格式转换约束、大规模矩阵(如非零元素近21亿)逼近32位索引上限的存储风险,以及部分源数据(如Netflix Prize、BeerAdvocate)因许可限制或停止分发而带来的可复用性与法律合规难题。
常用场景
经典使用场景
在单细胞组学与推荐系统交汇的稀疏矩阵计算领域,GADES 2.0基准矩阵集为GPU加速的距离计算提供了系统化的评测基础。该数据集最经典的使用场景在于,研究者利用其中涵盖不同规模与稀疏度的合成矩阵及真实单细胞图谱,对距离度量算法在GPU环境下的吞吐量与数值精度进行压力测试,从而验证稀疏矩阵运算库在极端稀疏与近稠密情形下的性能边界。
解决学术问题
该数据集直面稀疏单细胞矩阵距离计算中基准缺失与可复现性不足的学术困境,通过提供经逐单元校验的矩阵集合,解决了跨平台、跨算法比较时因数据版本差异而导致的结论难以对齐的问题。其意义在于将GPU加速距离计算的评测从孤立案例推进到统一基准,为算法鲁棒性、内存效率与数值稳定性研究奠定了可复用的经验基础,并对稀疏线性代数与生物信息学交叉领域产生持续影响。
实际应用
在实际应用中,该数据集支撑了单细胞转录组与染色质可及性数据的快速相似性检索、细胞类型注释及大规模图谱整合等任务,亦为推荐系统中用户—物品交互矩阵的邻域计算提供测试载体。工程人员可借助其真实矩阵与批量读取格式,评估GPU流水线在数十亿非零元规模下的显存管理与流式处理能力,从而优化面向生产环境的距离计算服务。
数据集最近研究
最新研究方向
面向单细胞多组学与推荐系统稀疏矩阵的GPU加速距离计算,正成为高性能计算与生物信息学交叉领域的前沿方向。GADES 2.0基准矩阵集通过整合scRNA-seq、scATAC-seq及跨域交互数据,构建了覆盖稠密与稀疏、不同规模与填充率的系统性评测体系。当前研究聚焦于稀疏结构下的算法可扩展性,利用该数据集中的密度梯度矩阵揭示距离计算随稀疏度变化的标度律,并借助Tabula Sapiens等百万级细胞图谱验证GPU显存受限场景下的分批流式读取策略。该工作不仅为单细胞图谱的快速相似性搜索提供可复现基准,也推动了推荐系统与生物信息学在稀疏矩阵计算上的方法互鉴,对可扩展数据分析具有重要的方法学意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务