arc-aphasia-bids
收藏资源简介:
失语症恢复队列(ARC)是一个大规模、纵向的多模态神经影像数据集,包含230名慢性中风失语症患者的多模态MRI扫描数据。该数据集提供了BIDS格式的数据,包括T1加权、T2加权、FLAIR结构扫描、BOLD fMRI(命名任务和静息状态)、扩散加权成像(DWI)等。数据集还包含专家绘制的病变掩码和临床元数据,如年龄、性别、种族、WAB-AQ评分等。该数据集支持多种任务,如病变分割、失语症严重程度预测、失语症类型分类等。数据集已去标识化和去面部化,符合HIPAA指南。
Aphasia Recovery Cohort (ARC) is a large-scale, longitudinal multi-modal neuroimaging dataset comprising multi-modal MRI scans from 230 patients with chronic stroke-induced aphasia. The dataset is provided in BIDS format, including T1-weighted, T2-weighted, FLAIR structural scans, BOLD fMRI (including naming task and resting-state), diffusion-weighted imaging (DWI), and other modalities. It also contains expert-drawn lesion masks and clinical metadata such as age, gender, race, WAB-AQ scores, and more. This dataset supports multiple downstream tasks including lesion segmentation, aphasia severity prediction, and aphasia subtype classification. The dataset has been de-identified and defaced, and complies with HIPAA guidelines.
Aphasia Recovery Cohort (ARC) 数据集概述
数据集基本信息
- 数据集名称:Aphasia Recovery Cohort (ARC)
- 主要用途:用于卒中后失语症研究的多模态神经影像数据集。
- 数据格式:BIDS格式,包含嵌入式NIfTI文件。
- 许可协议:CC0 1.0(公共领域)。
- 语言:英语(临床元数据和文档)。
数据规模与内容
- 受试者:230名慢性卒中失语症患者。
- 扫描会话:902次。
- 影像模态与数量:
- T1加权扫描:441个会话(每个会话恰好一次扫描)。
- T2加权扫描:439个会话(每个会话恰好一次扫描)。
- FLAIR扫描:231个会话(每个会话恰好一次扫描)。
- BOLD fMRI(命名任务):750个会话(894次运行)。
- BOLD fMRI(静息态):498个会话(508次运行)。
- 弥散成像(DWI):613个会话(2,089次运行)。
- 单波段参考图像:88个会话(322次运行)。
- 专家绘制的病灶掩膜:228个。
支持的任务
- 病灶分割
- 失语症严重程度预测(回归任务)
- 失语症类型分类
- 纵向分析
- 弥散分析
- 任务态fMRI分析
数据集结构
数据实例
每个数据行代表一个扫描会话(受试者+时间点),包含以下字段:
subject_id:受试者标识符。session_id:会话标识符。- 结构影像:
t1w,t2w,flair(可为空)。 - 功能影像:
bold_naming40,bold_rest。 - 弥散影像:
dwi,dwi_bvals,dwi_bvecs。 - 参考影像:
sbref。 - 病灶标注:
lesion(可为空)。 - 临床元数据:
age_at_stroke,sex,race,wab_aq,wab_days,wab_type。
数据划分
- 训练集:包含全部902个会话。未预设训练/验证/测试划分,使用者需自行划分,并确保不同划分间无受试者重叠。
数据来源与标注
- 原始来源:数据收集于南卡罗来纳大学和南卡罗来纳医科大学。
- 公开来源:OpenNeuro ds004884 (https://openneuro.org/datasets/ds004884)。
- 相关论文:Gibson et al., Scientific Data 2024 (https://doi.org/10.1038/s41597-024-03819-7)。
- 标注:病灶掩膜由神经影像专家在T1加权或FLAIR图像上手动勾画。
隐私与伦理考虑
- 数据已根据HIPAA指南进行去标识化处理。
- 结构MRI图像已进行去面部处理。
- 不包含受保护的健康信息。
- 所有参与者均同意公开数据共享。
使用注意事项
已知偏差
- 地理偏差:数据主要来自美国东南部的医疗中心。
- 年龄偏差:卒中主要影响老年人,儿科病例代表性不足。
- 严重程度偏差:由于知情同意要求,极严重失语症病例可能代表性不足。
已知局限性
- 并非所有会话都包含全部模态数据。
- 228/230名受试者有病灶掩膜。
- 受试者的纵向随访次数不同(1-12次会话)。
技术说明
- 多运行模态以列表形式提供,空列表表示该会话无此数据。
- 弥散成像数据包含对齐的梯度信息(
dwi_bvals,dwi_bvecs)。 - NIfTI文件按需加载,适合大规模流式处理。
版本更新
- v2 (2025年12月):将
bold列拆分为bold_naming40和bold_rest;新增dwi_bvals,dwi_bvecs,race,wab_days,t2w_acquisition列。 - v1 (2025年12月):初始发布,包含13个列。
引用信息
如需引用,请使用README中提供的BibTeX条目。




