遇见数据集

frozen-tribe-voe-reproduction-data

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

VOE frozen-TRIBE reproduction 数据集是一个公开的数据集,包含了用于 frozen TRIBE 复现的完整 VOE 数据、中间产物、预测结果、结果日志和代码。数据集中包含 29,435 个文件,总大小约为 437.7 GB。为了确保可重现性,有意省略了工作处理临时数据(work/)和下载缓存数据(hf_cache/),这些被省略的路径和原因记录在 metadata/excluded_file_inventory.csv.gz 中。数据集提供了两个示例:examples/timeline_fourview/ 包含一个13秒的时间线视频、海报、元数据以及五个人类被试的显示阵列(包括全体被试平均和 frozen TRIBE 预测),每个脑图使用原始 TRIBE 可视化的四视图(左侧外侧、左侧内侧、右侧内侧、右侧外侧);examples/multi_stimulus_timelines/ 添加了低、中、高 R_group 刺激,每个视频在标题中显示其刺激特异性13秒 R_group,并附有选择表记录所有符合条件的刺激及相关定义。存档布局采用 tar.zst 分片形式,保存在 archives/ 目录下,每个分片约15 GB(未压缩)。元数据文件包括 archive_file_map.csv.gz(原始路径到分片的映射)、file_inventory.csv.gz(所有原始路径、字节大小和修改时间)以及 shard_manifest.csv(每个分片的大小和 SHA-256 校验和)。提取时使用 tar --use-compress-program=unzstd -xf SHARD.tar.zst 命令。该数据集适用于脑影像分析、神经科学可视化以及复现研究等任务。

The VOE frozen-TRIBE reproduction dataset is a public dataset containing complete VOE data, intermediate products, prediction results, result logs, and code for reproducing frozen TRIBE. The dataset includes 29,435 files with a total size of approximately 437.7 GB. To ensure reproducibility, temporary working data (work/) and download cache (hf_cache/) are intentionally omitted; the omitted paths and reasons are recorded in metadata/excluded_file_inventory.csv.gz. The dataset provides two examples: examples/timeline_fourview/ includes a 13-second timeline video, poster, metadata, and display arrays for five human subjects (including the average of all subjects and frozen TRIBE predictions), with each brain map using the original TRIBE visualizations four views (left lateral, left medial, right medial, right lateral); examples/multi_stimulus_timelines/ adds low, medium, and high R_group stimuli, with each video displaying its stimulus-specific 13-second R_group in the title and an accompanying selection table recording all qualifying stimuli and related definitions. The archive layout uses tar.zst shards stored in the archives/ directory, each shard approximately 15 GB (uncompressed). Metadata files include archive_file_map.csv.gz (mapping original paths to shards), file_inventory.csv.gz (all original paths, byte sizes, and modification times), and shard_manifest.csv (size and SHA-256 checksum of each shard). Extraction uses the command tar --use-compress-program=unzstd -xf SHARD.tar.zst. This dataset is suitable for brain imaging analysis, neuroscience visualization, and reproducibility research.

创建时间:
2026-08-24
原始信息汇总

VOE frozen-TRIBE reproduction 数据集概述

该数据集是一个用于VOE frozen-TRIBE复现研究的完整数据档案库,包含数据、中间产物、预测结果、日志及相关代码。

数据规模

  • 保留数据:共包含 29,435 个文件,总计 437,716,887,971 字节(约437.7 GB)。
  • 有意省略的可复现临时数据:包括work/处理临时数据和hf_cache/下载缓存数据,共 960,407 个文件852,522,997,016 字节(约852.5 GB)。所有省略路径及原因记录在metadata/excluded_file_inventory.csv.gz中。

示例内容

  • examples/timeline_fourview/:包含一个13秒的时间线视频、海报、元数据以及五个人类被试、全体被试平均和frozen TRIBE预测的展示阵列。所有脑图均使用TRIBE可视化中的四个视角:左侧面、左内侧面、右内侧面、右侧面。逐帧PNG图像因可从保留的展示阵列和渲染代码无损重建而被有意省略。
  • examples/multi_stimulus_timelines/:增加了低、中、高R_group值刺激的时间线视频。每个视频在标题中直接显示该刺激的13秒R_group值,并附有选择表记录所有符合条件的刺激及精确的相关性定义。

档案结构

  • 原始tribe_replication_voe目录层次结构保存在archives/下按目录分组的tar.zst分片中,每个分片约15 GB(解压后)。例如,workspace/tribe_replication_voe/derivatives/中的文件存储在archives/derivatives/下。
  • 元数据文件
    • metadata/archive_file_map.csv.gz:映射每个原始路径到其对应的分片。
    • metadata/file_inventory.csv.gz:记录所有原始路径、字节大小和修改时间。
    • metadata/shard_manifest.csv:记录每个分片的大小和SHA-256校验值。

数据提取

使用以下命令解压单个分片:

bash tar --use-compress-program=unzstd -xf SHARD.tar.zst

解压后文件路径以workspace/tribe_replication_voe/开头。原始数据集许可证和参与者数据条款继续适用。

搜集汇总
数据集介绍
frozen-tribe-voe-reproduction-data 数据集图片
构建方式
该数据集的构建源于对frozen TRIBE模型的复现研究,通过系统归档VOE实验全流程数据而成。原始快照涵盖29,435个文件,总计437,716,887,971字节,囊括了从原始数据到中间产物、预测结果、日志及代码的完整链条。构建过程中,剔除了可明确复现的瞬态材料,如work/处理暂存数据和hf_cache/下载缓存数据,共960,407个文件、852,522,997,016字节,所有排除路径及原因均记录于metadata/excluded_file_inventory.csv.gz中。归档保留原始tribe_replication_voe层级结构,以约15 GB未压缩大小的tar.zst分片存储于archives/目录下,并通过metadata/archive_file_map.csv.gz、metadata/file_inventory.csv.gz和metadata/shard_manifest.csv分别映射原始路径、记录文件属性和校验分片完整性。
使用方法
使用该数据集需先依据metadata/archive_file_map.csv.gz定位目标文件所在分片,再通过tar --use-compress-program=unzstd -xf SHARD.tar.zst命令解压相应tar.zst分片,解压后自动重建以workspace/tribe_replication_voe/开头的路径。对于快速查看,可直接访问examples/timeline_fourview/和examples/multi_stimulus_timelines/中的视频、元数据及显示数组,无需解压完整归档。研究人员可依据metadata/file_inventory.csv.gz和metadata/shard_manifest.csv核验文件完整性与分片校验和,确保数据使用过程的可追溯性。所有操作须遵守原始数据集许可与参与者数据条款。
背景与挑战
背景概述
源于对TRIBE模型预测泛化能力的验证需求,frozen-tribe-voe-reproduction-data数据集于2020年代初期由研究团队构建,旨在通过严格冻结参数复现多被试视觉编码预测,涵盖29,435个文件与逾4,300亿字节数据,核心研究问题聚焦于脑活动预测模型在跨被试与跨刺激场景下的可重复性与稳定性,为计算神经科学与机器学习交叉领域提供了标准化基准,推动了脑解码研究的透明化与可验证性。
当前挑战
该数据集所应对的领域问题在于视觉编码预测中跨被试泛化与模型冻结条件下的精确复现,其构建挑战包括海量异构数据的有损压缩归档与可逆映射、TB级瞬时中间产物的甄别剔除与记录、多模态刺激时间线与四视图脑图渲染的一致性保障,以及原始许可证与参与者数据条款在再分发中的合规继承,对存储完整性、计算溯源和伦理约束均构成严峻考验。
常用场景
经典使用场景
在认知神经科学与计算神经影像学交叉领域,frozen-tribe-voe-reproduction-data数据集承载着对TRIBE模型进行冻结复现的完整实验档案,其经典使用场景聚焦于多被试视觉诱发脑活动的时间序列预测与跨模态对齐研究。研究者依托该数据集提供的29,435个文件与437 GB原始快照,涵盖衍生产物、预测结果、日志及代码,可直接复现TRIBE模型在自然视频刺激下的全脑映射,并借助四视图(左外侧、左内侧、右内侧、右外侧)呈现逐帧脑图,从而系统评估冻结模型对群体神经响应的泛化能力。
解决学术问题
该数据集直面神经影像研究中长期存在的可复现性危机与基准缺失问题,通过保留完整的处理谱系、排除清单与校验清单,为模型比较提供了透明且可审计的实验基础。其解决的核心学术问题包括:冻结预训练模型能否稳定预测个体与群体水平的视觉皮层响应;多被试间神经表征的变异性如何影响预测一致性;以及低、中、高R_group刺激条件下模型性能的梯度变化。这些问题的厘清有助于建立计算神经影像的可复现范式,推动领域从单一结果报告转向累积性证据构建。
实际应用
在实际应用层面,该数据集为脑机接口、神经反馈系统及个性化神经刺激方案提供了可验证的预测先验。工程团队可利用其中预计算的脑图显示数组与渲染代码,快速构建从视频流到全脑激活模式的实时映射原型,避免重复训练的高昂成本。同时,认知科学家可基于多被试时间线示例,设计跨刺激类别的迁移实验,评估模型在广告、教育或临床康复视频中的适用性,从而缩短从算法开发到神经技术部署的转化周期。
数据集最近研究
最新研究方向
在认知神经科学与人工智能交叉领域,基于frozen-TRIBE框架的脑活动预测模型复现正成为验证多模态神经编码理论可重复性的关键实践。该数据集通过完整保存29,435个文件及437GB中间产物,聚焦于冻结模型在视觉-语言刺激下对多个受试者脑响应时序的预测一致性,尤其关注低、中、高R_group刺激条件下跨个体表征的稳定性。当前前沿研究致力于利用此类高粒度复现档案,系统评估模型泛化边界与个体差异来源,并推动脑机接口解码算法的基准化。其意义在于为神经AI模型的可复现性设立新标准,同时为理解人脑语义处理机制提供可审计的计算证据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务