遇见数据集

cells-developmental-checkpoints

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集包含来自“Cells, developmental”项目的训练轨迹和测量部分,项目地址为https://github.com/bgradowhite/Cells_Developmental。数据集主要由四类工件组成:(1) paper_mlp/:MNIST MLP训练轨迹,包含“plain”和“res”两种变体,每个记录步骤以step_*.npz格式存储,共73 MB;(2) mnist_dense/:密集采样的MNIST训练轨迹,62 MB;(3) parts/:测量得到的数据部分,按组打包为tar.gz文件,解压后得到12,032个JSON文件,每个对应一个面板,以测量内容命名,总大小240 MB;(4) pages/:构建好的页面及其框架,共119 MB。数据集的主要目的是提供预计算的轨迹和测量结果,供研究人员直接读取和分析,无需重新训练或测量。所有工件均通过SHA-256校验保证完整性。注意,本数据集仅包含本项目自身产生的工件,其他公共资源(如KataGo检查点、Pythia/GPT-2/Gemma权重、图像语料库)需从原始来源获取。

This dataset contains training trajectories and measurement parts from the "Cells, developmental" project, hosted at https://github.com/bgradowhite/Cells_Developmental. It consists of four main artifact types: (1) paper_mlp/: MNIST MLP training trajectories with "plain" and "res" variants, stored as step_*.npz files (73 MB total); (2) mnist_dense/: densely sampled MNIST training trajectories (62 MB); (3) parts/: measurement data packaged as tar.gz files, which when extracted yield 12,032 JSON files (one per panel, named by measurement content, 240 MB total); (4) pages/: constructed pages and their frameworks (119 MB). The main purpose is to provide precomputed trajectories and measurements for direct reading and analysis, eliminating the need for retraining or remeasuring. All artifacts are verified via SHA-256 checksums. Note that this dataset includes only artifacts generated by this project; other public resources (e.g., KataGo checkpoints, Pythia/GPT-2/Gemma weights, image corpora) must be obtained from their original sources.

创建时间:
2026-09-10
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Cells, developmental: trained trajectories and measured parts
  • 数据集地址:https://huggingface.co/datasets/CarolusRenniusVitellius/cells-developmental-checkpoints
  • 标签:interpretability、checkpoints

数据集内容

该数据集包含由测量代码(https://github.com/bgradowhite/Cells_Developmental)生成的工件,镜像存储以便协作者无需重新训练或重新测量即可从相同基础开始。

仅包含本项目自身的工件。KataGo checkpoints、Pythia/GPT-2/Gemma 权重以及图像语料库均为其他地方的公开资源,在该仓库的 configs/inputs/ 中进行哈希固定,并从其自身来源获取。

路径 内容 大小
paper_mlp/ MNIST MLP 训练轨迹,包括 plainres,每个记录步骤一个 step_*.npz 73 MB
mnist_dense/ 密集采样的 MNIST 轨迹 62 MB
parts/ 页面构建所依据的已测量部分,每组一个 tar.gz;解包后为 12,032 个 JSON,每个面板一个,按测量内容命名 240 MB
pages/ 构建好的页面及其框架,无需重新构建即可读取结果 119 MB

使用方法

克隆代码仓库后执行:

bash python scripts/fetch_artifacts.py # checkpoints, verified per file python scripts/fetch_artifacts.py --with-parts # and the parts, verified and unpacked python scripts/build_pages.py # from whatever parts are present

该仓库中的 configs/inputs/shared_artifacts.yaml 是这些文件的身份标识:记录了每个 checkpoint 和每个 parts 归档文件的大小与 SHA-256。parts 以归档形式存储而非松散文件,是因为该 hub 拒绝包含超过一万个文件的目录,而 parts/mnist 包含一万一千个文件;在磁盘上它们保持每个面板一个文件,这使得重新运行可以精确替换其自身的文件。获取脚本会拒绝保留摘要不一致的文件,因此损坏或被替换的下载会在此处失败,而不会在之后静默改变测量结果。

来源

轨迹由 scripts/train_paper_mlp.pyscripts/train_mnist_dense.py 训练;parts 由 build_*_sweeps 脚本测量,其中一些在租用的 GPU 上运行。每个 part 测量了什么,以及依据九种方法约定中的哪一种,记录在 docs/conventions.md 和 part 自身的元数据中。

搜集汇总
数据集介绍
cells-developmental-checkpoints 数据集图片
构建方式
该数据集源于对神经网络训练动力学与可解释性的实证研究需求,通过受控实验轨迹与测量产物的系统化归档来支撑可复现分析。其构建依托于配套代码仓库中的训练脚本,分别对MNIST数据集上的多层感知机执行plain与res两种模式的逐步训练,并以稠密采样方式生成独立轨迹;随后由build系列扫描脚本对训练过程中各内部组件进行测量,所得结果按面板逐一序列化为JSON文件。所有产物经SHA-256哈希校验与尺寸记录后归档,确保分发副本与原始测量严格一致。
使用方法
使用时应先克隆配套代码仓库,继而执行fetch_artifacts.py脚本,该脚本依据configs/inputs/shared_artifacts.yaml中登记的SHA-256与文件大小逐项校验并获取检查点,若需测量部件则附加--with-parts参数以完成校验与解包。在所需部件就绪后,可调用build_pages.py基于当前存在的部件重建页面,无需重新训练或测量。脚本对摘要不符的文件予以拒收,从而保证任何后续分析均建立在未被篡改的数据基础之上。
背景与挑战
背景概述
在机器学习可解释性研究领域,对神经网络训练过程中内部表征的演化进行精细追踪,长期以来受制于可复现实验基准的匮乏。cells-developmental-checkpoints数据集由相关研究团队创建,旨在为发育动力学视角下的模型训练轨迹研究提供标准化的测量制品。该数据集收录了MNIST多层感知机在plain与res两种架构下的训练轨迹、密集采样轨迹,以及按面板测量的12,032份JSON测量结果,并附带已构建的可读页面。其核心研究问题在于揭示训练过程中表征结构如何逐步分化与定型,为可解释性社区提供了同一基准下无需重训练即可开展对比测量的稀缺资源,对推动训练动力学与表征发育研究的规范化具有基础性意义。
当前挑战
该数据集所对应的领域问题在于,神经网络训练过程中的内部表征演化难以被系统化、可复现地测量,缺乏统一的基准制品使得不同研究之间的结论难以直接比较。构建过程中,测量制品需覆盖九种方法约定下的多组扫描,涉及在租用GPU上完成的大规模测量,计算开销与一致性维护成本高昂;同时,parts目录下文件数量超过平台单目录一万个的上限,须以归档形式存储并在复查时逐面板替换,且每个检查点与归档件均须通过SHA-256校验,任何摘要不符都会导致下载失败,以保证测量结果不被静默篡改。
常用场景
经典使用场景
在神经网络可解释性研究领域,对于模型内部表征动态演化过程的精细刻画始终是一项核心挑战。该数据集通过提供MNIST多层感知机在plain与res两种架构下的完整训练轨迹(逐步记录为step_*.npz文件),以及密集采样的训练轨迹,为研究者构建了一个高时间分辨率的观测窗口。经典使用场景包括:追踪特定神经元或网络层在训练过程中功能分化的关键转折点,识别表征涌现的临界阶段,以及对比不同残差连接方式对学习动态的影响。研究者可基于这些轨迹复现并验证关于发育检查点(developmental checkpoints)的理论假设,从而在受控条件下探究深度网络从随机初始化到功能专一化的完整发育路径。
解决学术问题
该数据集主要回应了可解释性研究中关于训练动态与表征形成之间因果关系的若干关键问题。传统上,对网络内部机制的分析多局限于训练完成后的静态快照,难以揭示表征如何随时间逐步结构化。此数据集通过提供连续的、逐步记录的模型状态,使研究者能够回答诸如:网络在何时习得特定特征?残差连接是否改变了表征发育的时序?不同随机种子下发育轨迹的稳定性如何?这些问题的解答有助于建立更具预测力的学习理论,并为发育可塑性、灾难性遗忘等议题提供实证基础,其意义在于将可解释性从静态解剖推向动态发育的维度。
实际应用
在实际应用层面,该数据集为需要精细监控训练过程并据此进行干预的场景提供了基础资源。例如,在持续学习系统中,开发者可利用轨迹数据识别模型即将发生遗忘或干扰的早期信号,从而设计自适应的正则化或回放策略。在模型调试与诊断中,通过比对不同超参数设置下的发育轨迹,工程师能够更高效地定位训练不稳定或收敛异常的根源。此外,该数据集所配套的测量部件(parts/中的12,032个JSON文件,对应各个面板的测量结果)支持对特定网络属性的自动化扫描,可应用于神经架构搜索或训练课程设计的自动化评估流程中。
数据集最近研究
最新研究方向
在可解释性与模型训练动力学交叉领域,cells-developmental-checkpoints数据集为探索神经网络训练过程中表示空间的演化提供了高分辨率轨迹与系统性测量部件。当前前沿研究聚焦于利用密集采样的MNIST轨迹与多组方法约定下的测量面板,揭示发育式检查点(developmental checkpoints)如何映射模型内部表征的阶段性重组,进而关联至泛化性能的突变现象。该数据集通过哈希锚定与可复现的部件化设计,支撑对训练轨迹中“关键发育期”的细粒度溯源,推动了从静态权重分析向动态训练过程可解释性的范式转变,对理解深度学习模型的涌现行为与鲁棒性演化具有基础性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务