animal_dataset_activations
收藏资源简介:
该数据集名为'动物数据集激活',包含从处理动物数据集的各种模型中捕获的神经网络激活。数据集按模型(子集)和层(分割)组织,每个模型有自己的目录,每个层有自己的parquet文件目录。数据集包括来自Qwen_Qwen2.5-7B-Instruct、clip、facebook_dinov2-base和stabilityai_stable-diffusion-xl-base-1.0等模型的激活。README提供了如何加载数据集的详细信息,包括示例和每个模型的层统计信息。还提到了源数据集、parquet文件的格式、使用示例以及数据集结构的注意事项。
This dataset is named 'Animal Dataset Activations'. It contains neural network activations captured from various models that process animal datasets. The dataset is organized by model (subset) and layer (partition): each model has its own dedicated directory, and each layer has its own directory for Parquet files. The activations included in the dataset originate from models such as Qwen_Qwen2.5-7B-Instruct, CLIP, facebook_dinov2-base, and stabilityai_stable-diffusion-xl-base-1.0. The README document provides detailed guidance on loading the dataset, including usage examples and layer-wise statistics for each model. It also documents the source dataset, the format of Parquet files, additional usage examples, and important considerations regarding the dataset structure.
Animal Dataset Activations 数据集概述
数据集简介
此数据集包含多个模型在处理 animal_dataset 时捕获的神经网络激活值。
数据集结构
数据集按模型(子集)和层(分割)组织:
- 模型(子集):每个模型拥有独立的目录。
- 层(分割):模型内的每一层拥有独立的目录,目录中包含 Parquet 文件。
文件组织格式为:{model_name}/{layer_name}/*.parquet
包含的模型与配置
数据集包含以下四个模型配置,每个配置下包含多个特定层的激活数据:
-
Qwen_Qwen2.5-7B-Instruct
- 包含层:
model_layers_15至model_layers_27(共13层)。
- 包含层:
-
clip
- 包含层:
- 图像视觉变换器残差块:
image_visual_transformer_resblocks_12至image_visual_transformer_resblocks_23(共12层)。 - 文本变换器残差块:
text_transformer_resblocks_6至text_transformer_resblocks_11(共6层)。
- 图像视觉变换器残差块:
- 包含层:
-
facebook_dinov2-base
- 包含层:
encoder_layer_6至encoder_layer_11(共6层)。
- 包含层:
-
stabilityai_stable-diffusion-xl-base-1.0
- 包含层:
text_encoder_2_text_encoder_2_text_model_encoder_layers_20至text_encoder_2_text_encoder_2_text_model_encoder_layers_31(共12层)。
- 包含层:
数据加载方式
推荐方法:使用子集/分割API
python from datasets import load_dataset ds = load_dataset(nirmalendu01/animal_dataset_activations, name=model_name, split=layer_name)
备选方法:直接加载Parquet文件
python from datasets import load_dataset ds = load_dataset(parquet, data_files=https://huggingface.co/datasets/nirmalendu01/animal_dataset_activations/resolve/main/{model_name}/{layer_name}/*.parquet)
层统计信息
CLIP
| 层名称 | 样本数 | 文件数 | 总大小 (MB) | 平均文件大小 (MB) | 激活形状 |
|---|---|---|---|---|---|
image_visual_transformer_resblocks_12 |
1,000 | 10 | 1550.16 | 155.02 | (257, 1024) |
image_visual_transformer_resblocks_13 |
1,000 | 10 | 1550.56 | 155.06 | (257, 1024) |
image_visual_transformer_resblocks_14 |
1,000 | 10 | 1551.98 | 155.20 | (257, 1024) |
image_visual_transformer_resblocks_15 |
1,000 | 10 | 1552.21 | 155.22 | (257, 1024) |
image_visual_transformer_resblocks_16 |
1,000 | 10 | 1552.27 | 155.23 | (257, 1024) |
image_visual_transformer_resblocks_17 |
1,000 | 10 | 1553.21 | 155.32 | (257, 1024) |
image_visual_transformer_resblocks_18 |
1,000 | 10 | 1554.12 | 155.41 | (257, 1024) |
image_visual_transformer_resblocks_19 |
1,000 | 10 | 1554.53 | 155.45 | (257, 1024) |
image_visual_transformer_resblocks_20 |
1,000 | 10 | 1553.63 | 155.36 | (257, 1024) |
image_visual_transformer_resblocks_21 |
1,000 | 10 | 1552.98 | 155.30 | (257, 1024) |
image_visual_transformer_resblocks_22 |
1,000 | 10 | 1553.81 | 155.38 | (257, 1024) |
image_visual_transformer_resblocks_23 |
1,000 | 10 | 1552.81 | 155.28 | (257, 1024) |
text_transformer_resblocks_10 |
1,000 | 10 | 348.22 | 34.82 | (77, 768) |
text_transformer_resblocks_11 |
1,000 | 10 | 348.06 | 34.81 | (77, 768) |
text_transformer_resblocks_6 |
1,000 | 10 | 348.55 | 34.85 | (77, 768) |
text_transformer_resblocks_7 |
1,000 | 10 | 348.58 | 34.86 | (77, 768) |
text_transformer_resblocks_8 |
1,000 | 10 | 313.89 | 31.39 | (77, 768) |
text_transformer_resblocks_9 |
1,000 | 10 | 348.73 | 34.87 | (77, 768) |
facebook/dinov2-base
| 层名称 | 样本数 | 文件数 | 总大小 (MB) | 平均文件大小 (MB) | 激活形状 |
|---|---|---|---|---|---|
encoder_layer_10 |
1,000 | 10 | 1161.21 | 116.12 | (257, 768) |
encoder_layer_11 |
1,000 | 10 | 1161.13 | 116.11 | (257, 768) |
encoder_layer_6 |
1,000 | 10 | 1161.34 | 116.13 | (257, 768) |
encoder_layer_7 |
1,000 | 10 | 1160.79 | 116.08 | (257, 768) |
encoder_layer_8 |
1,000 | 10 | 1160.67 | 116.07 | (257, 768) |
encoder_layer_9 |
1,000 | 10 | 1160.83 | 116.08 | (257, 768) |
Qwen/Qwen2.5-7B-Instruct
| 层名称 | 样本数 | 文件数 | 总大小 (MB) | 平均文件大小 (MB) | 激活形状 |
|---|---|---|---|---|---|
model_layers_15 |
1,000 | 10 | 93.42 | 9.34 | (13, 3584) |
model_layers_16 |
1,000 | 10 | 93.42 | 9.34 | (13, 3584) |
model_layers_17 |
1,000 | 10 | 93.38 | 9.34 | (13, 3584) |
model_layers_18 |
1,000 | 10 | 93.38 | 9.34 | (13, 3584) |
model_layers_19 |
1,000 | 10 | 93.37 | 9.34 | (13, 3584) |
model_layers_20 |
1,000 | 10 | 93.35 | 9.33 | (13, 3584) |
model_layers_21 |
1,000 | 10 | 93.30 | 9.33 | (13, 3584) |
model_layers_22 |
1,000 | 10 | 93.24 | 9.32 | (13, 3584) |
model_layers_23 |
1,000 | 10 | 93.20 | 9.32 | (13, 3584) |
model_layers_24 |
1,000 | 10 | 93.17 | 9.32 | (13, 3584) |
model_layers_25 |
1,000 | 10 | 93.05 | 9.30 | (13, 3584) |
model_layers_26 |
1,000 | 10 | 93.02 | 9.30 | (13, 3584) |
model_layers_27 |
1,000 | 10 | 93.25 | 9.32 | (13, 3584) |
stabilityai/stable-diffusion-xl-base-1.0
| 层名称 | 样本数 | 文件数 | 总大小 (MB) | 平均文件大小 (MB) | 激活形状 |
|---|---|---|---|---|---|
text_encoder_2_text_encoder_2_text_model_encoder_layers_20 |
1,000 | 10 | 177.22 | 17.72 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_21 |
1,000 | 10 | 177.26 | 17.73 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_22 |
1,000 | 10 | 177.09 | 17.71 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_23 |
1,000 | 10 | 177.22 | 17.72 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_24 |
1,000 | 10 | 177.10 | 17.71 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_25 |
1,000 | 10 | 177.12 | 17.71 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_26 |
1,000 | 10 | 177.23 | 17.72 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_27 |
1,000 | 10 | 177.22 | 17.72 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_28 |
1,000 | 10 | 177.23 | 17.72 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_29 |
1,000 | 10 | 177.24 | 17.72 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_30 |
1,000 | 10 | 177.10 | 17.71 | (77, 1280) |
text_encoder_2_text_encoder_2_text_model_encoder_layers_31 |
1,000 | 10 | 177.23 | 17.72 | (77, 1280) |
数据格式
每个 Parquet 文件包含以下字段:
sample_key:样本的唯一标识符。activation_shape:激活张量的形状。activation_data:展平的激活数据(可使用activation_shape进行重塑)。- 其他元数据字段(例如
caption、prompt),具体字段取决于模型。
关键说明
- 所有激活数据均基于 animal_dataset 的 1000 个样本子集捕获。
- Parquet 文件默认分块存储(每文件约100个样本),以支持流式加载。
- 激活张量以展平的数组形式存储,需使用
activation_shape字段进行重塑。 - 模型名称中的“/”在文件夹名中已替换为“_”(例如,“facebook/dinov2-base”对应文件夹“facebook_dinov2-base”)。




