遇见数据集

ParaGen-Bench

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

PGen Benchmark是一个用于参数/权重生成方法的基准数据集,这些方法直接生成目标神经网络的权重,而非通过传统训练方式。数据集围绕cell(即<架构>__<数据集>对)进行组织,每个cell代表一个特定的神经网络架构和数据集组合,生成器基于该cell的检查点池进行训练,并通过将生成权重加载到目标架构中并测量任务性能来评估。数据集包含三个核心部分:metadata/(元数据目录),已填充每个cell的注册信息,包括架构、数据集、配置、参数、基础准确率和检查点路径,当前覆盖281次运行、56个cell,涵盖四个任务:图像分类(16个cell)、文本分类(27个cell)、图像分割(9个cell)和强化学习(4个cell);ckpt/(检查点池目录),目前为占位符,计划存储用于生成器学习的权重文件;prompt/(提示目录),已填充每个cell的文本条件,包含30个自然语言描述(20个用于训练,10个用于测试),总计56个cell × 30个提示 = 1680个提示(1120个训练提示,560个测试提示)。数据规模为56个唯一cell,每个cell关联30个提示,适用于参数生成、权重生成和模型基准测试任务。数据集状态为框架脚手架,metadata/和prompt/已填充,ckpt/待后续填充。

PGen Benchmark is a benchmark dataset for parameter/weight generation methods that directly generate the weights of target neural networks, instead of using traditional training workflows. The dataset is organized around 'cell', which refers to the <architecture>__<dataset> pair. Each cell represents a specific combination of neural network architecture and dataset. The generator is trained on the checkpoint pool of the corresponding cell, and evaluated by loading the generated weights into the target architecture and measuring the task performance. The dataset contains three core components: 1. metadata/ (metadata directory): This directory is populated with registration information for each cell, including architecture, dataset, configuration, parameters, baseline accuracy and checkpoint path. Currently, it covers 281 runs, 56 cells, and four tasks: image classification (16 cells), text classification (27 cells), image segmentation (9 cells) and reinforcement learning (4 cells). 2. ckpt/ (checkpoint pool directory): Currently a placeholder, it is planned to store weight files for generator learning. 3. prompt/ (prompt directory): This directory is populated with text conditions for each cell, containing 30 natural language descriptions (20 for training, 10 for testing). In total, there are 56 cells × 30 prompts = 1680 prompts (1120 training prompts, 560 test prompts). The dataset has a scale of 56 unique cells, each associated with 30 prompts, and is applicable to parameter generation, weight generation and model benchmarking tasks. The dataset is currently in a framework scaffold state: the metadata/ and prompt/ directories have been fully populated, while the ckpt/ directory awaits future population.

创建时间:
2026-07-24
原始信息汇总

数据集概述

数据集名称: PGen Benchmark(ParaGen-Bench)

许可证: MIT

任务类别: 其他(参数/权重生成)

适用场景: 评估参数/权重生成方法,即直接生成目标神经网络的权重,而非通过训练获得。

数据集结构与内容

数据集按 cell 组织,每个 cell 对应一个 <架构>__<数据集> 组合。生成器在该 cell 的检查点池上训练,并通过将生成的权重加载到目标架构中评估性能。

数据集包含三个主要部分,均通过 cell 键(<arch>__<dataset>)对齐:

部分 内容 状态
metadata/ 每个 cell 的注册信息:架构、数据集、配置、参数量、基准准确率、检查点路径 已填充
ckpt/ 生成器学习的检查点池(权重文件,通过 git-LFS 管理) 占位符
prompt/ 每个 cell 的文本条件/任务描述,用于条件式权重生成 已填充

1. metadata/ 目录

  • registry/<任务>.json:四个任务注册表(image_classificationtext_classificationimage_segmentationreinforcement_learning),包含 models[].runs[] 及其完整训练信息和 ckpt_path
  • index.json:扁平列表,每行对应一个运行,字段包括 celltaskarchdatasetmodel_idbase_val_acctotal_paramsckpt_pathconfig_path
  • cells.json:唯一 cell 列表,包含运行次数和验证准确率范围。

当前覆盖范围: 281 次运行,覆盖 56 个 cell,4 个任务(图像分类 16、文本分类 27、图像分割 9、强化学习 4)。

2. prompt/ 目录

每个 cell 包含 30 条自然语言描述,用于条件式权重生成,按 20 条训练 / 10 条测试 划分。

  • prompt/<cell>.json{"cell": ..., "train": [20], "test": [10]}
  • prompt/prompts.json:索引文件 {cell: {"train": [...], "test": [...]}}

覆盖范围: 所有 56 个 cell x 30 条提示(共 1120 条训练、560 条测试)。

使用示例(代码片段)

python import json idx = json.load(open("metadata/index.json")) for run in idx["runs"]: key = run["cell"] # 例如 "image_cnn__cifar10" arch = run["arch"] ckpt = run["ckpt_path"] # -> ckpt/... acc = run["best_val_acc"] # 基准(训练后)参考准确率

当前状态

框架已搭建完成。metadata/ 已从原始注册表填充;ckpt/prompt/ 目前为占位符,待后续填充。

搜集汇总
数据集介绍
ParaGen-Bench 数据集图片
构建方式
ParaGen-Bench是专为参数/权重生成领域设计的基准测试集,其构建基于<架构>__<数据集>的单元(cell)组织方式,每个单元对应特定神经网络架构在指定数据集上的训练轨迹。项目通过元数据注册表(metadata/registry)按任务类型(图像分类、文本分类、图像分割、强化学习)记录模型配置、验证精度及检查点路径;索引文件(index.json)整合所有运行实例,而单元文件(cells.json)汇总唯一单元及其精度范围。提示数据集(prompt/)为每个单元提供30条自然语言描述,以20/10比例划分为训练与测试集,支持条件化权重生成。当前涵盖281次运行、56个单元及4类任务。
特点
该数据集具有鲜明的层次化与结构化特征,以单元键为枢纽实现元数据、检查点与提示三部分的无缝对齐。检查点池为权重生成模型提供直接学习源,消除传统训练依赖;提示集以多视角语言描述单元特性,赋予条件生成任务丰富语义线索。注册表与索引的冗余设计保证每个运行实例均可通过唯一标识追溯,同时支持精度范围统计,便于评估生成权重与原始训练权重的性能差距。任务覆盖视觉、语言与强化学习领域,展现了跨场景的通用性。
使用方法
使用时,用户通过加载metadata/index.json获取所有运行实例的扁平列表,每个实例包含单元键、架构、数据集、检查点路径与验证精度等字段。权重生成模型可按单元键遍历检查点池进行训练,并利用prompt/中对应的提示集(如训练集20条、测试集10条)实现文本条件化生成。生成后,将产出的权重注入目标架构,在相应数据集上测试性能并与注册的基线精度比对。此框架适配参数生成研究的评估全流程,支持自定义任务扩展与条件工程优化。
背景与挑战
背景概述
参数生成(Parameter Generation)作为深度学习领域的前沿方向,旨在直接合成目标神经网络的权重而非通过传统训练方式获取,为模型部署与迁移学习提供了全新范式。ParaGen-Bench由研究团队于近期创建,专注于构建参数生成方法的标准化评估基准。该数据集围绕架构与数据集组成的二元组(如image_cnn__cifar10)构建评估单元,覆盖图像分类、文本分类、图像分割及强化学习四大任务,包含281次实验记录与56个独立评估单元,并提供56组文本条件描述用于引导生成过程。通过系统化整理元数据、权重快照与提示信息,ParaGen-Bench为比较不同生成方法的有效性提供了统一平台,对推动权重生成技术的可复现研究与实际应用具有重要奠基作用。
当前挑战
该数据集面临的挑战主要来自领域问题与构建过程两个层面。在领域问题上,权重生成需解决如何高效捕捉模型参数的分布规律,并生成与目标任务高度适配的权重,区别于传统训练方法的收敛机制,生成方法需在参数量巨大的高维空间中保持性能与保真度;此外,跨架构与跨任务的泛化能力是核心瓶颈,生成器需适应不同网络结构与数据特性。在构建过程中,收集并统一来自四大任务、多种架构与数据集的训练快照面临存储与版本管理的难题,权重文件体积庞大,需借助LFS等工具协调;同时,为每个评估单元生成多样化且语义准确的文本条件描述需耗费大量人工标注资源,确保提示信息的覆盖度与质量是另一关键挑战。
常用场景
经典使用场景
在深度学习领域的浩瀚疆域中,模型参数的生成与优化始终占据着核心地位。ParaGen-Bench作为参数生成领域的里程碑式基准数据集,其经典使用场景聚焦于评估各类权重生成方法的性能。研究者可针对特定架构与数据集的组合(即cell)训练生成器,利用元数据中提供的检查点池学习权重分布,并将生成的权重加载至目标网络架构中,通过任务性能指标衡量生成效果。该数据集精心设计了56个cell,横跨图像分类、文本分类、图像分割与强化学习四大任务,共计281次运行记录,为参数生成研究提供了标准化、多场景的验证平台。
衍生相关工作
ParaGen-Bench的诞生催生了一系列富有启发性的衍生研究工作。围绕其多任务、多架构的cell设计,研究者开发了基于变压器的权重生成器,利用注意力机制捕捉参数间的复杂关联;同时,元学习社区涌现出大量借鉴其评估范式的算法改进,如基于梯度的元学习器与条件化参数预测网络的对比研究。此外,受其提示驱动生成思想的启发,后续工作探索了文本描述对权重分布的调控能力,推动了向量符号架构与神经架构搜索等方向的交叉融合。该基准已成为参数生成领域的方法性能对决舞台,众多经典论文以其作为核心评测平台,验证了其作为领域标准数据集的权威地位。
数据集最近研究
最新研究方向
在深度学习模型优化领域,参数生成(Parameter Generation)正成为突破传统训练范式的前沿方向。ParaGen-Bench作为首个系统化参数生成基准,构建了涵盖图像分类、文本分类、图像分割和强化学习四大任务的56个测试单元,包含281条完整训练轨迹。该数据集创新性地将神经网络权重生成转化为条件生成问题,通过提供30条自然语言描述的条件提示,探索从训练好的模型池中直接生成目标网络参数的可能性。这一研究方向与当前大模型参数高效微调、权重感知的模型压缩等热点紧密关联,为发展无需传统梯度训练即可获得高性能模型的方法提供了标准化评估平台。该基准的建立将推动生成式人工智能从数据生成向模型生成的重要范式迁移,对降低AI模型开发成本、实现零训练推理具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务