遇见数据集

gauge-orbit-quantization-results

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是论文《Gauge equivalence does not survive quantisation: value-output orbit, norm-product bound, and consequences for rotational methods》的配套数据,包含量化下规范等价性研究的原始扫描结果、端到端向量以及论文引用的所有读取表。数据集分为两个版本:第一版基于两个具有d_h=64的模型(ViT-B/16),提供扫描实验(如规范扫描、条件扫描等)以及端到端正确性向量;第二版扩展至八个语言模型(参数从4亿到82亿不等),包括Pythia-410M、Pythia-6.9B、RedPajama-7B、Llama-2-7B、Llama-3.1-8B、Mistral-7B、Qwen2.5-7B和Qwen3-8B-Base,总测量数达8,692,320。数据结构包括:量化轨道扫描、条件扫描、对角规范族、平衡点、激活诊断、输出诊断、端到端负对数似然和argmax向量等。所有测量值以CSV和PyTorch张量文件(.pt)形式存储,每行对应不同配置下的结果。数据集不包含模型权重,权重需从原始公开仓库获取。适用于量化、规范等价性、旋转方法、语言模型行为分析等研究任务。

This dataset is the companion data for the paper "Gauge equivalence does not survive quantisation: value-output orbit, norm-product bound, and consequences for rotational methods", containing raw scan results of gauge equivalence studies under quantization, end-to-end vectors, and all reading tables referenced in the paper. The dataset is divided into two versions: the first version is based on two models with d_h=64 (ViT-B/16), providing scanning experiments (such as gauge scans, condition scans, etc.) and end-to-end correctness vectors; the second version extends to eight language models (ranging from 400M to 8.2B parameters), including Pythia-410M, Pythia-6.9B, RedPajama-7B, Llama-2-7B, Llama-3.1-8B, Mistral-7B, Qwen2.5-7B, and Qwen3-8B-Base, with a total of 8,692,320 measurements. Data structures include quantized orbit scans, condition scans, diagonal gauge families, equilibrium points, activation diagnostics, output diagnostics, end-to-end negative log-likelihood and argmax vectors, etc. All measurements are stored as CSV and PyTorch tensor files (.pt), with each row corresponding to results under different configurations. The dataset does not contain model weights; weights need to be obtained from the original public repositories. Suitable for research tasks such as quantization, gauge equivalence, rotational methods, and language model behavior analysis.

创建时间:
2026-09-23
原始信息汇总

Gauge equivalence does not survive quantisation: sweeps and results

数据集概述

  • 许可证:apache-2.0
  • 语言:en、es
  • 标签:quantization、gauge-orbit、transformers、reproducibility
  • 数据规模:1M<n<10M
  • 内容定位:该数据集是关于论文《Gauge equivalence does not survive quantisation: value-output orbit, norm-product bound, and consequences for rotational methods》(Manuel Muñoz Plá, 2026, v2.1)的原始 sweep 数据、端到端向量以及读取表格。
  • 目录结构:与代码仓库保持一致,可直接覆盖到代码仓库克隆副本上,所有读取脚本无需修改即可运行。
  • 代码仓库:https://github.com/mmunozpl/gauge-orbit-quantization (tag v2.1)
  • 代码与 PDF 存档:Zenodo,版本 DOI 10.5281/zenodo.23068428,概念 DOI 10.5281/zenodo.22904207

第二版本:八个语言模型

包含八个语言模型(0.4 至 8.2 亿参数)权重中的 8,692,320 次测量,以及每种条件的端到端向量。

数据文件

路径 行数 支撑内容
artifacts/logs/quant_orbita/quant_orbita_v2.csv 1,406,496 regime sweep:恒等、per-head 与共享正交、一般 GL
artifacts/logs/quant_kappa/quant_kappa_v2.csv 5,311,488 受控条件化 sweep
artifacts/logs/quant_kappa/quant_familia_v2.csv 847,392 带范数的原始族
artifacts/logs/quant_kappa/quant_diagonal_v2.csv 1,118,208 对角 gauge 族(F3)
artifacts/logs/quant_kappa/punto_balanceado_v2.csv 8,736 平衡点,八个模型与两种位宽
artifacts/logs/quant_orbita/diagnostico_activaciones_{model}.csv 每个 cell 与 gauge D1,按激活加权的电路误差
artifacts/logs/quant_orbita/diagnostico_salida_{model}.csv 每层与配置 D2,注意力块输出的误差
artifacts/logs/quant_orbita/e2e_v2_{model}.pt 7 个条件 WikiText-2 上端到端验证的每窗口 NLL 与每 token argmax
artifacts/logs/quant_orbita/e2e_extra_v2_{model}_{round}.pt 每轮 轮次 E2 至 E8 的相同向量:Haar 抽取、层、共享、第二量化器、逐层与第二语料
artifacts/tables/*.csv 论文引用的每张读取表格,两个版本均有
artifacts/tables/config_claves_v2.csv 167 配置键、八个模型的仓库与修订版本
paper/*.pdf 由 tag v2.1 冻结的两个 PDF,与 GitHub 和 Zenodo 字节一致
sello.json v2.1 封存部件的 sha256 清单
  • e2e_v2_qwen3-8b_bf16.pt 是论文作为精度注记记录的被弃用的半精度测量。

八个模型

权重未在此重新分发,从以下公共仓库的指定修订版本读取;Meta 的模型需要接受其许可证。

论文中的模型 仓库 修订版本
Pythia-410M EleutherAI/pythia-410m 9879c9b5f8bea9051dcb0e68dff21493d67e9d4f
Pythia-6.9B EleutherAI/pythia-6.9b c0e3eee36dc47af0c49f361c74cfe459c09f7f23
RedPajama-7B togethercomputer/RedPajama-INCITE-7B-Base 78f7e482443971f4873ba3239f0ac810a367833b
Llama-2-7B meta-llama/Llama-2-7b-hf 01c7f73d771dfac7d292323805ebc428287df4f9
Llama-3.1-8B meta-llama/Llama-3.1-8B d04e592bb4f6aa9cfee91e2e20afa771667e1d4b
Mistral-7B mistralai/Mistral-7B-v0.3 caa1feb0e54d415e2df31207e5f4e273e33509b1
Qwen2.5-7B Qwen/Qwen2.5-7B d149729398750b98c0af14eb82c78cfe92750796
Qwen3-8B-Base Qwen/Qwen3-8B-Base 49e3418fbbbca6ecbdf9608b4d22e5a407081db4
  • 论文的结果表格与图表将 Qwen3-8B-Base(仅预训练检查点)缩写为 Qwen3-8B,此处文件使用键 qwen3-8b。

第一版本:两个 d_h = 64 的模型

路径 行数 支撑内容
artifacts/logs/quant_orbita/quant_orbita.csv 170,016 regime sweep:恒等、per-head 与共享正交、一般 GL
artifacts/logs/quant_kappa/quant_kappa.csv 642,048 受控条件化 sweep
artifacts/logs/quant_kappa/quant_familia.csv 102,432 带范数的原始族的重新 sweep
artifacts/logs/quant_kappa/punto_balanceado.csv 1,056 平衡点,两个模型与位宽
artifacts/logs/quant_orbita/aciertos_e2e.pt 7 × 5,000 每个端到端条件的逐图像正确性
artifacts/logs/quant_orbita/predicciones_e2e.pt 7 × 5,000 每个条件的逐图像预测类别(argmax)
  • 每个采样 gauge 通过重放 sweep 所消费的生成器序列精确重建;矩阵不存储。
  • ViT-B/16 检查点是先前工作(https://doi.org/10.57967/hf/9742)所发布的,此处不重复。

引用

bibtex @software{munozpla2026gaugeequivalence, author = {Muñoz Plá, Manuel}, title = {Gauge equivalence does not survive quantisation: value-output orbit, norm-product bound, and consequences for rotational methods}, year = {2026}, version = {v2.1}, doi = {10.5281/zenodo.22904207}, url = {https://github.com/mmunozpl/gauge-orbit-quantization} }

搜集汇总
数据集介绍
gauge-orbit-quantization-results 数据集图片
构建方式
在量化与规范等价性交叉研究中,规范变换是否在量化后保持等价性长期缺乏系统性实证。该数据集通过大规模受控扫描构建,覆盖八种参数规模从0.4B至8.2B的语言模型。每一采样规范由生成器序列精确重放,矩阵不直接存储,从而在保证可复现性的同时控制存储开销。测量涵盖身份、逐头与共享正交、一般GL等规范族,并针对受控条件、对角规范及平衡点等场景生成端到端向量与激活诊断文件。所有原始扫描与读取表按代码仓库布局组织,可与代码克隆直接叠加运行,确保从数据到论文结论的完整链路可追溯。
特点
该数据集以逾八百六十万次权重测量与端到端向量为核心,系统记录了规范等价性在量化后失效的实证证据。其特色在于多维度覆盖:八种主流语言模型、多种规范族、两种位宽以及逐层与端到端诊断指标,形成对量化误差传播的完整刻画。所有测量均基于公开模型修订版本,权重不重分发,保障了许可合规与可复现性。数据集还包含精度注释、sha256清单与冻结PDF,使结果具备字节级可验证性,为旋转方法在量化场景下的行为分析提供了高保真基准。
使用方法
使用该数据集时,研究者可将数据目录直接覆盖至代码仓库克隆的对应路径,原有读取脚本无需修改即可运行。端到端向量以PyTorch格式存储,包含每个窗口的负对数似然与逐token argmax结果;激活与输出诊断文件则以CSV格式按模型、层和配置组织,便于统计分析与可视化。权重需从各模型公开仓库按指定修订版本获取,Meta系列模型须先接受许可协议。引用时请遵循提供的BibTeX条目,并注意区分论文中Qwen3-8B缩写与文件键qwen3-8b的对应关系。
背景与挑战
背景概述
在模型压缩与高效推理的浪潮中,量化技术已成为部署大语言模型的关键路径,而权重空间的规范变换是否在量化后依然保持等价性,则是一个兼具理论深度与工程后果的核心问题。2026年,Manuel Muñoz Plá发布的工作《Gauge equivalence does not survive quantisation》及其配套数据集gauge-orbit-quantization-results,系统探究了值-输出轨道、范数-乘积界以及旋转方法在量化下的行为。该数据集覆盖八个参数规模从0.4B至8.2B的语言模型,累计逾869万次权重测量,并辅以端到端验证向量,为理解量化对规范等价性的破坏提供了可复现的实证基础,对旋转式量化与后训练压缩方法的设计具有直接参考价值。
当前挑战
该数据集所直面的领域问题在于:量化过程是否会破坏权重空间中的规范等价性,从而使得依赖于旋转或规范变换的压缩方法失效。构建过程中,挑战亦层层叠现——需在八种不同架构与规模的语言模型上执行大规模受控扫描,涵盖恒等、逐头正交、共享正交及一般线性群等多种规范体制,同时精确复现每一个采样规范并记录激活加权误差与注意力块输出误差。此外,端到端验证须在WikiText-2上逐窗口计算负对数似然与逐词元预测,并管理多轮额外实验的向量存储,确保所有测量与论文表格严格对应,海量数据的组织与校验本身即构成显著挑战。
常用场景
经典使用场景
在量化感知训练与训练后量化的研究中,该数据集被广泛用于系统性地扫描不同规范变换(gauge transformation)对量化误差的影响。通过提供涵盖恒等映射、逐头正交、共享正交及一般线性群等多种规范轨道的完整扫描结果,研究者能够以可复现的方式评估规范化操作在量化前后的数值行为差异,从而揭示规范等价性在低精度表示下的破裂机制。
解决学术问题
该数据集直接回应了量化领域一个长期存在的理论困惑:为何在浮点精度下等价的权重规范变换,在量化后会导致截然不同的模型性能。借助超过八百万条测量记录和端到端验证向量,研究者得以定量分离规范变换的轨道效应与量化噪声的交互作用,为旋转类量化方法(如旋转矩阵优化、正交正则化)提供了失效边界的经验证据,并推动了对量化不变性理论假设的重新审视。
衍生相关工作
围绕该数据集,已衍生出一系列聚焦于量化不变性与规范轨道理论的分析工作,包括对旋转方法在低比特宽度下的失效边界进行形式化刻画的研究,以及基于值-输出轨道范数乘积界(norm-product bound)的量化误差传播模型。这些后续工作不仅验证了原始论文的核心结论,还将其扩展至不同量化器、层级共享策略及第二语料库的泛化测试,逐步构建起一个关于量化规范等价的系统性实证框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务