遇见数据集

quant-fidelity-registry

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

Quantization Fidelity Registry(量化保真度注册表)是一个公共的、有模式的、有收据支持的跨模型量化质量测量索引。该数据集旨在回答一个核心问题:展示模型X的每个已测量量化版本,包括其保真度数字以及足够的来源信息,以判断该数字是否有意义。它类似于本地AI注册表(local-ai-registry,关注速度、VRAM和成本),但专注于保真度。数据集包含多个JSONL文件,分别对应测量值(measurements)、工件(artifacts)、面板(panels)、参考(references)、管道(pipelines)和模型(models)等配置。每个测量记录都包含详细的字段,如模型、工件、面板、参考、KL方向、估计器精度、运行次数、确定性证据、测量范围、出处以及一个关键的比较键(comparability key)。该键是通过对面板ID、参考ID、度量名称、方向、累加精度、堆栈关系和头部策略七个字段进行哈希生成的,确保只有相同键的数值才可进行比较。数据集还提供了验证和渲染工具,用于确保数据的一致性和完整性。该数据集适用于评估和比较不同量化方法的保真度,帮助研究人员和工程师选择高质量的量化模型。

The Quantization Fidelity Registry is a public, schema-backed, receipt-backed, cross-model quantization quality measurement index. The dataset aims to answer a core question: show each measured quantization version of model X, including its fidelity number and sufficient provenance information to judge whether the number is meaningful. It is similar to local-ai-registry (which focuses on speed, VRAM, and cost) but focuses on fidelity. The dataset contains multiple JSONL files for configurations such as measurements, artifacts, panels, references, pipelines, and models. Each measurement record includes detailed fields like model, artifact, panel, reference, KL direction, estimator precision, number of runs, determinism evidence, measurement range, provenance, and a critical comparability key. The key is generated by hashing seven fields: panel ID, reference ID, metric name, direction, cumulation precision, stack relation, and head strategy, ensuring that only values with the same key can be compared. The dataset also provides validation and rendering tools to ensure data consistency and completeness. It is suitable for evaluating and comparing the fidelity of different quantization methods, helping researchers and engineers select high-quality quantized models.

创建时间:
2026-08-28
原始信息汇总

Quantization Fidelity Registry 数据集总结

数据集概览

Quantization Fidelity Registry 是一个公开、带模式定义、有凭证支撑的跨模型量化质量测量索引。该数据集的核心目标是回答一个问题:展示模型 X 的每一个已测量量化版本,附带其保真度数值和足够的溯源信息,让用户判断该数值是否有意义。

该数据集是 0xSero/local-ai-registry 的姊妹数据集,后者关注速度、显存占用和成本,而本数据集关注量化保真度。记录通过 ID 和 huggingface 身份块交叉链接,每个工件、模型、面板和管线均带有 cross_refs.local_ai_registry 槽位。

许可与配置

  • 许可证:cc-by-4.0
  • 数据集配置(共6个):
    • measurements:data/measurements.jsonl
    • artifacts:data/artifacts.jsonl
    • panels:data/panels.jsonl
    • references:data/references.jsonl
    • pipelines:data/pipelines.jsonl
    • models:data/models.jsonl

核心规则

该数据集存在的核心理念是:不同 comparability.key 值的两个保真度数值永远不可比较。相等的键仅使两行成为比较的候选——这是必要条件,而非认证。在将行按同质排序之前,需要检查组在 index.json 中的机器可读 comparability 谓词。

比较键的构成

comparability.key 是对以下七个要素的哈希:

  1. panel_id:使用哪些token,包括评分位置策略
  2. reference_id:哪个教师捕获(捕获而非模型:工件+面板+栈+精度)
  3. metric_name:如 mean_tokenwise_kldmean_of_run_means_tokenwise_kld
  4. directionreference_to_candidate 或反向
  5. accumulation_dtype:float64 vs float32(在1000万位置上是不同的估计器)
  6. stack_relationsame_stackcross_stack(后者带有已知的上偏)
  7. head_policy:候选自身的 lm_head,或应用于两侧的共享头

键格式为:"cmp--" + sha256("|".join([...]))[:16]

工具验证

  • tools/registry_validate.py 从行自身字段重算每个键,不匹配即拒绝(CMP-001
  • tools/registry_render.py 按该键分组表格,--check 在提交的README与数据渲染不一致时失败
  • 表格是 data/*.jsonl 的纯函数,非手工编写,不会漂移

数据结构要求

每项测量必须包含:

  • 模型固定工件
  • 面板:第一类记录,包含语料谱系、上下文和位置计数、分词器、污染防护、评分位置策略、token摘要、可用性
  • 参考:建模为捕获 (artifact, panel, stack, logits precision, head source)
  • 管线
  • KL方向估计器精度
  • 运行次数及类型化确定性证据
  • 测量范围溯源
  • 比较键、非空披露数组

关键原则与强调点

确定性需要证据而非布尔值

  • 只有张量内容摘要能支撑确定性声明(DET-001
  • 示例:K6五次运行有五组不同的 student_backend_identity_sha256 和一个相同的 tokenwise_kld_sha256,后者表明位级一致

测量者身份是四个独立事实

  1. provenance.measured_byself-measured | author-reported | third-party-reported
  2. independently_verified:独立布尔值,不能由前者隐含(PROV-003
  3. 工件是否为第三方(third_party_artifact_self_measured 披露)
  4. 面板是否自有

代码溯源是必填字段

  • 每行携带 harness 块,包含计算闭包的内容摘要
  • 等号 harness_id 表示字节级相同代码
  • 提交SHA被刻意排除在ID外,因为文档编辑会导致提交变化
  • 之前没有该机制的72行(2026-08-30前)列于 schema/harness-grandfather.json,新行无harness则被拒绝(HARN-001

断言是发布声明

  • 溯源断言需设置 asserts_provenance 并携带固定的 sources 及可选的 lines 锚点(PROV-014/PROV-015/PROV-016
  • /blob/main/ 被直接拒绝,因为行号会移动

面板由token标识,评分窗口属于身份的一部分

  • 相同token从位置0评分为 0.028104,从位置1024评分为 0.018794,差异达33%
  • 因此后者是独立的面板记录,带有 derivation.kind: scoring_window_change,具有不同的比较键

测量场景限制说明

比较键的七个输入中不含测量通道(lane),导致共享键的两行可能在机器和代码路径上不同。对于非密封通道的行,渲染器将其与组内其余行分开列表,且该通道的管线记录携带密封通道的实测桥接:有符号增量、tokenwise_kld_sha256_matches_sealed: falsepublishable_as_reproduction: false

桥接不可减去。对于没有密封通道兄弟的行,其偏差块记录偏移为 direction: unknown 且幅度为 null。

仅发布 “超出对照(nats)” 列(此前称 Attributable (nats),2026-08-31更名),不发布残差比值——旧 “2.52x” 头条被撤回,因为小残差之比会放大对照误差。BIAS-006 防止两个对照floor交叉:floor的 floor_measurement_ref 必须与引用它的行在同一通道测量。

种子数据溯源备注

面板密封验证

brandonmusic 的25窗口面板身份摘要 sha256 6bafe3283c54bc9342d0f30aa3199d36032d103feb92c31715be8545362790ff 已在种子过程中重新计算并匹配。该面板的自我声明摘要(0beec577...)被明确禁止用作token身份或确定性证据(PANEL-002)。

污染防护差异

该面板仅依赖角色分离(25个final窗口与384 fit等窗口同源于同一打包语料库),无词法或n-gram扫描公布。验证器在严格行依赖 contamination.checked 为 false 的面板时发出警告(PANEL-006)。这不影响面板内部的比较。

搜集汇总
数据集介绍
quant-fidelity-registry 数据集图片
构建方式
Quantization Fidelity Registry(量化保真度注册表)的构建遵循严谨的schema化设计,以JSONL格式存储六类核心记录:测量值、工件、面板、参考、流水线与模型。每条测量记录必须携带模型与固定工件、面板、参考捕获、流水线、KL方向、估计器精度、运行次数及确定性证据、测量范围与来源,并推导出可比性键。该键是对面板ID、参考ID、度量名称、方向、累积类型、堆栈关系和头部策略七项要素的SHA256哈希,确保仅在完全相同的条件下产生的数据方可比较。验证工具会重算每个键并拒绝不匹配项,从而保障数据的可信度和可追溯性。
特点
该数据集的核心特点在于其严苛的可比性规则与透明性。注册表明确声明,不同可比性键的保真度数字永不可比,而键相同的行仅是候选对象。所有测量均附带丰富的元数据,包括确定性证据(基于张量内容摘要而非容器哈希)、来源的四维度区分(测量者、独立验证、工件来源、面板来源),以及代码闭包的内容摘要。此外,数据集中设有偏置与基准地板,区分同堆栈与跨堆栈测量,并公开了走廊效应与不可减的差异,确保每个数字在上下文中可被正确解读。
使用方法
使用者可应用内置工具进行查询与验证。通过运行 registry_validate.py 并传入两个测量ID,可获取详细的不可比原因;registry_render.py 用于依据可比性键自动生成表格,并确保文档与数据一致。数据集的分配置设计允许按需加载不同维度的数据,例如 measurement、artifact、panel 等,便于与其他注册表(如 local-ai-registry)交叉引用。建议研究中先检查 index.json 中的 machine-readable 谓词,仅对 comparability 为 true 的行进行严格排名,并避免相减地板的操作,以正确利用保真度数据。
背景与挑战
背景概述
量化保真度注册表(Quantization Fidelity Registry)于2026年由多个研究团队联合创建,旨在弥补大规模语言模型量化评估中缺乏标准化和可复现性的重大空白。该注册表通过提供跨模型、可验证的量化质量测量指标,解决了一个核心问题:如何确保不同量化配置下的保真度数值具有可比性和可信度。其创新之处在于引入了一个复合可比性密钥,该密钥对面板、教师捕获、评估度量及数值精度等七个关键维度进行哈希处理,从而构建了严格的比较框架。该数据集已成为量化领域评估的权威参照,推动了透明度标准的建立,并对模型压缩研究社区产生了深远影响。
当前挑战
该领域面临的主要挑战在于,KL散度等保真度指标对测量条件极为敏感,任何参数(如评估面板、教师捕获、堆栈关系)的变化都会产生截然不同的数值,导致跨研究的比较常常无效。注册表构建过程中遭遇了多重难题:确保每个测量条目的完整溯源与可复现性,包括代码环境的哈希锁定和确定性验证;开发者需精心设计可比性密钥并规避其局限性,例如测量通道未包含在内可能引发的偏差;同时,需应对从数据收集、验证规则制定到跨组织协作的复杂性,以保证数据的一致性和第三方贡献的可信度。
常用场景
经典使用场景
在量化模型的实证研究中,该数据集作为标准化的保真度(fidelity)度量索引,为不同模型、量化方法及推理栈的对比提供了可靠基准。传统上,研究人员常因缺乏统一评估框架而难以比较不同量化方案的性能,此数据集通过引入可比较性键(comparability key),确保只有在面板、教师捕获、度量、方向、累积精度、栈关系及头部策略等七个维度完全一致时,数值才能相互比较,从而杜绝了'苹果与橘子'式误比。其经典运用见于量化误差的敏感性分析、不同位宽下模型性能衰减的追踪,以及跨硬件与软件栈的再现性验证。
实际应用
在实际应用中,该数据集服务于模型部署的选型决策,特别是大型语言模型的量化配置优化。工程团队可利用其表格对比不同量化产物(如GGUF、EXL3)在同一边际下的保真度,以权衡内存占用与生成质量。云服务提供商可依据其度量结果,选择在特定硬件(如A100与H200)上再现性最佳的量化方案。此外,数据集的交叉引用机制(如关联机器学习工作负载的0xSero本地AI注册表)有助于运维人员监控生产环境中模型的性能漂移,实现量化模型的精细化治理与质量控制。
衍生相关工作
该数据集催生了多项相关后继工作,包括自动化验证工具、可视化渲染器及标准化扩展。其内置的验证脚本(registry_validate.py)与渲染器(registry_render.py)模板构成了量化保真度复现的基础设施,启发了类似跨模型度量注册库的构建(如本地AI注册表)。学术上,关于比较键充分性、测量通道影响以及确定性证据类型的研究应运而生,引领了对量化评估协议形式化的深入探讨。此外,对量化模型数据集的去量化参考方法(如dequantized_from_quant)的分析,推动了更细粒度参考建立准则的发展,并为新兴量化框架的评估报告提供了参考范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务