遇见数据集

numeric-format-catalog

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

Numeric Format Catalog(Trinity S3AI / t27)是一个包含83种数字格式的规范性参考数据集,涵盖机器学习、科学计算、历史硬件和GoldenFloat phi结构化家族相关的格式。数据集从单一事实来源通过代码生成,确保规范一致性。数据按13个聚类组织,包括GoldenFloat(22种)、历史供应商格式(10种)、PositUnumIII(8种)、整数定点格式(8种)、机器学习低精度格式(7种)、IEEE 754二进制格式(5种)等。每个格式记录包含16个字段,如唯一标识符、名称、总位宽、符号位、指数位、尾数位、指数偏置、偏置公式、phi距离、存储封装、聚类标签、与GoldenFloat的关系、验证状态、来源引用、标准机构和典型用例。数据集提供JSONL、JSON和Markdown等多种格式文件,适用于AI加速器设计参考、格式发现、标准交叉引用和加速器架构研究。数据集明确说明其限制:不提供格式质量排名、不包含未公开的专有格式、不包含硅性能数据、不提供量化基准精度声明,且存在GoldenFloat中心视角的偏差。数据集遵循CC-BY-4.0许可证,由Trinity S3AI维护。

Numeric Format Catalog (Trinity S3AI / t27) is a normative reference dataset containing 83 numeric formats, covering formats related to machine learning, scientific computing, historical hardware, and the GoldenFloat phi structured family. The dataset is generated from a single source of truth through code to ensure specification consistency. Data is organized into 13 clusters, including GoldenFloat (22 types), historical vendor formats (10 types), PositUnumIII (8 types), integer fixed-point formats (8 types), machine learning low-precision formats (7 types), IEEE 754 binary formats (5 types), and others. Each format record includes 16 fields, such as unique identifier (id), name (name), total bit width (bits), sign bits (s_bits), exponent bits (e_bits), mantissa bits (m_bits), exponent bias (bias), bias formula (bias_formula), phi distance (phi_distance), storage encapsulation (storage), cluster label (cluster), relationship with GoldenFloat (gf_relation), validation status (status), source citation (source), standard organization (standard), and typical use case (use_case). The dataset provides multiple file formats including JSONL, JSON, and Markdown, suitable for AI accelerator design reference, format discovery, standard cross-referencing, and accelerator architecture research. The dataset explicitly states its limitations: it does not provide format quality rankings, does not include undisclosed proprietary formats, does not include silicon performance data, does not provide quantization benchmark accuracy claims, and has a GoldenFloat-centric perspective bias. The dataset follows the CC-BY-4.0 license and is maintained by Trinity S3AI.

创建时间:
2026-06-10
原始信息汇总

数据集概览

数据集名称: Numeric Format Catalog (Trinity S3AI / t27)

许可协议: CC-BY-4.0

语言: 英语

数据集规模: 少于1000个样本

任务类别: 其他

多语言性: 单语言

标注创建者: 专家生成

语言创建者: 机器生成

数据集版本与规模

  • 当前版本: v3.0 (2026-06-13),包含 83种数值格式,分布在 13个集群
  • 版本记录:
    • v3.0:83种格式(当前版本)
    • v2.0:81种格式(2026-06-10,已撤回,因解析错误)
    • v1.0:77种格式(2026-06-10,已撤回,数据陈旧)

数据内容

该数据集是一个关于机器学习、科学计算、历史硬件和 GoldenFloat 相关系列的数值格式的规范参考目录。

集群组成:

集群 格式数量 说明
GoldenFloat 22 GF4 至 GF1024,包含 17 个二进制阶梯及额外格式
HistoricalVendor 10 DEC、IBM、Cray 等历史厂商格式
PositUnumIII 8 Posit-{8,16,32},Unum-III 变体
IntegerFixed 8 int4 / int8 / 定点数扫描格式
MlLowPrecision 7 FP8 (E4M3, E5M2), NF4, NF8, OFP8
Ieee754Binary 5 binary16, binary32, binary64, binary128, bfloat16
Lns 4 对数数字系统变体
Theoretical 4 Takum 及类似研究格式
CompressionTrick 4 微缩放 + 结构化稀疏包装格式
Ieee754Decimal 3 decimal64, decimal128
ExtendedFloat 3 x87 80位,double-double 等
Microscaling 3 MXFP4, MXFP6, MXFP8
QuantTuned 2 调优量化变体

文件清单:

文件名 格式 用途
formats_catalog.jsonl JSONL 每行一种格式,共 83 行
formats_catalog.json JSON 包含相同数据的单个数组
formats_catalog.md Markdown 人类可读的表格
SHA256SUMS.txt 文本 用于防篡改的 SHA-256 清单

每条记录的字段结构:

字段 类型 描述
id 字符串 规范标识符(例如 binary16, gf16
name 字符串 人类可读的名称
bits 整数 总位宽
s_bits 整数 符号位数
e_bits 整数 指数位数
m_bits 整数 尾数位数
bias 整数 指数偏移值
bias_formula 字符串 闭式偏移规则(如适用)
phi_distance 浮点数 与 phi 结构字段宽度规则的距离值
storage 字符串 存储封装类型(例如 u16, u32
cluster 字符串 集群标签(共13个之一)
gf_relation 字符串 与 GoldenFloat 的关系(competitor, member, wrapper...)
status 字符串 验证状态(Verified, Conj, Risk...)
source 字符串 主要标准参考文献
standard 字符串 发布机构 / 规范
use_case 字符串 规范用例

数据来源与生成

该数据集是代码生成结果,并非手工编辑。其生成管线如下:

  1. 单一真实来源(SSOT): gHashTag/t27 仓库中的 specs/numeric/formats_catalog.t27 文件。
  2. 代码生成器: tools/gen_formats_catalog.py 脚本。
  3. 生成输出: gen/numeric/formats_catalog.{json,jsonl,md,...} 文件。
  4. 镜像: 镜像至本 Hugging Face 数据集。

推荐用途与范围

推荐用途:

  • AI 加速器设计中相关数值格式的参考列表。
  • 发现工具:用于查证格式 X 是否已被编录,以及属于哪个集群。
  • 标准交叉参考锚点(IEEE 754, OCP, IEEE P3109, posit)。
  • 为加速器架构研究人员提供 GoldenFloat 系列格式的文献目录。

不适用范围:

  • 不是质量排名: phi_distance = 0 仅表示字段宽度匹配 phi 规则,并非最佳格式。
  • 不是穷举目录: 未在标准机构中发布的厂商私有格式已被省略。
  • 不提供硅性能数据。
  • 不提供模型准确率声明: 这是一个格式规范目录,而非量化基准测试。

已知局限

  • 论文 / SSOT 计数差异: 论文中为84种,SSOT为83种。
  • 状态标签不统一: 不同集群间的 status 标签所代表的验证深度不一致。
  • GF 集群过度代表: 83种格式中 GF 占22种(27%),因为该目录源于 GoldenFloat 研究线。
  • 仅支持英文: 名称 / 用例无本地化。

已知偏见

  • 以 GoldenFloat 为中心: 格式基于 phi 结构化字段宽度规则进行排序和标记。

相关资源

搜集汇总
数据集介绍
numeric-format-catalog 数据集图片
构建方式
该数据集作为数值格式领域的权威参考目录,由代码生成引擎自动构建,其单一事实来源为 `gHashTag/t27` 仓库中的 `specs/numeric/formats_catalog.t27` 规范文件。通过运行 `tools/gen_formats_catalog.py` 生成脚本,将单一规范文件转化为标准的 JSONL、JSON 及 Markdown 格式,最终镜像至 Hugging Face 平台。这一管道确保了数据源的唯一性与可复现性,用户可通过克隆仓库并执行相同脚本在原地重新推导,从而获得与在线版本完全一致的结果。
特点
数据集收录了 83 种数值格式,横跨 13 个聚类簇,包括 GoldenFloat、IEEE 754 二进制与十进制、Posit、对数数系以及低精度机器学习格式等。每个条目均包含位宽、符号位、指数位与尾数位等结构化字段,并附加 phi 距离指标用以衡量格式是否遵循黄金比例场宽规则。数据集的独特之处在于其兼具跨标准锚定功能与聚类分析能力,能够高效服务于 AI 加速器设计、标准交叉验证及学术研究等多个场景。
使用方法
用户可通过 Hugging Face 的 `datasets` 库便捷加载,调用 `load_dataset("playra/numeric-format-catalog", split="catalog")` 即可获取完整目录。返回的每条记录均以字典形式呈现,支持通过聚类标签筛选特定类别(如 GoldenFloat),或按 phi 距离排序以寻找最接近黄金比例的格式。此数据集适合作为数值格式的静态参考清单,用于格式发现、标准锚定及 GoldenFloat 家族文献索引,但不适用于质量排序或模型精度评估。
背景与挑战
背景概述
在人工智能与科学计算领域,数值格式的统一编目与标准化研究长期面临碎片化挑战。为此,Trinity S3AI团队于2026年发布了Numeric Format Catalog数据集(v3.0),由Daniil Vasilev主导维护。该数据集系统收录了83种数值格式,涵盖GoldenFloat、IEEE 754、Posit、对数系统等13个簇类,旨在为AI加速器设计、高性能计算及历史硬件研究提供权威参考。通过代码生成流水线维护单一事实源,该数据集与配套的一致性测试包共同构成了phi结构算术研究的基石,其论文已在arXiv发表,对推动数值计算领域的跨标准协作与格式发现具有重要影响。
当前挑战
该数据集需应对的核心挑战包括:1)领域问题层面,数值格式的多样性导致了互操作性与标准交叉验证的困难,现有研究常因格式定义模糊或参数歧义而难以复现,亟需一个权威索引来统一描述字段宽度、偏置规则及phi距离等关键属性。2)构建过程中,维护单一事实源与论文草稿间的版本同步成为难题(如v3.0存在84与83的计数差异),同时需处理解析器缺陷导致的格式遗漏(v2.0因`bias_formula`解析错误仅含81条记录)。此外,不同簇类的验证状态(Verified/Conj/Risk)标签标准不统一,加之GoldenFloat簇类因研究侧重点而占比过高(27%),可能引入系统性偏倚,需在后续迭代中持续完善数据质量与公平性评估。
常用场景
经典使用场景
在人工智能加速器设计与科学计算领域,数值格式的选择对计算精度与硬件效率至关重要。该数据集以83种数值格式的权威目录为核心,横跨GoldenFloat、IEEE 754二进制、Posit、低精度机器学习格式及历史厂商格式等13个聚类,为研究者提供了一个系统化的格式参考基准。其经典使用场景包括作为格式发现与对比的标准化工具:研究人员可通过数据集快速检索特定格式的位宽、指数与尾数分配、偏置规则等参数,并借助phi距离度量评估格式与黄金分割结构的吻合程度。数据集还支持跨格式的聚类分析,便于探索不同数值体系间的内在关联与演化路径,从而为新型数值格式的设计与旧有格式的优化提供数据驱动的决策依据。
实际应用
在实际工程中,该数据集充当了AI加速器芯片设计流程中的格式规范锚点。芯片架构师可借此快速评估不同数值格式在硬件资源占用与计算精度间的权衡,例如在低精度推理引擎中选用FP8(E4M3、E5M2)或NF4格式,或在科学计算场景中指定binary64或GoldenFloat格式。数据集与配套的一致性测试向量集(numeric-conformance-packs)联动,支持硬件验证阶段的位精确测试,确保硅前仿真与硅后实现的一致性。此外,量化工具链开发者可将数据集作为格式库的权威来源,自动生成量化策略的枚举空间,从而缩短从研究原型到产品部署的迭代周期。
衍生相关工作
围绕该数据集已衍生出一系列重要学术工作。核心关联论文《Eighty Formats and a Ruler》提出了基于黄金分割比的phi结构化字段宽度规则,并以此构建了83种格式的统一分类体系。另一篇锚定论文《GoldenFloat Identity》则深入揭示了GoldenFloat格式家族的数论基础,为格式设计提供了理论支撑。在实践层面,一致性测试向量集numeric-conformance-packs实现了目录中的格式实例化,支持硬件验证的位精确度检测。此外,Tier 2验证栈tt-trinity-corona提供了端到端的硅性能评估框架,与目录中的数据形成互补。这些作品共同编织了一个从格式规范、理论验证到硬件实现的完整研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务