class-numbers-real-quadratic
收藏资源简介:
该数据集包含27.4亿个实二次域Q(√d)的类数计算结果,覆盖了所有基本判别式d在[10⁹, 10¹⁰)范围内的值。这是首个公开可用的、在此规模下按判别式分类的类数表,填补了先前研究未公开原始数据的空白。数据集采用Parquet格式存储,包含两个字段:'discriminant'(基本判别式d,uint64类型)和'class_number'(类数h(d),int32类型)。计算工作使用8×NVIDIA B200 DGX集群在30分钟内完成,吞吐量达到153万判别式/秒。数据集特别适用于研究Cohen-Lenstra猜想,展示了类数分布与渐近预测之间的显著差异(在d~10¹⁰时h=1的比例为16.7%,远低于预测的75.4%)。此外,数据集还包含详细的类数分布统计(h=1-16的计数及比例)和p-可分性分析(3、5、7等素数作为除数的观测频率)。计算过程采用GPU平方自由筛、连分数展开计算调节子、欧拉积计算L函数等方法,并通过与PARI/GP的交叉验证确保了结果准确性。
数据集概述:实二次域类数(GPU计算)
数据集基本信息
- 数据集名称:Class Numbers of Real Quadratic Fields (GPU-Computed)
- 发布者:Cahlen Humphreys
- 发布日期:2026年3月
- 许可证:CC BY 4.0
- 任务类别:表格分类
- 标签:数论、类数、实二次域、Cohen-Lenstra、GPU计算、数学、计算数论、代数数论、连分数
- 数据规模:1B < n < 10B
- 配置名称:
1e9_to_1e10 - 数据文件:
data/1e9_to_1e10/*.parquet - 数据描述:包含所有在区间 [10^9, 10^10) 内的基本判别式 d。
数据结构
- 特征:
discriminant(uint64): 基本判别式 d > 0。class_number(int32): 实二次域 Q(√d) 的类数 h(d)。
- 数据划分:
train: 包含 2,735,671,820 个样本。
数据集内容
- 数据范围:基本判别式 d ∈ [10^9, 10^10)。
- 数据总量:2,735,671,820 个基本判别式及其类数。
- 核心内容:每个数据行包含一个基本判别式 d 及其对应的类数 h(d)。基本判别式定义为:d ≡ 1 (mod 4) 且无平方因子,或 d = 4m,其中 m ≡ 2 或 3 (mod 4) 且 m 无平方因子。类数 h(d) 衡量了 Q(√d) 整数环中唯一分解性的失效程度;当 h(d) = 1 时,该环具有唯一分解性。
关键统计信息
- 计算时间:30分钟。
- 硬件配置:8× NVIDIA B200 DGX(1.43 TB VRAM,NVLink 5)。
- 吞吐量:153万判别式/秒。
类数分布
| 类数 h | 数量 | 占比 |
|---|---|---|
| 1 | 456,984,420 | 16.70% |
| 2 | 606,415,562 | 22.17% |
| 3 | 73,409,125 | 2.68% |
| 4 | 540,733,202 | 19.77% |
| 5 | 22,715,143 | 0.83% |
| 6 | 96,852,027 | 3.54% |
| 7 | 10,849,013 | 0.40% |
| 8 | 298,291,861 | 10.90% |
| 9 | 9,027,194 | 0.33% |
| 10 | 30,106,984 | 1.10% |
| 12 | 85,877,392 | 3.14% |
| 16 | 123,589,441 | 4.52% |
Cohen-Lenstra p-可除性观测
| 除数 | 观测比例 | Cohen-Lenstra(渐近)预测 |
|---|---|---|
| 3 整除 h | 15.28% | ~43.99% |
| 5 整除 h | 4.89% | ~23.84% |
| 7 整除 h | 2.35% | ~16.33% |
主要发现:非单调收敛
Cohen 和 Lenstra (1984) 预测 h(d) = 1 的渐近概率约为 75.446%。本数据集显示,在此尺度上观测到的比例正在下降:
| 判别式范围 | h = 1 比例 |
|---|---|
| d < 10^4 | 42.1% |
| d ~ 10^6 | 25.7% |
| d ∈ [10^9, 10^10) | 16.7% |
| 渐近预测 | 75.4% |
该比例最终必须反转并增至 75.4%,但在 d ~ 10^10 时尚未出现转折。这是因为种理论(类群的 2-部分,由 d 的素因子个数决定)在中等判别式处占主导。仅 h = 2, 4, 8, 16 就占所有判别式的 57%。类群的奇数部分——Cohen-Lenstra 实际适用的部分——最终必须占主导,但收敛速度极慢。
计算方法
对于每个基本判别式 d,通过解析类数公式计算 h(d):
h(d) = round( sqrt(d) * L(1, χ_d) / (2 * R(d)) )
计算步骤包括:
- GPU 无平方因子筛法:每个 GPU 线程检查其位置是否被所有 p ≤ √d 的素数 p^2 整除。在设备上分类基本判别式并流压缩为打包数组。
- 计算调节子 R(d):通过连分数展开计算调节子 R(d) = log(ε_d),完全在对数空间中进行以避免 d > 10^9 时的整数溢出。
- 通过欧拉积计算 L-函数:
L(1, χ_d) = ∏(p ≤ 99991) (1 - χ_d(p)/p)⁻¹,其中 9,592 个素数存储在 CUDA__constant__内存中。 - 组装:将 sqrt(d) * L / (2R) 四舍五入到最接近的整数。原子直方图更新用于聚合统计。
验证
- 在整个范围内随机抽取的 1,000 个判别式上,与 PARI/GP 的
qfbclassno()完全匹配。 - 对于 d < 10^4,h = 1 的比例为 42.13%,与 PARI 完全一致。
- 交叉验证:调节子值与 PARI 的
quadregulator()匹配到 12 位以上数字。
硬件详情
| 组件 | 规格 |
|---|---|
| 节点 | NVIDIA DGX B200 |
| GPU | 8× NVIDIA B200(每个 183 GB VRAM) |
| 总 VRAM | 1.43 TB |
| 互连 | NVLink 5 (NV18),全网格 |
| CPU | 2× Intel Xeon Platinum 8570(112 核 / 224 线程) |
| 系统内存 | 2 TB DDR5 |
计划扩展
| 判别式范围 | 估计判别式数量 | 估计时间(8× B200) |
|---|---|---|
| [10^10, 10^11) | ~270亿 | ~65小时(进行中) |
| [10^11, 10^12) | ~2700亿 | ~27天 |
| [10^12, 10^13) | ~2.7万亿 | ~270天 |
相关资源
- 源代码:https://github.com/cahlen/idontknow
- 实验页面:https://bigcompute.science/experiments/class-numbers-real-quadratic/
- 发现报告:https://bigcompute.science/findings/class-number-convergence/
- 所有实验:https://bigcompute.science
- Agent可读索引:https://bigcompute.science/llms.txt
引用
bibtex @dataset{humphreys2026classnumbers, title = {Class Numbers of Real Quadratic Fields: GPU-Accelerated Computation to 10^10}, author = {Humphreys, Cahlen}, year = {2026}, month = mar, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/cahlen/class-numbers-real-quadratic}, note = {2.74 billion fundamental discriminants, 8x NVIDIA B200} }




