遇见数据集

primelist

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集为Prime List from 1 to 1e14,旨在提供从1到100,000,000,000,000(1e14)之间的所有素数,并以Parquet格式发布,便于流式传输、选择性分片下载和在线预览。数据集仅包含素数数值,不包含标签、自然语言内容或衍生特征。数据覆盖范围为1 ≤ p < 1e14,共分为1000个分片,每个分片覆盖1e11的整数区间,文件名格式为part-NNNN-of-1000.parquet(NNNN从0000到0999)。每个分片内的素数严格递增,所有分片合并后得到全局有序的完整素数列表。数据模式包含一个prime字段,类型为uint64,不可为空,数据页使用ZSTD压缩。用户可通过Hugging Face Datasets以流式模式加载数据,无需下载整个数据集。该数据集适用于素数枚举、数学研究、数值测试等场景。

The dataset is Prime List from 1 to 1e14, which aims to provide all prime numbers from 1 to 100,000,000,000,000 (1e14) and is published in Parquet format for easy streaming, selective shard download, and online preview. The dataset contains only prime numbers, no labels, natural language content, or derived features. The coverage is 1 ≤ p < 1e14, divided into 1000 shards, each covering an integer interval of 1e11, with filenames like part-NNNN-of-1000.parquet (NNNN from 0000 to 0999). Primes are strictly increasing within each shard, and merging all shards yields a globally ordered complete prime list. The schema has a single prime field of type uint64, non-nullable, with ZSTD compression on data pages. Users can load the dataset in streaming mode via Hugging Face Datasets without downloading the entire dataset. It is suitable for prime enumeration, mathematical research, numerical testing, etc.

创建时间:
2026-08-10
原始信息汇总

数据集概述:Prime List from 1 to 1e14

基本信息

  • 数据集名称:Prime List from 1 to 1e14
  • 数据集标识lzray/primelist
  • 类别标签:数学、素数、Parquet格式
  • 语言:不包含自然语言内容或无标签数据,仅包含素数数值

数据范围与内容

  • 覆盖范围:包含从1到100,000,000,000,000(即 1e14)之间的所有素数,且按升序排列
  • 内容类型:仅提供素数数值,不包含标签、衍生特征或自然语言描述
  • 数据唯一性:每个素数在整个数据集中仅出现一次

数据分片结构

  • 数据目录1-1e14/
  • 分片数量:共1,000个分片
  • 分片命名规则:文件名符合 part-NNNN-of-1000.parquet 模式,其中NNNN从 00000999
  • 分片间隔宽度:每个分片覆盖一个半开区间 [i * 1e11, (i + 1) * 1e11),其中 i 为分片索引(0到999)
  • 相邻分片关系:相邻分片的区间互不重叠、无间隔,按文件名顺序读取所有分片即可获得完整的全局有序素数列表

数据模式

  • 字段:仅有 prime 一列
  • 字段类型:Arrow类型为 uint64,不可为空
  • 排序规则:严格递增
  • 压缩方式:数据页采用ZSTD压缩

使用建议

  • 推荐方式:使用Hugging Face Datasets库的流式模式,避免一次性下载完整数据集
  • 分段加载:如需特定数值范围,可选择与该范围相交的分片文件进行读取
  • 类型注意:保留 uint64 类型,避免将大数值转换为32位整数导致溢出

引用示例代码

python from datasets import load_dataset

primes = load_dataset( "lzray/primelist", data_files="1-1e14/*.parquet", split="train", streaming=True, )

for row in primes.take(10): print(row["prime"])

局限性说明

该数据集提供素数枚举数据,而非素性测试API或交互式计算工具。使用者需自行处理数值类型转换,确保不丢失精度。

搜集汇总
数据集介绍
primelist 数据集图片
构建方式
该数据集的构建源于数论研究对大规模素数枚举的长期需求,其核心策略是将1至10^14区间内的素数按固定整数宽度划分为1000个互不重叠且无间隙的连续分片,每个分片覆盖10^11的数值范围。所有素数均以严格递增顺序存入独立的Parquet文件,文件命名遵循part-NNNN-of-1000.parquet的规则,分片索引从0000至0999。每个素数唯一出现于其所属数值区间的分片中,数据页面采用ZSTD压缩以优化存储效率,最终形成全局有序且可直接读取的完整素数列表。
使用方法
使用者可通过Hugging Face Datasets库以流式模式加载该数据集,避免一次性下载全部1000个分片文件造成的存储与内存压力。代码示例如下:调用load_dataset函数并指定data_files参数为1-1e14/*.parquet,设置split为train且streaming为True,随后利用take方法按需获取素数行。对于限定数值范围的应用场景,可依据分片区间计算公式仅选择与目标范围相交的特定文件,从而实现选择性下载与局部读取。需注意保留prime列的uint64类型,避免转换为32位整数导致溢出错误。
背景与挑战
背景概述
素数作为数论中最基础且神秘的研究对象,其枚举与分布问题始终驱动着计算数学的演进。2024年,独立研究者发布了覆盖1至1e14完整素数列表的primelist数据集,以1000个Parquet分片存储严格递增的uint64素数值,并提供流式加载与选择性分片下载机制。该数据集回应了大规模素数计算与验证对可靠、可复现数据源的迫切需求,为素数间隔研究、算法基准测试及数论教学提供了标准化基础设施,同时其可扩展的分片契约设计也为超大规模数学数据集的发布树立了典范。
当前挑战
该数据集所直面的核心领域难题在于一维整数空间中素数分布的稀疏性与不规则性,使得完整枚举至1e14需高效生成并验证约数万亿个候选整数,对计算资源与算法效率构成严峻考验。构建过程中,研究者须确保每个uint64素数在唯一分片内严格递增且无遗漏,须在ZSTD压缩下维持分片独立可读性,并须规避32位转换溢出等数据类型风险;此外,分片区间边界须精确对齐,防止重复或空缺,而流式访问与选择性下载的平衡亦要求精细的工程规划。
常用场景
经典使用场景
在数论研究与计算数学领域,素数序列的获取与处理始终是基础而关键的任务。primelist数据集提供了从1至10^14范围内所有素数的有序枚举,以Parquet格式按万亿区间分片存储,共1000个分片文件,每个分片包含严格递增的素数序列。经典使用场景聚焦于流式加载与分片选择性下载,研究人员可利用Hugging Face Datasets的流式模式按需读取特定数值区间的素数,避免全量下载带来的存储与内存开销;同时,该数据集支持在线预览,便于快速验证素数分布假设或开展大规模数值实验。其分片契约明确,读取全部文件即可获得全局有序的完整素数列表,为素数计数、间隔分析等任务提供了高效的数据基础。
解决学术问题
在解析数论与计算数论中,素数分布的精确数据对于验证猜想、校准启发式模型至关重要。primelist数据集解决了大规模素数枚举数据获取困难、格式不统一的问题,为研究者提供了标准化的Parquet格式素数列表,涵盖至10^14的完整范围,填补了公开可用高覆盖素数数据集的空白。它使得素数计数函数π(x)的精确计算、素数间隔统计、以及勒让德猜想等经典问题的实证检验成为可能。同时,该数据集支持可重复研究,避免了因数据来源差异导致的结果偏差,推动了素数分布理论、随机模型验证以及算法性能评估的学术进展。
实际应用
在密码学、随机数生成与算法工程实践中,素数列表具有广泛的实际应用价值。primelist数据集可用于生成大素数候选、测试素性检验算法的效率与准确性、以及构建哈希函数中的素数模数。在密码学教育中,该数据集支持RSA算法参数生成的演示与实验;在分布式计算中,分片化的素数数据便于并行处理与负载均衡。此外,该数据集还可用于数据库索引优化、数值分析教学以及高性能计算基准测试,为工业界与教育界提供了可靠且易于集成的素数数据源。
数据集最近研究
最新研究方向
在解析数论与计算数学的交汇处,大规模素数枚举数据集的构建与开放共享正成为推动前沿探索的关键基础设施。primelist数据集以Parquet格式完整收录了1至1e14区间内所有素数,其分片设计兼顾了流式读取与选择性下载,为素数间隙分布、黎曼假设数值验证、以及基于机器学习的素数模式识别等研究提供了高吞吐、低冗余的数据底座。当前,围绕该数据集的典型研究方向包括:利用分布式计算框架对素数计数函数π(x)进行高精度逼近与误差分析,探索大区间内素数间隙的统计规律与极端事件;结合张量分解与序列建模技术,挖掘素数序列中的隐含结构与伪随机性;以及面向密码学应用,评估大素数生成与验证算法在超大规模数据上的性能边界。该数据集亦与近年数论计算竞赛、开放科学数据倡议等热点事件形成呼应,显著降低了素数相关实证研究的门槛,为跨学科方法在经典数论问题中的融合创新提供了可复现的实验平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务