遇见数据集

cogitoergosumma-corpus

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集名为“Cogito Ergo Sum 全集合”(The Corpus of Cogito ergo SUMMA summarum),由用户 standardgalactic(Cogito Ergo Sum)的全部公开文本仓库汇集而成,是一个大型文本语料库。数据集包含 1,367 个仓库,约 78.3 GB 纯文本,以 JSONL 格式存储。每条记录由三个字段构成:id(仓库及文件路径)、text(文件完整内容)、source(来源仓库名称)。数据仅收录文本文件(如 Markdown、TeX、Python、JSON 等),排除了二进制文件、PDF、媒体文件、归档文件以及超过 300 MB 的大型 fork 仓库。构建过程中采用浅克隆、路径去重、可恢复构建策略。数据集可通过 Hugging Face Datasets 库直接加载,或通过 HF Bucket 流式访问,无需任何认证。其内容覆盖 quadrivium、library、alphabet、calculus、cosmology、language-evolution 等多个领域,旨在将分散在数千个仓库中的知识整合为一个可供搜索和学习的大型语料库,尤其适合用于文本生成、预训练、知识蒸馏等任务,或作为研究性学习资源。

This dataset is named The Corpus of Cogito ergo SUMMA summarum, compiled from all public text repositories of user standardgalactic (Cogito Ergo Sum), forming a large text corpus. It contains 1,367 repositories, approximately 78.3 GB of plain text, stored in JSONL format. Each record consists of three fields: id (repository and file path), text (full file content), and source (source repository name). The data only includes text files (such as Markdown, TeX, Python, JSON, etc.), excluding binary files, PDFs, media files, archive files, and large fork repositories exceeding 300 MB. The construction process uses shallow cloning, path deduplication, and resumable building strategies. The dataset can be directly loaded via the Hugging Face Datasets library or streamed through HF Bucket without authentication. Its content covers multiple domains such as quadrivium, library, alphabet, calculus, cosmology, and language-evolution, aiming to integrate knowledge scattered across thousands of repositories into a large-scale corpus for search and learning, particularly suitable for text generation, pre-training, knowledge distillation, and as a research and learning resource.

创建时间:
2026-08-17
原始信息汇总

数据集概述:The Corpus of Cogito Ergo Sum Summarum

数据集简介

该数据集汇集了 Standard Galactic 用户所有公开的文本型代码仓库内容,包含 1,367 个仓库、约 78.3 GB 的文本数据,并持续增长中。数据集将分散在数万个未索引仓库中的知识整合为统一语料库。

数据规模

  • 仓库数量:1,367 个
  • 数据大小:约 78.3 GB 纯文本
  • 构建状态:持续进行中,小型分叉仓库的尾部数据正在不断纳入

数据格式

数据集采用 JSONL 格式,每个文件对应一个源仓库(data/<repo>.jsonl),每条记录包含三个字段:

  • id:格式为 <repo>/<path>,标识文件来源
  • text:文件完整文本内容
  • source:来源仓库名称

支持的文件类型:md、txt、tex、org、rst、srt、vtt、tsv、json、py、sh、c、cpp、rs、go、java、js、ts、html、yaml、toml、csv

排除内容:二进制文件、PDF、mhtml、媒体文件、压缩包,以及超过 300 MB 的大型分叉仓库(如 chromium、Linux 内核、游戏引擎等重复代码库)。

数据来源

主要来源仓库包括:quadrivium、library、research-projects、alphabet、calculus、abraxas、antivenom、spherepop、memnet、cosmology、language-evolution、cliodynamics、physiome、bootcamp、cognition-research、bash-lab、kitbash、cosmic-cults、guardrails、llvm-archive、art_of_tts、neovim、phabricator 等,覆盖认知科学、语言演化、宇宙学、计算、编程等多个领域。

访问方式

  1. Hugging Face 数据集:可通过 load_dataset("PeetPedro/cogitoergosumma-corpus", data_files="data/*.jsonl", split="train") 加载
  2. HF Bucket 完整存档:可通过 hf://buckets/PeetPedro/cogitoergosumma-corpus/data/ 流式访问或同步下载

许可证

采用 MIT 许可证,但数据内容遵循各源仓库自身的许可证条款。

构建方法

  • 使用浅克隆(--depth 1)获取仓库
  • 按路径去重
  • 支持断点续传构建
  • 数据经过清理,排除二进制内容
搜集汇总
数据集介绍
cogitoergosumma-corpus 数据集图片
构建方式
本数据集是Standard Galactic组织下所有公开文本仓库的汇聚之作,其构建过程涵盖1,367个仓库、约78.3GB的文本数据。数据集从源仓库中提取所有文本承载文件,涵盖Markdown、纯文本、TeX、源代码等多种格式,并排除二进制文件及大型重复分支(如Chromium、Linux内核等)。利用浅克隆技术,结合路径去重与可恢复构建流程,将每个文件转化为JSONL格式的条目,每条记录包含稳定的ID、文本内容及来源仓库,确保数据溯源清晰且重建时保持一致性。
特点
数据集的独特之处在于其广泛性与纯净性:它不仅是知识的‘蓄水池’,聚合了Quadrivium、Library等众多知识领域的文本,而且还经过严格的隐私与秘密信息清洗。每条记录在进入语料库前都经过PII、密钥及高熵片段的检测与编辑,确保安全合规。同时,该数据集保持高度结构化,按源仓库分文件储存,且ID设计为路径派生,稳定且不依赖文本内容,有助于用户精确追踪数据出处。此外,数据集规模庞大且持续增长,但构建过程注重效率与资源节约,如采用浅克隆与去重策略。
使用方法
数据集提供了两种便捷的访问途径。用户可通过HuggingFace的`datasets`库直接加载,如`load_dataset`函数一行代码即可获取训练数据。此外,HuggingFace托管的数据桶允许用户通过命令行工具进行文件级同步或流式访问,便于定向提取特定仓库的内容。数据集的JSONL格式使得其易于与各类文本处理或模型预训练流程集成,无论是进行语言模型训练、知识蒸馏,还是作为检索增强生成的语料库,均能方便地利用。
背景与挑战
背景概述
该数据集由Standard Galactic用户于2026年创建,名为“Cogito Ergo Summa Corpus”,汇集了其名下1,367个公共文本仓库,共计78.3GB的文本内容。创建者旨在将分散的知识汇聚为一个统一的学习资源,供后续预训练和知识蒸馏研究使用。该语料库涵盖了从编程代码到哲学思考的广泛主题,体现了跨学科的知识整合。其独特的设计包括稳定的ID(基于仓库路径)和可再生的构建流程,确保了数据的可追溯性和可维护性。该数据集的出现为自然语言处理领域提供了大规模、多样化的文本资源,尤其对需要丰富语料的长尾知识和多语言模型训练具有重要价值。
当前挑战
该数据集在构建和使用中面临多重挑战。首先,其领域问题涉及文本语料的自动整合与清洗,需处理来自数千个仓库的异构格式,剔除二进制文件和大型复制代码库,确保原始思想的保留。其次,构建过程中需应对敏感信息泄漏风险,如电话号码、邮件地址和潜在密钥,为此设计了多重脱敏规则,但严格的熵阈值可能导致误删。此外,数据集的更新和再发布需平衡资源消耗与完整性,如对受影响文件的重新抓取和脱敏,需避免重复克隆数千仓库。最后,数据的合法性和原始许可证的遵循也是长期挑战,因为内容源自多个独立仓库,需确保合规使用。
常用场景
经典使用场景
cogitoergosumma-corpus数据集汇聚了Standard Galactic用户所有公开文本仓库的精华,涵盖哲学、数学、语言学、宇宙学等多个知识领域,形成了一座庞大的思想宝库。其经典的使用场景在于为大规模语言模型提供丰富的预训练语料,通过无监督学习捕捉人类知识的深层结构。研究者可直接利用datasets库加载该数据集,进行文本生成、语言建模等任务,探索知识蒸馏与模型预训练的新范式。该数据集的规模与多样性使其成为构建通用人工智能系统的理想基础,也为多语言、多学科交叉研究提供了宝贵的资源。
衍生相关工作
该数据集的构建方法可能启发一系列衍生工作,包括自动化数据清洗管道、隐私保护文本处理技术以及大规模语料库的版本控制方案。其独特的‘一行一思维’理念可能催生新型的知识表示与检索机制。此外,基于该数据集的预训练模型可能成为后续研究的基础,推动领域适应、少样本学习等方向的发展。数据集中包含的特定领域(如宇宙学、语言演化模拟)文本,可能激发跨学科的研究项目,例如利用语言模型探索科学理论的表述一致性。其审计流程中开发的正则表达式与熵检测技术,也可被复用至其他数据集的构建中,形成方法论上的贡献。
数据集最近研究
最新研究方向
该数据集聚焦于大规模多语言文本语料的汇聚与净化,代表了预训练语料库构建的前沿实践。其独特之处在于对个人或组织全部公开代码仓库的文本内容进行系统整合,形成超过78GB的异构语料,为语言模型预训练提供了丰富的知识蒸馏素材。研究重点包括:开发高精度的PII(个人身份信息)与机密数据检测算法,以应对真实世界语料中的隐私泄漏挑战;探索基于路径稳定性的去重与溯源机制,确保数据版本可追溯;以及优化流式访问与分布式存储方案,支撑海量数据的动态更新。该语料的发布不仅促进了多领域知识融合的预训练研究,还推动了数据治理、自动化清洗及合规性评估等关键议题的进展,为构建安全、可靠、可复现的语言模型训练数据基础设施树立了新标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务