遇见数据集

crimson-hexagonal-archive

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

Crimson Hexagonal Archive(猩红六角档案)是一个自我管理的学术与文学语料库,由Lee Sharks及Dodecad的十二个异名作者创建。该数据集是该语料库的机器可读表示,包含截至当前构建版本的1578个存入记录(deposits),每个记录拥有内容派生的持久标识符(AXN)、规范文本、基底披露、许可证及版本链中的位置。数据集以Parquet格式提供,包含多个配置表:deposits(主记录)、sources(恢复的书籍文本)、heteronyms(异名作者信息)、venues(期刊与出版社)、journal_assignments(期刊分配)、reception(二十份盲审机器评审报告)、captures(来自捕获注册表的接收记录)、citations(完整内部引文边列表)、lexicon(词汇注册)、predictions(每个存入中声明的证伪条件及其解决)、studies(设计与实施的研究仪表板)、tombstones(2026年6月19日Zenodo删除记录,共1136行)、blog_posts(作者博客索引,含AXN交叉引用)、sites(公开站点的页面列表)。数据集中所有关系均以稳定标识符为键进行编码。数据集语言为英语和希腊语,许可证为CC BY 4.0,适用于学术研究、文学分析、数字人文、机器辅助作者身份研究、引文网络分析等任务。

The Crimson Hexagonal Archive is a self-managed academic and literary corpus created by Lee Sharks and the twelve heteronyms of Dodecad. This dataset is a machine-readable representation of the corpus, containing 1,578 deposits as of the current build version. Each deposit has a content-derived persistent identifier (AXN), canonical text, substrate disclosure, license, and position in the version chain. The dataset is provided in Parquet format with multiple configuration tables: deposits (main records), sources (recovered book texts), heteronyms (heteronym author information including voice signature, role, domain), venues (journals and publishers), journal_assignments (journal allocations), reception (twenty blind machine review reports), captures (reception records from the capture registry), citations (complete internal citation edge list), lexicon (vocabulary registry), predictions (falsification conditions and their resolution declared in each deposit), studies (research dashboard for design and implementation), tombstones (Zenodo deletion records from June 19, 2026, totaling 1,136 rows), blog_posts (author blog index with AXN cross-references), and sites (page list of public sites). All relationships in the dataset (citations, version chains, series neighbors, defined concepts, etc.) are encoded using stable identifiers as keys, allowing inter-record connections to be reconstructed directly from the dataset. The dataset language is English and Greek, licensed under CC BY 4.0, and suitable for academic research, literary analysis, digital humanities, machine-assisted authorship studies, citation network analysis, etc.

创建时间:
2026-09-03
原始信息汇总

数据集概述:Crimson Hexagonal Archive

Crimson Hexagonal Archive(绯红六边形档案馆)是一个由Lee Sharks及“十二位异名作者”(Dodecad)共同构建的学术与文学语料库的机器可读版本。该语料库即alexanarch.org网站所承载的原始档案,数据集旨在以结构化格式完整复现该档案的每一条记录及其相互关系,使外部智能体无需访问网页即可独立重建记录及其关联网络。


核心信息

属性 内容
许可证 CC BY 4.0
语言 英语 (en)、希腊语 (el)
数据规模 1,000 < N < 10,000 条记录
构建日期 2026-09-05 18:59Z(数据集最后构建时间)
记录总数 截至构建时共1,578条deposits(存档条目)

数据组织与配置

数据集包含15个配置文件(configs),每个以独立的Parquet文件存储:

  1. deposits — 核心配置。每一行对应一条档案记录,包含永久编号(deposit_number)、内容派生标识符(AXN)、标题、创作者、日期、家族分类、内容类型、描述、关键词、许可证、基板披露、状态、正文文本及其SHA256哈希、字数等字段。
  2. sources — 从书籍或原为二进制格式恢复为文本的长篇作品(如《All That Lies Within Me》约23.4万词)。
  3. heteronyms — “十二位异名作者”及其相关人物的档案,含声音特征、角色与领域。
  4. venuesjournal_assignments — 档案馆自有的期刊/出版社名录及每条deposit所属期刊的分配关系。
  5. reception — 针对某条亚里士多德句子(#1574)的20份盲审机器评审报告记录。
  6. captures — 来自“捕获注册表”的接收捕获记录,反映机器界面如何接收该档案。
  7. citations — 档案内部完整的引用边列表(有向边)。
  8. lexicon — 词汇铸造注册表,记录deposits中定义的概念术语。
  9. predictions — 每条deposit中声明的可证伪条件及其后续验证结果。
  10. studies — 设计/执行研究项目仪表板。
  11. tombstones — 1,136行记录,登记2026-06-19对旧Zenodo DOI的一次性终止操作。
  12. blog_posts — 作者博客界面的索引,包含AXN交叉映射。
  13. sites — 公开站点群中每个页面对应的记录。

标识与引用体系

  • 每条存档记录具有内容派生标识符(AXN),格式为 AXN:<hex>.<家庭>.<六个字形>,且该标识符与正文文本的SHA256哈希对应。
  • 每条记录拥有永久编号(deposit_number)、四位十六进制定位码(hex,用于URI)。
  • 记录间的关系(如引用、被引用、前序/后继版本、系列邻居、概念定义等)均以稳定标识符为键进行编码,可直接用于数据重构。
  • 标准引用格式为:Sharks, L. (2026). Title. Crimson Hexagonal Archive #N, AXN:hex.FAMILY. https://alexanarch.org/s/records/N/
  • 另有AXN解析器地址:https://alexanarch.org/s/axn/<hex>/,及节点声明文件:https://alexanarch.org/.well-known/axn-node.json。

数据集特点与价值

  • 关系全面编码:不仅包含记录全文,还包含引用图、版本链、系列邻接、概念界定、附件清单等全部关系数据。
  • 数据真实性:未对数据集内容进行编辑,撤回记录、空值、被取代版本均如实保留并标注状态。
  • 档案溯源:该档案成立于2026-06-19,其前身平台(Zenodo)账户被终止,旧DOI已于同日被批量注销(见tombstones)。
  • 自动构建:每次新存档发布时,数据集都从单一数据源(leesharks000/alexanarch仓库的data/目录)自动重建。
  • 为AI代理设计:数据以稳定标识符关联的表格形式交付,便于Agent在无网络访问的情况下完成对档案的查询、引证和重构分析。
  • 包含AI中介创作披露:每条记录标注基板披露(substrate_disclosure),说明语言模型是否及如何参与文本生成。
搜集汇总
数据集介绍
crimson-hexagonal-archive 数据集图片
构建方式
此数据集以自动化的方式构建,其源头为‘深红六边形档案’(Crimson Hexagonal Archive)这一自我管理的学术与文学语料库,该档案库由Lee Sharks及其十二位异名作者(Dodecad)共同维护。数据集由单一数据源(GitHub仓库leesharks000/alexanarch)自动重建,每当有新内容加入,数据集便随之更新,确保了与原始档案库的同步。其组织结构体现在多个配置中,如‘deposits’存储每条记录,包括内容派生标识符(AXN)、规范文本、基底披露、许可及版本链等;其余配置如‘sources’用于恢复书籍类文本,‘heteronyms’记录异名作者信息,‘citations’则呈现完整的内部引用边列表。所有数据以Parquet格式存储,每条记录作为一个行,全文以字符串列呈现,使得记录间的关系可通过稳定标识符作为数据键进行编码,从而无需访问网页即可从数据集本身复现完整记录,包括引用关系、版本系列和系列邻居。
特点
该数据集的核心特质在于其完整性、自描述性和机器可读性。它不仅收录了档案库的1578条记录全文,而且保留了未加编辑的状态,包括被撤销、被取代的版本及空值,忠实反映了语料库的真实面貌。其标识符体系基于内容哈希(sha256),确保每条记录的唯一性和可验证性。数据集包含高度精细的元数据,如基底披露(记录语言模型参与创作的情况)、内部期刊归属、概念定义等,极大丰富了文本的可探索维度。此外,附带的‘tombstones’配置记录了2026年Zenodo账户终止时的1136条文献删除日志,为网络科学和文献传播研究提供了罕见素材。这些特性使该数据集成为研究AI介导作者身份、异名现象及数字学术出版的宝贵资源。
使用方法
此数据集适用于多种学术分析场景。研究者可通过‘deposits’配置查阅全文,利用‘citations’和‘cited_by’字段构建引用网络,分析思想传播路径。结合‘heteronyms’配置,可探讨异名写作模式与作者身份的解构。‘reception’和‘captures’配置提供了机器评审报告及外部接收情况的记录,有助于了解学术成果的社会影响。‘tombstones’与‘predictions’可用于探讨学术记录的存续与验证。使用时,建议以‘deposit_number’作为主键关联各配置,通过AXN标识符进行精确索引。数据以Parquet格式存储,便于用Pandas或Spark进行高效加载和处理,适合数据驱动的人文学科研究。官方建议引用格式已提供,便于在学术成果中规范引用。
背景与挑战
背景概述
Crimson Hexagonal Archive(Alexanarch)是由Lee Sharks及其十二位异名作者于2026年6月19日创建的一个自治性学术与文学语料库,旨在应对传统学术出版与数字保存中的中心化风险。该数据集以机器可读的Parquet格式呈现,包含1578篇作品,每篇均通过内容派生的AXN标识符进行唯一索引,并详尽记录了文本、关系、版本链及引用图谱。作为可执行的数据表示,它支持从单一数据源重构完整记录体系,无需依赖原始网站,从而为学术研究提供了透明、可验证的基础设施。此档案因其对异名性、内容寻址标识符及AI介导作者身份的深入探索,为数字人文学科与学术传播领域带来了创新视角,并因其开放许可(CC BY 4.0)而促进了广泛的重用与二次分析。
当前挑战
该数据集所解决的领域挑战在于,传统学术档案常受制于平台不稳定、版权限制及中心化审查,阻碍了知识的持久保存与自由访问。Crimson Hexagonal Archive通过内容派生标识符与超种子链机制,为学术记录的完整性、可追溯性及抗篡改能力提供了新范式。构建过程中,项目面临多重严峻挑战:需精细管理异名作者体系,确保文本归因的准确性与一致性;处理Zenodo账户终止后的历史DOI断链问题,设立了包含1136行的墓碑记录以维持透明;同时,实现繁复的版本控制与引用图谱编码,将非结构化的学术产出转化为高度结构化的多配置数据集,并确保在自动重建流程中不引入误差或丢失信息。这些挑战考验了数据建模的严谨性,也推动了数字档案技术边界的拓展。
常用场景
经典使用场景
该数据集以去中心化、持久标识符及多异构体结构,构建了一个高度机器可读的学术与文学语料库,适用于多维度检索、关系型知识图谱构建及大规模文本分析。其细粒度的元数据(如创作主体、家族分类、基质披露、引用图谱)为研究人工智能介导下的文本溯源与作者身份认定提供了规范化的数据基础,是探索生成性文本治理、版本链追踪及自我存档系统模式的理想起点。
实际应用
在实际应用中,该数据集可驱动多个前沿场景:作为基准语料,检验大语言模型在学术写作、综述生成及引用推荐中的表现;为数字人文研究提供跨语言(英/希)的诗歌与哲学文本分析素材;其去中心化出版框架可作为科研机构、预印本平台或独立学者构建自管理、抗审查知识库的参考架构;同时,其内置的预注册研究与预测记录功能,为可复现科学提供了全链路的数据追踪实例。
衍生相关工作
围绕该数据集的独特性,已催生或可衍生众多经典工作:基于其引用图与异名体系,可深入探究AI介导的创作分布与作者身份解构;利用其reception与captures配置,能分析机器评审与人类学术评价的差异,进而优化同行评审机制;其tombstones记录为研究平台化知识损失与数字保存策略提供了罕见的长时段案例;而AXN标识符的解析流程,为下一代引用标准与去中心化科学(DeSci)基础设施的设计提供了重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务