遇见数据集

full-scrolls

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

该数据集名为full-scrolls,专门为维苏威挑战赛的赫库兰尼姆卷轴提供纤维取向方向场预测数据,旨在作为VC3D中Surface Growth纤维方向优化模块的输入,以帮助分割管道更准确地追踪单个纸莎草纸层。数据内容包括针对每个卷轴CT体积的256x256x256体素立方体预测的纤维取向向量(法向、垂直和水平三个分量),这些预测由Joseph Balmaceda基于维苏威挑战赛纤维骨架数据集训练的小型3D U-Net模型生成,模型在保留数据上的平均性能为|cos(angle)|=0.807(1.0表示完美)。数据集覆盖Scroll 2、3、4和5,其中Scroll 5部分区域已有预计算数据,而Scroll 1仅作为支架结构。数据以瓦片形式存储,每个瓦片文件夹包含Zarr数组文件和meta.json配置文件,整体文件夹结构遵循VC3D volpkg标准,适用于古文书数字化、卷轴层分割和纤维结构分析等任务。

The dataset, named full-scrolls, provides fiber orientation direction field prediction data specifically for the Herculaneum scrolls in the Vesuvius Challenge. It is organized according to the VC3D volpkg folder structure and serves as input for the Surface Growth fiber direction optimization module in VC3D, aiding the segmentation pipeline in more accurately tracking individual papyrus layers. The data includes predicted fiber orientation vectors for 256x256x256 voxel cubes from each scrolls CT volume, with normal, vertical, and horizontal components. These predictions are generated by a small 3D U-Net model trained by Joseph Balmaceda based on the Vesuvius Challenge fiber skeleton dataset, with an average performance of |cos(angle)|=0.807 on held-out data (1.0 indicates perfection). The dataset covers Scrolls 2, 3, 4, and 5, with pre-computed direction fields available for parts of Scroll 5, while Scroll 1 serves only as a scaffold structure. Data is stored in tile format, with each tile folder containing Zarr array files and a meta.json configuration file, following the VC3D volpkg standard. It is suitable for tasks such as ancient document digitization, scroll layer segmentation, and fiber structure analysis.

创建时间:
2026-07-06
原始信息汇总

full-scrolls 数据集详情

数据集简介

该数据集包含维苏威挑战赛(Vesuvius Challenge)中赫库兰尼姆古卷(Herculaneum scrolls)的纤维取向方向场,组织结构与VC3D volpkg文件夹结构完全一致。该数据集由Joseph Balmaceda基于维苏威挑战赛纤维骨架数据集训练的小型3D U-Net模型生成。

数据内容

每个瓦片包含256×256×256体素立方体的预测纤维取向向量(包括法向、垂直、水平分量),作为VC3D表面生长纤维方向优化槽的输入,帮助分割管线更准确地追踪单个纸莎草纸层。

  • 模型在保留数据上的性能:平均|cos(角度)| = 0.807(1.0为完美,0.5为随机)
  • 此为基线/概念验证模型,非生产级模型

各卷轴状态

卷轴 标签 状态 备注
Scroll 1 PHercParis4 仅骨架结构 已被社区团队完全读取(2023年大奖),不包含预测数据
Scroll 2 PHercParis3 预测进行中 未读取,活跃奖金目标
Scroll 3 PHerc332 预测进行中 未读取,活跃奖金目标
Scroll 4 PHerc1667 预测进行中 -
Scroll 5 PHerc172 预测进行中 注意:Scroll 5部分区域已有预计算纤维方向场位于dl.ash2txt.org

目录结构

full_scrolls/ Scroll1/PHercParis4.volpkg/ (仅骨架) Scroll2/PHercParis3.volpkg/ Scroll3/PHerc332.volpkg/ Scroll4/PHerc1667.volpkg/ Scroll5/PHerc172.volpkg/ new_segments/ run_vc.sh docker_commands.txt

每个volpkg包含:

  • config.json — VC3D必需文件
  • volumes/{volume_id}/meta.json — VC3D必需文件
  • representations/direction_fields/fiber-directions.zarr/ — 预测数据
  • paths/, renders/, working/, normal_grids/ — VC3D工作目录

瓦片格式

每个瓦片文件夹(z{z}_y{y}_x{x}/)包含:

  • horizontal/ — dx分量zarr数组(float32,最大256³)
  • vertical/ — dy分量zarr数组
  • normal/ — dz分量zarr数组
  • meta.json — 绝对卷轴坐标、体素大小、卷轴信息

VC3D使用方式

在VC3D中加载volpkg,将Surface Growth > Zarr文件夹指向: representations/direction_fields/fiber-directions.zarr/horizontal

许可协议

MIT许可证

搜集汇总
数据集介绍
full-scrolls 数据集图片
构建方式
该数据集源自维苏威挑战赛,旨在为赫库兰尼姆古卷提供纤维方向场数据。其构建基于一个小型3D U-Net模型,由Joseph Balmaceda利用维苏威挑战赛纤维骨架数据集(包含来自Scrolls 1、3和5的31个手动标注立方体)训练而成。每个瓦片对应256x256x256体素的CT体积块,预测结果以zarr格式存储,包含法向量、水平及垂直分量,并严格按照VC3D volpkg文件夹结构组织,便于直接集成至分割管线。
使用方法
使用者需在VC3D中加载对应卷宗的volpkg文件夹,并在Surface Growth模块的Zarr文件夹选项中指向representations/direction_fields/fiber-directions.zarr/horizontal路径,即可利用预测的纤维方向优化分段流程。数据集附带的run_vc.sh和docker_commands.txt脚本简化了环境配置,支持通过Docker容器快速运行。注意,模型权重未开源,仅提供预测结果作为输入。
背景与挑战
背景概述
full-scrolls数据集诞生于维苏威挑战赛(Vesuvius Challenge)的背景下,由研究人员Joseph Balmaceda主导创建,旨在通过深度学习技术复原赫库兰尼姆(Herculaneum)古卷的文本内容。这些古卷在公元79年维苏威火山爆发中被碳化,传统手段难以展开阅读。数据集针对VC3D卷宗包(volpkg)结构设计,提供每个卷轴CT体素块的预测纤维方向向量(法向、垂直和水平分量),作为分割流程的输入以精确追踪莎草纸层。该数据集基于纤维骨架数据集训练的3D U-Net生成,目前覆盖Scroll 2至Scroll 5的未读部分,已在相关领域引发关注,为碳化古卷的无损数字化阅读奠定了基础。
当前挑战
该数据集面临的核心挑战是解决碳化古卷中纤维追踪的精确性问题,传统方法因卷轴极度脆弱、内部结构模糊而难以实现分层重建;构建过程中,训练数据仅包含31个手工标注的体素块,样本稀疏且分布不均,导致模型性能有限(平均角度余弦为0.807)。此外,数据集需兼容VC3D复杂的工作目录结构,并处理每个厚达256³体素的深度分块预测,计算资源消耗巨大。未读卷轴的图像预处理、预测方向的尺度适应性以及不同卷轴CT体积的配准一致性,亦构成显著技术障碍。
常用场景
经典使用场景
full-scrolls数据集的核心用途在于为赫库兰尼姆古卷的CT扫描数据提供预测的纤维方向场,以辅助三维纸莎草纸层分割。该数据集基于维苏威挑战赛中建立的VC3D框架,通过小型3D U-Net模型在手工标注的纤维骨架数据上训练,生成每个256x256x256体素立方体的纤维方向向量(法向、垂直、水平分量)。研究人员可将其作为表面生长算法的初始输入,优化纤维方向追踪,从而更精确地分离卷轴中相互粘连的纸莎草层,为后续文本解码提供基础。
解决学术问题
该数据集直接回应了古卷文本修复领域的核心难题——如何从高分辨率CT体数据中自动化识别纸莎草纸的多层纤维结构。传统方法依赖人工逐层标注,效率低且主观性强,难以应对因碳化导致的层间粘连。full-scrolls通过引入数据驱动的纤维方向预测,显著降低了对人工干预的依赖,将分割精度提升至新高度,其平均方向角余弦值达0.807,验证了深度学习在考古材料微结构解析中的可行性。这项成果推动了数字纸莎草学的发展,使那些因火山爆发而毁坏的经典文本(如伊壁鸠鲁学派著作)得以重见天日。
实际应用
在实际考古工作中,full-scrolls已融入维苏威挑战赛的自动化分割流水线。团队可将其预训练纤维方向场直接接入VC3D软件的表面增长工具,实现跨多个卷轴(Scroll2至Scroll5)的批量层析解析。例如,针对尚未阅读的Scroll2和Scroll3,该数据集正作为核心输入参与帕特里·帕里斯奖的竞争,加速完整文本的破解。此外,其zarr格式的瓦片结构便于分布式计算,支持研究者在高性能集群上并行处理,从而在中短期内覆盖更多赫库兰尼姆古卷,为全球数字人文项目提供可复现的基础设施。
数据集最近研究
最新研究方向
该数据集聚焦于维苏威挑战赛(Vesuvius Challenge)中赫库兰尼姆(Herculaneum)古卷的数字化复原与文本解读前沿领域,通过提供基于3D U-Net预测的纤维取向矢量场,为CT体积分割中的纸莎草层追踪提供关键输入。这一方向与近期古典文献数字化研究的突破性事件紧密相连——2023年社区团队已利用类似技术首次完整读取卷轴1(Scroll 1),而本数据集针对尚未解读的卷轴2至卷轴5(Active prize targets)推进预测工作,有望揭示被维苏威火山爆发掩埋的千年智慧。其影响在于为文化遗产保护与古代文本重建提供了高效的计算方法支持,将深度学习与考古学深度融合,推动了用人工智能破译碳化古卷的前沿边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务