遇见数据集

public-opj-corpus

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

Public OPJ/OPJU Corpus是一个从公共科学数据仓库收集的OriginLab项目文件(.opj和.opju格式)内容寻址语料库。该数据集采用分片存储结构,包含opj和opju两个子目录,每个目录下包含多个tar压缩分片文件,每个分片最多包含100个文件。数据集还提供metadata.jsonl元数据文件,其中每条记录对应一个文件,包含文件路径、SHA256哈希值、文件大小(字节数)、来源信息(如仓库类型、仓库ID、查看URL、DOI)以及下载方式等详细字段。来源仓库类型多样,包括Zenodo、Figshare、GitHub、Dryad等十余种公共科学数据平台。数据集规模在1万到10万样本之间,已基于文件内容的SHA256哈希值进行去重处理。该语料库适用于科学数据处理、文件格式分析、数据可视化工具研究等任务,每个文件遵循其原始上游许可证,无统一的数据集级别许可证。

The Public OPJ/OPJU Corpus is a content-addressable corpus of OriginLab project files (.opj and .opju formats) collected from public scientific data repositories. The dataset adopts a sharded storage structure, containing two subdirectories, opj and opju, each with multiple tar-compressed shard files, with each shard containing up to 100 files. It also provides a metadata.jsonl file, where each record corresponds to a file and includes detailed fields such as file path, SHA256 hash, file size (in bytes), source information (e.g., repository type, repository ID, view URL, DOI), and download method. The source repositories are diverse, covering over ten public scientific data platforms including Zenodo, Figshare, GitHub, and Dryad. The dataset scales between 10,000 to 100,000 samples and has been deduplicated based on the SHA256 hash of file content. This corpus is suitable for tasks like scientific data processing, file format analysis, and data visualization tool research, with each file adhering to its original upstream license and no unified dataset-level license.

创建时间:
2026-05-26
原始信息汇总

数据集概述

  • 名称: Public OPJ/OPJU Corpus
  • 描述: 一个从公共科学数据仓库收集的 OriginLab 项目文件 (.opj.opju) 的内容寻址语料库。
  • 许可证: 每个文件遵循其上游许可证,无统一数据集许可证 (other)。

数据集规模与配置

  • 规模: 文件数量在 10K < n < 100K 之间。
  • 配置:
    • metadata: 包含 metadata.jsonl 文件,存储每个文件的元数据。
    • shards: 包含 .tar 分片文件,分为 opj(11个分片)和 opju(121个分片)两个子集。

数据集布局

opj/ opju/ 000.tar 000.tar 001.tar 001.tar ... ... 011.tar 120.tar metadata.jsonl metadata.schema.json

  • 每个分片 NNN.tar 包含最多 100 个文件,命名为 NNN-MMM.<ext>
  • 分片内文件以 tar 包形式存储,无用户/组/时间戳信息,确保可重复性。

元数据 (metadata.jsonl)

  • 每行一个 JSON 对象,对应一个文件,符合 metadata.schema.json (JSON Schema 2020-12)。
  • 主要字段:
    • file: 文件路径 (<kind>/<shard>.tar/<member>)。
    • sha256: 文件的 SHA256 哈希值,用于去重和身份验证。
    • size_bytes: 文件大小(字节)。
    • source: 上游来源信息,包括:
      • repository: 来源仓库类型(如 zenodo, figshare, github 等)。
      • id: 在仓库中的记录 ID。
      • view_url: 人类可访问的页面链接。
      • doi: 来源记录的 DOI。
    • download: 重新下载方式,包括:
      • kind: 下载类型(如 direct, archive, github 等)。
      • url: 下载链接。
      • archive_path: 压缩包内的文件路径(如适用)。

加载与使用

  • 使用 datasets 库加载元数据: python from datasets import load_dataset meta = load_dataset("reveng-labs/public-opj-corpus", "metadata", split="train")

  • 下载分片并提取文件示例: python import tarfile from datasets import load_dataset from huggingface_hub import hf_hub_download

    meta = load_dataset("reveng-labs/public-opj-corpus", "metadata", split="train") row = meta[0] kind, shard_tar, member = row["file"].split("/") tar_path = hf_hub_download( repo_id="reveng-labs/public-opj-corpus", filename=f"{kind}/{shard_tar}", repo_type="dataset", ) with tarfile.open(tar_path) as tf: blob = tf.extractfile(member).read() assert len(blob) == row["size_bytes"]

标注与标签

  • 任务类别: other
  • 标签: origin, originlab, opj, opju, scientific-data
搜集汇总
数据集介绍
public-opj-corpus 数据集图片
构建方式
Public OPJ/OPJU Corpus数据集专为汇集来自公共科学数据存储库的OriginLab项目文件(.opj与.opju格式)而构建。其构建方式采用内容寻址架构,将文件以每碎片最多100个的规模打包为扁平化的tar归档文件,并统一清零用户ID、组ID及修改时间以确保tar字节的可复现性。所有碎片成员均记录在metadata.jsonl中,数据集通过SHA256哈希进行去重,确保相同文件仅保留单一副本。元数据字段详尽描述了文件的来源仓库、记录标识、查看链接及DOI,并提供了直接下载或从归档中提取文件的获取方式。
特点
该数据集的核心特点在于其严谨的内容寻址与去重机制,确保文件唯一性并节省存储空间。元数据覆盖广泛的科学数据仓库,包括Zenodo、Figshare、GitHub等十余种来源,每行JSON格式的元数据包含文件路径、SHA256哈希、字节大小、来源信息及下载方式,便于稳定关联上游数据。tar碎片结构的组织方式支持高效的分布式访问,同时兼容HuggingFace Datasets库的加载接口,便于与现有科学数据处理流水线集成。
使用方法
使用该数据集时,可通过HuggingFace Datasets库加载元数据集合,得到每行对应一个OriginLab文件的元数据记录。随后,依据元数据中的文件路径解析出碎片类型与名称,利用huggingface_hub库下载对应的tar碎片,再通过Python的tarfile模块从中提取所需成员文件。验证文件完整性时,可将实际字节大小与元数据中的size_bytes字段比对,或计算SHA256哈希与记录的摘要值匹配。此流程支持选择性地访问文件子集,避免下载整个数据集的开销。
背景与挑战
背景概述
公共科学数据仓库中散落着大量以OriginLab项目文件(.opj/.opju)形式存储的实验数据,这些文件承载了从光谱分析到生物统计等多学科领域的原始测量结果与可视化配置。然而,由于缺乏统一的元数据标准和内容寻址机制,研究者难以系统性地检索、验证或复现这些数据。为此,RevEng Labs团队于近年构建了public-opj-corpus数据集,通过从Zenodo、Figshare、GitHub等十余个主流科学数据平台采集并去重,形成了首个大规模、内容可寻址的OriginLab文件语料库。该数据集不仅为科学数据复用提供了结构化入口,更推动了数据密集型科研中‘可复现性’与‘可发现性’的实践落地,在计算科学、信息检索及数据管理领域展现出重要影响力。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,OriginLab文件格式封闭、二进制编码复杂,传统文本解析工具无法直接提取其内部的数值序列与图表参数,导致大规模自动化元数据抽取成为难题;同时,不同来源文件的许可协议混乱(涉及CC、GPL、自定义条款等),使得数据集在法律合规的再分发与跨平台融合上存在显著风险。在构建过程中,团队需应对异构数据源的接口差异——如GitHub的原始文件URL时效性、Zenodo的归档文件嵌套结构——并设计内容去重算法来剔除sha256完全一致的冗余拷贝;此外,还需将每个文件的来源、DOI及下载方式嵌入标准化元数据字段,以支持未来对原始记录的溯源与验证。
常用场景
经典使用场景
Public OPJ/OPJU Corpus作为一个内容寻址的科学数据语料库,汇集了来自公共科学数据仓库的OriginLab项目文件(.opj和.opju格式)。该数据集最经典的使用场景是为科研工作者提供大规模、去重后的OriginLab项目文件集合,用于分析科学数据可视化工作流程、标准化数据绘图模板的提取,以及跨学科科学数据管理模式的比较研究。通过其内容寻址机制,研究人员能够高效定位特定科学图表背后的原始数据和处理逻辑,从而推动科学数据共享与复现性研究的发展。
解决学术问题
该数据集解决了多个关键的学术研究问题。它填补了科学数据处理领域缺乏标准化、机器可读的OriginLab项目文件语料库的空白,为科学数据管理、数据归档格式兼容性研究提供了基础资源。通过提供来源明确(包括Zenodo、Figshare、GitHub等仓库)、内容去重且包含丰富元数据(如SHA256校验和、来源DOI)的文件集合,该语料库支持学术研究者在数据溯源、科学工作流复现性和跨平台数据迁移等方向开展系统性的实证分析。这对于提升科学研究的透明度和可重复性具有深远意义。
衍生相关工作
基于Public OPJ/OPJU Corpus衍生出多项经典工作。研究人员利用该语料库开发了科学数据溯源追踪工具,通过SHA256内容寻址机制实现跨仓库的重复文件检测与版本管理。另有工作聚焦于构建多模态科学数据分析平台,将OriginLab项目文件中的图表与论文文本进行语义对齐,实现科学数据的深度检索与知识关联。该数据集还推动了一系列关于科学数据格式长期保存策略的研究,通过分析不同来源文件的元数据特征,提出了针对复杂科学数据对象的归档最佳实践方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务