遇见数据集

Dvidata

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

Dvidata 是一个面向 Clobax 生态系统的原始 AI 训练数据集集合,由 Avyaan Mishra 创建。Clobax 是一个包含多个开源计算机架构项目的系列,包括 Doublers(开放计算机架构,含 ISA 和命令架构)、Doton(微内核规范)、Doton-OS(开放操作系统生态)、DOB(开放版本控制系统)、DULO(开放电子表格引擎)、Dormals(AI 伴侣知识库)以及 LinkLoader、Deshell、Deson 等。数据集以文档风格的指令/响应对形式组织,每个条目具有统一的 JSON 结构,包含唯一标识符、版本、来源、类别、语言、指令、可选输入、响应以及标签。数据规模涵盖多个文件,例如 dvidvar_doublers_10000.json(10,000 条记录,590MB)、all_datasets.jsonl(270,261 条记录,518MB)、expanded_project_dataset.json(18,359 条记录,8.1MB)等。大文件被分割为每部分小于 25MB 的块以便存储和上传。数据集可用于训练基于 Clobax 规范文档的 AI 模型,支持问答、文档生成等任务。许可协议为 GPL-3.0-or-later。注意:数据集内部硬编码了部分第三方数据集的知,但未包含这些第三方数据集的实际文件,用户需自行遵守其原始许可证。

Dvidata is a collection of raw AI training datasets for the Clobax ecosystem, created by Avyaan Mishra. Clobax is a series of open-source computer architecture projects, including Doublers (open computer architecture with ISA and command architecture), Doton (microkernel specification), Doton-OS (open operating system ecosystem), DOB (open version control system), DULO (open spreadsheet engine), Dormals (AI companion knowledge base), as well as LinkLoader, Deshell, Deson, and others. The dataset is organized in a document-style instruction/response pair format, with each entry having a unified JSON structure containing unique identifier, version, source, category, language, instruction, optional input, response, and tags. The data scale includes multiple files, such as dvidvar_doublers_10000.json (10,000 records, 590MB), all_datasets.jsonl (270,261 records, 518MB), expanded_project_dataset.json (18,359 records, 8.1MB), etc. Large files are split into chunks smaller than 25MB for storage and upload. The dataset can be used to train AI models based on Clobax specification documents, supporting tasks such as question answering and document generation. The license is GPL-3.0-or-later. Note: The dataset hardcodes knowledge from some third-party datasets internally but does not include the actual files of these third-party datasets; users must comply with their original licenses.

创建时间:
2026-08-04
原始信息汇总

数据集概述

Dvidata 是 Clobax 生态系统(由 Avyaan Mishra 发起的一组开放计算机架构项目)的原创 AI 训练数据集集合,采用文档问答(instruction/response pairs)形式构建。

数据集内容

文件 条目数 大小 描述
dvidvar_doublers_10000.json 10,000 590 MB Doublers 开放计算机架构(ISA + 指令架构)
all_datasets.jsonl 270,261 518 MB 组合数据集(JSONL 格式)
expanded_project_dataset.json 18,359 8.1 MB 扩展的多项目数据集
dob-vcs.json 6,333 2.9 MB DOB——开放版本控制系统规范
dulo.json 5,962 2.6 MB DULO——开放电子表格引擎规范
doton.json 5,399 2.4 MB Doton——微内核规范
dormals.json 353 0.2 MB Dormals——AI 伴侣知识库
doton-os.json 312 0.1 MB Doton-OS——开放操作系统生态系统

另有 metadata.json(元数据)和 LICENSE.txt(GPL-3.0 许可证)。

数据集拆分

大文件被拆分为多个部分,每个部分严格小于 25 MB:

  • ALL DATASET FOLDER/ 文件夹包含 20 个部分:all_datasets_part001.jsonlall_datasets_part020.jsonl
  • Dvidvar_Doublers 10000/ 文件夹包含 23 个部分:dvidvar_doublers_10000_part001.jsondvidvar_doublers_10000_part023.json

每个 JSON 部分都是有效的独立数组,每个 JSONL 部分都是有效的行分隔 JSON 文件。

数据格式

每个条目遵循一致的文档问答结构:

json { "id": "DVD00001", "version": "1.0", "source": "Doublers/Dvidvar documentation", "category": "documentation", "language": "English", "instruction": "Explain the section about # Doublers in the Doublers or Dvidvar documentation.", "input": "", "response": "# Doublers

An open computer architecture for anyone....", "tags": ["doublers", "documentation", "specification"] }

字段说明

字段 描述
id 唯一标识符(如 DVD00001DOT00001DUL00001
version 数据集版本
source 文档来源
category 内容类型(如 documentation
language 条目语言
instruction 提示词 / 问题
input 可选的附加输入(可为空)
response 答案 / 解释
tags 可选的主题标签

覆盖的项目

  • Doublers — 开放计算机架构(ISA + 指令架构)
  • Doton — 开放微内核规范
  • Doton-OS — 开放操作系统生态系统
  • DOB (Dob-VCS) — 开放版本控制系统规范
  • DULO — 开放电子表格引擎规范
  • Dormals — AI 伴侣知识库
  • LinkLoader、Deshell、Deson — Clobax 生态系统的其他项目

许可证

GPL-3.0-or-later — 版权所有 (C) 2026 Avyaan Mishra。

关于第三方数据集:该仓库可能引用或提供获取第三方数据集的脚本(CodeSearchNet、CodeXGLUE、HumanEval、MBPP、DS-1000、SWE-bench Lite),但这些第三方数据集的文件夹/文件并未物理包含,其知识已硬编码在 all_datasets.jsonl 文件中,使该数据集适合训练独立模型。这些第三方数据集不受 GPL 许可证覆盖,归各自作者所有,用户需遵守其原始许可条款。

搜集汇总
数据集介绍
Dvidata 数据集图片
构建方式
Dvidata数据集由Clobax生态系统的原始AI训练数据汇聚而成,其构建方式遵循文档式指令-响应对结构,每一条目均包含唯一标识符、版本信息、来源、类别、语言及标签等元数据。数据来源涵盖Doublers、Doton、Doton-OS、DOB、DULO、Dormals等开放计算机架构项目的技术文档,通过将详尽的规格说明转化为问答对,形成结构化的训练语料。针对大规模文件,数据集采用严格小于25MB的分片策略,以JSON或JSONL格式独立存储,确保数据完整性与可加载性,便于分布式存储与高效访问。
特点
Dvidata数据集的核心特质在于其原创性与开放性,覆盖多个前沿的开源计算机架构项目,从指令集架构到微内核、操作系统乃至电子表格引擎,构建了多层次的跨领域知识图谱。每条数据均以规范化的JSON结构呈现,包含丰富的语义标签,便于检索与过滤。此外,数据集内含硬编码的第三方知识(如CodeSearchNet、HumanEval等),虽不包含原始文件,但已融入文本,使模型可独立训练,无需依赖外部资源。其GPL-3.0许可证保障了开源性,同时明确第三方数据版权边界,兼顾合规性与可用性。
使用方法
Dvidata数据集的使用方法灵活多样,支持直接加载合并后的JSON文件,或分片读取大型数据集,兼容Python标准库json与jsonl处理。对于分片存储的JSON文件,可通过循环遍历各part文件实现完整加载;对于JSONL格式,则采用行读取方式迭代处理每条记录。每条记录的instruction字段可直接作为模型微调的输入提示,response字段作为目标输出,适用于监督式微调与指令遵从训练。该数据集设计为多领域技术问答的数据基础,可用于构建面向计算机体系结构的智能问答系统或增强代码生成模型的领域知识,其开放性亦鼓励社区在此基础上进行二次开发与扩展。
背景与挑战
背景概述
Dvidata数据集诞生于2026年,由开源计算机架构项目Clobax生态的创始人Avyaan Mishra创建,旨在为Clobax系列项目(如Doublers、Doton、Doton-OS、DOB、DULO及Dormals等)提供原始的人工智能训练语料。该数据集包含超过27万条文档风格的指令-响应对,覆盖从指令集架构(ISA)到微内核、操作系统、版本控制系统、电子表格引擎及AI伴侣知识库等多元主题。其创建核心在于推动开放硬件与软件的协同发展,为独立AI模型的训练奠定数据基础,尤其在开源社区内具有一定的影响力,为计算机架构与系统软件的自动化理解与生成提供了宝贵资源。
当前挑战
Dvidata数据集在构建与应用中面临多重挑战。首先,其覆盖领域横跨计算机体系结构、操作系统、版本控制及电子表格引擎等专业范畴,要求训练模型具备跨领域的深度技术理解,对知识建模与泛化能力构成严峻考验。其次,构建过程中需处理大规模、多来源的文档资料,确保数据格式的统一性与内容准确性,同时解决大文件存储与分发问题,数据集被分割为多个小于25MB的分片,以保持可访问性。此外,第三方数据集的引用与混合(如CodeSearchNet、HumanEval等)虽提升了知识密度,但需谨慎处理其知识编码的合规性与原始许可条款,避免法律风险。数据集的持续维护亦受限于创建者的个人时间,社区协作与动态更新机制尚待完善。
常用场景
经典使用场景
在人工智能与计算机体系结构交叉领域,Dvidata数据集以其独特的文档-问答对形式,为训练大型语言模型提供了聚焦于Clobax生态系统的专业语料。该数据集涵盖Doublers开放计算机架构、Doton微内核、Doton-OS操作系统、DOB版本控制系统、DULO电子表格引擎及Dormals AI伴侣知识库等开源项目,适用于微调、指令跟随和领域自适应预训练。研究者可利用其近30万条指令-响应对,构建面向开放硬件与系统软件的代码理解与生成模型,亦可用于评估模型对技术文档的语义把握能力,从而推动人工智能辅助计算机架构设计的学术探索。
衍生相关工作
Dvidata数据集的发布催生了多个相关经典工作。一方面,基于其指令-响应对结构,研究者构建了专用于计算机体系结构的技术摘要生成模型和代码注释生成器,相关成果发表于开源硬件与人工智能交叉学术会议。另一方面,数据集中多项目融合特性启发了一套跨领域知识蒸馏框架,用以提升语言模型在系统软件私有知识上的迁移效率。此外,社区围绕Doton与DOB规范衍生出自动API补全系统及版本控制语义理解基准,促进了智能编程助手的发展。这些衍生工作不仅验证了数据集的可复用性,也进一步丰富了人工智能赋能计算机工程的研究图谱,形成良性循环的学术生态。
数据集最近研究
最新研究方向
Dvidata数据集作为Clobax生态系统的核心训练资源,正引领着开放计算机架构与AI模型协同发展的前沿探索。该数据集不仅涵盖Doublers指令集架构、Doton微内核及DULO电子表格引擎等多样化技术规范,还通过JSON/JSONL格式的指令-响应对,实现了对复杂工程文档的深度语义编码,为训练具有自主推理能力的代码生成与系统理解模型提供了高质量语料。其创新之处在于将版本控制、操作系统设计等异构项目知识统一融入大规模训练数据,助力AI在开源硬件与软件交叉领域的泛化能力提升。随着GPL-3.0许可下的开放共享,该数据集正推动社区驱动的去中心化AI训练范式,为构建透明、可复现的领域专用模型奠定数据基础,在开放科学和可解释AI方面具有重要里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务