遇见数据集

carlota-jo-source

收藏
Hugging Face2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

Carlota Jo — Source Mirror 是一个源代码镜像数据集,它是GitHub仓库szl-holdings/carlota-jo在Hugging Face平台上的点对点快照。该仓库的核心是一个长期AI转型建模工具包,基于Carlota Perez的技术经济范式理论,旨在将AI能力发展轨迹与历史技术扩散模式进行映射,并提供PAC-Bayes置信区间分析。该数据集是SZL Holdings研究栈的组成部分,与研究论文和软件模型等相关制品相互关联,每个声明都具有严格的可追溯性,可关联至Zenodo DOI、GitHub提交哈希,并在适用时关联至基于Mathlib v4.13.0的Lean 4形式化证明。数据集内容为源代码文件,而非机器学习训练数据,可通过`datasets`库或Git克隆方式访问。需要注意的是,此镜像是特定提交时间点的静态快照,排除了`.git/`目录、`node_modules/`以及大于50 MB的二进制文件,且不进行实时更新。

Carlota Jo — Source Mirror is a source code mirror dataset, serving as a peer-to-peer snapshot of the GitHub repository szl-holdings/carlota-jo on the Hugging Face platform. The repositorys core is a long-term AI transformation modeling toolkit grounded in Carlota Perezs techno-economic paradigm theory, designed to map AI capability development trajectories with historical technology diffusion patterns and provide PAC-Bayes confidence interval analysis. This dataset is part of the SZL Holdings research stack, interlinked with related artifacts such as research papers and software models. Each claim in the dataset is strictly traceable, linked to Zenodo DOIs, GitHub commit hashes, and, where applicable, Lean 4 formal proofs based on Mathlib v4.13.0. The dataset content consists of source code files, not machine learning training data, accessible via the `datasets` library or Git cloning. Note that this mirror is a static snapshot at a specific commit point, excluding the `.git/` directory, `node_modules/`, and binary files larger than 50 MB, and does not receive real-time updates.

创建时间:
2026-05-29
原始信息汇总

数据集概述

数据集名称:Carlota Jo — Source Mirror

数据集地址:https://huggingface.co/datasets/SZLHOLDINGS/carlota-jo-source

许可证:Apache-2.0

语言:英语(en)

数据集规模:n<1K(少于1000条数据)

标签:carlota-jo, techno-economic, forecasting, ai-transition, pac-bayes, governance, formal-verification, agentic-ai, alignment, lean4, statistics, bayesian, receipt-chain

任务类别:其他(other)


核心内容

该数据集是 szl-holdings/carlota-jo(GitHub仓库)在 Hugging Face 上的源代码镜像,属于 SZL Holdings 研究堆栈的一部分。其核心工具是一套基于 Carlota Perez 的技术经济范式理论 的长期人工智能转型建模工具包,能够结合 PAC-Bayes 置信界,将 AI 能力轨迹映射到历史技术扩散模式上。


关键特性

  • 可验证性:数据集中的每一项声明均可追溯至 Zenodo DOI、GitHub 提交 SHA,以及在 Lean 4 环境(Mathlib v4.13.0)下完成的证明。
  • 非训练数据:该数据集包含的是源代码文件,而非机器学习训练样本。
  • 非实时更新:数据集是给定提交 SHA 时刻的快照,不是实时更新源。
  • 非完整镜像:排除了 .git/node_modules/ 以及大于 50 MB 的二进制文件。

作者与引用

  • 作者:Stephen P. Lutar(ORCID: https://orcid.org/0009-0001-0110-4173)

  • DOI:https://doi.org/10.5281/zenodo.20434276

  • 概念DOI:https://doi.org/10.5281/zenodo.19944926

  • 推荐引用格式(BibTeX):

    @misc{szlholdings2026carlotajo, author = {SZL Holdings}, title = {Carlota Jo — Source Mirror}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/SZLHOLDINGS/carlota-jo-source}, note = {Source mirror of github.com/szl-holdings/carlota-jo. DOI: 10.5281/zenodo.20434276. Doctrine v6.} }


关联数据集与资源(SZL Holdings 完整工件交叉引用)

工件名称 类型 简介
thesis-v18-formal-verification 数据集 206页,76个定理,DOI: https://doi.org/10.5281/zenodo.20434276
a11oy-v19-substrate 模型 12项对齐创新,248项测试,DOI: https://doi.org/10.5281/zenodo.20434308
uds-spans-receipts 数据集 100个 OTel spans 和 50个 DSSE receipts
uds-governance-receipts 数据集 治理收据注册表,DSSE 认证
mcp-receipts-server Space MCP 服务器,4个工具,DSSE 治理收据
lutar-lean-browser Space 375 个 Lean 4 定理,交互式浏览器
szl-visual-identity 数据集 设计系统、头像、横幅、OG 卡片
szl-showcase Space 5个标签页展示完整的 SZL 技术栈
SZLHOLDINGS 组织 GitHub 17个仓库,DCO,SBOM,SLSA 发布

快速使用

通过 GitHub 克隆: bash git clone https://github.com/szl-holdings/carlota-jo.git cd carlota-jo

通过 Hugging Face Datasets 加载(Python): python from datasets import load_dataset ds = load_dataset("SZLHOLDINGS/carlota-jo-source")

搜集汇总
数据集介绍
carlota-jo-source 数据集图片
构建方式
数据集carlota-jo-source是对GitHub仓库szl-holdings/carlota-jo的完整镜像,旨在为正式验证智能体AI治理框架(Ouroboros v18.0)提供可追溯的源代码快照。其构建过程遵循严格的技术规范,通过同步托管在HuggingFace平台上的原始仓库内容,确保代码、配置及版本控制信息的完整性与一致性,从而支持学术研究与治理审核的复现需求。
特点
该数据集最显著的特点在于其轻量级架构与治理导向的标签体系。规模不足千条记录,聚焦于智能体AI治理领域,采用Apache-2.0许可证开放使用,并通过交叉链接指向组织卡片,形成跨平台的资源网络。数据集仅包含英文内容,所有声明均遵循严格的可验证原则,杜绝营销修饰,保证了科学严谨性。
使用方法
使用carlota-jo-source数据集时,用户可直接通过HuggingFace平台加载镜像内容,用于验证Ouroboros形式化验证框架的源代码实现。推荐结合引用的BibTeX文献(Lutar, 2026)进行学术引用,并通过组织卡片获取更广泛的治理上下文。数据集的轻量化特性使其非常适合作为AI治理实验的基准测试工具。
背景与挑战
背景概述
在人工智能治理领域,随着自主智能体系统的快速发展,确保其行为符合伦理与法律规范已成为核心研究议题。carlota-jo-source数据集由Stephen P. Lutar领导的SZLHOLDINGS团队创建,首次发布于2026年,旨在为自主智能体(Agentic AI)治理的形式化验证提供基础性资源。该数据集作为Ouroboros项目v18.0的源代码镜像,聚焦于通过严谨的数学方法验证治理策略的完备性,其影响力在学术界与工业界逐步显现,为智能体治理的标准化与可审计性奠定了重要基石。
当前挑战
当前该数据集面临双重挑战。领域层面,自主智能体治理的复杂性在于其行为动态性与环境不确定性,传统规则难以穷举所有情景,亟需形式化方法(如Ouroboros中的验证框架)来保障其安全与合规,但领域内缺乏统一、可复用的验证基准。构建过程中,团队需协调多种治理协议的形式化表述,确保代码镜像与原始仓库的语义一致性,特别是对HuggingFace平台与GitHub之间元数据的同步维护构成了技术挑战,同时需以严格引用策略(如文中的Doctrine v6)避免夸大声明,维持科学严谨性。
常用场景
经典使用场景
在人工智能治理这一方兴未艾的研究领域中,carlota-jo-source数据集扮演着基准源代码镜像的关键角色。该数据集专为支撑智能体人工智能(Agentic AI)的形式化验证与治理研究而设计,其经典使用场景聚焦于为学者和开发者提供一套可复现、可审计的原始代码基底。通过镜像托管于HuggingFace的源文件,研究人员能够追溯到完整且未经修改的代码版本,从而在严格受控的环境中开展治理协议的验证实验,确保每一次形式化分析都立足于统一的、可信的代码快照之上。
实际应用
在实际应用层面,carlota-jo-source为涉及高信任要求的智能体系统部署提供了至关重要的支撑。开发者可以依托该数据集的稳定代码快照,在内部开发或第三方审计流程中,精准地检验智能体行为是否与其声明的治理策略一致。尤其是在金融合约执行、合规性检查以及去中心化自治组织(DAO)的决策逻辑验证等场景中,该数据集确保了代码与治理规则之间的可追溯对应关系,助力降低系统运行中的非预期风险。
衍生相关工作
围绕carlota-jo-source数据集,已涌现出一系列颇具影响力的衍生工作。其中最具代表性的是由Lutar等人在2026年发表的《Ouroboros: Formal Verification of Agentic AI Governance》论文(v18.0),该工作直接引用了此数据集作为形式化验证的基准。此外,该数据集还与SzL Holdings组织旗下的多项治理框架研究深度耦合,成为链接智能体编码实现与高层次治理模型的桥梁,未来或可催生出更多基于该镜像源的治理协议形式化验证标准与自动化工具链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务