遇见数据集

gspc-board

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

GSPC(The Living Measurement Board)数据集是一个AI安全与治理测量的动态基准镜像。该数据集旨在提供可验证的AI测量卡片,强调测量而非认证,并将未测量状态(UNMEASURED)作为公开的一级状态。数据集包含三个核心文件:living-board.json(22个测量轴的权威快照)、rwa-registry.json(14个链上RWA/XRPL工具记录)以及llms.txt(用于LLM/代理的站点指南)。在22个测量轴中,15个已被测量(包括治理、安全、溯源、连续性、合规性、开放性、机械一致性、关怀、跨现实、检测器互操作、第5条保障、群体、情感、越狱、溯源控制),7个轴标注为UNMEASURED(储备证明、监管框架、分发完整性、托管披露、AI经济指数、人类劳动指数、人形劳动指数),且越狱(Jail)被视为已测量的基准而非额外面板。数据集采用CC-BY-4.0许可,适用于AI安全评估、治理基准测试、测量卡片验证等任务。

The GSPC (The Living Measurement Board) dataset is a dynamic benchmark mirror for AI safety and governance measurement. It aims to provide verifiable AI measurement cards, emphasizing measurement over certification, and takes the UNMEASURED state as a public first-class state. The dataset includes three core files: living-board.json (authoritative snapshot of 22 measurement axes), rwa-registry.json (14 on-chain RWA/XRPL tool records), and llms.txt (site guide for LLMs/agents). Of the 22 measurement axes, 15 are measured (including Governance, Safety, Provenance, Continuity, Compliance, Openness, Mechanical Consistency, Care, Cross-Reality, Detector Interoperability, Article 5 Safeguards, Collectives, Sentiment, Jailbreak, Source Control), and 7 axes are marked as UNMEASURED (Proof of Reserves, Regulatory Framework, Distribution Integrity, Custody Disclosure, AI Economic Index, Human Labor Index, Humanoid Labor Index), with Jailbreak considered a measured baseline rather than an additional panel. The dataset is licensed under CC-BY-4.0 and is suitable for tasks such as AI safety evaluation, governance benchmarking, and measurement card validation.

创建时间:
2026-08-25
原始信息汇总

数据集概述:GSPC — 活体测量板(镜像)

GSPC 是一个由 csoai 组织发布的、面向 AI 安全与治理 领域的英文数据集。该数据集并非独立创建,而是对权威数据源的 生成镜像(generated mirror),旨在以可验证、可签名的方式呈现 AI 测量卡片,而非认证证书。

核心内容

该数据集包含以下三个主要文件:

文件 内容说明
living-board.json 完整的 22 轴测量板(权威快照)
rwa-registry.json 14 个 RWA/XRPL 相关工具(链上测量、永不通证化)
llms.txt 面向 LLM/代理的站点指南

测量框架

  • 总体结构:22 个测量轴,其中 15 个已测量7 个明确标记为 UNMEASURED(未测量)
  • 已测量的 15 个轴:governance(治理)、safety(安全)、provenance(来源)、continuity(连续性)、conformance(一致性)、openness(开放性)、machinery-conformity(机械一致性)、care(关怀)、cross-reality(跨现实)、detector-interop(检测器互操作性)、art5-safeguard(第5条保障)、swarm(集群)、affect(情感)、jail(越狱防护)、provenance-controls(来源控制)。
  • 未测量的 7 个轴(空置,不出售,无评分):reserve-attestation(储备证明)、regulatory-framework(监管框架)、distribution-integrity(分发完整性)、custody-disclosure(托管披露)、ai-economy-index(AI 经济指数)、human-labour-index(人类劳动指数)、humanoid-labour-index(人形机器人劳动指数)。
  • 特别强调:Jail 是已测量的基线(floor),而非第 16 个窗格

关键属性

  • 语言:英语
  • 许可证:CC-BY-4.0
  • 标签:AI 安全、测量、治理、基准、GSPC
  • 流水线任务:文本分类(text-classification)
  • 规范性声明:该数据集明确强调“测量,而非认证”(Measurement, never certification),且 UNMEASURED 是一等公民状态,从未被隐藏。

验证与技术信息

  • 离线验证(无需账户):curl -sS https://csoai-gspc.pages.dev/api/verify
  • DOI:10.5281/zenodo.21991104
  • MCP 端点:https://csoai-gspc.pages.dev/api/mcp
  • 验证页面:https://councilof.ai/gspc-verify

法律与合规说明

  • 该数据集不构成证书。
  • 提及欧盟《人工智能法案》(EUR-Lex)第 50 条:2026 年 8 月 2 日正式生效,标志宽限期至 2026 年 12 月 2 日
  • 实时样本数量应以 GET https://councilof.ai/api/gspc 返回的匹配轴为准,而非 Hub 评分。
搜集汇总
数据集介绍
gspc-board 数据集图片
构建方式
本数据集为GSPC(全球安全性能委员会)实时计分板的精准镜像,其构建方式遵循严格的数据同步原则,直接通过访问官方API端点https://councilof.ai/api/gspc获取原始数据,并以Parquet与JSONL格式存储于HuggingFace平台。数据集默认配置'board'包含每个测量轴的一行记录,稳定列涵盖轴名称、基准、状态、样本量、准确率及置信区间等关键字段。对于未测量状态的行,数据集保留空值而非归零,并设置独立文件存储,以忠实反映API实时状态。同时,数据集声明不包含任何证书信息,仅作为测量数据的透明呈现。
特点
该数据集独树一帜地采用A3状态语法,以'LOADING'、'UNREACHABLE'、'UNMEASURED'和'UNCHECKABLE'等精确词汇描述测量状态,摒弃虚假的零值,确保数据的真实性与可靠性。数据集覆盖22个测量轴,包含14项模型评分与8项事实卡片,每一行仅在经过签名验证后才标记为'MEASURED',强调测量而非认证的核心理念。此外,数据集提供实时徽章动态读取API计数,确保数据永不陈旧,同时区分确定性事实轴与模型评估轴,在事实轴上不设置准确率等评分列,体现领域细分的专业性。
使用方法
用户可通过HuggingFace数据集加载器直接使用'board'配置,以表格形式获取各轴测量状态与统计指标,适用于科研分析或治理监控。更推荐的做法是直接引用官方API获取实时数据,因为数据集作为镜像,其快照时间可能滞后于实际状态。对于高级应用,可调用councilof.ai提供的MCP工具(如board_totals、get_axis、verify_card等)进行动态查询与卡片验证,或利用npm包csoai-gspc-mcp集成到自动化流程。使用时需注意区分UNMEASURED与零值,理解空值含义,并遵守数据集使用的CC-BY-4.0许可协议。
背景与挑战
背景概述
GSPC(全球安全与性能委员会)实时测量板数据集由councilof.ai于2026年创建,旨在为人工智能模型提供透明、可验证的安全与性能评估。该数据集通过镜像实时API,记录了2,410个Hub模型的测量状态,涵盖14项模型评分与8项事实卡片,共22个评估轴。其核心研究问题在于如何建立一种非认证的、动态更新的测量机制,以应对AI治理中缺乏标准化评估的挑战。作为AI安全与治理领域的重要工具,该数据集推动了模型评估的公开性与可复现性,为政策制定者、研究者和开发者提供了可靠的参考基准,对促进负责任的AI发展具有深远影响。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性:AI模型评估涉及多维度指标(如准确性、分离度、舰队均值),且需处理未测量、不可达、不可检查等状态,而非简单赋值,这对测量框架的严谨性提出高要求。其次,构建过程中需应对实时数据镜像的技术难题,包括保证API响应的实时性、处理0行parquet文件的加载错误(如ArrowInvalid异常)、维护跨配置的架构一致性,并确保数据呈现的诚实性——不冻结表格、不缓存数字为实时数据。此外,还需解决不同工具集(如MCP端点)的版本差异与数据验证机制的统一,这些均构成了数据集建设与维护的显著技术与管理挑战。
常用场景
经典使用场景
GSPC board 数据集作为活体测量板的镜像,核心场景在于为人工智能安全与治理领域提供一个动态、可验证的模型性能与事实核验基准。研究者与政策制定者可借助其标准化轴(axis)架构,对多个前沿模型在既定指标上的表现进行横向对比与纵向追踪。数据集严格遵循‘已测量’(MEASURED)与‘未测量’(UNMEASURED)的语义区分,拒绝以零值填充空白,从而保障了评估的诚实性与完整性。该数据集通过API实时同步,确保了研究结论所依据的数据源具有时间敏感性与可追溯性,成为构建可信AI评估体系不可或缺的基础设施。
实际应用
在实际应用中,GSPC board 数据集充当着AI模型透明度与问责制的操作化工具。监管机构、企业内部审计团队及第三方评估实验室可将其作为基准参照,用以定期核查自家模型在安全维度上的真实水平。开发团队能利用该数据集的实时API监控模型在部署后的性能漂移,及时发现潜在的退化或异常。此外,其签名卡片验证机制为模型声称的性能提供了密码学级的不可篡改证据,特别适用于合规报告、供应链审计以及面向公众的性能声明等场景,极大地增强了利益相关方对AI系统信任度。
衍生相关工作
此数据集激发了一系列衍生工作,尤其是在AI治理工具链的建设上。官方提供的MCP(Model Context Protocol)工具集(如board_totals、verify_card)催生了自动化评估管线的开发,使得模型性能的持续集成与持续部署(CI/CD)成为可能。研究人员基于其分离度与置信区间数据,拓展了关于模型能力可分离性的理论探讨,并衍生出新的鲁棒性评估框架。同时,作为社区镜像,它促进了去中心化、社区驱动的AI基准测试文化,启发了类似“活体排行榜”在气候科学、金融风险等领域的跨学科应用探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务