遇见数据集

gspc-leaderboard-results

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

该数据集名为gspc-leaderboard-results,由Council of AI发布,采用CC-BY-4.0许可证。它是一个测量银行,旨在提供人工智能系统在多个维度上的测量结果,而非认证。数据集包含22个测量轴,其中15个维度已获得实际测量值,包括:治理、安全性、来源、连续性、合规性、开放性、机械一致性、关怀、跨现实、检测器互操作性、第五条保障、群体、情感、越狱和来源控制。另外7个维度未测量(为空),包括:保留证明、监管框架、分发完整性、托管披露、AI经济指数、人类劳动指数和类人劳动指数。数据集可用于评估、比较和审计人工智能系统在治理、安全、合规等方面的表现,适用于AI治理研究、合规性分析、安全性评估等任务。

The dataset is named gspc-leaderboard-results, released by the Council of AI under the CC-BY-4.0 license. It is a measurement bank designed to provide measurement results of AI systems across multiple dimensions, not certification. The dataset contains 22 measurement axes, of which 15 dimensions have actual measurements, including: governance, safety, provenance, continuity, conformance, openness, machinery-conformity, care, cross-reality, detector-interop, art5-safeguard, swarm, affect, jail, and provenance-controls. The other 7 dimensions are unmeasured (empty), including: reserve-attestation, regulatory-framework, distribution-integrity, custody-disclosure, ai-economy-index, human-labour-index, and humanoid-labour-index. The dataset can be used to evaluate, compare, and audit AI systems in terms of governance, safety, compliance, etc., suitable for tasks such as AI governance research, compliance analysis, and safety assessment.

创建时间:
2026-08-25
原始信息汇总

GSPC 排行榜结果数据集

数据集概述

gspc-leaderboard-results 是 Council of AI 提供的测量数据库,专注于对 AI 系统进行多维度测量,而非认证。

测量维度

该数据集包含 22 个测量轴,分为以下两类:

已测量维度(15 项)

  • 治理类:governance(治理)、safety(安全)、provenance(溯源)、continuity(连续性)、conformance(合规性)、openness(开放性)
  • 合规类:machinery-conformity(机器一致性)、care(关怀)、cross-reality(跨现实)、detector-interop(检测器互操作性)、art5-safeguard(第5条保障)
  • 行为类:swarm(群体行为)、affect(情感影响)、jail(越狱防护)、provenance-controls(溯源控制)

未测量维度(7 项)

以下维度当前为空,未提供评分,且不可出售:

  • reserve-attestation(保留证明)
  • regulatory-framework(监管框架)
  • distribution-integrity(分发完整性)
  • custody-disclosure(托管披露)
  • ai-economy-index(AI经济指数)
  • human-labour-index(人类劳动指数)
  • humanoid-labour-index(人形劳动指数)

重要说明

  • Jail(越狱防护) 是一个已测量的基线维度,不属于第 16 个面板。
  • 数据可通过 GET https://councilof.ai/api/gspc 获取。
  • 验证功能可通过 https://councilof.ai/gspc-verify 使用。
  • 数据集采用 CC-BY-4.0 许可证。
搜集汇总
数据集介绍
gspc-leaderboard-results 数据集图片
构建方式
该数据集源自Council of AI的GSPC实时记分板,通过API端点https://councilof.ai/api/gspc收集数据,覆盖22个测量轴,其中15个轴进行量化评分,8个轴作为确定性事实记录。数据集的构建秉承'测量而非认证'的核心理念,避免伪造零值,仅记录真实测量结果。每个条目附带状态标识(如LOADING、UNREACHABLE等),确保数据的透明性和可追溯性。此外,数据集通过MCP工具和npm包提供访问接口,支持自动化和手动验证。
特点
数据集的核心特点在于其多维度的评估体系,涵盖治理、安全、来源、连续性、合规性、开放性等多个关键领域,并深入至跨现实交互、探测器互操作性等前沿议题。特别的是,数据集将‘越狱’作为测量下限而非评分项,体现了严谨的测量伦理。所有数据均来自实时测量,杜绝虚构数值,且提供免费验证服务,保障了结果的可靠性。这种设计使数据集不仅反映现状,更可作为行业基准,推动AI治理的标准化进程。
使用方法
使用时,用户可通过GET请求访问API获取实时数据,或利用数据集的CSV快照进行离线分析。数据集预设了丰富的测量轴,适用于研究、政策制定和产品合规评估。开发人员可集成MCP工具(csoai-gspc-mcp@0.1.0)以编程方式查询,简化流程。建议结合验证链接(councilof.ai/gspc-verify)对具体结果进行复核,以确保数据的完整性。对于非专业用户,数据集提供了友好的交互界面,便于快速获取关键指标。
背景与挑战
背景概述
gspc-leaderboard-results数据集由Council of AI于近期创建,旨在系统化度量通用智能体(GSPC)的合规性与安全性。该数据集作为CSOAI目录工件,并非直接测量结果,而是为实时GSPC排行榜提供结构化存储与验证支持。核心研究问题在于构建一套涵盖22个轴的多维评估框架,以量化智能体在治理、安全、溯源、连续性、一致性、开放性等关键维度的表现。其影响力体现在为AI系统提供了可重复、可审计的度量标准,区别于传统的认证体系,强调测量而非认证,推动了AI评估领域的标准化进程。该数据集通过免费验证接口和MCP工具,促进了社区参与和透明度,成为AI治理研究的重要参考。
当前挑战
该数据集面临的挑战首先在于领域问题:GSPC度量需涵盖从治理、安全到跨现实、群体智能等22个复杂轴,确保全面性与准确性,同时避免虚假测量(如从未使用伪造的0.000),并处理不可达或不可检查的状态。其次,构建过程中的挑战包括:整合多个确定性事实轴(如储备证明、监管框架、分发完整性)与评分轴,确保数据采集的一致性;设计可互操作的检测器接口与防护措施,以应对对抗性攻击;以及维护实时更新的排行榜同时保证数据完整性。此外,数据集需平衡维度覆盖的广度与测量深度,避免过度简化,并确保所有度量结果均可验证,从而建立信任。
常用场景
经典使用场景
gspc-leaderboard-results作为CSOAI目录体系中的关键构件,并非直接的评测榜单,而是为全球人工智能治理与安全评估提供了一套结构化、可验证的测量基准库。其最经典的使用场景在于研究者与监管机构通过调用实时API(GET https://councilof.ai/api/gspc),获取涵盖治理、安全、溯源、连续性、一致性等22个维度的量化度量结果,从而对各类AI系统进行标准化、可复现的横向比较与纵向追踪,为多维度的能力评估奠定数据基础。
实际应用
在实际应用中,该数据集主要服务于AI治理实践、合规审计与风险监测。政策制定者、企业合规部门以及第三方审计机构可以借助其公开的测量数据,快速掌握不同AI产品或服务的治理成熟度与安全基线,从而辅助决策。此外,数据集提供的验证接口(gspc-verify)允许免费核查特定模型的测量卡片,为供应链尽职调查、采购评估以及行业自律提供了客观依据,促进了从理论评估到现实监管的有效落地。
衍生相关工作
基于此测量库,衍生出了一系列具有影响力的相关工作和工具。官方提供了完整的MCP服务器(POST https://councilof.ai/mcp)与npm包(csoai-gspc-mcp@0.1.0),封装了七种或四种交互工具,极大地方便了开发者将GSPC测量能力集成到现有工作流中。此外,状态词(如LOADING、UNREACHABLE)的设计催生了关于测量可靠性与数据质量控制的研究,而‘Jail是测量下限’的概念则引发了针对AI安全脆弱性量化方法的探讨。这些衍生工作不仅丰富了数据集的应用生态,也反哺了AI治理基础理论的完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务