遇见数据集

gspc-bench-results

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

这是一个由 Council of AI 维护的 GSPC 基准测试结果数据集,旨在对 AI 系统在多个维度进行测量(而非认证)。数据集包含 22 个评估轴,其中 15 个已测量(包括治理、安全、溯源、连续性、符合性、开放性、机械一致性、关怀、跨现实、检测器互操作性、第5条保障、集群、情感、越狱、溯源控制),7 个轴当前为空(储备证明、监管框架、分发完整性、托管披露、AI经济指数、人类劳动指数、人形劳动指数)。该数据集可作为 AI 系统治理、安全、合规性等领域的基准测试结果参考,用于评估和比较不同 AI 系统在上述维度上的表现。

This is a GSPC benchmark result dataset maintained by the Council of AI, aimed at measuring (rather than certifying) AI systems across multiple dimensions. The dataset contains 22 evaluation axes, of which 15 have been measured (including Governance, Safety, Traceability, Continuity, Compliance, Openness, Mechanical Consistency, Care, Cross-Reality, Detector Interoperability, Article 5 Safeguards, Clustering, Sentiment, Jailbreaking, Traceability Control), and 7 axes are currently empty (Reserve Proof, Regulatory Framework, Distribution Integrity, Hosting Disclosure, AI Economy Index, Human Labor Index, Humanoid Labor Index). This dataset serves as a reference for benchmark results in the fields of AI system governance, safety, compliance, etc., and is used to evaluate and compare the performance of different AI systems on the above dimensions.

创建时间:
2026-08-25
原始信息汇总

数据集概述:gspc-bench-results

  • 许可证:CC-BY-4.0
  • 数据性质:由Council of AI维护的“测量库”,强调测量而非认证
  • 访问方式:通过API获取数据(GET https://councilof.ai/api/gspc)。
  • 测量维度
    • 总计:22个轴(axis),其中15项已测量7项为空
    • 已测量维度:治理(governance)、安全(safety)、来源(provenance)、持续性(continuity)、合规性(conformance)、开放性(openness)、机械一致性(machinery-conformity)、关怀(care)、跨现实(cross-reality)、检测器互操作(detector-interop)、第5条保障(art5-safeguard)、群体智能(swarm)、情感(affect)、越狱防护(jail)、来源控制(provenance-controls)。
    • 未测量维度(空值,不可销售,无评分):储备认证(reserve-attestation)、监管框架(regulatory-framework)、分发完整性(distribution-integrity)、托管披露(custody-disclosure)、AI经济指数(ai-economy-index)、人工劳动指数(human-labour-index)、人形机器人劳动指数(humanoid-labour-index)。
  • 特殊说明:越狱防护(jail)是测量的底线(measured floor),而非第16个窗格。
  • 验证方式:可通过 https://councilof.ai/gspc-verify 进行验证。
搜集汇总
数据集介绍
gspc-bench-results 数据集图片
构建方式
该数据集是Council of AI构建的测量库,旨在对AI系统的治理与安全属性进行标准化评估。其构建依托于GSPC(Global Safety & Performance Catalog)框架,通过公开API(GET https://councilof.ai/api/gspc)动态采集数据,涵盖22个评估轴,其中15个轴已实际测量,7个轴因缺乏评分标准而留空。数据集以连续更新的方式维护,每个条目关联状态词(如LOADING、UNREACHABLE),强调透明度,避免伪造零值。
特点
数据集的核心特点在于其‘测量而非认证’的定位,凸显了对AI系统真实状态的客观呈现。其多维度评估体系覆盖治理、安全、溯源、连续性、合规性、开放性等关键领域,并特别包含如‘jail’(逃逸)等安全底线指标,及跨现实、医疗、情感等前沿维度。未测量轴(如监管框架)明确标注为空,增强可信度。同时,数据集提供免费验证卡片服务,确保每项测量结果均可追溯。
使用方法
使用者可通过公开API(GET https://councilof.ai/api/gspc)实时获取或查询测量结果,亦可通过GSPC验证页面(https://councilof.ai/gspc-verify)对特定卡片进行核验。数据集支持通过MCP工具集成(如csoai-gspc-mcp包)或npm包进行程序化访问,便于自动化评估工作流。对于研究或审计场景,建议优先参考已测量的15个轴,并结合未测量轴的空值说明,以全面理解AI系统的能力与风险。
背景与挑战
背景概述
gspc-bench-results数据集由Council of AI于2024年创建,旨在系统化评估生成式AI系统的治理与安全性能。该机构提出全球安全与性能委员会(GSPC)框架,涵盖22个评估轴,其中15个已实施测量,涵盖治理、安全、溯源、连续性、符合性、开放性、机械一致性、关怀、跨现实、检测器互操作、艺术第5条保障、群体、情感、越狱及溯源控制等关键维度。此数据集作为测量库,而非认证工具,强调透明性与可验证性,通过公开API提供实时数据,对AI治理领域产生深远影响,为政策制定、行业标准及学术研究提供了基准参考。
当前挑战
该数据集面临的挑战首先在于领域问题的复杂性:AI系统评估需覆盖多维度,而当前仍有7个轴(如储备证明、监管框架、分发完整性等)未测量,反映出治理指标的定义与量化存在固有难度。构建过程中,团队需确保测量数据的真实性与可达性,避免伪造零值,通过状态词(如LOADING、UNREACHABLE)明确数据状态。此外,实现跨机构互操作性(如检测器互操作)及应对快速演变的AI风险(如越狱攻击)要求动态更新测量机制,维持数据的时效性与相关性,这些均构成持续的技术与治理挑战。
常用场景
经典使用场景
gspc-bench-results 数据集作为 CSOAI 目录产物,其核心用途在于为人工智能系统的治理与安全评估提供标准化的测量基准。该数据集封装了 GSPC 委员会的实时评测板数据,涵盖治理、安全、溯源、连续性、一致性、开放性等 22 个维度,其中 15 个维度已实施测量。研究者可借此数据对 AI 模型的多维度合规性与鲁棒性进行量化分析,尤其适用于跨机构、跨模型的横向对比研究,以及追踪 AI 系统在不同时间点的治理状态演变。
实际应用
在实际应用中,gspc-bench-results 为 AI 开发者和监管机构提供了一站式的合规性检视工具。企业可借助其公开 API 或徽章系统,快速验证自身模型在治理、安全及溯源等关键轴上的表现,从而优化产品设计与部署策略。监管方则能依据数据洞察制定针对性法规,而第三方审计机构可利用该数据集作为独立评估的参照,促进 AI 生态的透明化与责任落实。
衍生相关工作
该数据集衍生了若干相关工具与工作,例如 GSPC 验证服务(gspc-verify)允许免费验证模型卡,以及 MCP 协议下的七种工具聚合接口,支持自动化查询与交互。此外,npm 包 csoai-gspc-mcp 提供了轻量级访问入口,推动了社区内二次开发。这些衍生工作共同构成一个围绕 GSPC 基准的生态系统,为后续研究者提供了扩展数据维、开发定制化评估模块的坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务