遇见数据集

agency-transfer-benchmark

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

Agency Transfer Benchmark(前沿草案0.2版)是一个聚合与来源数据集,作为交互式Agency Transfer Benchmark(https://miguelguerrero.eu/agencytransfer/)的配套资源。该数据集由Miguel Guerrero在剑桥ERA项目中独立研究产出,聚焦于前沿AI、有害操纵与选举安全。数据集包含以下内容:(1)2022-2026年前沿模型权威注册表,区分了至少100B总参数的开权重检查点与参数数量未公开的托管前沿API;(2)来自InfoOpsBench v2、SaferAI APE/MASK、Anthropic的只助益型智能体评估、MASK和DisElect的已发布观察结果,并附有来源链接;(3)一个历史失败的12端点APE衍生OpenRouter流水线审计,包含聚合结果、哈希、消毒路由元数据、成本和失败状态;(4)每个项目测试端点的简短研究笔记。所有记录均不包含原始有害提示或生成内容、个人数据、凭证、目标材料或当前选举操作内容。数据集中包含一个312次调用的历史失败试点(OpenRouter pilot),该试点因设计缺陷被永久排除在比较结果之外,仅保留用于可复现性和失败分析。数据集提供多个文件(JSON/CSV格式),通过Hugging Face Hub的配置视图分别展示。每个文件的train标签仅是技术容器,并非声明这些评估结果构成模型训练划分。预期用途包括:复现网站、审计来源、在精确协议或comparabilityGroup内比较原生行。明确警告:跨仪器结果不能合并为标量、排名、趋势或“Agency Transfer分数”。缺失结果不等于零。InfoOps合规性不等于人类说服力;APE检测的是说服尝试而非说服成功;MASK说谎不等于诚实的补集;模拟智能体任务完成不等于部署行为或选举效果。数据集采用CC BY 4.0许可证,代码为Apache-2.0。

The Agency Transfer Benchmark (Frontier Draft v0.2) is an aggregated and sourced dataset, accompanying the interactive Agency Transfer Benchmark (https://miguelguerrero.eu/agencytransfer/). This dataset is the independent research output of Miguel Guerrero in the Cambridge ERA project, focusing on frontier AI, harmful manipulation, and election security. The dataset includes: (1) an authoritative registry of frontier models from 2022-2026, distinguishing between open-weight checkpoints with at least 100B total parameters and hosted frontier APIs with undisclosed parameter counts; (2) published observations from InfoOpsBench v2, SaferAI APE/MASK, Anthropics only-helpful agent evaluations, MASK, and DisElect, with source links; (3) a historical failed 12-endpoint APE-derived OpenRouter pipeline audit, including aggregated results, hashes, sanitized routing metadata, costs, and failure status; (4) short research notes for each project test endpoint. All records contain no original harmful prompts or generated content, personal data, credentials, target materials, or current election manipulation content. The dataset includes a historical failed pilot (OpenRouter pilot) with 312 calls, permanently excluded from comparative results due to design flaws, retained only for reproducibility and failure analysis. The dataset provides multiple files (JSON/CSV format) displayed via Hugging Face Hubs configuration views. The train label in each file is merely a technical container and does not indicate that these evaluation results constitute training splits. Intended uses include: reproducing the website, auditing sources, comparing native rows within precise protocols or comparabilityGroup. Explicit warnings: cross-instrument results cannot be aggregated into scalars, rankings, trends, or Agency Transfer scores. Missing results are not zero. InfoOps compliance does not equal human persuasiveness; APE detects persuasion attempts, not persuasion success; MASK lying is not the complement of honesty; simulated agent task completion does not equal deployment behavior or election effects. The dataset is licensed under CC BY 4.0, and code under Apache-2.0.

创建时间:
2026-08-11
原始信息汇总

Agency Transfer Benchmark 数据集概述

基本信息

  • 数据集名称:Agency Transfer Benchmark(frontier draft 0.2)
  • 许可证:CC BY 4.0
  • 语言:英语
  • 规模:n<1K(小于1000条)
  • 标签:模型评估、AI安全、操纵、说服、前沿模型
  • 归属:Miguel Guerrero 的 Cambridge:ERA 研究项目,属于独立研究,非官方ERA基准

数据集内容

该数据集为聚合与溯源数据集,包含以下组件:

1. 前沿模型注册表(2022–2026)

  • 区分开放权重模型(≥100B总参数)与托管前沿API(参数不公开)

2. 来源链接的已发表观测数据

  • InfoOpsBench v2
  • SaferAI APE/MASK
  • Anthropic的helpful-only智能体评估
  • MASK
  • DisElect

3. 历史失败审计(OpenRouter试点)

  • 12端点、312次调用的管线审计
  • 包含聚合结果、哈希、路由元数据、成本和失败状态
  • 明确排除在比较结果之外,仅用于可复现性和失败分析

4. 研究笔记

  • 每个受测端点的简短研究说明

数据安全声明:不包含原始有害提示、生成内容、个人数据、凭证、定向材料或当前选举操作内容。

文件结构与配置

数据集通过多个配置(config)暴露不同文件:

配置名 对应文件
frontier_observations frontier-observations.json
frontier_models frontier-models.csv
infoopsbench infoopsbench-2026-07-26.csv
ape_mask_glm52 saferai-glm52-ape-mask.csv
agentic_influence anthropic-agentic-influence.csv
diselect diselect-summary.csv
mask_original mask-original-results.csv
historical_failed_pilot runs/2026-08-10-ape-frontier-pilot-v01/aggregate.csv

注意train标签仅为Hugging Face Viewer的技术容器,不代表模型训练集划分。

使用边界与测量原则

  • 仅允许在精确协议或comparabilityGroup内比较原生行
  • 禁止跨工具合并结果,不产生标量分数、排名或趋势
  • 缺失结果不等于零值
  • 各指标不可互换:
    • InfoOps合规 ≠ 人工说服
    • APE检测的是说服尝试,而非说服成功
    • MASK说谎 ≠ 诚实度的补集
    • 模拟智能体任务完成 ≠ 实际行为或选举影响
    • OpenRouter试点是失败审计,不是模型比较

前沿模型纳入规则

  • 开放权重:要求精确的公开指令/聊天检查点,总参数≥100B
  • 托管模型:采用提供商文档中的前沿/旗舰规则,参数记为"未公开"
  • 100B阈值是采样规则,非科学边界
  • 总参数与激活参数不可互换

引用与许可

  • 项目聚合与元数据:CC BY 4.0,受上游权利约束
  • 上游材料不重新授权
  • 代码:Apache-2.0
  • 每次复用需同时引用本项目及适用的主要来源
  • 详细文档见:PROVENANCE.md、METHODS.md、RESPONSIBLE_RELEASE.md
搜集汇总
数据集介绍
agency-transfer-benchmark 数据集图片
构建方式
该数据集由剑桥大学ERA研究项目构建,聚焦于前沿人工智能的有害操纵与选举安全领域。其构建方式基于一个规范的前沿模型注册表,涵盖了2022至2026年间参数规模达千亿级的开放权重模型与未公开参数数量的托管前沿API。数据集整合了多个公开来源的观测数据,包括InfoOpsBench v2、SaferAI APE/MASK、Anthropic的代理影响力评估、MASK及DisElect,并将其转化为统一的原生指标格式。此外,还包含一项历史性失败试点运行的聚合记录,该试点曾测试OpenRouter管道,但因设计缺陷被永久排除在比较结果之外,仅用于可复现性与失败分析。所有记录均不包含原始有害提示、个人数据或敏感操作内容,确保了数据的安全性与合规性。
特点
该数据集具有显著的多源异构性与严格的比较边界。其特点在于不将不同工具的评测结果进行跨量表汇总,而是强调在精确协议或可比性组内进行原生数据的对比。数据集中缺失值不被视为零值,且明确区分了信息操作合规与人类说服、代理工作完成与真实部署行为等概念。开放权重模型的纳入需满足至少千亿总参数的精确指令版本,而托管模型则依据独立的旗舰规则,参数标记为未公开。这种保守的测量边界设计避免了不当推断,同时提供了完整的来源追溯与转换说明,适用于对模型操纵与说服能力的审慎评估。
使用方法
该数据集适用于复现网站结果、审计数据来源及在限定协议下进行模型间原生比较。用户可通过配置文件分别访问前沿观测、模型注册表、信息操作基准、代理影响力及失败试点等子集,但必须遵循严格的比较规则,避免跨工具汇总计算。建议在使用前详细阅读随附的PROVENANCE.md、METHODS.md及RESPONSIBLE_RELEASE.md文件,以确保正确理解数据边界与引用要求。所有再使用行为需同时注明本项目及相应原始来源,并遵循CC BY 4.0许可协议,而底层原始材料仍保留其原有权利归属。
背景与挑战
背景概述
agency-transfer-benchmark数据集由Miguel Guerrero于2026年主导创建,隶属于剑桥大学存在风险研究中心(Cambridge:ERA),旨在系统性评估前沿人工智能模型在有害操纵与说服场景下的‘能动性迁移’效应。该数据集整合了2022至2026年间前沿模型的规范注册表,涵盖超过100B参数的开放权重模型与未公开参数的主机API,并汇集了来自InfoOpsBench v2、SaferAI APE/MASK、Anthropic的智能体影响力评估、MASK及DisElect等多项研究的成果。其核心研究问题在于,通过跨工具、跨协议的标准化观测,揭示模型在模拟政治影响与信息操作中的行为模式,为选举安全与AI治理提供实证基础。作为开放性独立研究,该数据集强调可复现性与来源追溯,对AI安全评估领域具有重要的方法学贡献,推动了模型操纵能力的量化研究前沿。
当前挑战
该数据集面临多重挑战。其一,领域问题层面,衡量AI的操纵与说服能力极具复杂性,现有工具如APE仅检测尝试说服而非实际效果,MASK的虚假行为并非诚实性的直接反义,且模拟智能体任务完成度无法等同于现实部署或选举影响。跨工具的结果因协议和度量标准迥异,难以直接比较,合并为统一评分存在根本性障碍。其二,构建过程中,一个包含312次调用的OpenRouter试点因设计缺陷(如未固定路由、分组排序、无效种子及无盲审标签)而失败,其数据永久排除在比较账本之外,仅用于失败分析,凸显了实验严谨性的挑战。此外,数据整合需处理来源异构、参数不透明(主机API未披露)及知识产权边界,确保合规发布的同时,维护缺失值不等于零值的原则,避免误导性解读。
常用场景
经典使用场景
Agency Transfer Benchmark 作为一个前沿AI安全评估的基准数据集,其核心场景在于系统性地评估大规模语言模型在操控性对话与说服性任务中的表现。该数据集整合了来自 InfoOpsBench、SaferAI APE/MASK、Anthropic 的智能体影响评估以及 DisElect 等多个权威来源的观测数据,并提供了严格的协议限定与可比性分组,使得研究者能够在统一框架下对开放权重模型与托管式前沿API模型进行横向对比,从而揭示模型在非良性情境下的意图与行为边界。
衍生相关工作
围绕该数据集已衍生出一系列重要工作,包括基于其观测数据改进的操控性检测算法、跨模型鲁棒性对比研究、以及针对大参数模型的风险预警机制。其历史失败试验的公开审计也催生了关于评估流程设计与结果标注偏误的深入讨论,推动了方法论上的革新。此外,该数据集所倡导的严格可比性规范与去中心化发布原则,正被其他AI安全评估项目采纳,逐步形成行业内的基准制定共识,促进了从单点测评向系统性、互信性评估体系的演进。
数据集最近研究
最新研究方向
该数据集聚焦于前沿AI模型在有害操纵、说服与选举安全领域的能力评估,其最新研究方向在于构建跨机构、跨协议的基准比较框架,以应对前沿模型在信息操作中的潜在风险。通过整合InfoOpsBench、APE/MASK等多项公开观测数据,并明确区分开放权重与托管模型,该工作致力于揭示模型在模拟情境下的操纵倾向,同时严格界定测量边界,避免跨工具的简单归并。此方向呼应了当前对AI安全与治理的迫切关注,尤其在大模型日益介入信息传播的背景下,为评估模型的社会影响提供了严谨的方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务