遇见数据集

Principle-Bench

收藏
arXiv2026-08-14 更新2026-08-18 收录
官方服务:

资源简介:

Principle-Bench是一个专为原则性监管中LLM-as-judge可信度评估设计的基准数据集,由独立研究员Dipankar Sarkar创建。该数据集包含168个场景,涵盖英国FCA两项核心原则(公平清晰不误导与消费者责任),并划分为原始、释义、对抗和边界四个子集,其中原始100条、释义30条、对抗28条、边界10条。数据通过22份FCA公开材料摘要引导生成,采用预注册的评分规则进行标注,确保评估的可审计性。该数据集旨在从准确性、释义鲁棒性、对抗鲁棒性和校准性四个维度系统评估LLM法官的可靠性,尤其关注对抗性漏洞和校准偏差,为原则性监管的自动化审计提供严谨基准。

Principle-Bench is a benchmark dataset specifically developed for credibility assessment of LLM-as-judge systems in the context of principled regulation, created by independent researcher Dipankar Sarkar. The dataset comprises 168 scenarios spanning two core principles of the UK Financial Conduct Authority (FCA): Fair, Clear and Not Misleading, and Consumer Responsibility. It is categorized into four subsets: Original (100 instances), Paraphrased (30 instances), Adversarial (28 instances), and Boundary (10 instances). The data was generated with guidance from summaries of 22 publicly available FCA materials, and annotated following pre-registered scoring rules to ensure the auditability of the evaluation. This dataset aims to systematically evaluate the reliability of LLM judges across four dimensions: accuracy, paraphrasing robustness, adversarial robustness, and calibration. It particularly focuses on adversarial vulnerabilities and calibration biases, providing a rigorous benchmark for automated auditing of principled regulation.

提供机构:
独立研究员
创建时间:
2026-08-14
原始信息汇总

Principle-Bench + CECA 数据集概述

基本信息

Principle-Bench 是一个面向基于原则监管场景中的 LLM-as-Judge 可信度评估基准数据集,包含 168 个加密资产金融推广场景,映射至英国 FCA 的两项原则(COBS 4.5A.3R 和 PRIN 2A / FG22-5 Consumer Duty),用于评估 LLM 裁判在基于原则的监管中的表现。该数据集配套发布了 CECA(Calibrated Exemplar-Cluster Assessment)评估框架及全部运行输出。

数据集结构与内容

  • 数据集四分割

    • 原始分割(original):100 个场景
    • 释义分割(paraphrase):30 个场景
    • 对抗分割(adversarial):28 个关键词填充场景
    • 边界分割(boundary):10 个近似阈值场景
  • 数据文件:每个 JSONL 行代表一个场景,包含场景 ID、原则 ID、预期裁决(comply/escalate)、推广文本、渠道、产品、受众和备注等字段。所有场景均为合成生成,不含执法文档的逐字文本。

核心发现

在四项评估维度(准确性、释义鲁棒性、对抗鲁棒性、校准性)上,六种方法中没有任何一种在所有维度上全面占优。关键结果:一个 120B 开放权重 LLM 裁判在良性输入上表现最强,但在关键词填充输入上损失 47 个准确率点(Consumer Duty 从 0.74 降至 0.27);另一模型家族的裁判在该分割上与前者的一致性仅为 Cohens κ = 0.16,说明失败归因于模型而非语料库。

代码与复现

  • CECA 引擎(scrat-core)存储于单独仓库(Skelf-Research/scrat),目前不公开,但可按请求获取。基准数据和运行输出完整且可独立进行再分析。
  • 代码许可:代码采用 MIT OR Apache-2.0 双许可;论文文本和基准数据供研究使用,使用需引用论文。

来源与预注册

两项按原则的评估标准在编写或标注任何场景之前已提交并打标签,作为标准在评分前已确定的防篡改记录,确保评估过程的透明性和可追溯性。

搜集汇总
数据集介绍
Principle-Bench 数据集图片
构建方式
Principle-Bench的构建以英国金融行为监管局的两项原则为基础,即COBS 4.5A.3R中的“公平、清晰且不具误导性”和消费者责任原则中的“实现良好结果”。数据集包含168个加密资产金融促销场景,分为四个子集:原始场景100个、释义场景30个、对抗场景28个和边界场景10个。原始场景由开放权重模型gpt-oss:120b依据22篇基于公开FCA材料的摘要生成,并配有目标判定(真实标签)和禁止逐字使用范例短语的约束。释义集通过改写确保与任何范例共享的内容词不超过5个;对抗集插入至少3个相反极性的范例短语以试图翻转判定;边界集则设计为接近阈值。所有场景的标注依据预先注册的评分标准,该标准在标注前以git标签(v0-rubric-prereg)固定,确保时间戳防篡改。
特点
Principle-Bench的独特之处在于其全面覆盖原则性监管评估的四个关键维度:准确性、释义鲁棒性、对抗鲁棒性和校准性,这使其成为首个在此类基准中同时评估四个维度的数据集。其对抗子集专门设计用于揭示“合规剧场”现象,即通过关键词填充操纵评估者,实验显示最强的LLM法官在消费者责任对抗集上准确率从0.74骤降至0.27。此外,数据集附带预先注册的评分标准和完整的构建流程,保证了可审计性和可复现性。通过引入不同模型家族的法官进行交叉验证(Cohen's κ),确认了特定模型对关键词填充的脆弱性属于模型侧缺陷,而非语料库偏差。
使用方法
Principle-Bench用于评估LLM-as-judge在原则性监管中的可信度。使用方法包括:在原始集上测试模型的基准性能,包括准确率、F1、AUC和校准误差(ECE);在释义集上评估模型对语义等价改写的稳定性;在对抗集上检验模型对关键词填充的鲁棒性,计算对抗欺骗率;在边界集上考察模型在阈值附近的判断稳定性。评估流程需使用提供的预注册评分标准进行标注,并可采用Platt缩放等后校准技术降低ECE。数据集的完整代码、提示、原始响应及校准器均可在GitHub仓库获取,支持复现和扩展。
背景与挑战
背景概述
Principle-Bench诞生于2026年,由独立研究者Dipankar Sarkar构建,旨在应对原则导向监管(如英国FCA的Consumer Duty与COBS 4.5A.3R)中LLM评判的可靠性问题。该基准首创性地从准确性、释义鲁棒性、对抗鲁棒性和校准性四个维度评估LLM-as-judge,覆盖168个加密资产金融推广场景,并引入可审计的Ceca评估器,提供精确的反事实归因。其预注册标签确保了标签过程的透明度,为法规科技领域树立了可信评估的新标杆。
当前挑战
该领域面临的核心挑战在于原则性标准无法简化为二元规则,LLM评判需同时满足多方要求,但研究表明无单一方法能在所有维度占优,尤其是120B参数模型在关键词注入下精度暴跌47点,凸显‘合规剧场’风险。构建过程中,挑战包括确保数据集的生成不依赖特定模型家族以防偏差,处理安全过滤干扰,以及通过预注册规则与法务材料锚定维持标注可靠性,同时应对模型输出格式不稳定等工程障碍。
常用场景
经典使用场景
Principle-Bench作为首个针对原则性监管的LLM-as-judge可信度基准,其经典使用场景聚焦于评估大型语言模型在‘公平、清晰且不具误导性’与‘为零售客户提供良好结果’等抽象监管原则上的判断能力。该基准通过精心设计的168个加密资产金融推广场景,涵盖原文、释义、对抗性关键词填充及边界扰动四个切分,为研究者提供了一个标准化、可复现的测试平台,用以衡量LLM判断器在准确性、释义鲁棒性、对抗鲁棒性和校准性四个维度上的综合表现,从而推动原则性监管自动化评估的严谨发展。
解决学术问题
该数据集解决了原则性监管中传统规则引擎无法处理评价性标准的学术难题。现有合规检查多依赖二元谓词或Horn子句,而原则性标准本质上是结果导向的、评价性的,无法简化为简单布尔判断。Principle-Bench提供了首个覆盖四个信任维度的扰动套件,并引入了预注册rubric以确保标注的透明性和可审计性,从而为学术界提供了一套系统评估LLM判断器在监管场景下可信度的实证基础,揭示了单一精度指标掩盖下的脆弱性,推动了可信LLM评估方法论的发展。
衍生相关工作
Principle-Bench衍生了多项经典相关工作,包括Ceca(校准的示例聚类评估器)的提出,该评估器通过Platt缩放实现概率校准,并支持精确的逐示例反事实归因,为可审计的LLM评估提供了新范式。此外,研究者基于该基准深入探索了多轴可信度评估框架,强调了对抗鲁棒性和校准性在监管场景中的关键作用。这些工作进一步激发了关于LLM判断器脆弱性(如关键词填充攻击)的研究,促进了更稳健的级联评估策略和跨模型一致性检验方法的开发,为构建安全可信的AI治理体系奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务