Principle-Bench
收藏资源简介:
Principle-Bench是一个专为原则性监管中LLM-as-judge可信度评估设计的基准数据集,由独立研究员Dipankar Sarkar创建。该数据集包含168个场景,涵盖英国FCA两项核心原则(公平清晰不误导与消费者责任),并划分为原始、释义、对抗和边界四个子集,其中原始100条、释义30条、对抗28条、边界10条。数据通过22份FCA公开材料摘要引导生成,采用预注册的评分规则进行标注,确保评估的可审计性。该数据集旨在从准确性、释义鲁棒性、对抗鲁棒性和校准性四个维度系统评估LLM法官的可靠性,尤其关注对抗性漏洞和校准偏差,为原则性监管的自动化审计提供严谨基准。
Principle-Bench is a benchmark dataset specifically developed for credibility assessment of LLM-as-judge systems in the context of principled regulation, created by independent researcher Dipankar Sarkar. The dataset comprises 168 scenarios spanning two core principles of the UK Financial Conduct Authority (FCA): Fair, Clear and Not Misleading, and Consumer Responsibility. It is categorized into four subsets: Original (100 instances), Paraphrased (30 instances), Adversarial (28 instances), and Boundary (10 instances). The data was generated with guidance from summaries of 22 publicly available FCA materials, and annotated following pre-registered scoring rules to ensure the auditability of the evaluation. This dataset aims to systematically evaluate the reliability of LLM judges across four dimensions: accuracy, paraphrasing robustness, adversarial robustness, and calibration. It particularly focuses on adversarial vulnerabilities and calibration biases, providing a rigorous benchmark for automated auditing of principled regulation.
Principle-Bench + CECA 数据集概述
基本信息
Principle-Bench 是一个面向基于原则监管场景中的 LLM-as-Judge 可信度评估基准数据集,包含 168 个加密资产金融推广场景,映射至英国 FCA 的两项原则(COBS 4.5A.3R 和 PRIN 2A / FG22-5 Consumer Duty),用于评估 LLM 裁判在基于原则的监管中的表现。该数据集配套发布了 CECA(Calibrated Exemplar-Cluster Assessment)评估框架及全部运行输出。
数据集结构与内容
-
数据集四分割:
- 原始分割(original):100 个场景
- 释义分割(paraphrase):30 个场景
- 对抗分割(adversarial):28 个关键词填充场景
- 边界分割(boundary):10 个近似阈值场景
-
数据文件:每个 JSONL 行代表一个场景,包含场景 ID、原则 ID、预期裁决(comply/escalate)、推广文本、渠道、产品、受众和备注等字段。所有场景均为合成生成,不含执法文档的逐字文本。
核心发现
在四项评估维度(准确性、释义鲁棒性、对抗鲁棒性、校准性)上,六种方法中没有任何一种在所有维度上全面占优。关键结果:一个 120B 开放权重 LLM 裁判在良性输入上表现最强,但在关键词填充输入上损失 47 个准确率点(Consumer Duty 从 0.74 降至 0.27);另一模型家族的裁判在该分割上与前者的一致性仅为 Cohens κ = 0.16,说明失败归因于模型而非语料库。
代码与复现
- CECA 引擎(scrat-core)存储于单独仓库(Skelf-Research/scrat),目前不公开,但可按请求获取。基准数据和运行输出完整且可独立进行再分析。
- 代码许可:代码采用 MIT OR Apache-2.0 双许可;论文文本和基准数据供研究使用,使用需引用论文。
来源与预注册
两项按原则的评估标准在编写或标注任何场景之前已提交并打标签,作为标准在评分前已确定的防篡改记录,确保评估过程的透明性和可追溯性。




