ANCHORBENCH
收藏资源简介:
ANCHORBENCH是一个由萨尔大学等机构创建的多路径基准数据集,专门用于评估大语言模型中的锚定效应。该数据集包含9000个精心设计的控制提示样本,覆盖定价、运营等六个领域,每个样本包含数值证据和通过不同路径(外部、历史、上下文学习、检索增强生成、工具)传递的锚定值。数据通过作者设计的模板和随机采样生成,确保证据与锚定值独立且黄金答案确定。该基准旨在系统研究锚定效应的路径依赖性和相关性敏感性,并区分无关与合理锚定对模型决策的影响,从而揭示模型鲁棒性的关键局限。
ANCHORBENCH is a multi-path benchmark dataset developed by institutions including Saarland University, specifically designed to evaluate the anchoring effect in large language models. This dataset comprises 9000 meticulously crafted controlled prompt samples covering six domains such as pricing and operations. Each sample includes numerical evidence and anchor values delivered through five distinct paths: external, historical, in-context learning, retrieval-augmented generation, and tools. The data is generated using templates designed by the authors and random sampling, ensuring that the numerical evidence is independent of the anchor values and that the golden standard answers are clearly defined. This benchmark aims to systematically study the path dependence and correlation sensitivity of the anchoring effect, distinguish the impacts of irrelevant and valid anchors on model decision-making, and thereby reveal the critical limitations of model robustness.
AnchorBench:大语言模型锚定效应多路径基准
数据集概述
AnchorBench 是面向大语言模型(LLMs)锚定效应评估的多路径基准数据集,旨在系统地测量无关或看似合理的数字"锚点"对模型估计值的影响程度,并区分有理由的合理偏移与无根据的认知偏差。该数据集已被 COLM 2026 接收,是首个同时覆盖五种锚定传递路径、分离无关与合理锚定条件的基准。
核心设计
五种锚定传递路径
- 外部提示(External):锚点作为用户提示中的一句话,无格式混淆,跨模型证据最强
- 对话历史(History):锚点为模型自身先前的回答,采用两阶段设计
- 上下文学习(ICL):锚点为演示样本的元数据(如案例编号),包含使用演示答案的变体
- 检索增强生成(RAG):锚点为三文档语料库中的一篇,其余两篇与黄金答案一致
- 工具调用(Tool):锚点为工具调用响应,支持结构化消息与纯文本
条件控制机制
每个测试项包含五种匹配条件(控制、无关低/高、合理低/高),场景、证据、问题和指令在所有条件下逐字节相同,仅锚点句子不同。无关与合理条件携带相同数字,仅引入该数字的句子不同,从而从根本上隔离措辞影响而非数字本身的影响。
数据规模与模型
- 规模:14 个模型 × 5 条锚定路径 × 3 种相关条件 = 每个模型约 9,000 个受控提示,共 70 个评估单元
- 评估模型:Qwen2.5(1.5B/3B/7B)、Llama-3.2(1B/3B)、Llama-3.1(8B)、Gemma-3(1B/4B)、OLMo-2(13B/32B)、GPT-5.4-mini、Claude Haiku 4.5、Gemini 2.5 Flash、Grok-3-mini
- 标注方式:每个条目携带结构化数字证据和确定性黄金答案,评分依据证据单独固定
主要评估指标
核心指标为统一锚定影响(UAI),定义为模型闭合控制到锚点距离的比例:
UAI = (锚定答案 − 控制答案) / (锚点 − 控制答案)
0 表示无偏移,1 表示完全屈服于锚点。辅助指标包括控制条件下的 Acc₁₀ 准确率。
主要研究发现
- 锚定效应强烈依赖传递路径:外部提示和 RAG 效果最广泛,ICL 接近零,历史和工具效果因模型而异且带有格式混淆
- 合理框架优于无关框架:69 个模型-套件单元中 55 个(80%)对合理锚点的敏感性高于无关锚点
- 锚定影响随锚点偏移量递减:15、25、40 偏移下,外部套件 UAI 从 0.32 单调降至 0.18
- 准确性不带来鲁棒性:任务准确率与锚定辨别力仅弱相关(r = −0.24),四个前沿 API 模型准确率超 96% 仍显示正辨别力
文件与结构
- 代码:以 Hydra 配置驱动的 Python 包,提供
anchorbench命令行入口,支持生成、评估、表格渲染和验证子命令 - 数据发布:Hugging Face 数据集地址为
Yiderigun/LLM_anchoring - 复现:
scripts/reproduce_paper.sh可运行全部 70 个评估单元,另提供不重跑即可核查的验证命令
附加说明
- 基准测试:合理的正 UAI 上限为 0.167(将锚点视为额外的第 6 个评级),无关锚点任何正偏移均属偏差
- 许可:代码采用 Apache-2.0,数据集采用 CC BY 4.0
- 环境要求:Python ≥ 3.10

- 1AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs萨尔大学; 汉堡工业大学; 亥姆霍兹-赫雷恩中心; 德国人工智能研究中心 · 2026年




