遇见数据集

ANCHORBENCH

收藏
arXiv2026-08-14 更新2026-08-18 收录
官方服务:

资源简介:

ANCHORBENCH是一个由萨尔大学等机构创建的多路径基准数据集,专门用于评估大语言模型中的锚定效应。该数据集包含9000个精心设计的控制提示样本,覆盖定价、运营等六个领域,每个样本包含数值证据和通过不同路径(外部、历史、上下文学习、检索增强生成、工具)传递的锚定值。数据通过作者设计的模板和随机采样生成,确保证据与锚定值独立且黄金答案确定。该基准旨在系统研究锚定效应的路径依赖性和相关性敏感性,并区分无关与合理锚定对模型决策的影响,从而揭示模型鲁棒性的关键局限。

ANCHORBENCH is a multi-path benchmark dataset developed by institutions including Saarland University, specifically designed to evaluate the anchoring effect in large language models. This dataset comprises 9000 meticulously crafted controlled prompt samples covering six domains such as pricing and operations. Each sample includes numerical evidence and anchor values delivered through five distinct paths: external, historical, in-context learning, retrieval-augmented generation, and tools. The data is generated using templates designed by the authors and random sampling, ensuring that the numerical evidence is independent of the anchor values and that the golden standard answers are clearly defined. This benchmark aims to systematically study the path dependence and correlation sensitivity of the anchoring effect, distinguish the impacts of irrelevant and valid anchors on model decision-making, and thereby reveal the critical limitations of model robustness.

创建时间:
2026-08-14
原始信息汇总

AnchorBench:大语言模型锚定效应多路径基准

数据集概述

AnchorBench 是面向大语言模型(LLMs)锚定效应评估的多路径基准数据集,旨在系统地测量无关或看似合理的数字"锚点"对模型估计值的影响程度,并区分有理由的合理偏移与无根据的认知偏差。该数据集已被 COLM 2026 接收,是首个同时覆盖五种锚定传递路径、分离无关与合理锚定条件的基准。

核心设计

五种锚定传递路径

  • 外部提示(External):锚点作为用户提示中的一句话,无格式混淆,跨模型证据最强
  • 对话历史(History):锚点为模型自身先前的回答,采用两阶段设计
  • 上下文学习(ICL):锚点为演示样本的元数据(如案例编号),包含使用演示答案的变体
  • 检索增强生成(RAG):锚点为三文档语料库中的一篇,其余两篇与黄金答案一致
  • 工具调用(Tool):锚点为工具调用响应,支持结构化消息与纯文本

条件控制机制

每个测试项包含五种匹配条件(控制、无关低/高、合理低/高),场景、证据、问题和指令在所有条件下逐字节相同,仅锚点句子不同。无关与合理条件携带相同数字,仅引入该数字的句子不同,从而从根本上隔离措辞影响而非数字本身的影响。

数据规模与模型

  • 规模:14 个模型 × 5 条锚定路径 × 3 种相关条件 = 每个模型约 9,000 个受控提示,共 70 个评估单元
  • 评估模型:Qwen2.5(1.5B/3B/7B)、Llama-3.2(1B/3B)、Llama-3.1(8B)、Gemma-3(1B/4B)、OLMo-2(13B/32B)、GPT-5.4-mini、Claude Haiku 4.5、Gemini 2.5 Flash、Grok-3-mini
  • 标注方式:每个条目携带结构化数字证据和确定性黄金答案,评分依据证据单独固定

主要评估指标

核心指标为统一锚定影响(UAI),定义为模型闭合控制到锚点距离的比例:

UAI = (锚定答案 − 控制答案) / (锚点 − 控制答案)

0 表示无偏移,1 表示完全屈服于锚点。辅助指标包括控制条件下的 Acc₁₀ 准确率。

主要研究发现

  1. 锚定效应强烈依赖传递路径:外部提示和 RAG 效果最广泛,ICL 接近零,历史和工具效果因模型而异且带有格式混淆
  2. 合理框架优于无关框架:69 个模型-套件单元中 55 个(80%)对合理锚点的敏感性高于无关锚点
  3. 锚定影响随锚点偏移量递减:15、25、40 偏移下,外部套件 UAI 从 0.32 单调降至 0.18
  4. 准确性不带来鲁棒性:任务准确率与锚定辨别力仅弱相关(r = −0.24),四个前沿 API 模型准确率超 96% 仍显示正辨别力

文件与结构

  • 代码:以 Hydra 配置驱动的 Python 包,提供 anchorbench 命令行入口,支持生成、评估、表格渲染和验证子命令
  • 数据发布:Hugging Face 数据集地址为 Yiderigun/LLM_anchoring
  • 复现scripts/reproduce_paper.sh 可运行全部 70 个评估单元,另提供不重跑即可核查的验证命令

附加说明

  • 基准测试:合理的正 UAI 上限为 0.167(将锚点视为额外的第 6 个评级),无关锚点任何正偏移均属偏差
  • 许可:代码采用 Apache-2.0,数据集采用 CC BY 4.0
  • 环境要求:Python ≥ 3.10
搜集汇总
数据集介绍
ANCHORBENCH 数据集图片
构建方式
ANCHORBENCH的构建基于对照诊断的理念,旨在系统性地评估大语言模型中的锚定效应。每个测试项都是一个数字判断任务,采用0-100的统一评分尺度,覆盖定价、运营、物流、资源消耗、市场采用和合规性六大领域。为避免有机查询带来的混淆,所有项目均为合成生成,并确保金标准答案仅由提供的证据决定。通过控制锚定路径和锚定相关性两个设计因素,构建了五种锚定路径(外部提示、历史对话、上下文学习、检索增强生成和工具调用)以及三种锚定相关性条件(无锚、无关锚、合理锚)。每个项目在五组匹配条件下呈现,锚定值固定,仅通过框架句的变化来隔离框架效应的影响。数据生成过程采用固定随机种子,确保可复现性,共生成360个项目,每个项目五种条件,形成1800个提示,为每个模型提供全面测试。
特点
ANCHORBENCH的核心特点在于其多路径与相关性感知的设计。基准涵盖了五种现实世界中的锚定传递路径,使研究者能够比较不同路径下锚定效应的强度差异。引入相关性轴,区分无关锚与合理锚,使得能够区分单纯的偏见和基于合理证据的合理偏移。所有项目均包含结构化数值证据和确定性金标准答案,从而不仅测量输出是否偏移,还能判断偏移是否合理。基准控制锚定值不变,仅改变其框架,确保了相关性轴的有效性。评估指标方面,采用统一锚定影响(UAI)和朝向锚定率(TAR)以及判别差距(DiscΔ),全面衡量模型的任务精度、锚定敏感度和相关性判别能力。此外,基准在14个模型上进行评估,包括10个开放权重模型和4个前沿API模型,提供了广泛的跨模型比较,并发现锚定效应强烈依赖于路径,且合理锚通常比无关锚引起更大偏移。
使用方法
ANCHORBENCH的使用方法旨在作为评估大语言模型在锚定效应下鲁棒性的诊断工具。研究者可以通过Hugging Face平台获取基准数据,包括提示、金标准和锚定值,从而独立计算UAI等指标。基准支持多种模型类型,开放权重模型可通过本地vLLM推理,API模型则通过OpenRouter访问,所有模型均采用贪心解码以确保可比性。评估流程涉及对五种套件中每个模型的1800个提示进行标准化推理,采用确定性解析提取答案(解析率中位数99.9%),并计算控制条件下的MAEc和Acc10,以及锚定条件下的UAI和TAR。通过分析DiscΔ的正负和大小,研究者能够判断模型是否过度受合理锚影响,以及其对无关锚的敏感性。此外,基准附带详细的鲁棒性检查,如排除阈值敏感性、采样鲁棒性和跨域通用性测试,确保结论的稳健性。ANCHORBENCH还支持扩展研究,如部分证据压力测试和提示缓解策略评估,为深入探究锚定机制提供了灵活平台。
背景与挑战
背景概述
ANCHORBENCH基准由萨尔大学、汉堡工业大学及德国人工智能研究中心的研究人员于2026年提出,旨在系统评估大型语言模型中的锚定效应。该基准受人类认知偏差研究启发,以Tversky和Kahneman的经典锚定理论为基础,构建了涵盖外部提示、对话历史、上下文学习、检索增强生成及工具输出五种锚定传递路径的评测框架,并创新性地引入锚定相关性维度,区分无关与合理锚点对模型判断的影响。通过对十四种主流模型的9000个受控提示测试,该基准揭示了锚定效应的路径依赖性及合理锚点引发的显著偏移,为量化模型决策可靠性提供了重要工具。
当前挑战
ANCHORBENCH面临的挑战包括:多路径锚定效应的精细建模,现有基准多聚焦单一或双路径,难以全面捕捉真实部署场景中锚定的多样性;锚定相关性的区分困难,分离无关与合理锚点的认知影响需严谨的实验设计;构建过程中需确保合成场景的生态效度,同时保持金标准的确定性,以准确衡量偏移的合理性。此外,跨模型、跨路径的评测标准统一及格式混淆因素的控制,如历史路径的单阶段对照与工具路径的格式差异,均是构建中需克服的技术难题。
常用场景
经典使用场景
ANCHORBENCH作为首个多路径锚定效应基准,其经典使用场景在于系统性地量化大型语言模型在不同上下文传递方式下的锚定偏差。该基准通过精心设计的五种锚定路径——外部提示、对话历史、上下文学习、检索增强生成及工具输出——在统一的数值判断任务框架下,对模型的锚定敏感性进行标准化测量。研究者可依托该基准对模型行为进行细粒度剖析,比较不同路径下锚定效应的强度差异,并借助明确的锚定相关性轴(对照、无关、合理)区分无根据的偏移与合理的信息整合,从而为认知偏差研究提供严谨的实验范式。
衍生相关工作
ANCHORBENCH的提出激发了多项衍生研究,推动了LLM认知偏差领域的深入探索。其多路径设计与相关性轴思想被后续工作借鉴,用于构建更复杂的认知偏差基准,如结合因果追踪技术分析锚定效应的内部机制,或扩展至更广泛的启发式与偏见类型。基准中关于准确率与鲁棒性解耦的发现,促使研究者重新审视模型评估体系,催生了针对鲁棒性的专项测试集和去偏训练方法。此外,其部分证据条件下的压力测试范式,为研究模型在不确定性下的决策行为提供了新视角,衍生出关于理性更新与偏差叠加的理论探讨,以及探索链式思考等提示策略对锚定缓解效果的系统性研究。
数据集最近研究
最新研究方向
锚定效应作为人类决策中的经典认知偏差,近年来在大型语言模型(LLMs)中的涌现引起了广泛关注。ANCHORBENCH基准的提出,标志着对这一现象的系统性研究迈入新阶段。该基准通过设计外部提示、对话历史、上下文学习、检索增强生成及工具输出五条锚定通路,并引入锚定相关性维度,揭示了LLMs中锚定效应的路径依赖性、可信锚点对不同模型家族的差异化影响,以及高任务准确率与鲁棒性之间的背离现象。这一前沿研究方向不仅深化了对LLM认知偏差机制的理解,还为构建更可靠、更具决策支持能力的AI系统提供了关键评估工具,对医疗问答、时间序列预测等高风险应用领域具有重要的现实意义。
相关研究论文
  • 1
    AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs萨尔大学; 汉堡工业大学; 亥姆霍兹-赫雷恩中心; 德国人工智能研究中心 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务