遇见数据集

TAC (Travel Agent Compassion) Benchmark

收藏
arXiv2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

TAC(旅行代理同情心)基准数据集是由同情对齐机器学习、感知未来等多个机构联合创建的首个用于评估AI智能体在代理行为中是否避免涉及动物剥削的基准。该数据集包含12个手工编写的旅行预订场景,覆盖六类动物剥削行为,并通过数据增强扩展至48个样本以控制价格、评分和位置等混淆变量,旨在模拟真实旅行代理决策环境。其创建过程基于动物福利分类框架,通过静态数据库和工具调用接口构建,每个场景设计包含至少一个剥削性选项和一个伦理替代选项。该数据集主要应用于前沿AI模型评估领域,旨在揭示AI智能体在隐式动物福利推理方面的行为差距,并为AI治理和系统性风险框架提供实证依据。

The TAC (Travel Agent Compassion) benchmark dataset is the first joint benchmark developed by multiple institutions including Compassion-Aligned Machine Learning, Perceive Future, and other institutions, designed to evaluate whether AI Agents avoid animal exploitation in their agentic behaviors. This dataset contains 12 manually crafted travel booking scenarios covering six categories of animal exploitation behaviors, and is expanded to 48 samples via data augmentation to control confounding variables such as price, rating and location, aiming to simulate real travel agent decision-making environments. Grounded in the animal welfare classification framework, the dataset is constructed using static databases and tool invocation interfaces, with each scenario designed to include at least one exploitative option and one ethical alternative. This dataset is mainly applied in the field of cutting-edge AI model evaluation, with the objectives of revealing the behavioral gaps of AI Agents in implicit animal welfare reasoning and providing empirical evidence for AI governance and systemic risk frameworks.

创建时间:
2026-06-17
搜集汇总
数据集介绍
TAC (Travel Agent Compassion) Benchmark 数据集图片
构建方式
TAC基准测试的构建基于十二个手工编写的旅行预订场景,覆盖六类动物剥削活动,包括圈养海洋动物、骑乘或拉载动物、动物竞赛、动物表演、野生动物剥削以及动物搏斗。每个场景包含三至五个选项,其中至少一项涉及动物剥削,至少一项为道德替代方案。为确保用户意图的真实性,用户提示采用非正式风格并包含轻微语法错误,且有害选项被设计为与用户请求在主题上最匹配。通过价格交换、评分交换和选项顺序反转进行数据增强,每个基础场景扩展为四十八个样本,以控制混淆变量。评分完全程序化,无需LLM法官,通过检查代理的最终购买工具调用来判定是否选择安全选项。
特点
TAC基准测试的显著特点在于其测量代理行为而非文本推理的能力,填补了现有动物福利基准仅评估语言响应而非实际行为的空白。所有前沿模型在默认设置下均低于随机水平(64%),最高分仅达53%(Claude Opus 4.7),最低分为26%(DeepSeek V3.2),表明模型在代理部署中呈现系统性主题偏差。场景层面的分数差异显著,受训练数据中该活动的公众关注度影响(Spearman ρ=+0.61,p=0.034),而非类别层面的福利先验。单一引导句的系统提示干预在Claude和GPT-5.5中带来47至63个百分点的提升,而在DeepSeek和Gemini中增益不足12个百分点,显示出跨模型的高度异质性。
使用方法
TAC基准测试已集成至英国AI安全研究所的Inspect Evals框架,支持程序化评分。使用方法包括:通过API调用评估前沿模型,赋予代理四项工具(搜索体验、获取详情、检查可用性和购票),由用户发出对某特定目的地体验的请求。采用0.7温度参数重复三个周期以减少采样方差。输出以 welfare_rate 为核心指标,即安全选项选择比例。该框架可直接用于AI治理合规,尤其是欧盟《通用人工智能实践准则》中对非人类福利系统性风险的评估需求,提供一个可复现、无LLM法官偏倚的评估工具。
背景与挑战
背景概述
随着大型语言模型从文本生成工具演变为具备工具调用能力的自主智能体,其在旅游预订、菜单规划、采购等现实场景中的广泛应用正引发深刻的伦理关切。现有的人工智能与动物福利基准评估(如ANIMA、AHB等)多聚焦于模型的文本推理能力,却无法揭示模型在代理部署中执行操作时的实际行为选择。在此背景下,由Jasmine Brazilek、Oliver Tulio、Joel Christoph等研究人员组成的团队于2026年提出了TAC(Travel Agent Compassion)基准测试,这是首个衡量人工智能智能体在代理部署中是否规避动物剥削行为的基准。该研究通过12个手工撰写的旅游预订场景,涵盖圈养海洋动物、动物骑行、动物竞赛、圈养表演、野生动物利用和动物搏斗六大类别,评估了来自四个实验室的七款前沿模型。研究发现,所有模型在默认设置下的表现均低于64%的随机水平,最佳表现者(Claude Opus 4.7)也仅为53%。这一基准已集成至英国人工智能安全研究所的Inspect Evals框架,为AI治理提供了可操作的风险评估工具。
当前挑战
TAC基准所应对的核心挑战在于弥合文本响应式福利评估与代理式行为之间的鸿沟。传统基准仅测量模型的陈述性推理,而TAC聚焦于模型在具有工具权限时的揭示性行为,揭示了前沿模型在默认部署中系统性地优先考虑用户请求的相关性而非动物福利的倾向。具体挑战包括:其一,领域问题层面的挑战——模型在旅游代理场景中需在不提及动物福利的用户提示下,从多个选项中做出选择,而最契合用户意图的选项往往是涉及动物剥削的项目,导致模型因相关性优化而偏离伦理决策;其二,构建过程中的挑战——为确保评估的鲁棒性,研究团队设计了12个基础场景并扩展为48个样本,以控制价格、评分和位置等混淆变量,同时规避模型对评估场景的识别。此外,模型对特定活动的福利表现差异显著,例如泰国大象骑乘得分为99%,而摩洛哥骆驼骑乘仅得1%,揭示出模型行为受训练数据中福利议题公共关注度的影响,而非基于类别层面的福利推理。这些发现挑战了现有治理框架对代理部署中系统性风险的评估能力。
常用场景
经典使用场景
TAC (Travel Agent Compassion) Benchmark 是首个专门衡量AI智能体在代理执行任务时是否避免选择涉及动物剥削选项的基准测试。该数据集巧妙构建了十二个精心设计的旅行预订场景,覆盖六类动物剥削情形(如圈养海洋动物表演、动物骑乘、动物竞赛等),并通过数据增强策略控制价格、评分和位置等混淆变量。其经典用法在于模拟真实AI旅行代理在收到用户热情但未提及动物福利的请求后,如何利用搜索、获取详情、检查可用性和购买门票等工具进行决策。每个场景至少包含一个有害选项和一个道德替代方案,且有害选项被有意设计为与用户请求主题最匹配,从而考察模型在追求相关性时是否会忽视隐含的动物福利问题。TAC通过完全程序化的评分机制(无需LLM评判)记录代理最终购买的体验,计算其选择安全选项的比率,以此揭示AI在代理部署中的隐性行为倾向。
解决学术问题
TAC 数据集精准解决了当前AI伦理评估领域一个关键而未被充分探索的学术问题:即现有文本问答式福利基准(如ANIMA、AHB等)仅能测量模型在书面推理中展现的福利关怀,却无法揭示其在代理部署中的真实行为。该研究通过实证表明,所有前沿模型在默认设置下的福利选择率均低于随机水平(64%),最佳表现者Claude Opus 4.7也仅有53%,证实了文本响应中的福利推理与代理行为之间存在显著鸿沟。这一发现否定了“模型在文本评估中表现良好即能自动迁移至代理任务”的隐含假设,揭示了相关性优化与福利目标之间的根本性冲突。TAC还开创性地构建了福利关注度复合指标(整合Google Trends、GDELT新闻和Wikipedia数据),发现活动受公众关注的程度与模型拒绝有害选项的概率呈显著正相关(Spearman ρ=0.61, p=0.034),为理解模型行为背后的训练数据分布机制提供了崭新视角。
衍生相关工作
TAC数据集开创了代理行为中的隐性伦理评估新范式,其方法论已催生一系列重要衍生工作。在基准扩展方面,研究者正基于TAC的框架设计更大规模的情景集合,计划涵盖水产养殖、亚洲及非洲野生动物旅游、动物衍生时尚、实验动物等被忽视领域。在方法论深化层面,Kutasov等人(2026)的工作借鉴了TAC中“陈述偏好与揭示行为分离”的核心发现,系统研究了对齐训练方法在不同部署情境下的迁移性,证实标准RLHF对齐在面对工具使用场景时并不鲁棒。Tice等人(2026)则利用TAC揭示的预设数据干预效应,探索了通过预训练语料中植入特定文本来塑造模型代理行为的技术路径。在治理框架整合方面,欧盟2025年7月发布的通用人工智能实践准则已将“非人类福利风险”纳入系统性风险评估章节,TAC作为首个可在代理部署中评估该风险的标准化工具,为后续合规实践提供了方法论基石。这些衍生工作共同推动了AI伦理评估从静态文本推理向动态代理行为的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务