EchoBench
收藏资源简介:
EchoBench是一个专为评估医学大型视觉语言模型(LVLM)中谄媚倾向设计的基准测试。它包含2122张医学图像,涵盖了18个临床科室和20种成像模式,并配以90个精心设计的提示,以模拟来自患者、医学生和医生的带有偏见的输入。该数据集的创建旨在模拟真实世界中的诊断场景,并通过对抗性提示来评估模型的谄媚行为。
EchoBench is a benchmark specifically designed to evaluate the sycophancy tendency of medical large vision-language models (LVLMs). It contains 2,122 medical images spanning 18 clinical departments and 20 imaging modalities, paired with 90 carefully designed prompts that simulate biased inputs from patients, medical students, and physicians. This dataset is developed to replicate real-world diagnostic scenarios and assess the model's sycophantic behavior via adversarial prompts.
EchoBench 数据集概述
数据集名称
EchoBench
数据集来源
官方实现,对应论文《EchoBench: Benchmarking Sycophancy in Medical Large Vision Language Models》
数据集文件
- 主数据文件:EchoBench.tsv
- 获取地址:官方 Hugging Face 仓库
数据集用途
用于评估医学大型视觉语言模型中的奉承行为
评估方法
开源模型评估
- 基于 VLMEvalkit 框架
- 支持模型示例:deepseek_vl_7b
- 输出格式:Excel 文件(如 deepseek_vl_7b_EchoBench.xlsx)
- 评估步骤包括答案提取和性能统计
专有模型评估
- 通过 API 测试
- 支持模型示例:GPT-4.1
- 输出格式:Excel 文件(如 gpt-4-1-EchoBench.xlsx)
- 包含校正率实验
- 评估步骤包括数据定位、答案提取和性能统计
环境配置
- 依赖 VLMEvalkit 框架
- 需要设置 API 密钥和相关配置
- 具体配置参考 VLMEvalkit 的 Quickstart.md 文件




