Olfactory Perception (OP) Benchmark
收藏资源简介:
一个全面的基准数据集,用于评估大型语言模型是否能够推理气味。该基准包含1,010个问题,涵盖八个任务类别,每个问题以两种提示格式(SMILES和化合物名称)呈现,便于直接比较分子表示。
A comprehensive benchmark dataset designed to evaluate whether large language models (LLMs) can perform olfactory reasoning. This benchmark comprises 1,010 questions spanning eight task categories, where each question is presented in two prompt formats: SMILES and compound names, to facilitate direct comparison of molecular representations.
Olfactory Perception (OP) Benchmark 数据集概述
数据集简介
Olfactory Perception (OP) Benchmark 是一个用于评估大语言模型是否能够进行嗅觉推理的综合基准。该基准包含 1,010 个问题,涵盖八个任务类别,每个问题以两种提示格式(SMILES 和化合物名称)呈现,便于直接比较分子表示。
基准结构概览
| 类别 | 问题数量 | 难度 | 任务类型 |
|---|---|---|---|
| 气味分类 (OC) | 175 | 简单 | 二元:有气味 / 无气味 |
| 主要气味描述符 (POD) | 175 | 简单 | 四选一多项选择 |
| 气味强度 (OIn) | 175 | 简单 | 成对比较 + 评级 |
| 气味愉悦度 (OPl) | 175 | 简单 | 成对比较 + 评级 |
| 适用性全评分 (RATA) | 100 | 中等 | 从 138 个描述符中进行多标签选择 |
| 混合物气味相似性 (OS) | 100 | 中等 | 4 点量表 + 距离 |
| 嗅觉受体激活 (ORA) | 80 | 困难 | 多标签受体选择 |
| 气味识别测试 (SIT) | 30 | 困难 | 从混合物中进行四选一识别 |
数据格式与内容
- 每个问题以两种提示格式呈现:
- 提示 1: 异构 SMILES 表示法
- 提示 2: 常见化合物名称
- 真实答案来源于已建立的嗅觉科学数据集和资源。
- 主基准文件为
OP_Benchmark.csv,包含以下列:question_ID:唯一问题标识符compound.name_1/compound.name_2:化合物名称SMILES_1/SMILES_2:异构 SMILES 字符串OPTIONS:答案选项(分号分隔)question_category:任务类别prompt.1:基于 SMILES 的提示prompt.2:基于化合物名称的提示answer:真实答案other_info:其他元数据
评估模型
基准评估了来自 6 个提供商的 21 种模型配置:
- 闭源模型: OpenAI (GPT-5, GPT-5 Pro, GPT-5.2 Pro, GPT-OSS-120B, o3, o4-mini)、Anthropic (Claude Sonnet 4.5, Claude Opus 4.5, Claude Opus 4.6)、Google (Gemini 2.5 Pro)、xAI (Grok 3 Mini, Grok 4.1 Fast)
- 开源模型: DeepSeek (DeepSeek Reasoner)、Meta (Llama 3.3 70B Instruct)
关键结果
- 最佳总体准确率:Claude Opus 4.6 (max) 达到 64.3%(化合物名称提示)
- 化合物名称提示的表现始终优于 SMILES 提示,高出 3 到 19 个百分点(平均高出 8 个百分点),表明大语言模型主要通过词汇关联而非结构分子推理来获取嗅觉知识。
- 简单任务准确率最高可达 92%(气味分类);中等难度任务更具挑战性(RATA 最佳:42.2%,气味相似性最佳:35%)。
- 扩展推理预算能带来一致但有限的增益(最高约 2 个百分点)。
- 有 119 个问题(12%)被所有 21 个模型错误回答。
评估指标
- 单答案任务 (OC, POD, OIn, OPl, OS, SIT): 任意重叠准确率
- 多答案任务 (RATA, ORA): 多标签 F1 分数
- 连续一致性 (强度、愉悦度、相似性): 与人类心理物理测量的皮尔逊相关性
- 总体准确率: 所有任务类别的未加权平均值
数据来源
| 任务 | 来源 |
|---|---|
| 气味分类 | Mayhew et al., PNAS 2022 |
| 主要气味描述符 | IFRA Fragrance Ingredient Glossary (FIG) 2020 |
| 强度 / 愉悦度 | Keller et al., Science 2017 (DREAM Challenge) |
| RATA | Lee et al., Science 2023 (Principal Odor Map / GS-LF) |
| 气味相似性 | Snitz et al., PLoS Comp Bio 2013; Bushdid et al., Science 2014; Ravia et al., Nature 2020 |
| 受体激活 | Lalis et al., Nucleic Acids Research 2024 (M2OR database) |
| 气味识别 | Leibniz-LSB@TUM Odorant Database |
引用
Eftychia Makri, Nikolaos Nakis, Laura Sisson, Gigi Minsky, Leandros Tassiulas, Vahid Satarifard, Nicholas A. Christakis Benchmark for Assessing Olfactory Perception of Large Language Models. arxiv (2026)




