遇见数据集

FTF-BENCH

收藏
arXiv2026-09-04 更新2026-09-08 收录
数据链接:
官方服务:

资源简介:

FTF-BENCH(First Things First Benchmark)是由上海交通大学与字节跳动联合创建的多模态大语言模型评估基准,旨在测试模型在处理包含必须需求和可选需求的复杂用户指令时的推理能力。数据集包含3,649个图像-需求对,覆盖电商、预订服务和地图/打车三个真实场景,每个样本由界面截图、候选对象及结构化需求组成。其构建采用大模型驱动流水线,经图像收集、需求生成、口语化表达和人工审核确保质量。该基准聚焦于三类任务:唯一答案、多答案和不可回答,用于诊断MLLM在优先级感知推理中的缺陷,并推动服务型智能体泛化能力的提升。

FTF-BENCH (First Things First Benchmark) is a multimodal large language model evaluation benchmark jointly created by Shanghai Jiao Tong University and ByteDance, aiming to evaluate the reasoning capabilities of models when handling complex user instructions that involve both mandatory and optional requirements. The dataset consists of 3,649 image-demand pairs, covering three real-world scenarios: e-commerce, booking services, and map/taxi-hailing. Each sample comprises an interface screenshot, candidate objects, and structured requirements. Its construction follows a large model-driven pipeline, with quality ensured through four stages: image collection, requirement generation, colloquial paraphrasing, and manual review. This benchmark focuses on three task categories: single-answer, multi-answer, and unanswerable. It is designed to diagnose the flaws of multimodal large language models (MLLMs) in priority-aware reasoning, and to promote the enhancement of the generalization ability of service-oriented AI agents.

创建时间:
2026-09-04
原始信息汇总

数据集概述:FTF-RL

FTF-RL 是一个面向服务场景的多模态强化学习项目,其核心贡献与数据资源如下:

主要贡献

  1. 基准与评估框架
    构建了一个包含 3,649 个服务导向型多模态问题 的综合性评估框架,用于在结构化用户约束条件下评估模型性能。

  2. 算法创新:FTF-RL
    提出了一种新颖的强化学习方法,显式优化模型对多优先级用户需求(“必须满足”与“最好满足”)的推理过程。

  3. 泛化能力提升
    FTF-RL 在需求遵循型任务上显著提升了任务成功率,同时在标准逻辑与数学基准上也表现出更优的通用性能。

当前状态

  • 该项目的 源代码、文档及预训练模型 正在准备中,预计在公告发布后的 两周内 正式开源。
搜集汇总
数据集介绍
FTF-BENCH 数据集图片
构建方式
FTF-BENCH旨在评估多模态大语言模型(MLLM)在复杂多优先级用户需求下的推理能力,其构建依托于一种融合自动化生成与人工校验的系统化流水线。首先,通过志愿者采集电商平台、预订服务及地图/打车应用中的真实界面截图,构建多样化图像语料。随后,借助大语言模型为每张图像生成与图像内容严格对应的需求及标注答案,并依据任务场景分为单一答案、多重答案与不可解答三类。为使需求更贴近自然语言表达,结构化需求被改写为上下文感知的口语化查询,同时保留必备与偏好需求的层级区分。最后,由四位训练有素的标注员独立校验每对图像-查询的合理性、答案正确性及需求分类准确性,分歧经讨论达成共识,从而保障基准的高质量与标准性,得到总计3649个样本,覆盖三种场景,均衡分布且各具挑战性。
使用方法
FTF-BENCH可作为评估与训练MLLM需求感知推理能力的基准测试。评估时,模型接收一张界面截图像与口语化用户请求文本,需在必备需求约束下筛选候选对象,若存在多个满足项则依据偏好需求优先级排序选择最佳,若无任何候选满足所有必备条件,模型应明确输出拒绝语句。数据集提供统一的评估提示词,规范输出格式,并采用基于MLLM的评判器判断答案语义等价性,以缓解表达差异影响。训练方面,可将数据划分为90%训练与10%验证子集,采用多目标强化学习框架(如FTF-RL),设计奖励函数对齐格式合规、答案正确性及需求分类准确率,引导模型在推理过程中显式分解需求并遵守必要性优先原则。该基准不仅适用于评估,也能用于微调,以增强模型在现实服务场景中的需求感知与决策能力,并有望迁移至更广泛的逻辑与数学推理任务。
背景与挑战
背景概述
随着多模态大语言模型(MLLMs)在真实世界服务场景中作为自主代理的广泛应用,用户需求往往混合了必须满足的硬性条件与可优化的软性偏好,这要求模型具备基于优先级进行推理的能力。然而,现有基准大多聚焦于通用指令遵循,未能充分衡量这种关键能力。为此,上海交通大学与字节跳动等机构的研究人员于2026年提出了FTF-BENCH基准,旨在系统评估MLLMs在电商、预订、地图及叫车平台等多模态场景下的需求感知推理能力。该基准包含3,649个精心构造的样本,分为单一答案、多答案及不可回答三种任务类型,核心研究问题在于模型能否准确区分并优先满足必备需求。FTF-BENCH填补了现有评测在复杂用户需求层次化处理方面的空白,为推动MLLMs向更可靠的真实世界代理迈进提供了重要的评测基座。
当前挑战
FTF-BENCH所针对的领域挑战在于,真实服务场景中用户常以口语化方式混合表达必备与可选需求,模型需在隐含的优先级层次下进行精准推理,现有MLLMs在此类任务上普遍出现灾难性失败,如误解需求、将可选条件误判为硬性约束,或在无可行解时仍强行生成答案。构建过程中亦面临多重挑战:首先,需在多样化界面图像上设计逻辑严谨的需求生成模板;其次,要将结构化需求自然转化为符合语境的表述且不丢失优先级信息;再者,需通过人工验证确保需求分类及答案的正确性,涉及多位标注者的严格核查与分歧消解;最后,还需规避生成模型带来的偏差,确保基准的公正性与可靠性。这些挑战共同构成了FTF-BENCH构建的核心难度,也为后续强化学习方法的设计指明了方向。
常用场景
经典使用场景
FTF-BENCH作为首个聚焦多模态大语言模型(MLLM)在多层次需求理解与推理能力的基准测试,其核心使用场景在于系统评估模型在真实服务环境中对'必须满足'与'最好满足'两类需求的优先级处理能力。该基准精心构建了3,649个涵盖电子商务、预订服务以及地图与打车平台等典型界面的图像-需求配对任务,并细分为单答案、多答案与不可解答三种情境,以全面检验模型是否能在候选对象中准确识别满足刚性约束的唯一解或最优解,以及在无解时合理拒绝回答。通过这一设计,FTF-BENCH为研究者提供了一个标准化的诊断工具,用以剖析MLLM在解析模糊口语化指令、区分需求主次、进行权衡决策等方面的潜在缺陷,从而推动智能体从理想化指令执行向现实复杂服务场景的适应性跨越。
解决学术问题
该数据集直面现有评测体系中将所有指令等量齐观的根本盲区,着力破解MLLM在多重约束条件下需求优先级推理能力匮乏的学术难题。传统基准往往预设清晰无歧义的指令,忽略了真实用户请求中刚性条件与弹性偏好交织的普遍性,导致模型频繁出现将可选需求硬性化或无视核心约束的灾难性失误。FTF-BENCH通过严谨的任务形式化定义,将'必须满足'需求作为逻辑谓词严格筛选可行解,并对'最好满足'需求施加优先级排序以臻选最优项,同时引入不可解答情境以测试模型的弃权智慧,从而精准量化模型在需求层级识别、权衡取舍以及适度拒绝等维度的表现。这一基准的建立填补了该领域缺乏具象化评测工具的空白,为剖析模型意图理解与推理链断裂的根本原因提供了实证基础,刺激了后续对需求感知推理机制的深入探究。
实际应用
在实际应用层面,FTF-BENCH所模拟的服务场景与日常数字生活紧密交织,其衍生能力直接映射为电子商务平台的智能导购、在线旅行预订的酒店与航班筛选、以及地图导航和网约车服务中个性化出行方案推荐等现实功能。例如在电商场景下,系统需依据用户对于商品硬性属性(如规格、色彩)与软性偏好(如价格区间、促销标记)的复杂描述,从海量候选中精准锁定唯一合规商品;在预订服务中则需在满足入住人数、床型等刚性条件基础上,依据早餐包含、室内面积等弹性诉求对不同酒店进行排序推荐。FTF-BENCH所强调的'必要优先于择优'原则,能够有效提升虚拟助理与聊天机器人在真实交互中的任务成功率,降低因误解用户意图而导致的服务失败率,从而增强用户对自动化代理的信任与依赖,推动人机协同的和谐高效。
数据集最近研究
最新研究方向
FTF-BENCH的提出标志着多模态大语言模型在现实服务场景中从单一指令执行向需-求感知推理的范式转向,聚焦于解析用户多层级需求的核心命题。该基准通过构建具备‘必备需求’与‘理想需求’优先级层次的结构化任务体系,精准刻画出当前模型在电商、预订及导航等实际界面中的失效模式,并引入多目标强化学习框架,显式优化模型对需求的分类与排序能力。研究证实,面向需求感知的强化训练不仅能显著提升复杂约束下的决策准确率,更展现出跨模态推理基准的泛化魅力,为强化智能体在动态真实环境中遵循用户意图的稳健性铺设了关键基石。
相关研究论文
  • 1
    First Things First: Teaching LLM-Based Agents to Prioritize Must-Haves before Nice-to-Haves上海交通大学; 字节跳动 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务