遇见数据集

SFC-Bench

收藏
arXiv2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

SFC-Bench是首个大规模语音功能调用数据集,由上海交通大学与阿里巴巴集团联合构建。该数据集基于传统SLU基准(如ATIS、SNIPS、FSC、SLURP)精心筛选并扩展出300个口语功能,通过多智能体系统自动合成涵盖单轮、多轮及多意图等复杂度的查询与标签。其旨在为大型语言模型和大型音频语言模型提供标准化评估框架,突破传统闭集SLU在开放域语义提取中的模糊性局限,推动语音交互向结构化、可泛化的功能调用范式演进。

SFC-Bench is the first large-scale spoken function calling dataset, jointly constructed by Shanghai Jiao Tong University and Alibaba Group. Based on traditional Spoken Language Understanding (SLU) benchmarks including ATIS, SNIPS, FSC and SLURP, this dataset has been carefully screened and expanded to encompass 300 spoken functions. It automatically synthesizes queries and labels with complexities covering single-turn, multi-turn and multi-intent scenarios via a multi-agent system. This dataset aims to provide a standardized evaluation framework for large language models (LLMs) and large audio language models, breaking through the ambiguity limitations of traditional closed-set SLU in open-domain semantic extraction, and advancing the evolution of spoken language interaction towards a structured and generalizable function calling paradigm.

创建时间:
2026-08-06
搜集汇总
数据集介绍
SFC-Bench 数据集图片
构建方式
在任务型对话系统蓬勃发展的背景下,SFC-Bench的构建响应了语音语义理解向开放域演进的迫切需求。该数据集首先基于广泛应用的SLU基准场景,利用Gemini-2.5 Pro将场景转化为结构化函数定义,并参考BFCL与ToolACE等函数调用基准以增强功能多样性与逻辑复杂度,最终通过人工精炼获得包含300个口语工具的元集,覆盖5大领域与21个场景。随后,构建了由查询智能体、标签智能体和语音智能体组成的多智能体生成器,借助GPT-OSS-120B与IndexTTS-2分别完成文本查询生成、函数调用标注及语音合成,并引入环境上下文与模糊语义重写以提升难度。最后,经由验证智能体与人工审核确保数据质量,形成包含单意图、多意图、多轮及域外样本的逾七千条SFC数据。
特点
SFC-Bench作为首个大规模口语函数调用数据集,其核心特性在于以结构化函数定义取代传统意图-槽位框架,从而解决参数边界模糊与意图-槽位耦合不足的固有局限。数据集合成了多层级难度体系,从基础的单词函数调用至多意图、多轮及NAN参数识别,平均答案长度由20词跃升至70词以上,音频时长从7秒延伸至13秒,深刻考验模型在长语音上下文下的结构化解析能力。同时,数据严格区分ID(分布内)与OOD(分布外)函数集,并确保训练、验证与测试集之间说话人完全隔离,为评测模型的泛化性与鲁棒性提供了严谨条件,且其工具集涵盖日常生活五大场景,兼具领域广度与生态效度。
使用方法
SFC-Bench适用于评估与优化大型语言模型及大型音频语言模型在口语函数调用任务上的效能。使用时,模型需依据用户语音查询、环境上下文及可用函数集,输出可直接执行的结构化API调用序列。评估指标涵盖函数名准确率、参数键匹配度及参数值F1分数,并采用总体准确率衡量端到端能力。该数据集支持ICL与SFT两种范式,研究者可结合RL后训练策略(如GRPO与细粒度奖励)提升模型在复杂任务中的表现。此外,通过ID与OOD测试集的双轨评测,可系统验证模型对未见函数和场景的适应能力,为语音智能体的人机协同交互提供标准化评估基准。
背景与挑战
背景概述
SFC-Bench由上海交通大学与阿里巴巴集团的研究团队联合构建,于2026年提出,旨在解决传统口语语言理解(SLU)在开放域任务中依赖预定义规则、难以泛化的问题。该数据集首次将函数调用(Function Calling)范式引入口语语义理解,提出Spoken Function Calling(SFC)这一新视角,通过结构化函数定义取代封闭集意图分类和槽填充,以适配大语言模型(LLMs)和大音频语言模型(LALMs)的上下文学习能力。基于传统SLU数据集,团队整合300个口语函数,覆盖5大领域21个场景,利用多智能体系统合成超7000条多层级、多意图、多轮对话样本,并区分分布内(ID)与分布外(OOD)测试集以评估泛化性。该数据集不仅填补了口语函数调用领域的空白,还通过后训练优化(如GRPO及细粒度奖励)显著提升模型在复杂口语任务上的语义抽取精度,对智能语音助手、人机交互等应用领域具有重要推动作用。
当前挑战
SFC-Bench面临的挑战源于领域任务复杂性与数据构建技术双重层面。领域层面,传统SLU受限于封闭集假设,依赖监督微调记忆规则,难以应对开放词汇和域外任务,而现有函数调用数据集集中于文本代码或数学推理,缺乏口语固有的不确定性(如省略、口误)及环境上下文依赖,导致LALMs在解析多意图和歧义语义时易产生参数幻觉或错误填充。数据构建层面,需从异构SLU基准中提炼统一函数定义,确保功能多样性与逻辑一致性,同时通过多智能体系统生成自然口语句式并合成高质量语音,还需严格区分布内/分布外函数及说话人身份,以避免数据泄漏。此外,多轮对话中需处理环境状态动态变化、参数缺失(NAN)推理及ASR错误传播,对数据集标注一致性和模型鲁棒性构成严峻挑战。
常用场景
经典使用场景
SFC-Bench作为首个大规模口语函数调用基准,旨在评估和提升大语言模型(LLM)与大音频语言模型(LALM)在口语语义理解中的泛化能力。该数据集基于传统SLU基准构建,包含300个口语函数,横跨个人助理、通讯、旅行交通、生活服务及信息检索五大领域,并设计了单意图、多意图、多轮及歧义语义等四级难度任务。其经典使用场景在于通过上下文学习(ICL)和结构化提示,驱动模型动态解析口语指令并生成可执行的API调用序列,从而突破传统SLU依赖闭集意图和槽位预定义的局限,实现开放域任务的语义理解与工具调用。研究者可利用该数据集系统评估模型在语音输入下的函数名识别、参数键匹配及参数值抽取的准确率,尤其关注ASR错误传播和长程语义对齐等挑战。
实际应用
SFC-Bench的实际应用场景紧密贴合智能语音助手的真实需求,涵盖日程管理、提醒设置、导航查询、酒店预订、信息检索等日常生活服务。该数据集支持模型在语音交互中直接调用结构化工具,例如通过口语指令更新提醒内容、查询两地通勤时间或搜索百科知识,且能处理带环境上下文(如位置、时间)的多轮对话。其训练后的模型(如SpokenFC-7B)在语音识别和音频推理等常规任务上保持稳健性能,同时显著提升工具调用的准确率,这使得SFC-Bench可被直接用于开发更智能的语音助理、车载语音系统及智能家居控制中枢,实现从语音输入到任务执行的端到端闭环,提升人机交互的自然度与效率。
衍生相关工作
SFC-Bench的提出催生了一系列相关研究工作。在数据集构建方法上,其多智能体合成框架(包含查询生成、标签生成和语音合成代理)以及人工验证流程,为后续口语任务数据集的自动化构建提供了范式参考。在模型优化方面,该工作提出的基于细粒度奖励的强化学习后训练策略(如GRPO算法),被证明能有效应对结构化函数调用的稀疏奖励问题,并已应用于其他工具学习任务。此外,SFC-Bench的基准评估结果促进了对LALM在口语函数调用中失败模式的深入分析,引发了对模型幻觉抑制、指令遵循强化及跨模态对齐等课题的探讨。后续研究还将其与文本函数调用数据集(如API-Bank)结合,探索语音到文本的功能迁移,进一步拓展了跨模态工具学习的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务