遇见数据集

bosonai/IHBench

收藏
Hugging Face2026-06-19 更新2026-06-21 收录
官方服务:

资源简介:

IHBench是一个用于评估语音代理在结构化多步骤工作流中中断后恢复能力的基准测试。与衡量中断时机(如打断检测、端点检测、轮转)的基准不同,IHBench专注于评估中断后代理的响应:是否在正确步骤恢复工作流、处理用户插话,并避免重复用户已听过的内容。该基准包含45个合成生成且经过验证的对话,覆盖10个企业领域,具有428个中断点,涵盖六种中断类型(正常、不耐烦、纠正、话题切换、填充语、反驳)。每个中断都带有单独的中断评估标准,并在任务完成度和恢复质量两个轴上进行评分。数据集中每个用户回合的音频都直接嵌入。

IHBench evaluates post-interruption recovery in voice agents executing structured, multi-step workflows. Unlike benchmarks that measure the timing of interruptions (barge-in detection, endpointing, turn-taking), IHBench measures what the agent says after an interruption: does it resume the workflow at the correct step, address the users interjection, and avoid re-delivering content the user already heard? The benchmark contains 45 synthetically generated, verified conversations across 10 enterprise domains, with 428 interruption points spanning six interruption types (normal, impatient, correction, topic switch, filler, pushback). Each interruption carries a per-interruption evaluation rubric and is scored on two axes: task fulfillment and recovery quality. Audio for every user turn is embedded directly in the dataset.

提供机构:
bosonai
搜集汇总
数据集介绍
bosonai/IHBench 数据集图片
构建方式
IHBench数据集旨在评估语音智能体在执行结构化多步骤工作流时遭遇中断后的恢复能力。其构建基于合成对话技术,跨越10个企业领域,精心设计并生成了45段经过验证的对话样本,总计包含428个中断点。这些中断点依据用户行为模式被划分为六种类型,包括正常打断、不耐烦、纠正、话题切换、填充语以及反驳。每一个中断点均配有专属的评价准则,从任务完成度与回复质量两个核心维度进行量化评分。用户每一轮语音交互的音频数据均直接内嵌于数据集中,便于直接的端到端评估。
使用方法
使用IHBench进行模型评估需遵循一套标准化流程。首先,研究者需通过官方工具包加载数据集,并使用配置的模型生成对中断点的回复。随后,利用工具包中的双轴评价机制进行打分:任务完成度方面,采用对比评判方法,将模型回复与GPT-4o Audio基线进行比较,计算胜率;回复质量方面,则依据每个中断点预设的恢复质量准则,检查模型回复是否满足所有标准。最终,通过汇总脚本输出任务完成度胜率与回复质量通过率。该流程支持通过JSONL格式接入自定义模型,并提供了详细的架构说明以供直接数据消费。
背景与挑战
背景概述
随着语音助手在复杂工作流场景中的广泛应用,中断后恢复能力成为衡量其鲁棒性的关键指标。由Boson AI团队于2026年提出的IHBench(中断处理基准测试),针对结构化多步骤语音工作流中的中断后恢复任务构建了首个标准化评估框架。核心研究人员Salimi、Ma、Tang、Shen、Li与Smola聚焦于智能体在用户中断后能否正确恢复工作流步骤、回应插入信息并避免重复已传达内容的挑战。该数据集覆盖10个企业领域,包含45段合成对话与428个中断点,通过任务完成度与恢复质量双轴评分,为语音交互系统的人机协同能力提供了新型度量范式。
当前挑战
IHBench解决的领域核心挑战在于,现有语音基准测试仅衡量打断时机(如语音端点检测),而忽视中断后的智能体响应质量——即如何在复杂工作流中平衡任务连续性、用户即时需求与信息冗余控制。构建过程中,研究人员面临双重挑战:首先需设计六类符合真实场景的中断类型(如紧急打断、修正性打断、话题转移等),并确保每类中断点含有明确的任务完成度与恢复质量评估标准;其次,合成对话必须兼顾企业领域知识、用户意图隐藏信息与智能体系统提示之间的动态交互,以规避生成器与评判模型的偏见对数据集效度的影响。
常用场景
经典使用场景
IHBench(中断处理基准)是专为评估语音助手在结构化多步骤工作流中的中断后恢复能力而设计的基准数据集。在智能语音交互领域,现有评估体系多聚焦于中断的时机感知(如语音打断检测、端点识别和话轮转换),而IHBench独辟蹊径,衡量代理在用户打断后如何优雅地恢复对话——能否正确回溯工作流步骤、妥善回应用户的插话意图,并避免重复已传达的内容。该数据集包含45段精心合成并验证的对话,横跨10个企业级领域,涵盖428个中断点,覆盖正常、急躁、纠正、主题切换、填充语和反驳六种中断类型,每个中断点均配有评估细则,分别从任务完成度和恢复质量两个维度进行评分。
解决学术问题
IHBench深刻回应了学术界在评估语音代理鲁棒性时面临的核心痛点:即现有基准多局限于“是否检测到中断”这一二元指标,而忽视了中断后对话恢复的复杂性和语义连续性。该数据集系统性地构建了多维度评估框架,解决了如何在任务导向型对话中量化代理对用户突发插话的适应能力这一关键问题。其学术意义在于,它首次将中断后恢复视为一个融合对话管理、工作流推理和用户意图理解的综合能力进行严格评测,为多模态人机交互研究提供了可重复、可比较的标准化方法。通过区分任务完成度与恢复质量,该基准有力推动了语音代理在复杂、动态交互场景中的可靠性与智能化进化。
实际应用
在实际应用层面,IHBench为构建面向企业场景的鲁棒语音助手提供了关键的质量标尺。在客服中心、智能工单处理、医疗问诊记录、金融业务咨询等高频互动领域,用户经常因急于调整信息或纠正错误而打断代理,此时代理能否无缝衔接被打断的工作流、准确把握用户情绪的微妙变化并维持任务的连贯性,直接决定了用户体验与服务效率。该数据集能够助力开发者诊断模型的薄弱环节,如代理在打断后是否重复已完成的步骤、是否遗漏用户的关键修正提示,从而有针对性地优化对话策略。基于IHBench,企业可快速对不同语音模型进行横向对比,筛选出更适应实际业务复杂性的方案。
数据集最近研究
最新研究方向
IHBench为语音智能体在结构化工作流场景中的被打断后恢复能力提供了首个系统化评估基准,这一前沿研究方向聚焦于测量智能体在遭遇用户插话、打断、转移话题等六类交互干扰后,能否精准定位工作流断点、合理解答用户插言并避免重复已传递内容。该基准覆盖10个企业领域、428个中断点,以任务完成率与恢复质量双维度打分,破解了当前语音交互评测仅关注打断时机检测而忽略恢复体面性的关键瓶颈。在大模型驱动的语音助手日趋商业应用的当下,IHBench的发布弥补了对话交互中恢复能力的标准化缺失,为构建流畅、自然且具备上下文觉察能力的新一代企业级语音智能体奠定了评测基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务