遇见数据集

IHBench

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

IHBench(中断处理基准)是一个专门设计用于评估语音助手在执行结构化、多步骤工作流时,处理用户中断后的恢复能力的基准数据集。与关注中断时机(如抢话检测、端点检测、话轮转换)的基准不同,IHBench专注于评估助手在中断发生后所说内容的质量:它是否能从工作流的正确步骤恢复,回应用户的插话,并避免重复用户已经听过的内容?该数据集包含45个合成生成且经过验证的英语对话,覆盖10个不同的企业领域(如客户服务、技术支持等)。这些对话共包含428个中断点,涵盖了六种中断类型:正常、不耐烦、纠正、话题切换、填充词和反驳。每个中断点都附带一个针对该中断的评估准则。数据集以两种配置提供:1) conversations配置(默认):包含45行数据,每行代表一个完整的对话,对话被修剪至最后一个中断回合结束。每个对话都从助理消息开始,消息严格配对(偶数索引为助理,奇数索引为用户)。数据字段包括对话ID、领域信息、工作流目标、完整的系统指令、知识库(原理、详细指南、已知用户信息、阶段)、用户意图(反应特征、描述、情绪、隐藏信息)、回合数,以及每个回合的助理转录文本(包括被截断前的原始文本)、用户转录文本、用户音频(16 kHz嵌入式音频)、中断类型(若非中断则为None)、任务完成度评估准则和恢复质量评估准则列表。2) baseline配置:包含428行数据,提供了作为任务完成度比较锚点的GPT-4o Audio模型对每个中断的响应,用于计算胜率。评估以每个中断为一个样本。评估过程是:给定模型系统提示和截断至中断用户回合的对话历史(被中断的助理回合仅保留已交付的文本;用户回合为嵌入式音频或其转录文本),让模型生成下一个助理响应,然后从两个维度进行评分:任务完成度(通过与基线响应比较的胜率)和恢复质量(根据每个中断的恢复质量准则判断是否全部满足)。数据集适用于语音代理、中断处理、口语对话系统、多轮对话管理、工作流恢复等任务的研究与评估。需要注意的是,数据集基于合成对话构建,其评估准则继承了生成模型和评判模型的潜在偏差。

IHBench (Interruption Handling Benchmark) is a benchmark dataset specifically designed to evaluate the recovery capabilities of voice assistants when handling user interruptions during structured, multi-step workflows. Unlike benchmarks that focus on interruption timing (such as barge-in detection, endpoint detection, and turn-taking), IHBench concentrates on assessing the quality of the assistants response after an interruption occurs: Can it resume from the correct step in the workflow, respond to the users interjection, and avoid repeating content the user has already heard? The dataset includes 45 synthetically generated and validated English conversations, covering 10 different enterprise domains (e.g., customer service, technical support). These conversations contain a total of 428 interruption points, encompassing six interruption types: normal, impatient, correction, topic shift, filler, and rebuttal. Each interruption point is accompanied by a specific evaluation criterion for that interruption. The dataset is provided in two configurations: 1) conversations configuration (default): Contains 45 rows, each representing a complete conversation trimmed to the end of the last interruption turn. Each conversation starts with an assistant message, with messages strictly paired (even indices for assistant, odd indices for user). Data fields include conversation ID, domain information, workflow objective, full system instructions, knowledge base (principles, detailed guides, known user information, phases), user intent (reaction characteristics, description, emotion, hidden information), number of turns, and for each turn: assistant transcript text (including original text before truncation), user transcript text, user audio (16 kHz embedded audio), interruption type (None if not an interruption), task completion evaluation criteria, and a list of recovery quality evaluation criteria. 2) baseline configuration: Contains 428 rows, providing responses from the GPT-4o Audio model for each interruption as an anchor for task completion comparison, used to calculate win rates. Evaluation is performed per interruption as a sample. The evaluation process is: given the model system prompt and dialogue history truncated to the interrupting user turn (the interrupted assistant turn retains only delivered text; user turns are embedded audio or their transcripts), the model generates the next assistant response, which is then scored on two dimensions: task completion (via win rate compared to baseline responses) and recovery quality (based on whether all recovery quality criteria for that interruption are met). The dataset is suitable for research and evaluation in tasks such as voice agents, interruption handling, spoken dialogue systems, multi-turn dialogue management, and workflow recovery. It is important to note that the dataset is built on synthetic conversations, and its evaluation criteria inherit potential biases from generative and judging models.

创建时间:
2026-06-18
原始信息汇总

数据集概要:IHBench (Interruption Handling Benchmark)

IHBench 是一个专注于评估语音助手在被打断后恢复能力的基准数据集。它衡量的是语音助手在中断后能否正确恢复工作流程、回应插话并避免重复用户已听过的内容,而非中断时机的检测。

数据集核心信息

  • 任务类型:音频文本转文本 (audio-text-to-text)
  • 语言:英语 (English)
  • 许可证:CC-BY-4.0
  • 标签:语音助手 (voice-agents)、中断处理 (interruption-handling)、口语对话 (spoken-dialogue)、基准测试 (benchmark)
  • 领域:涵盖10个企业级应用领域
  • 数据量:包含45个合成生成的验证对话
  • 评估样本:共428个中断点,横跨6种中断类型(正常、不耐烦、纠正、话题切换、填充、反驳)
  • 评估维度:每个中断点从 任务完成度恢复质量 两个维度进行评估

数据集内容与结构

数据集包含两个配置(configs):

  1. conversations (默认配置)

    • 行数:45行,每行代表一个对话。
    • 结构:对话从助手的消息开始,助手和用户消息交替出现(偶数索引为助手消息,奇数索引为用户消息)。对话被修剪至最后一个中断轮次。
    • 关键列
      • conversation_id: 唯一对话ID
      • domain: 领域信息(包含ID,名称和描述)
      • goal: 助手的工作流程目标
      • system_message: 完整的系统提示词
      • knowledge_base: 知识库信息
      • user_intent: 用户意图
      • num_turns: 对话的轮次数
      • assistant_turn_{t}_transcript: 助手实际发出的文本
      • assistant_turn_{t}_original: 被中断的助手消息的完整文本(如未被中断则为None
      • user_turn_{t}_transcript: 用户话语
      • user_turn_{t}_audio: 用户轮次的音频文件 (16 kHz)
      • user_turn_{t}_interruption_type: 中断类型
      • turn_{t}_tf_rubric: 任务完成度评估标准
      • turn_{t}_rq_rubrics: 恢复质量评估标准列表
  2. baseline (基准配置)

    • 行数:428行
    • 用途:包含GPT-4o Audio模型对每个中断点的回复,用作任务完成度比较的锚点(胜率参照)。
    • 关键列
      • conversation_id: 对话ID
      • interrupting_user_message_index: 中断发生的消息索引
      • turn: 轮次数
      • response: 基线模型的回复文本

评估方法

  • 评估样本:每个中断点为一个独立的评估样本。
  • 评估流程
    1. 将系统提示词和对话历史提供给待评估模型。
    2. 模型生成中断后的助手回复。
    3. 任务完成度:通过比较模型回复与GPT-4o Audio基线模型的回复,计算任务完成度的胜率。
    4. 恢复质量:根据预设的评估标准,检查模型回复是否满足所有要求,计算通过率。

引用信息

bibtex @misc{ihbench2026, title = {IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows}, author = {Salimi, Ahmad and Ma, Wentao and Tang, Yuzhi and Shen, Dongming and Li, Mu and Smola, Alex}, year = {2026}, eprint = {arXiv:TODO}, archivePrefix = {arXiv}, primaryClass = {cs.CL}, }

搜集汇总
数据集介绍
IHBench 数据集图片
构建方式
IHBench 是一个专注于评估语音助手在遭遇中断后恢复能力的基准测试数据集。其构建基础为45条经过精心合成与验证的对话,这些对话覆盖了10个企业级应用场景,并包含428个精心设计的中断点。每个中断点隶属于六种中断类型之一(常规、急躁、更正、话题切换、填充语、反驳),并配有详细的评估准则。每条用户发言的音频信息已直接嵌入数据集,便于端到端评估。数据集划分为两个配置:'conversations' 存储完整的对话流与评价指标,'baseline' 则包含GPT-4o Audio模型对每个中断的回复,作为任务完成度比较的基线。
特点
该数据集的核心特色在于其双维度评价体系:任务完成度与恢复质量。任务完成度通过将待测模型的回复与GPT-4o Audio基线的回复进行对比,以胜率作为衡量标准。恢复质量则依据每个中断点预设的严格准则,要求模型回复必须满足全部条件方为通过。此外,IHBench 明确区隔了中断的时机检测与中断后的内容恢复,专注于衡量模型能否在正确的工作流步骤上继续、恰当回应用户的插话并避免重复已传达信息,从而刻画了语音助手在现实交互中的核心能力。
使用方法
使用IHBench需先克隆其官方评测工具包,安装依赖并配置API密钥。通过运行推理脚本,工具包会自动加载数据集,让待测模型针对每个中断点生成回复。随后执行评估脚本,即可从任务完成度与恢复质量两个维度对模型进行评分,并最终输出汇总结果。用户也可自行生成符合指定JSONL格式的模型回复,再利用评估及汇总脚本进行评测。数据集同时支持文本与音频两种输入模式,为不同模态的模型提供了灵活的评测路径。
背景与挑战
背景概述
在人机交互领域,语音代理(voice agents)正日益承担起结构化、多步骤工作流的执行任务,然而,当用户中途打断(interrupt)代理的讲话时,代理能否在被打断后正确恢复工作流、妥善回应用户的插话,并避免重复已传递的信息,成为一个关键但尚未被充分评估的能力缺口。为填补这一空白,Ahmad Salimi、Wentao Ma、Yuzhi Tang、Dongming Shen、Mu Li 与 Alex Smola 等研究人员于2026年创建了 IHBench(Interruption Handling Benchmark)。该基准测试聚焦于语音代理在遭受打断后的恢复能力,而非传统研究关注的打断时序检测(如语音活动端点检测、话轮转换等)。IHBench 包含45条合成生成的对话、涵盖10个企业领域、共计428个打断点,并提供了细粒度的评估框架。该数据集为语音代理的交互鲁棒性研究提供了首个系统化评估工具,有望推动相关领域从基础感知向对话管理的纵深发展。
当前挑战
IHBench 所面临的挑战体现在两个层面。在领域问题层面,现有基准多侧重于检测打断的时机(如语音端点判定),却极少评估代理在打断发生之后是否能在正确步骤恢复工作流、是否恰当处理用户插话以及能否避免冗余信息传递,这一问题直接关系到语音代理在实际企业场景中执行多步骤任务时的可用性与用户体验。在数据集构建层面,所有对话均为合成生成,评估准则和评判模型不可避免地继承了生成模型与评判模型的固有偏见;同时,45条对话与428个可用打断点在统计上相对有限,部分合成对话及尾部打断点因无法生成有效评估项而被剔除,这为评测结果的泛化性与稳定性带来了潜在挑战。
常用场景
经典使用场景
在语音交互系统的评估版图中,IHBench为检测语音助手在结构化多步骤工作流中的中断后恢复能力提供了专门化测试框架。该基准涵盖10个企业领域、45段合成对话与428个中断点,按照正常、急躁、纠正、话题切换、填充词与反驳等六种中断类型精心编排。每个中断点均配有细粒度的评测标准,分别从任务完成度与恢复质量两个维度对助手应对策略进行打分,从而实现对中断处理质量的精准度量。
衍生相关工作
IHBench的开源评估工具链与基准数据集共同推动了多项后续研究。围绕其提出的双重评分机制,研究人员开发了多种针对中断恢复的强化学习训练方法;其六类中断标签体系被广泛应用于对话状态追踪与情感识别模型的扩展训练中。此外,基于该基准的比较结果也为GPT-4o等大规模语音模型的中断处理能力提供了系统性的参照锚点。
数据集最近研究
最新研究方向
语音代理中断恢复能力评估的前沿探索:随着多模态交互系统在客服、医疗和企业级工作流中的广泛应用,如何让语音代理在遭遇用户中断后精准恢复任务流程、平衡任务履行与交互流畅性已成为核心挑战。IHBench作为首个聚焦结构化工作流中断后恢复的基准,通过45段涵盖10个企业领域的合成对话和428个中断点,系统评估模型在用户正常、焦急、纠正、话题切换、填充语及反驳六类中断类型下的行为表现。该数据集提出的任务完成度与恢复质量双轴评分体系,揭示了现有语音代理在上下文保持与用户意图感知上的薄弱环节,为下一代抗干扰语音交互系统的设计与评估提供了关键度量标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务