遇见数据集

ConvFill Dataset

收藏
github2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

ConvFill数据集是一个包含290,571个训练示例的语料库,用于对话填充任务:通过将运行在设备上的小型低延迟说话者模型与在后台推理、检索和调用工具的大型云端推理者模型配对,以保持语音代理的响应性。说话者立即响应用户,并在推理者的知识流式传输时融入其中,从而确保对话在推理者工作时不会停滞。

The ConvFill dataset is a corpus containing 290,571 training examples for the dialogue filling task. It pairs on-device small low-latency speaker models with large cloud-based reasoner models that perform background inference, retrieval and tool invocation to maintain the responsiveness of voice agents. The speaker responds to users instantly, and incorporates the streamed knowledge outputs from the reasoner into its responses, thus ensuring that the conversation does not stall while the reasoner is working.

创建时间:
2026-06-23
原始信息汇总

ConvFill 数据集概述

ConvFill 数据集是一个用于**对话填充(Conversational Infill)**任务的语料库,包含 290,571 个训练样本。该任务旨在通过一个本地运行的轻量级 Talker 模型 与一个云端大模型的 Reasoner 模型 协作,使得语音智能体在 Reasoner 进行推理、检索或调用工具的同时,Talker 能够即时回应用户,避免对话中断。

数据规模与组成

数据集包含 8,443 个对话,共计 74,508 个轮次,每个轮次包含多个短语级别的训练样本。具体数据文件及统计如下:

文件 对话数 轮次数 短语样本数 <sil> 填充样本数 知识样本数
conversations_advice.jsonl 1,000 8,308 36,710 12,342 24,368
conversations_assistant.jsonl 1,000 8,408 37,495 12,676 24,819
conversations_support.jsonl 1,000 8,313 35,862 12,147 23,715
conversations_education.jsonl 1,000 8,421 37,153 12,481 24,672
conversations_medical.jsonl 1,000 8,400 37,246 12,540 24,706
conversations_planning.jsonl 1,005 8,474 37,488 12,655 24,833
conversations_dstc8_scaffold.jsonl 2,438 24,184 68,617 36,711 31,906
总计 8,443 74,508 290,571 111,552 179,019

数据全部为英文。前六个文件覆盖了建议、通用助手查询、客服、教育、医疗和规划领域。conversations_dstc8_scaffold.jsonl 基于 Schema-Guided Dialogue (SGD / DSTC8) 对话框架生成。

数据格式

每个 JSONL 记录包含一个顶层 conversation 数组,每个元素代表一个对话轮次,结构如下:

  • user: 当前轮次的用户话语。
  • thoughts: Reasoner 模型生成的思考流,每个元素是一条知识片段或 <sil>(表示沉默)标记。
  • response: Talker 模型输出的响应流,与 thoughts 一一对应。
  • len(thoughts) == len(response):保证输入输出序列长度相等。
  • response[i]thoughts[i] 对齐:若 thoughts[i]<sil>,则 response[i] 为不依赖未获取知识的填充语;否则,response[i] 应对话式地传达 thoughts[i] 的知识。

示例 JSON 结构: json { "conversation": [ { "user": "Ive been having a really hard time falling asleep lately...", "thoughts": ["<sil>", "How long has this been going on?", "Does this happen at the same time every night or does it vary?"], "response": ["Oh man, that sounds rough.", "How long would you say this has been going on?", "And is it the same time every night, or does it vary a lot?"] } ] }

数据加载

数据集可通过 Python 标准库加载,每个 (thoughts[i], response[i]) 对通常被转换为一个短语级别的训练样本,上下文包含之前的对话轮次及当前轮次中先前的短语。

仓库结构

  • data/: 已发布的 JSONL 数据集与统计数据。
  • generated_data/: 生成管道的默认输出目录。
  • configs/: 各子集的生成配置文件。
  • examples/: 生成提示中使用的少样本示例。
  • topics/: 自由生成子集的主题种子。
  • prompt_template.txtprompt_template_scaffold.txt: 生成提示模板。
  • src/pipeline/: 数据集生成与 LLM 客户端代码。
  • src/validators/: 结构、NLI、BERTScore 和骨架验证。
  • src/evals/generated_data_stats.py: 重新生成 dataset_stats.csv

许可证

  • 代码与支持文件src/configs/ 等)采用 MIT 许可证。
  • 数据data/topics/examples/)采用 CC BY-SA 4.0 许可证。
  • DSTC8/SGD 骨架子集源自 Schema-Guided Dialogue 数据集,亦采用 CC BY-SA 4.0。

引用

若使用该数据集,请引用以下论文:

bibtex @misc{srinivas2026thinkingspeakinginferencetimeknowledge, title={Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents}, author={Vidya Srinivas and Zachary Englhardt and Vikram Iyer and Shwetak Patel}, year={2026}, eprint={2511.07397}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2511.07397}, }

搜集汇总
数据集介绍
ConvFill Dataset 数据集图片
构建方式
ConvFill数据集的构建依托于一种创新的合成生成流水线,旨在模拟对话式填充任务中Talker与Reasoner模型的协同交互。具体而言,研究者利用高性能云端大语言模型(如Claude Opus)作为Reasoner,为每一轮用户输入生成由知识片段与静默标记<sil>交织而成的思考流。而后,基于这些思考流,通过精心设计的提示模板与少量示例,驱动合成一个轻量化Talker模型的输出,使其在应对静默标记时产生上下文感知的填充短语,在面对知识片段时则生成流畅的会话式表述。该流水线涵盖了六个自由形式领域(如建议、客服、教育等)以及基于Schema-Guided Dialogue数据集衍生的脚手架对话子集,总计生成了超过29万条短语级别的训练样本。为确保数据质量,流水线集成了结构验证、自然语言推理、BERTScore以及专有名词检查等多重过滤机制,所有未通过验证的候选样本均会被重新生成,直至满足要求。
使用方法
使用ConvFill数据集时,用户可直接从Hugging Face平台或本仓库的data目录下获取JSONL格式的对话记录。加载过程简便,借助Python标准库的json模块即可逐行解析,每条记录包含一个conversation数组,其中每个元素代表一轮对话,内含用户话语、思考流与响应流三个核心字段。在模型训练中,通常将每个(thoughts[i], response[i])对作为一个短语级别的训练实例,并结合历史对话及当前轮次的前序短语作为上下文输入。对于希望复现或扩展数据集的用户,仓库提供了完整的合成生成流水线,只需配置API密钥并运行相应的生成脚本,即可针对特定领域或自定义主题生成新样本。此外,用户还可通过调整配置文件中的参数(如静默标记数量、知识片段长度等),灵活控制数据的复杂度与风格,以适应不同的研究需求与应用场景。
背景与挑战
背景概述
ConvFill数据集由华盛顿大学保罗·艾伦计算机科学与工程学院的Vidya Srinivas、Zachary Englhardt、Vikram Iyer和Shwetak Patel于2026年创建,旨在解决对话式语音代理在实时响应与深度推理之间的根本矛盾。该数据集围绕“交谈中思考”(Thinking While Speaking)范式,设计了轻量级本地Talker模型与云端Reasoner模型协同工作的框架。Talker即时回应用户,Reasoner在后台进行检索、推理与工具调用,其知识流以短语级别注入Talker的输出中,确保对话流畅无中断。数据集包含290,571个训练样本,覆盖建议、助理、客服、教育、医疗和规划六个自由对话领域,并包含基于Schema-Guided Dialogue(DSTC8)的支架式对话。这一开创性工作为构建响应迅速且具备深度理解能力的语音代理提供了关键数据基础,对实时对话系统与人机交互领域产生了重要影响。
当前挑战
ConvFill数据集面临的核心挑战在于实现Talker与Reasoner模型的无缝协同:Talker需在缺乏完整上下文时生成合理的填充短语,避免偏离用户意图或捏造信息,同时Reasoner的知识流必须实时、准确地融入对话,这对生成模型的事实一致性提出了极高要求。数据集构建过程中,合成数据生成面临双重障碍:一是设计有效的提示模板和少样本示例,确保生成的对话片段覆盖多样化的用户意图与知识类型;二是通过结构验证、自然语言推理、BERTScore和专有名词检查等多层质量控制机制过滤低质量样本,仅验证阶段就耗费约2,400美元的API成本。此外,如何平衡填充短语(<sil>)与知识块的分布比例,以及如何确保跨领域的泛化能力,也是数据集设计与应用中的持续挑战。
常用场景
经典使用场景
在对话式人工智能领域中,实时性与智能性之间的张力始终是核心挑战。ConvFill数据集正是为此而生,其经典的使用场景聚焦于训练一种称为“会话插入”(conversational infill)的机制:在语音代理系统中,一个轻量级、低延迟的Talker模型在本地设备上即时响应用户,同时一个强大的云端Reasoner模型在后台进行推理、检索和工具调用。当Reasoner尚未产出知识时,Talker需生成上下文相关的填充语以维持对话流畅;当Reasoner的知识块到达时,Talker则需将其自然融入对话流。该数据集通过提供海量的、经过对齐的Reasoner思考流与Talker响应短语对,为训练这种能在推理过程中动态整合外部知识的响应生成模型奠定了坚实基础。
解决学术问题
ConvFill数据集精准回应了语音对话系统中一个长期存在且极具挑战性的学术问题:如何在不牺牲响应速度的前提下,赋予设备端模型强大的知识和工具调用能力。传统的云-端分离架构常常导致对话因等待云端推理而产生显著延迟,破坏用户体验;而纯设备端模型虽快,却受限于算力与知识库。该数据集通过引入“推理时知识迁移”这一创新框架,系统性地收集并标注了Talker模型在不同知识就绪状态下的最优响应策略,从而为学术界提供了一种可复现、可扩展的研究范式。其意义在于,它首次构建了一个大规模、多领域(涵盖医疗、教育、客服等)的基准,使得研究者能够量化评估不同模型在动态知识注入场景下的对话流畅度与信息准确性。
实际应用
在实际应用层面,ConvFill数据集所驱动的技术直接服务于对交互体验有极致要求的智能语音系统。在智能客服场景中,用户无需等待系统查询后台数据库即可获得包含情感慰藉的即时回应,随后当知识就绪时,系统能无缝补充解决方案。在医疗咨询领域,设备端Talker模型可以先行安抚患者并收集关键症状,而云端Reasoner则同步检索最新治疗方案或药物相互作用,进而由Talker以口语化方式传达专业建议。教育辅导场景同样受益:Talker实时回应学生的疑问并保持学习对话的节奏,Reasoner则深入检索背景知识,最终以启发式的方式融入教学讲解。该数据集使得“思考与说话同步进行”的愿景从概念走向了工程可行性,极大提升了语音助手在复杂任务中的用户粘性。
数据集最近研究
最新研究方向
在智能语音代理领域,实时响应与深度推理能力之间的天然矛盾始终是技术突破的瓶颈。ConvFill数据集应运而生,它开创性地定义了“对话填充”这一新兴研究方向,通过构建290571条精细化对齐的训练样本,推动了一种异步协作架构的发展:即轻量级Talker模型在设备端即时回应,同时后台强大的Reasoner模型进行推理、检索与工具调用,其流式传入的知识被无缝融入口语表达,彻底消除了对话停滞。这一数据集紧密关联了边缘计算与云端智能融合的前沿浪潮,覆盖建议、客服、医疗等六大自由对话场景及Schema-Guided Dialogue任务,为打造既流畅响应又具备深度理解能力的语音代理提供了关键的训练基座,其合成生成管线与多层验证机制为后续研究树立了高质量基准,对推动智能语音交互迈向更自然、更富智慧的时代具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务