遇见数据集

vadrami/dialogsum

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

DIALOGSum Corpus是一个大规模对话摘要数据集,包含13,460个对话(外加100个用于主题生成的保留数据),每个对话都配有相应的人工标注摘要和主题。该数据集旨在支持对话摘要任务,数据来源于多个公开对话语料库,如Dailydialog、DREAM和MuTual,以及一个英语口语练习网站,覆盖了日常生活中的广泛主题,包括学校教育、工作、医疗、购物、休闲和旅行等。对话通常发生在朋友、同事或服务提供者与客户之间,具有清晰的沟通模式和意图,适合用于自动摘要研究。数据集被划分为训练集(12,460个对话)、验证集(500个对话)和测试集(1,500个对话),并包含一个保留集(100个对话,仅含ID、对话和主题字段)。每个数据实例包括对话文本、人工编写的摘要、主题以及唯一ID。数据集的创建基于真实场景,强调传递最突出的信息、简洁性、保留重要命名实体、从观察者视角编写并使用正式语言。

DialogSum is a large-scale dialogue summarization dataset, consisting of 13,460 dialogues (plus 100 holdout data for topic generation) with corresponding manually labeled summaries and topics. It is designed for summarization tasks and derived from multiple public dialogue corpora, including Dailydialog, DREAM, and MuTual, as well as an English speaking practice website. The dialogues cover a wide range of daily-life topics such as schooling, work, medication, shopping, leisure, and travel, typically occurring between friends, colleagues, or service providers and customers, featuring clear communication patterns and intents suitable for automatic summarization. The dataset is split into train (12,460 dialogues), validation (500 dialogues), test (1,500 dialogues), and a holdout set (100 dialogues with only ID, dialogue, and topic fields). Each instance includes the dialogue text, human-written summary, topic, and a unique ID. The curation rationale emphasizes conveying salient information, brevity, preserving important named entities, writing from an observer perspective, and using formal language.

提供机构:
vadrami
搜集汇总
数据集介绍
vadrami/dialogsum 数据集图片
构建方式
DialogSum是一个大规模对话摘要数据集,其构建依托于三个公开对话语料库——Dailydialog、DREAM和MuTual,并辅以一个英语口语练习网站的数据来源。这些语料库涵盖日常生活的广泛主题,如学业、工作、医疗、购物、休闲与旅行,对话场景包括朋友闲聊、同事协作以及服务提供者与顾客的互动。在构建过程中,语言专家遵循严格准则对每个对话进行摘要标注:需传递最显著的信息、保持简洁、保留关键命名实体、采用观察者视角并以正式语言撰写。最终数据集包含13,460个对话样本及其对应的人工撰写摘要与主题标签,并按12460/500/1500的比例划分为训练集、验证集和测试集。
特点
DialogSum数据集的核心特点在于其真实生活场景的丰富性与多样性,相较于先前数据集,它涵盖了更多面向任务的场景,对话具有清晰的交流模式与意图,非常适合作为摘要生成的源材料。对话长度适中,便于自动摘要模型处理。每个样本包含对话文本、人工撰写的摘要及主题标签,其中摘要需传达最核心信息并保留关键实体,主题则简练概括对话主旨。此外,数据集还包含100个用于主题生成的保留样本,进一步拓展了其应用范围。
使用方法
DialogSum可广泛用于对话摘要、文本到文本生成及文本生成等自然语言处理任务。用户可通过HuggingFace数据集库直接加载数据,每条样本包含'dialogue'、'summary'、'topic'和'id'四个字段。针对摘要任务,模型可基于对话生成摘要或主题;在主题生成任务中,可利用测试集中的'holdout'样本评估模型对未见过对话的泛化能力。建议使用官方划分的训练、验证和测试集进行模型训练与评估,并遵循CC BY-NC-SA 4.0许可协议进行学术或非商业用途。
背景与挑战
背景概述
对话摘要任务旨在将冗长的对话内容凝练为简洁的摘要,在信息爆炸的时代具有重要的应用价值。然而,早期对话摘要数据集多聚焦于特定领域或任务导向型对话,缺乏涵盖多样化日常场景的大规模资源。为弥补这一空白,Yulong Chen、Yang Liu等研究者在2021年提出了DialogSum数据集,其创建得到了ACL-IJCNLP 2021会议的认可。该数据集从DailyDialog、DREAM、MuTual及英语口语练习网站中收集了13,460段对话,覆盖学校、工作、医疗、购物、休闲等广泛的生活主题,并配备了由语言专家人工标注的摘要和主题。DialogSum以其丰富的真实生活场景、清晰的沟通模式及合理的对话长度,显著推动了对话摘要领域的研究,成为评估模型在非结构化、多领域对话中生成摘要能力的重要基准。
当前挑战
DialogSum所解决的领域核心挑战在于,面对日常对话中话题跳跃、指代模糊及口语化表达等复杂语言现象,如何从冗长且信息分散的对话中提取最关键信息并生成连贯、简洁的摘要,这要求模型具备深层语义理解与信息压缩能力。在数据集构建过程中,挑战亦不容小觑:首先,需从不同来源(如任务导向对话、开放域对话)的语料中筛选出具有明确交流意图与合理长度的对话,以保证摘要源的多样性;其次,标注者需遵循严格准则,在保留关键命名实体与正式书面语风格的前提下,兼顾信息显著性与简洁性,这对标注专家的语言素养与一致性提出了极高要求。
常用场景
经典使用场景
DialogSum作为大规模对话摘要数据集,涵盖日常对话场景,如医疗咨询、购物、休闲等,经典使用场景在于训练和评估对话摘要模型,要求模型从多轮对话中提取核心信息,生成简洁且保留关键实体(如人名、地点)的摘要。其12460条训练样本和明确的人为标注标准(如观察者视角、正式语言)使其成为对话理解与生成领域的基准测试平台,尤其适用于低资源环境下对话摘要任务的微调与评估。
衍生相关工作
DialogSum衍生了一系列经典工作,包括基于预训练语言模型(如BART、T5)的对话摘要优化方法,以及引入对比学习或图神经网络以增强对话中说话人角色和话题转换的建模能力。同时,该数据集催生了面向对话摘要的评估指标研究,如考虑事实一致性和实体保留率的专用评测方案。此外,以DialogSum为基准的模型也推动了对话推理、情感摘要等跨任务联合学习的探索,成为对话理解领域的重要基石。
数据集最近研究
最新研究方向
围绕对话摘要生成的前沿探索,DialogSum数据集正成为多模态与预训练语言模型微调的关键基准。近期研究聚焦于如何利用该数据集提升模型对复杂对话结构(如多轮意图与角色变换)的语义压缩能力,并结合大规模语言模型(如GPT系列)进行零样本与少样本摘要质量的对比分析。此外,受真实场景中“话题生成”任务的启发,研究者尝试融合主题建模与摘要生成,以增强生成结果的上下文连贯性与信息密度。该数据集的发布推动了对话式人工智能在客服、医疗咨询等热点领域的应用落地,为评估摘要准确性、事实一致性及命名实体保留率提供了标准化平台,其影响力已延伸至跨语言对话理解与领域自适应摘要等前沿课题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务