遇见数据集

thu-coai/kd_conv_with_kb

收藏
Hugging Face2024-05-17 更新2024-05-25 收录
官方服务:

资源简介:

KdConv是一个中文多领域知识驱动对话数据集,包含了电影、音乐和旅行三个领域的对话数据。数据集包含4.5K个对话和86K个话语,平均每个对话有19轮。这些对话涉及深入的主题讨论和自然的话题转换,适用于多轮对话建模和知识库设置的任务。数据集的结构包括对话数据和知识库数据,对话数据包含多个轮次的消息和相关的知识图谱三元组,知识库数据则包含知识图谱的三元组信息。数据集分为训练集、验证集和测试集,知识库数据只有训练集。

KdConv是一个中文多领域知识驱动对话数据集,包含了电影、音乐和旅行三个领域的对话数据。数据集包含4.5K个对话和86K个话语,平均每个对话有19轮。这些对话涉及深入的主题讨论和自然的话题转换,适用于多轮对话建模和知识库设置的任务。数据集的结构包括对话数据和知识库数据,对话数据包含多个轮次的消息和相关的知识图谱三元组,知识库数据则包含知识图谱的三元组信息。数据集分为训练集、验证集和测试集,知识库数据只有训练集。

提供机构:
thu-coai
原始信息汇总

数据集概述

数据集名称: KdConv

数据集描述: KdConv是一个中文多领域知识驱动对话数据集,旨在通过多轮对话与知识图谱的结合,支持多轮知识驱动的对话建模。该数据集包含4.5K对话,来自电影、音乐和旅行三个领域,共计86K话语,平均每轮对话19.0次。

支持的任务: 多轮对话建模、知识驱动对话。

语言: 中文

许可证: Apache License 2.0

多语言性: 单语(中文)

数据集大小:

  • 旅行对话:训练集1200例,测试集150例,验证集150例,总大小4652610字节。
  • 旅行知识库:训练集1154例,总大小1517024字节。
  • 音乐对话:训练集1200例,测试集150例,验证集150例,总大小4441109字节。
  • 音乐知识库:训练集4441例,总大小5980643字节。
  • 电影对话:训练集1200例,测试集150例,验证集150例,总大小6708886字节。
  • 电影知识库:训练集8090例,总大小10500882字节。
  • 所有对话:训练集3600例,测试集450例,验证集450例,总大小15802341字节。
  • 所有知识库:训练集13685例,总大小17998529字节。

数据集结构:

  • 对话数据字段:

    • name: 对话的起始话题(实体)
    • domain: 样本所属的领域,分类值为{travel, film, music}
    • messages: 对话中的所有轮次列表,每轮包含:
      • message: 话语
      • attrs: 话语引用的知识图谱三元组列表,每个三元组包含:
        • name: 头部实体
        • attrname: 关系
        • attrvalue: 尾部实体
  • 知识库数据字段:

    • head_entity: 头部实体
    • kb_triplets: 对应的三元组列表
    • domain: 样本所属的领域,分类值为{travel, film, music}

数据分割:

  • 对话数据: 分为训练集、验证集和测试集。
  • 知识库数据: 仅包含训练集。
搜集汇总
数据集介绍
thu-coai/kd_conv_with_kb 数据集图片
构建方式
在对话系统与知识图谱交叉融合的研究背景下,KdConv数据集应运而生,旨在构建多轮知识驱动的中文对话语料。该数据集通过众包与机器辅助相结合的方式构建:首先由标注人员围绕电影、音乐、旅行三个领域的实体发起话题,随后由另一名标注者基于预定义的知识图谱三元组进行多轮互动式对话。每轮对话均关联知识图谱中的实体关系,确保语义连贯性与知识准确性。最终形成了4500组对话、8.6万条语句的多领域语料,平均轮次达19.0。
使用方法
该数据集可通过HuggingFace的datasets库直接加载,支持按领域(travel/film/music)或全量(all)选择对话或知识库配置。例如,使用load_dataset('thu-coai/kd_conv_with_kb', 'travel_dialogues')可获取旅行领域对话数据,每个样本包含name(起始话题)、domain(领域标签)及messages列表。知识库数据则通过load_dataset('thu-coai/kd_conv_with_kb', 'travel_knowledge_base')获取,其head_entity字段与对话中的name字段可建立关联。数据预划分了训练、验证、测试集,便于直接用于对话生成、知识增强等任务的模型训练与评估。
背景与挑战
背景概述
KdConv是由清华大学计算机科学与技术系的研究团队于2020年发布的中文多领域知识驱动对话数据集,由周浩、郑楚杰、黄凯莉、黄民烈和朱小燕等学者共同构建。该数据集旨在解决开放域对话系统中知识融合与多轮对话连贯性的核心研究问题,通过将对话主题锚定于知识图谱,实现了电影、音乐和旅行三个领域的深度话题探讨。KdConv包含4500余条对话和8.6万句语料,平均对话轮次达19.0,为知识增强型对话建模、多领域迁移学习及领域自适应研究提供了重要的基准资源,在自然语言处理领域产生了广泛影响力。
当前挑战
KdConv所解决的领域问题在于,传统对话系统难以在长时间交互中保持话题连贯性并有效利用结构化知识,而该数据集通过知识图谱的引入,要求模型在生成回复时精准关联实体与关系,这对知识推理与语言生成的协同能力提出了严峻挑战。在构建过程中,团队面临了多源知识图谱对齐的复杂性,需确保跨领域实体与三元组的一致性与准确性;同时,人工标注与机器生成结合的注释方式增加了数据质量控制难度,需平衡标注成本与语料多样性,避免引入噪声或领域偏差,从而影响模型在真实场景中的泛化性能。
常用场景
经典使用场景
KdConv作为中文多领域知识驱动对话数据集,其经典使用场景在于构建和评估多轮对话系统中知识图谱的融合能力。研究者利用该数据集训练模型,在电影、音乐和旅游三个领域中模拟人类自然对话,通过引入结构化知识三元组来增强对话的深度与连贯性。该场景尤其关注对话中知识检索与生成的协同,例如模型需从知识库中精准抽取实体关系以回应用户查询,同时维持话题的平滑过渡,从而为知识增强型对话系统提供标准化测试基准。
解决学术问题
该数据集的核心学术贡献在于解决了多轮对话中知识融合与领域迁移的瓶颈问题。传统对话模型常因缺乏结构化知识支撑而陷入浅层闲聊,KdConv通过将对话上下文与知识图谱显式对齐,为研究知识驱动的语义理解与生成提供了可靠载体。它推动了跨领域对话中的迁移学习探索,使模型能在不同知识域间共享抽象模式,并验证了知识图谱在缓解对话稀疏性、提升信息准确性方面的有效性,为构建更智能的对话代理奠定了理论基础。
实际应用
在实际应用中,KdConv催生了一系列智能客服与推荐系统的落地场景。例如,旅游领域的对话数据可用于开发行程规划助手,通过解析用户对景点、交通等实体的偏好,结合知识库动态提供个性化建议;音乐和电影领域的对话则能赋能内容推荐引擎,使系统在自然交互中理解用户品味,并基于知识图谱的关联属性推荐相似作品。此外,该数据集还支撑了多轮问答平台的构建,提升人机交互中信息服务的精准度与流畅性。
数据集最近研究
最新研究方向
当前,知识驱动对话系统作为人工智能领域的前沿方向,正致力于突破传统开放域对话中信息泛化与知识匮乏的瓶颈。KdConv数据集以其多领域(电影、音乐、旅游)多轮对话与知识图谱的深度融合特性,成为研究知识增强型对话模型的关键资源。该数据集不仅支持对话建模与知识库检索的结合,还为跨领域迁移学习与域适应技术提供了丰富的实验场景。近期研究热点聚焦于利用KdConv构建能够感知实体关系、动态调用结构化知识进行逻辑推理的对话系统,探索如何在大规模预训练语言模型中无缝嵌入外部知识,以提升对话的准确性与信息密度。这一方向对于推动智能助手、推荐系统等应用在复杂现实场景中的知识交互能力具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务