遇见数据集

conversations_in_OpenAI_format

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

该数据集将DailyDialog、ESConv、EmpatheticDialogues三个对话数据集转换为标准的OpenAI格式,支持使用LlamaFactory等工具进行标准化微调。同时,在JSON中新增了策略(strategy)和情感(emotion)键,便于情感计算领域的特定方法研究。数据预处理方面,对ESConv进行了精简,移除了冗余属性(如情感/策略强度),并维护严格的用户-助手交替对话结构:连续助手回复被合并,其策略标签取自最后一条回复;若最后一条话语来自用户,则将其删除。数据集构成上,DailyDialog和EmpatheticDialogues包含训练集、验证集和测试集划分,ESConv无划分。该数据集适用于对话系统微调、情感计算等任务。

This dataset converts multiple dialogue datasets (DailyDialog, ESConv, EmpatheticDialogues) into the standard OpenAI format to support fine-tuning using tools like LlamaFactory. Additionally, new keys such as strategy and emotion are added to the JSON to facilitate research in specific methods within the field of affective computing. In terms of data preprocessing, ESConv is simplified by removing redundant attributes (e.g., emotion/strategy intensity) and maintaining a strict user-assistant alternating dialogue structure: consecutive assistant responses are merged, with the strategy label taken from the last response; if the last utterance is from the user, it is deleted. Regarding dataset composition, DailyDialog and EmpatheticDialogues include training, validation, and test splits, while ESConv has no splits. This dataset is suitable for tasks such as dialogue system fine-tuning and affective computing.

创建时间:
2026-08-31
原始信息汇总

数据集概述

该数据集名为 Conversations in OpenAI Format,由用户 jiluoaaron 上传至 Hugging Face。其核心目的是将多个对话数据集转换为标准的 OpenAI 格式,以便于使用 LlamaFactory 等工具进行标准化的模型微调。在转换过程中,数据集中新增了用于标注的键(如策略和情感),以支持情感计算领域的特定研究方法。

数据集组成

该数据集由以下三个知名的对话数据集转换而来,具体内容如下:

数据集名称 划分情况
DailyDialog 包含训练集、验证集和测试集 (train-validation-test splits)
ESConv 不包含任何划分 (no splits)
EmpatheticDialogues 包含训练集、验证集和测试集 (train-validation-test splits)

数据处理细节

  • 对于 ESConv 数据集,处理时省略了一些冗余属性,例如情感和策略的强度信息。
  • 为了保持严格的用户-助手交替对话结构,当遇到连续的多条助手回复时,系统会将它们的内容合并为一条回复。同时,新合并的助手回复的策略标签会采用最后一条回复的策略。
  • 如果对话的最后一条语句来自用户,则该语句会被移除,以确保对话以助手回复作为结束。

补充说明

该数据集的卡片信息中,关于数据集的维护者语言许可证来源链接论文等详细信息均未提供(标记为 [More Information Needed])。关于数据集的潜在用途、结构、创建过程、注释方式、可能存在的偏见或局限性等信息也尚未完善。

搜集汇总
数据集介绍
conversations_in_OpenAI_format 数据集图片
构建方式
该数据集由多种经典的对话数据集转换而来,包括DailyDialog、ESConv和EmpatheticDialogues,其核心目标是统一为OpenAI标准的对话格式,以便于使用LlamaFactory等工具进行标准化的微调。在转换过程中,对原始数据进行了细致的清理与重构:剔除了ESConv中如情感强度等冗余属性,合并了连续的助手回复并标注最后一条的策略,同时移除了以用户话语结尾的片段,确保对话严格遵循用户与助手交替进行的结构。此外,数据集中还新增了策略与情感等标注键,以支持情感计算领域的特定研究方法。数据集划分上,DailyDialog和EmpatheticDialogues保留了各自的训练、验证和测试分割,而ESConv则整体作为一个集合使用。
特点
该数据集的显著特色在于其标准化的OpenAI格式与丰富的情感计算标注的融合。它不仅提供了适用于主流微调框架的通用接口,还通过引入策略和情感等元数据,为研究对话系统中的情感支持与策略选择提供了坚实基础。数据集的构建严格维护了对话的交替性,避免了格式歧义,同时通过合并连续助手回复并保留最后一条策略的方式,确保了每个助手回合的策略标签具有明确指向性。此外,数据集的来源多元,覆盖了日常对话、情感支持以及同理心回应等多类场景,使得基于此数据集的模型训练能够兼顾通用性与专用性,为情感对话系统的研发提供了兼具规模与深度的数据支撑。
使用方法
使用时,研究人员可直接加载该数据集,将其作为标准输入用于LlamaFactory或其他兼容OpenAI格式的微调工具,进行对话模型的指令微调或参数高效微调。对于希望深入探索情感计算的用户,数据集内嵌的策略与情感标签可作为监督信号,用于训练策略选择模块或情感识别模型。鉴于数据集已对对话结构和元数据进行了规范化处理,用户无需进行繁琐的预处理,即可专注于模型架构的设计与训练策略的优化。需注意的是,ESConv部分没有预先设定分割,使用者应根据研究目标自行划分训练与测试集,或整体用于特定场景的领域适应训练。
背景与挑战
背景概述
随着大型语言模型在对话系统领域的广泛应用,标准化微调流程与情感计算研究的融合成为前沿趋势。该数据集于近年由学术与工业界研究者共同构建,旨在将多个经典对话数据集统一转换为OpenAI格式,以适配如LlamaFactory等微调框架,从而提升模型训练的高效性与可复现性。核心研究问题聚焦于如何在保持对话结构严谨性的同时,注入情感与策略注释,为情感感知对话生成提供数据基础。其影响力体现在为情感计算与对话AI的交叉研究提供了标准化资源,促进了多数据集间的比较与集成学习。
当前挑战
该数据集面临的挑战多维且相互交织。领域层面,对话系统需处理自然语言的多义性与上下文依赖性,而情感识别与策略选择的高度主观性加剧了标注一致性难题;同时,跨数据集格式差异与注释粒度不统一,对标准化的实现构成障碍。构建过程中,为维持严格的用户-助手交替对话模式,需合并连续助手回复并仅保留末条策略标签,此操作可能丢失细粒度情感信息;移除用户末轮对话则牺牲了部分实际交互的自然终止状态。此外,冗余属性如情感/策略强度的省略,虽简化了数据结构,却限制了深度情感建模的可能性。
常用场景
经典使用场景
该数据集将多个经典对话语料库统一转换为OpenAI标准格式,为对话系统的标准化微调提供了便捷途径。其核心应用在于利用LlamaFactory等工具进行大规模语言模型的指令微调,通过统一的格式简化了数据预处理流程,使得研究者能够快速地将不同来源的对话数据用于模型训练,从而有效提升模型在对话生成、情感支持等任务上的性能表现。
解决学术问题
该数据集解决了多源对话数据格式不统一、难以直接用于先进微调框架的学术难题。通过整合DailyDialog、ESConv和EmpatheticDialogues等资源,并引入策略和情感等注释信息,为情感计算和人机交互领域的可控对话生成研究提供了标准化数据基础,促进了跨数据集比较和模型泛化能力的提升。
衍生相关工作
基于该数据集,研究者已衍生出系列工作,包括利用统一格式进行多任务学习、策略情感联合建模以及基于对话历史的情感响应生成等。同时,该数据集促进了跨数据集迁移学习研究,并为评估模型在情感支持任务中的表现提供了标准化基准,推动了对话AI领域向更富同理心和适应性的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务