conversations_in_OpenAI_format
收藏资源简介:
该数据集将DailyDialog、ESConv、EmpatheticDialogues三个对话数据集转换为标准的OpenAI格式,支持使用LlamaFactory等工具进行标准化微调。同时,在JSON中新增了策略(strategy)和情感(emotion)键,便于情感计算领域的特定方法研究。数据预处理方面,对ESConv进行了精简,移除了冗余属性(如情感/策略强度),并维护严格的用户-助手交替对话结构:连续助手回复被合并,其策略标签取自最后一条回复;若最后一条话语来自用户,则将其删除。数据集构成上,DailyDialog和EmpatheticDialogues包含训练集、验证集和测试集划分,ESConv无划分。该数据集适用于对话系统微调、情感计算等任务。
This dataset converts multiple dialogue datasets (DailyDialog, ESConv, EmpatheticDialogues) into the standard OpenAI format to support fine-tuning using tools like LlamaFactory. Additionally, new keys such as strategy and emotion are added to the JSON to facilitate research in specific methods within the field of affective computing. In terms of data preprocessing, ESConv is simplified by removing redundant attributes (e.g., emotion/strategy intensity) and maintaining a strict user-assistant alternating dialogue structure: consecutive assistant responses are merged, with the strategy label taken from the last response; if the last utterance is from the user, it is deleted. Regarding dataset composition, DailyDialog and EmpatheticDialogues include training, validation, and test splits, while ESConv has no splits. This dataset is suitable for tasks such as dialogue system fine-tuning and affective computing.
数据集概述
该数据集名为 Conversations in OpenAI Format,由用户 jiluoaaron 上传至 Hugging Face。其核心目的是将多个对话数据集转换为标准的 OpenAI 格式,以便于使用 LlamaFactory 等工具进行标准化的模型微调。在转换过程中,数据集中新增了用于标注的键(如策略和情感),以支持情感计算领域的特定研究方法。
数据集组成
该数据集由以下三个知名的对话数据集转换而来,具体内容如下:
| 数据集名称 | 划分情况 |
|---|---|
| DailyDialog | 包含训练集、验证集和测试集 (train-validation-test splits) |
| ESConv | 不包含任何划分 (no splits) |
| EmpatheticDialogues | 包含训练集、验证集和测试集 (train-validation-test splits) |
数据处理细节
- 对于 ESConv 数据集,处理时省略了一些冗余属性,例如情感和策略的强度信息。
- 为了保持严格的用户-助手交替对话结构,当遇到连续的多条助手回复时,系统会将它们的内容合并为一条回复。同时,新合并的助手回复的策略标签会采用最后一条回复的策略。
- 如果对话的最后一条语句来自用户,则该语句会被移除,以确保对话以助手回复作为结束。
补充说明
该数据集的卡片信息中,关于数据集的维护者、语言、许可证、来源链接及论文等详细信息均未提供(标记为 [More Information Needed])。关于数据集的潜在用途、结构、创建过程、注释方式、可能存在的偏见或局限性等信息也尚未完善。




