botp/Azure99_blossom-chat-v3
收藏资源简介:
Blossom Chat V3是一个基于ShareGPT 90K的中英双语对话数据集,适用于多轮对话微调。该数据集完全使用GPT-4进行蒸馏,解决了中文对话数据量较少和输出截断问题。数据集中中英文数据按照约1:1的比例混合,每条数据代表一个完整的多轮对话,包含id和conversations两个字段。conversations字段包含role和content,分别代表用户输入和助手输出。数据集存在多轮对话不连贯和回答不准确的问题。
Blossom Chat V3 is a Chinese-English bilingual dialogue dataset based on the ShareGPT 90K corpus, tailored for multi-turn dialogue fine-tuning. This dataset is fully distilled using GPT-4, addressing the challenges of limited scale of Chinese dialogue data and output truncation. The dataset mixes Chinese and English data at an approximate 1:1 ratio. Each entry represents a complete multi-turn dialogue, containing two fields: "id" and "conversations". The "conversations" field includes "role" and "content", which respectively denote user inputs and assistant outputs. Nevertheless, the dataset suffers from issues including incoherent multi-turn dialogues and inaccurate responses.
数据集概述
数据集名称
BLOSSOM CHAT V3
数据集来源
基于ShareGPT 90K衍生而来,专门用于中英双语多轮对话微调。
数据集特点
- 完全使用GPT-4进行蒸馏。
- 解决了中文对话数据量较少和ChatGPT生成长度限制导致的输出截断问题。
- 本次发布的数据量为全量数据的50%,包含5K记录。
语言
数据集主要包含中文和英文,两者按照约1:1的比例混合。
数据集结构
- id:从1开始递增的唯一标识。
- conversations:包含多个对象的数组,每个对象有
role和content两个字段。role:取值为user或assistant,分别代表用户输入和助手输出。content:对应的内容。
数据集限制
- 可能存在多轮对话不连贯的情况,特别是在涉及随机性的对话中。
- 所有响应由gpt-4-0125-preview生成,未经过严格的数据校验,可能包含不准确甚至严重错误的回答。




