遇见数据集

chansung/synth_summarize_dataset

收藏
Hugging Face2024-05-31 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: prompt dtype: string - name: prompt_id dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string - name: category dtype: string - name: generator dtype: string - name: seed_prompt dtype: string splits: - name: test num_bytes: 89079 num_examples: 25 - name: train_sft_gpt4o num_bytes: 1134293655 num_examples: 288440 - name: train_sft_gemini1_5flash num_bytes: 1132074791 num_examples: 291145 - name: train_sft_claude3sonnet num_bytes: 1299831985.5417352 num_examples: 300639 download_size: 573263360 dataset_size: 3566289510.541735 configs: - config_name: default data_files: - split: test path: data/test-* - split: train_sft_gpt4o path: data/train_sft_gpt4o-* - split: train_sft_gemini1_5flash path: data/train_sft_gemini1_5flash-* - split: train_sft_claude3sonnet path: data/train_sft_claude3sonnet-* ---

数据集信息: 特征字段: - 名称:提示词(prompt),数据类型:字符串 - 名称:提示词ID(prompt_id),数据类型:字符串 - 名称:对话消息(messages),为列表类型,列表元素包含: - 名称:内容(content),数据类型:字符串 - 名称:角色(role),数据类型:字符串 - 名称:类别(category),数据类型:字符串 - 名称:生成器(generator),数据类型:字符串 - 名称:种子提示词(seed_prompt),数据类型:字符串 数据集划分: - 划分名称:测试集(test),字节大小:89079,样本数量:25 - 划分名称:GPT-4o 监督微调训练集(train_sft_gpt4o),字节大小:1134293655,样本数量:288440 - 划分名称:Gemini 1.5 Flash 监督微调训练集(train_sft_gemini1_5flash),字节大小:1132074791,样本数量:291145 - 划分名称:Claude 3 Sonnet 监督微调训练集(train_sft_claude3sonnet),字节大小:1299831985.5417352,样本数量:300639 下载大小:573263360 数据集总大小:3566289510.541735 配置项: - 配置名称:默认(default),数据文件: - 对应划分:测试集(test),路径:data/test-* - 对应划分:GPT-4o 监督微调训练集(train_sft_gpt4o),路径:data/train_sft_gpt4o-* - 对应划分:Gemini 1.5 Flash 监督微调训练集(train_sft_gemini1_5flash),路径:data/train_sft_gemini1_5flash-* - 对应划分:Claude 3 Sonnet 监督微调训练集(train_sft_claude3sonnet),路径:data/train_sft_claude3sonnet-*

提供机构:
chansung
原始信息汇总

数据集概述

数据集特征

  • prompt: 数据类型为字符串。
  • prompt_id: 数据类型为字符串。
  • messages: 包含以下子特征:
    • content: 数据类型为字符串。
    • role: 数据类型为字符串。
  • category: 数据类型为字符串。
  • generator: 数据类型为字符串。
  • seed_prompt: 数据类型为字符串。

数据集分割

  • test: 包含25个示例,占用89079字节。
  • train_sft_gpt4o: 包含288440个示例,占用1134293655字节。
  • train_sft_gemini1_5flash: 包含291145个示例,占用1132074791字节。
  • train_sft_claude3sonnet: 包含300639个示例,占用1299831985.5417352字节。

数据集大小

  • 下载大小: 573263360字节。
  • 数据集总大小: 3566289510.541735字节。

配置文件

  • 配置名: default
  • 数据文件路径:
    • test: data/test-*
    • train_sft_gpt4o: data/train_sft_gpt4o-*
    • train_sft_gemini1_5flash: data/train_sft_gemini1_5flash-*
    • train_sft_claude3sonnet: data/train_sft_claude3sonnet-*
搜集汇总
数据集介绍
构建方式
在自然语言处理领域,高质量的摘要生成数据集对于训练和评估模型至关重要。chansung/synth_summarize_dataset 是一个通过合成方式构建的摘要数据集,其核心设计思路是利用多种先进的大语言模型生成对话摘要。数据集的构建过程首先从一组种子提示(seed_prompt)出发,这些提示作为生成任务的起点。随后,不同的生成器(generator),包括 GPT-4o、Gemini 1.5 Flash 和 Claude 3 Sonnet,被分别调用以产生多样化的对话摘要样本。每条样本包含一个原始提示(prompt)、对应的唯一标识符(prompt_id)、结构化的消息序列(messages,包含内容和角色)、类别标签(category)以及生成器和种子提示信息。数据集被划分为测试集和三个训练子集,分别对应不同的生成器,其中测试集包含25个样本,而训练子集规模庞大,每个子集包含近30万个样本,确保了数据的丰富性和覆盖度。
特点
该数据集最显著的特点在于其多生成器合成策略带来的多样性和规模优势。通过引入 GPT-4o、Gemini 1.5 Flash 和 Claude 3 Sonnet 三种不同架构和训练方式的模型作为生成器,数据集在摘要风格、语言表达和内容侧重上呈现出丰富的变异,有助于训练出更具泛化能力的摘要模型。每个样本均包含完整的对话消息序列和角色信息,使得数据集不仅适用于简单的文本摘要任务,还能支持对话式摘要和角色感知的生成场景。此外,数据集提供了明确的类别标签和种子提示来源,便于研究者进行细粒度的分析和控制实验。其近300万条样本的庞大规模,为深度学习模型的训练提供了坚实的数据基础,同时测试集的独立设计保证了评估的公正性。
使用方法
在应用层面,chansung/synth_summarize_dataset 提供了灵活的使用方式。研究者可以直接从 Hugging Face 数据集库加载数据,通过指定配置名称(config_name)为 'default' 来获取所有分片。加载后,数据以标准的字典格式呈现,包含 prompt、prompt_id、messages、category、generator 和 seed_prompt 等字段。对于监督微调(SFT)任务,可以选择使用特定的训练子集,例如 train_sft_gpt4o 专注于 GPT-4o 生成的数据,而 cross-generator 训练则可以混合所有子集以提升模型的鲁棒性。在预处理阶段,可将 messages 字段中的对话内容转换为模型所需的输入格式,并利用 category 和 generator 字段进行数据过滤或分组实验。测试集可用于最终性能评估,确保模型在未见过的生成器数据上的表现。
背景与挑战
背景概述
在自然语言处理领域,大语言模型的指令微调(Supervised Fine-Tuning, SFT)是提升模型遵循指令能力的关键技术路径,而高质量的对话数据则是这一过程的基石。由研究者Chan-Sung于2023年构建的synth_summarize_dataset数据集,旨在通过合成数据生成范式,为模型提供多样化的对话摘要训练样本。该数据集汇聚了来自GPT-4o、Gemini 1.5 Flash及Claude 3 Sonnet三种主流大语言模型生成的近88万条训练实例,覆盖了从种子提示词到多轮对话的结构化信息,开创性地探索了跨模型知识蒸馏与数据增强的融合策略。其发布不仅为对话摘要任务提供了规模化的训练资源,更推动了合成数据在指令微调中的标准化应用,对提升模型在复杂对话场景下的泛化能力具有重要影响。
当前挑战
该数据集面临的核心挑战首先在于合成数据的真实性与多样性平衡问题:尽管通过多模型生成可丰富数据分布,但合成样本仍可能引入模型固有的偏差或重复模式,导致下游模型过度拟合特定生成风格,削弱对真实用户对话的适应力。其次,数据构建过程中需应对跨模型一致性难题——不同生成器对相同种子提示词可能产出语义相似但表达迥异的摘要,如何设计有效的质量筛选与去重机制以确保训练数据的可靠性,成为技术瓶颈。此外,数据集规模庞大(超300万条记录),存储与加载效率对计算资源提出严苛要求,同时缺乏对长尾对话场景的系统覆盖,可能限制模型在罕见或复杂对话结构上的表现。
常用场景
经典使用场景
在自然语言处理领域,摘要生成与指令微调是大型语言模型能力提升的关键环节。chansung/synth_summarize_dataset作为一个大规模合成摘要数据集,其经典使用场景在于为语言模型提供高质量的监督式微调(SFT)训练样本。该数据集包含由GPT-4o、Gemini 1.5 Flash和Claude 3 Sonnet等多种先进模型生成的多样化摘要指令对,覆盖了丰富的提示模板与类别标签,使得研究者能够利用其对模型进行多源知识蒸馏与对齐训练,从而显著提升模型的指令跟随能力和生成摘要的忠实度与流畅性。
实际应用
在实际应用层面,该数据集可被广泛部署于各类需要文本摘要与内容精简的场景中。例如,在新闻聚合平台中,模型可借助该数据集微调后自动生成新闻摘要,提升信息获取效率;在学术文献管理系统中,它可用于生成论文核心观点提炼;在商业智能分析中,它能够帮助快速总结会议纪要或客户反馈。此外,该数据集还可用于构建智能客服对话摘要、法律文书摘要等垂直领域的定制化模型,凭借其丰富的类别和提示结构,显著降低了实际系统对昂贵人工标注数据的依赖,加速了产品落地进程。
衍生相关工作
该数据集的发布催生了一系列相关研究工作。一方面,它被用作基准数据集来评估不同合成数据生成策略对模型性能的影响,催生了关于数据多样性、模型选择与提示工程优化的系统性分析。另一方面,研究者基于其多模型来源特性,探索了集成学习与知识蒸馏方法在摘要任务中的应用,衍生出如跨模型一致性训练、对抗性数据增强等前沿技术。此外,该数据集还促进了针对合成数据质量自动评估与筛选的工具开发,推动了更高效、更可靠的训练数据构建范式,为后续大规模指令微调数据集的标准化建设提供了重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务