遇见数据集

HuggingFaceTB/openhermes_filtered

收藏
Hugging Face2024-02-20 更新2024-03-04 收录
官方服务:

资源简介:

这是一个OpenHermes 2.5数据集的过滤版本,移除了非英语指令和不适合生成故事的部分子集。数据集包含三个主要特征:类别、来源和提示。数据集被分为一个训练集,包含732,509个例子,总大小为1,026,332,050字节。下载大小为557,491,441字节。数据集的语言为英语,标签为合成。具体移除了来源为camelai和glaive-code-assist,以及类别为coding、wordgame、riddle、rp和gtkm的数据。

这是一个OpenHermes 2.5数据集的过滤版本,移除了非英语指令和不适合生成故事的部分子集。数据集包含三个主要特征:类别、来源和提示。数据集被分为一个训练集,包含732,509个例子,总大小为1,026,332,050字节。下载大小为557,491,441字节。数据集的语言为英语,标签为合成。具体移除了来源为camelai和glaive-code-assist,以及类别为coding、wordgame、riddle、rp和gtkm的数据。

提供机构:
HuggingFaceTB
原始信息汇总

数据集概述

数据集信息

  • 特征:
    • category: 类型为字符串
    • source: 类型为字符串
    • prompt: 类型为字符串
  • 分割:
    • train: 包含1026332050字节,732509个样本
  • 下载大小: 557491441字节
  • 数据集大小: 1026332050字节

配置

  • 配置名称: default
    • 数据文件:
      • train: 路径为data/train-*

语言

  • 英语

标签

  • 合成数据
搜集汇总
数据集介绍
HuggingFaceTB/openhermes_filtered 数据集图片
构建方式
在自然语言处理与生成式模型的研究中,高质量指令微调数据集对模型性能的提升至关重要。HuggingFaceTB/openhermes_filtered 数据集源自著名的 OpenHermes 2.5 数据集,经过精细过滤构建而成。构建者首先依据语言特征筛除了非英语指令,随后针对生成故事场景的适用性,剔除了特定来源与类别的子集。具体而言,来源方面排除了 camelai 和 glaive-code-assist,类别方面去除了 coding、wordgame、riddle、rp 和 gtkm,从而保留了对叙事生成更有价值的样本。最终数据集包含约 73 万条训练样本,以 prompt、category 和 source 三个字段结构化存储,为后续模型微调提供了精炼且聚焦的语料基础。
特点
该数据集的核心特点体现在其针对性与高效性上。通过去除与故事生成关联度较低的编码、文字游戏、谜题等类别,数据集在保留指令多样性的同时,强化了叙事相关的语义丰富度。所有样本均为英文,避免了多语言混杂带来的噪声,提升了跨场景迁移的稳定性。此外,数据集仅包含训练集分裂,格式简洁统一,每条记录由 prompt 字段承载核心指令内容,category 和 source 字段则便于用户按需求进行二次筛选或分析。这种结构既降低了使用门槛,又为研究者提供了灵活的扩展空间。
使用方法
使用者可通过 Hugging Face Datasets 库便捷加载该数据集,直接指定配置名为 default 即可获取训练分裂的全部数据。数据以 Parquet 格式存储,支持流式读取以应对大规模训练需求。在应用时,用户可借助 category 或 source 字段按需过滤子集,例如仅保留特定类别的指令用于特定任务微调。由于数据已过滤为非英文和低相关性内容,适合直接用于生成式模型的指令微调或作为故事生成任务的训练语料。推荐结合 transformers 库的 Trainer 或自定义训练循环,将 prompt 字段作为输入,配合目标输出进行序列到序列的学习。
背景与挑战
背景概述
在大型语言模型(LLM)的快速发展中,高质量的指令微调数据集是提升模型对齐能力与生成质量的核心资源。OpenHermes 2.5 作为一款广泛使用的合成数据集,由 Teknium 团队于 2023 年发布,汇聚了来自多种来源的指令-响应对,旨在增强模型在对话、推理与创作等任务中的表现。然而,原始数据集存在语言混杂、部分子集与故事生成任务不匹配等问题。为此,HuggingFaceTB 团队于 2024 年推出了 OpenHermes 2.5 的过滤版本(openhermes_filtered),通过剔除非英语指令以及编码、字谜、角色扮演等不适宜的子集,聚焦于提升模型在叙事生成领域的适用性。该过滤数据集共包含约 73 万个样本,为故事生成等创造性任务提供了更纯净的训练基础,推动了语言模型在特定生成场景中的精细化研究。
当前挑战
该数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,原始 OpenHermes 2.5 数据集虽涵盖广泛任务,但其非英语样本与编码、推理等子集对故事生成任务构成干扰,导致模型在创造性叙事中引入不协调的逻辑或语言模式。过滤版本需精准识别并移除这些不相关样本,同时保留对话、创意写作等有益内容,这对分类规则的制定与数据清洗的鲁棒性提出高要求。其次,在构建过程中,过滤操作依赖人工预设的丢弃规则(如剔除 camelai 与 glaive-code-assist 来源),这种基于关键词与来源的筛选方法可能误删部分潜在有效数据,或遗漏隐藏在保留子集中的噪声样本。此外,大规模数据的语言检测与子集划分需要高效的自动化流程,确保过滤后数据集在规模与质量间取得平衡,避免因过度过滤导致数据多样性不足,影响模型的泛化能力。
常用场景
经典使用场景
在自然语言处理与生成式人工智能的交叉领域中,OpenHermes 2.5 filtered 数据集常被用于微调大规模语言模型,以提升其在英语指令理解与故事生成任务上的表现。该数据集通过对原始 OpenHermes 2.5 进行精细筛选,剔除非英语指令以及编码、字谜、谜语、角色扮演等不适宜故事生成的子集,从而构建出一个高质量、聚焦于叙事与开放域对话的语料库。研究者利用其丰富的 prompt 与 category 标注,可系统性地训练模型掌握连贯叙事、情感表达与上下文一致性,为生成式模型的领域适配提供了坚实的数据基础。
衍生相关工作
围绕该数据集衍生了一系列具有影响力的研究工作,包括针对叙事连贯性的评估框架与面向低资源语言的跨领域迁移方法。其中,部分工作基于其筛选逻辑提出了自适应数据过滤策略,将类似方法应用于多语言故事生成任务。另有研究以其为训练基础,探索了提示工程与少样本学习在叙事质量控制中的协同作用,推动了生成式模型在文学创作辅助工具中的落地。这些工作共同构建了从数据筛选到模型部署的完整技术链条,巩固了该数据集在开放域生成研究中的基准地位。
数据集最近研究
最新研究方向
在大型语言模型微调数据集的构建与精炼领域,HuggingFaceTB/openhermes_filtered 代表了前沿研究方向中对数据质量与任务适配性的精细化追求。该数据集源自 OpenHermes 2.5,通过系统性地剔除非英语指令及编码、文字游戏、谜语、角色扮演和通用知识问答等类别,聚焦于生成式叙事场景的优化。这一过滤策略呼应了当前学术界对合成数据噪声控制与领域特异性增强的热点讨论,特别是针对故事生成任务中数据分布偏差的纠正。其影响在于为后续模型在创意写作、语境连贯性等高级语言生成任务上提供了更纯净的训练基础,推动了从通用指令微调向特定能力定向强化的范式转变,对提升生成文本的叙事质量与人类偏好对齐具有方法论上的示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务