遇见数据集

SupraLabs/chat-titles-12K

收藏
Hugging Face2026-06-19 更新2026-06-14 收录
官方服务:

资源简介:

Supra Titles 12K 是一个精选的聊天标题生成数据集,源自用于实验性 Supra Title 模型家族的训练流程。该数据集专门设计用于训练、微调和评估模型,这些模型能够从用户对话的第一条消息生成简洁、描述性的标题。与一般的指令遵循数据集不同,Supra Titles 12K 专注于单一任务:将用户消息转换为高质量聊天标题,准确捕捉对话的意图、主题或上下文,同时保持简洁和可读性。数据集构建自过滤的对话数据,原始数据来源于 `sam-mosaic/orca-gpt4-chatml` 数据集。用户消息被提取、清理,并通过多阶段质量流程处理,以提高一致性并减少噪声。生成过程包括数据提取、标题生成(使用 Qwen3.6-35B-A3B 模型)、清理和去重以及质量审查(使用 Qwen3.5-9B-Q8 模型)。每个数据集条目包含两个字段:user(从源数据集中提取的处理后的用户消息)和title(描述用户消息的生成标题)。

Supra Titles 12K is a curated chat title generation dataset derived from the training pipeline used for the experimental Supra Title model family. The dataset is designed specifically for training, fine-tuning, and evaluating models that generate concise, descriptive titles from a users first message in a conversation. Unlike general instruction-following datasets, Supra Titles 12K focuses on a single task: transforming a user message into a high-quality chat title that accurately captures the intent, topic, or context of the conversation while remaining concise and readable. The dataset was constructed from filtered conversation data originating from the `sam-mosaic/orca-gpt4-chatml` dataset. User messages were extracted, cleaned, and processed through a multi-stage quality pipeline designed to improve consistency and reduce noise. The generation process included data extraction, title generation (using Qwen3.6-35B-A3B), cleaning and deduplication, and quality review (using Qwen3.5-9B-Q8). Each dataset entry contains two fields: user (the processed user message extracted from the source dataset) and title (a generated title describing the users message).

提供机构:
SupraLabs
搜集汇总
数据集介绍
SupraLabs/chat-titles-12K 数据集图片
构建方式
本数据集源自 `sam-mosaic/orca-gpt4-chatml` 中的对话数据,经过精细的抽取与清洗流程构建而成。首先,从源数据中提取用户消息,移除系统提示、助手回复及冗余元数据,仅保留与用户意图直接相关的核心内容。随后,利用 Qwen3.6-35B-A3B 模型为每条用户消息生成高质量标题,专注于捕捉对话的意图、主题或上下文,同时确保标题简洁且具可读性。在此基础上,执行去重与质量过滤,剔除低质量、格式错误或含义模糊的样本,并由 Qwen3.5-9B-Q8 模型进行额外验证,最终经过人工审查以确保数据集整体的一致性。
特点
本数据集专为聊天标题生成任务而设计,聚焦于将用户的首条消息转化为精准、简洁且富有描述性的标题。与通用指令遵循数据集不同,它专注于单一任务,从而在特定场景下提供高一致性与专业性。每条数据包含 `user` 和 `title` 两个字段,前者为处理后的用户消息,后者为生成的标题,结构清晰,便于直接用于模型训练与评估。数据集规模约为 12,000 条样本,经过多阶段质量管道过滤,确保了内容的可靠性与实用性,适用于真实聊天应用中的标题生成场景。
使用方法
本数据集适用于训练、微调及评估聊天标题生成模型。用户可直接加载数据集,将 `user` 字段作为模型输入,`title` 字段作为目标输出,进行有监督学习。例如,可用于训练序列到序列模型或大型语言模型,使其学会从用户消息中提取关键信息并生成简明标题。此外,该数据集也可用于零样本或少样本评估,测试模型在聊天标题生成任务上的泛化能力。推荐的评估指标包括 BLEU、ROUGE 及人工评分,以衡量生成标题的准确性与可读性。使用时需注明数据来源,遵守 CC-BY-4.0 许可证。
背景与挑战
背景概述
随着对话式人工智能的飞速发展,如何从用户首条消息中自动提炼出精准且具概括性的对话标题,成为提升人机交互体验的关键技术瓶颈。为此,SupraLabs团队于2026年创建了chat-titles-12K数据集,该数据集由研究者QyrouNnet-AI主导开发,专注于解决从用户消息到高质量聊天标题的生成任务。数据集源于对sam-mosaic/orca-gpt4-chatml对话数据的精心筛选与多阶段管道处理,涵盖数据提取、标题生成(借助Qwen3.6-35B-A3B模型)、清洗去重及质量审核(含Qwen3.5-9B-Q8验证)等环节,最终凝练出约12,000条精炼样本。作为面向标题生成任务的专用资源,该数据集为模型训练、微调与评估提供了标准化基准,对推动对话摘要与意图捕获技术的研究具有重要价值。
当前挑战
数据集所聚焦的核心挑战在于,对话标题生成不同于常规摘要任务,需在极短文本中同时兼顾用户意图的精确性、主题的完整性以及表达的简洁性,这对模型的语义理解和抽象概括能力提出了较高要求。在构建过程中,原始对话数据存在大量噪音,例如系统提示、元数据和不规范格式的干扰,须通过繁复的清洗流程加以剔除;同时,标题的生成依赖大语言模型,如何确保生成结果的一致性与高质量,避免歧义或空洞标题,并在此基础上进行有效的去重与质量复审,成为数据集建设中的关键技术难题。此外,跨领域、多意图的用户消息进一步加剧了标题表征的复杂度,使得数据筛选与标注的标准化尤为困难。
常用场景
经典使用场景
在对话系统与自然语言生成领域,为用户的首次消息自动生成精炼且信息丰富的标题是一项具有挑战性的任务。chat-titles-12K数据集专为此场景设计,其经典用法在于训练模型将用户输入的原始对话片段转化为一段高度概括的题目。该数据集聚焦于单一指令,从用户消息中提取对话意图、主题或上下文,生成兼具准确性与可读性的简洁标题,广泛应用于聊天标题生成任务的模型微调与评估。
解决学术问题
该数据集有效回应了自动摘要与对话理解研究中的关键难题:如何从无结构的用户首条消息中提取核心语义并凝练成标题。它解决了传统数据集缺乏针对聊天标题任务的专用标注、噪音多且格式不一的问题。通过提供经过多阶段清洗与质量校验的高质量样本,chat-titles-12K推动了少样本对话标题生成、信息压缩与意图识别等学术研究的发展,为探索自然语言中的核心内容抽取提供了坚实的基石。
衍生相关工作
基于chat-titles-12K数据集,研究者们衍生出多项经典工作,包括探索更大规模标题生成模型的鲁棒性训练、结合对比学习优化标题与用户消息的语义对齐,以及开发面向多语言对话场景的迁移学习框架。该数据集也常被用作基准测试集,在对话理解与生成领域的论文中用于评估不同模型在标题生成任务上的性能,并激发了后续关于低资源条件下标题质量自动评估指标的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务