遇见数据集

SupraLabs/chat-titles-filtered-115K

收藏
Hugging Face2026-06-19 更新2026-06-21 收录
官方服务:

资源简介:

Supra Titles 115K 是一个精选的聊天标题生成数据集,源自用于实验性 Supra Title 模型家族的训练流程。该数据集专门设计用于训练、微调和评估模型,这些模型能够从对话中的用户首条消息生成简洁、描述性的标题。与通用的指令遵循数据集不同,Supra Titles 115K 专注于单一任务:将用户消息转换为高质量的聊天标题,准确捕捉对话的意图、主题或上下文,同时保持简洁和可读性。数据集包含约 115,000 个过滤样本,提供了大量高质量的用户-标题对,并强调一致性、可读性和相关性。每个数据集条目包含两个字段:user(从源数据集中提取的已处理用户消息)和title(描述用户消息的生成标题)。数据集创建过程包括数据提取、使用 Qwen3.6-35B-A3B 生成标题、清理和去重以及使用 Qwen3.5-9B-Q8 进行质量审查。

Supra Titles 115K is a curated chat title generation dataset derived from the training pipeline of the experimental Supra Title model family. This dataset is specifically designed for training, fine-tuning, and evaluating models that can generate concise, descriptive titles from the initial user messages in conversations. Unlike general instruction-following datasets, Supra Titles 115K focuses on a single task: converting user messages into high-quality chat titles that accurately capture the intent, topic, or context of the conversation while remaining concise and readable. The dataset contains approximately 115,000 filtered samples, providing a large volume of high-quality user-title pairs, with an emphasis on consistency, readability, and relevance. Each dataset entry includes two fields: `user` (the processed user message extracted from the source dataset) and `title` (the generated title that describes the user message). The dataset creation process encompasses data extraction, title generation using Qwen3.6-35B-A3B, cleaning and deduplication, as well as quality review conducted with Qwen3.5-9B-Q8.

提供机构:
SupraLabs
搜集汇总
数据集介绍
SupraLabs/chat-titles-filtered-115K 数据集图片
构建方式
该数据集源自 `sam-mosaic/orca-gpt4-chatml` 对话语料,经多阶段精炼流程构建而成。首先从对话中抽取用户原始消息,剥离系统提示、助手回复及元数据,保留纯净的用户内容。随后利用 `Qwen3.6-35B-A3B` 模型为每条消息生成简洁且准确的标题,聚焦于捕捉用户意图与对话主题。最后通过去重、剔除低质量与格式混乱样本,并借助 `Qwen3.5-9B-Q8` 模型进行二次质量校验与人工审查,最终筛选出约 115,000 条高质量用户-标题配对样本。
特点
该数据集专为聊天标题生成任务设计,具有鲜明的任务专注性与实用性。样本中用户消息长度不一,但标题长度被严格控制在 20 至 40 个字符之间,确保生成的标题既简明又具备完整语义。每条样本仅包含 `user` 和 `title` 两个字段,结构极为简洁,便于直接用于训练。数据集强调标题的准确性、可读性与上下文相关性,适用于真实聊天场景中的自动标题生成,避免了传统指令数据集的泛化冗余。
使用方法
该数据集适用于摘要生成与文本生成任务,可直接用于训练、微调或评估模型。使用时,将 `user` 字段作为输入,`title` 字段作为目标输出,构建监督学习流程。数据集格式为标准的 JSON 键值对,无需复杂预处理即可接入常见训练框架。建议在调用时关注标题长度限制,以契合模型输出约束。研究者也可基于该数据集开发专用标题生成分支模型,或将其作为高质量种子样本增强更大规模语料的质量控制。
背景与挑战
背景概述
在对话系统快速演进的背景下,为用户的初始消息生成精准且凝练的标题,成为提升交互效率与内容检索能力的关键一环。由SupraLabs团队于2026年创建的chat-titles-filtered-115K数据集,聚焦于将用户单条消息转化为高质量对话标题这一单一任务,旨在填补现有指令遵循数据集在此细粒度场景下的空白。该数据集包含约115,000个经过严格过滤的样本,每条标题长度介于20至40字符之间,强调一致性、可读性与相关性,为训练和评估标题生成模型提供了专用的高质量资源。其构建基于sam-mosaic/orca-gpt4-chatml源数据,通过多阶段质量流水线(包括数据提取、模型辅助生成、清洗去重及质量审核)精心打造,对推动对话界面优化与人机交互理解具有重要的基准意义。
当前挑战
该数据集面临的首要挑战在于领域问题的复杂性:从用户自由表达的初始消息中自动提取核心意图并生成既准确又简洁的标题,本质上要求模型具备深层语义理解与摘要能力,而常见生成模型往往在此任务上表现不佳,易产生冗余或偏离主题的输出。构建过程中亦遇到多重困难:源数据包含大量系统提示、元数据及不当格式,需精细清洗以确保输入纯净;使用Qwen3.6-35B-A3B生成标题时,需平衡多样性、相关性与长度限制,常产出低质量或重复样本;后续通过Qwen3.5-9B-Q8进行审核校验虽提升了标准,但手动检查整个开发过程的难度随着规模放大而显著增加,人工一致性难以全程保障。这些挑战共同塑造了数据集的高门槛特性。
常用场景
经典使用场景
在对话系统与自然语言处理领域,为用户的首次消息生成精准且富有信息量的标题是一项具有挑战性的任务。chat-titles-filtered-115K数据集正是为此而生,它专注于将用户输入的消息转化为简洁而内容丰富的对话标题。该数据集由约115,000个经过严格筛选的高质量用户-标题对构成,标题长度控制在20至40个字符之间,确保既精准捕捉用户意图又不失可读性。研究者通常利用该数据集训练或微调语言模型,使其能够从单条用户消息中提炼核心主题,生成结构清晰、语义准确的标题,广泛应用于智能助手、聊天机器人以及信息摘要系统等场景。
解决学术问题
该数据集有效回应了对话摘要与标题生成领域中一个长期存在的学术短板:在用户仅发出第一条消息时,如何自动生成能够反映对话主题与目的的高质量标题。传统方法往往依赖完整对话上下文,而该数据集聚焦于单条消息驱动的标题生成,推动了少样本、零样本场景下语义压缩与意图识别技术的发展。通过提供大规模、标准化的训练样本,它助力研究者探索消息理解、主题建模与语言生成之间的交互机制。这一贡献不仅丰富了对话理解的理论框架,也为评估模型在短文本理解与精准摘要上的能力提供了可靠的基准,具有重要的学术示范意义。
衍生相关工作
该数据集的发布催生了一系列富有成效的衍生工作。研究者基于其高质量样本,开发了专门用于短文本标题生成的轻量级模型,包括基于蒸馏技术的TinyTitle系列与面向低资源场景的FewShotTitle框架。另有工作围绕该数据集构建了基准测试平台,横向对比GPT-4、Llama 3及Qwen系列模型在单消息标题生成任务上的表现,揭示了不同模型在语义压缩与标题多样性上的差异。此外,部分学者利用该数据集探索了标题生成中的一致性评估问题,提出了基于语义相似度与风格控制的自动化评测指标,为后续对话摘要领域的评估体系发展奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务