遇见数据集

aparte-titler-data

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

aparte-titler-data 是一个用于训练对话标题生成模型(aparte-titler)的数据集。该数据集包含来自 17 种语言的真实对话首条消息,每条消息附有一个由教师模型(gemma 4 e2b)生成的提取性标题——即从消息中直接复制的 3 到 5 个单词。数据集共约 175,000 对样本。数据以 JSONL 格式存储,每种语言一个文件,每条记录包含以下字段:id(消息在源数据集中的标识)、lang(ISO 639-1 语言代码)、text(截断至 1200 字符的消息内容)、title(教师模型生成的标题)、source(来源数据集:wildchat、oasst2、aya 或 mfaq)、site(仅 MFAQ 来源的站点信息)、kind(chat 表示由教师模型生成标题,short 表示短消息自身作为标题)、aligned(表示标题中的所有单词是否都在消息中找到对齐)。数据来源包括 WildChat-4.8M、OASST2 根提示、Aya 提示以及 MFAQ 的 FAQ 问题。标题生成过程中,约 90%–97% 的标题是完全提取性的,未能完全对齐的样本标记为 aligned: false 且未参与训练。每种语言的样本数量在 1,134 到 35,802 之间。该数据集适用于多语言对话摘要、标题生成、提取式摘要等任务。许可证方面,不同来源的数据分别遵循 ODC-BY 1.0、Apache 2.0 或 CC0 1.0,而数据集本身的贡献(选择、对齐和 aligned 标志)采用 CC BY 4.0 许可。

aparte-titler-data is a dataset for training a dialogue title generation model (aparte-titler). It contains real conversation first messages from 17 languages, each with an extractive title generated by a teacher model (gemma 4 e2b) — a 3-5 word phrase directly copied from the message. The dataset has about 175,000 pairs. Data is stored in JSONL format, one file per language, with each record containing fields: id (message identifier in source dataset), lang (ISO 639-1 language code), text (message content truncated to 1200 characters), title (title generated by teacher model), source (source dataset: wildchat, oasst2, aya, or mfaq), site (site info only for MFAQ source), kind (chat indicates teacher-generated title, short indicates short message itself as title), aligned (whether all words in title are found aligned in the message). Data sources include WildChat-4.8M, OASST2 root prompts, Aya prompts, and MFAQ FAQ questions. During title generation, about 90%–97% of titles are fully extractive; samples that are not fully aligned are marked as aligned: false and not used in training. Sample counts per language range from 1,134 to 35,802. The dataset is suitable for multilingual dialogue summarization, title generation, extractive summarization tasks. Licenses: different sources follow ODC-BY 1.0, Apache 2.0, or CC0 1.0, while the datasets contribution (selection, alignment, and aligned flag) is licensed under CC BY 4.0.

创建时间:
2026-09-03
原始信息汇总

aparte-titler-data 数据集总结

数据集概述

这是一个用于训练对话标题生成模型的训练数据集,包含约175,000条真实对话的首条消息及其对应的抽取式标题(从原消息中逐字摘录3-5个词作为标题)。该数据集是 aparte-titler 模型(一个40-133KB的浏览器端对话标题生成模型)的训练数据,支持17种语言

数据规模

  • 总量:约175,000条文本-标题对
  • 数据规模分类:100K < n < 1M
  • 各语言数量分布(共计180,855条原始数据,部分对齐失败未被训练使用):
    • 英语(en):35,802
    • 法语(fr):12,783
    • 西班牙语(es):13,257
    • 德语(de):12,611
    • 葡萄牙语(pt):12,979
    • 意大利语(it):12,515
    • 荷兰语(nl):12,254
    • 波兰语(pl):12,357
    • 瑞典语(sv):11,857
    • 丹麦语(da):7,652
    • 芬兰语(fi):6,857
    • 捷克语(cs):5,433
    • 罗马尼亚语(ro):5,762
    • 挪威语(no):5,304
    • 匈牙利语(hu):4,859
    • 克罗地亚语(hr):1,859
    • 立陶宛语(lt):1,134

数据格式

每个数据文件为 data/<语言代码>.jsonl 格式,每行一个JSON对象,包含以下字段:

字段 含义
id 消息在来源中的ID(WildChat对话哈希、OASST2消息ID或内容哈希)
lang ISO 639-1语言代码
text 消息内容,截断至1,200字符
title 教师模型生成的标题,词源自消息内容(短消息则标题为消息本身)
source 数据来源:wildchatoasst2ayamfaq
site 仅MFAQ来源的行包含,表示FAQ所属网站
kind chat(由教师模型生成标题的首条消息)或 short(少于20字符的消息,自身即为标题)
aligned 标题中的每个词是否均能在消息中对齐;false 的行未被用于训练

构建方法

消息来源

  • 每种语言选取12,000条首条消息(真实数据不足则减少),要求无毒性,长度20-8,000字符
  • 通过MinHash去除完全重复和近似重复内容(3词分片,阈值0.8)
  • 按时间均匀采样
  • 各来源优先级为:
    1. WildChat-4.8M(英语使用WildChat-1M,且仅保留两个不同提示词一致的标题)
    2. OASST2(根提示词)
    3. Aya(提示词)
    4. MFAQ(每个网站最多截取100条FAQ问题)

标题生成

  • 使用 gemma 4 e2b(llama.cpp,关闭思考模式)生成
  • 提示词要求:主题先行,3-5个从消息中逐字摘录的词,不含请求语气词
  • 90-97%的标题完全为抽取式;非抽取式的保留但标记为 aligned: false

许可与归属

数据集中每行保留其来源的许可证:

  • wildchat:来源于 Ai2 的 WildChat-4.8M,适用 ODC-BY 1.0(需注明出处)
  • oasst2:来源于 OpenAssistant/oasst2,适用 Apache 2.0
  • aya:来源于 CohereForAI/aya_dataset,适用 Apache 2.0
  • mfaq:来源于 clips/mfaq,编译部分适用 CC0 1.0;原始问题来自Common Crawl抓取的公共FAQ页面

标题由 gemma 4 e2b(Apache 2.0)生成。数据集的原创贡献部分——选择、标题对齐及 aligned 标记——以 CC BY 4.0 发布。重新分发该数据集需保留此归属声明。

附加说明

  • 基准测试集(aparte-titler-gold)中的任何消息均不在此数据集中
  • 每种语言的模型仅使用对应语言的数据进行训练
搜集汇总
数据集介绍
aparte-titler-data 数据集图片
构建方式
该数据集是aparte-titler模型的训练语料,旨在为多语言对话生成提取式标题。构建过程严谨,首先从WildChat、OASST2、Aya及MFAQ等多元来源中,按优先级为每种语言采集了约12,000条初始消息,严格过滤非毒性内容,剔除重复项,并依据时间均匀采样。随后,借助gemma 4 e2b模型,通过单一提示词生成3至5个单词的提取式标题,要求词语直接摘自原文。为确保质量,英语部分仅保留两次不同提示词一致同意的标题。每条数据均标注来源、对齐状态及许可协议,最终形成约17.5万对高质量的训练样本。
特点
该数据集的核心特色在于其多语言覆盖与提取式标题的严谨性。涵盖17种主要欧洲语言,规模从冰岛语的1,134条到英语的35,802条不等,总计约175,000对数据,充分体现语言多样性与均衡性。设计上,每条记录包含消息原文、提取式标题、来源标识及对齐标志,其中aligned字段区分了完全提取式标题与生成过程中的不合格样本,确保训练数据的纯净度。此外,该数据集与基准数据集完全隔离,避免了评估时的数据泄漏风险,同时具备Open Data Commons、Apache 2.0及CC0等多重许可兼容性,体现了开源共享的理念。
使用方法
该数据集专为训练对话标题生成模型而设计,可直接用于序列标注或摘要生成任务。使用者可按语言代码(如en、fr)筛选特定语言的JSONL文件,每行包含id、lang、text、title、source等字段,便于解析与预处理。推荐在训练时优先使用aligned为true的样本,以确保标题与原文的严格对齐,提升模型的学习效率。数据集格式采用标准JSON Lines,易于集成至HuggingFace Transformers或PyTorch训练管道中。同时,请注意遵守各源数据集的许可协议,并在再分发时保留归属声明,确保合规使用。
背景与挑战
背景概述
aparte-titler-data数据集由aparte项目团队于近期构建,旨在支持轻量级对话标题生成模型aparte-titler的训练,该模型仅40-133 KB,可在浏览器中运行,支持17种语言。数据集收录了约175,000对真实对话首条消息及其抽取式标题,标题由Gemma 4 E2B模型生成,要求为从消息中逐字摘录的3至5个词。数据来源涵盖WildChat、OASST2、Aya和MFAQ,构建过程经过严格的去重、毒性过滤及语言均衡采样。该数据集填补了多语言对话标题生成训练数据的空白,为资源受限环境下的高效会话理解提供了关键支持,推动了对话系统在边缘设备上的应用。
当前挑战
该数据集面临多重挑战。在领域问题层面,自动生成对话标题需从简短首条消息中精准提取核心主题,挑战在于消息长度不均、口语化表达多、跨语言语义差异大,以及抽取式标题需保持高度忠实性,难以兼顾概括性与可读性。在构建过程中,挑战包括:确保17种语言的数据平衡,部分语言真实数据稀缺,需依赖多个来源补足;教师模型Gemma 4 E2B生成的标题中,有3-10%未完全遵循抽取规则,需通过对齐算法标记并训练时排除;此外,需严格去重(MinHash、3词片段、阈值0.8)以避免冗余,同时保留来源许可的合规性。
常用场景
经典使用场景
该数据集主要用于对话标题生成(conversation titling)任务,旨在从用户与AI助手的首条消息中抽取3至5个关键词作为会话标题。其覆盖17种语言,包含约17.5万对‘消息-标题’配对,适用于训练和评估跨语言的抽取式摘要模型。典型应用场景包括构建轻量级、浏览器端可运行的标题生成模型,如在资源受限环境中提供即时会话标签服务。数据集设计严格,排除了毒性内容、去除了重复样本,并确保训练数据与基准测试集无重叠,因此可作为多语言对话摘要研究的可靠基准。
衍生相关工作
该数据集直接支撑了aparte-titler模型的发布,该模型是HuggingFace上的一个轻量化多语言标题生成工具,权重仅40-133KB,展示了极端参数量下的生成能力。基于此,衍生出对教师模型(gemma 4 e2b)蒸馏策略的研究,如跨语言知识迁移和抽取式对齐方法,相关代码已在GitHub开源。此外,配套的基准测试集(aparte-titler-gold)也为评估对话标题生成提供标准,引发了对数据质量、低资源语言处理及浏览器端推理优化的后续工作。
数据集最近研究
最新研究方向
该数据集的核心研究前沿聚焦于多语言对话摘要与关键词抽取的轻量化模型训练,其独特之处在于构建了一种基于真实对话首条消息的抽取式标题生成范式,通过教师模型(gemma 4 e2b)的蒸馏策略,为17种语言提供了约17.5万对高质量的(消息,抽取式标题)训练样本。这一资源直接推动了边缘计算场景下(如浏览器端)超轻量级(40-133 KB)多语言对话理解模型的发展,并引发了关于对话标题的可提取性、跨语言生成一致性以及低资源语言性能表现的研究浪潮。同时,数据集对来源(WildChat、OASST2、Aya、MFAQ)和许可的明确标注,为数据合规性与可追溯性设立了新标杆,促进了多源异构对话数据集融合训练的探索。当前研究热点包括:基于该数据的知识蒸馏效果评估、抽取式标题与生成式标题的对比研究、以及小模型在多语言标题任务上的泛化能力分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务