遇见数据集

aparte-titler-gold

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

aparte-titler-gold 是 aparte-titler 项目的一部分,是一个用于抽取式会话标题生成(extractive conversation titling)的基准测试数据集。该数据集包含来自17种语言的4,732条消息,其中4,247条已评分。每条消息是对话中的第一条消息,任务是从该消息中逐字复制3-5个词作为标题。数据格式为 JSONL 文件,每行一个 JSON 对象,包含以下字段:id(消息ID)、lang(语言)、text(消息文本,截断至1200字符)、source(来源数据集)、bucket(消息长度类别:short、medium、long、very_long)、title(主要参考标题,由Claude模型生成)、impossible(布尔值,表示消息是否无法提取3个有用词)、off_language(布尔值,表示消息是否不是其文件对应的语言)、references(所有可用的参考标题及其标注者和字符偏移)。多个大型语言模型(如Claude、Gemma)作为标注者提供了参考标题。评估指标为词级别F1,计算候选标题与参考标题的匹配度,排除impossible和off_language的行。数据来自多个来源,包括WildChat、OASST2、Aya、MFAQ等。该数据集仅作为测试集使用,不可用于训练。参考标题和注释以CC BY 4.0许可发布,消息内容保留各自来源的原始许可。

Aparte-titler-gold is part of the aparte-titler project, a benchmark dataset for extractive conversation titling. The dataset contains 4,732 messages from 17 languages, of which 4,247 are scored. Each message is the first message in a conversation, and the task is to verbatim copy 3-5 words from the message as the title. The data format is JSONL, with each line being a JSON object containing the following fields: id (message ID), lang (language), text (message text, truncated to 1200 characters), source (source dataset), bucket (message length category: short, medium, long, very_long), title (primary reference title generated by the Claude model), impossible (boolean indicating whether the message cannot extract 3 useful words), off_language (boolean indicating whether the message is not in the language of its file), references (all available reference titles with annotators and character offsets). Multiple large language models (e.g., Claude, Gemma) served as annotators providing reference titles. The evaluation metric is word-level F1, measuring the match between candidate titles and reference titles, excluding rows with impossible or off_language. Data comes from multiple sources, including WildChat, OASST2, Aya, MFAQ, etc. This dataset is only used as a test set and cannot be used for training. Reference titles and annotations are released under the CC BY 4.0 license, while message content retains the original licenses from their respective sources.

创建时间:
2026-09-03
原始信息汇总

aparte-titler-gold 数据集概述

基本信息

  • 许可证:CC BY-4.0(参考标题与标注部分,© 2026 Paul Richez)
  • 语言:包含 17 种语言(英语、法语、西班牙语、德语、葡萄牙语、意大利语、荷兰语、波兰语、瑞典语、丹麦语、芬兰语、捷克语、罗马尼亚语、挪威语、匈牙利语、克罗地亚语、立陶宛语)
  • 任务类型:token 分类(token-classification)、摘要(summarization)
  • 数据规模:1,000 < N < 10,000
  • 数据集配置:默认配置,数据文件为 gold/*.jsonl

核心用途

作为 提取式对话标题生成 的基准测试集:给定对话的第一条消息,生成一个从该消息中逐词复制的 3 至 5 个词的标题。共包含 17 种语言的 4,732 条消息,其中 4,247 条被评分,每条消息包含一个或多个由前沿模型盲注并逐词校验的参考标题。

重要提示:此数据集是 aparte-titler 模型的测试集,禁止用于训练

数据格式

每行一个 JSON 对象,字段含义如下:

字段 含义
id, lang, text, source 消息内容(截断至 1,200 字符)、语言及来源数据集
bucket 消息长度类别:short(<100字符)、medium(<400)、long(<1,500)、very_long
title 主要参考标题:由 Claude (Fable) 从消息中按顺序复制的 3–5 个词
impossible 当消息无法提取出 3 个有意义的词时为 true(如问候语、乱码、原始代码),评分时跳过该行
off_language 当消息语言与文件标注语言不符时为 true,评分时跳过该行
references 所有可用参考标题,格式为 [{annotator, title, spans}]spans 为标题各词在消息中的字符偏移量

标注者信息

  • claude-fable-5-1:覆盖全部 17 种语言(盲注、单次生成、机械验证每个词均存在于原文且顺序正确、大小写精确匹配)
  • gemma-4-e2b-it:覆盖全部 17 种语言(模型训练阶段的教师模型,使用生产环境提示词)
  • 英语额外标注者:claude-opus(原始标注)、claude-sonnet、gemma-4-26b-a4b-it、gemma-4-12b-it
  • 法语额外标注者:claude-sonnet

评分数据与语言分布

各语言已评分/总数统计(完整数据见 counts.json):英语 296/300、法语 293/300、西班牙语 282/300、德语 234/282、葡萄牙语 288/300、意大利语 263/300、荷兰语 201/243、波兰语 268/296、瑞典语 282/300、丹麦语 267/300、芬兰语 228/300、捷克语 277/300、罗马尼亚语 289/300、挪威语 238/300、匈牙利语 263/300、克罗地亚语 184/197、立陶宛语 94/114。

未评分的 485 行中,403 行为 impossible,84 行为 off_language

评测指标

采用 词级 F1 分数,比较候选标题与参考标题(词转为小写并去除标点),排除 impossibleoff_language 行。仅使用主要参考标题进行报告,使教师模型与其他模型在同一标准下被评分。

  • 两位在全部语言可用的标注者之间的 F1 一致性为 0.61–0.82(真实对话语言的区间为 0.61–0.72,简短 FAQ 风格数据更高)
  • 该任务允许多个合理的标题,真实对话场景下高于约 0.75 的分数不再具有区分意义
  • 若需更公平的单条消息评分,可对 references 取最大值

局限说明

主要参考标题来自单一标注者,因此分数衡量的是系统复现该标注者的程度。在 9% 的消息上,两位可用标注者生成的标题完全没有共同词——常见于“指令+粘贴文档”型消息,一位标注者按任务命名,另一位按文档命名,规则无法解决此类情况。

构建方法

消息来源与训练数据相同的池子(但无重叠),并按长度类别平衡采样。标注规则的详细说明及机械验证方法见标注协议文档。每位标注者独立查看消息,规则为“3–5 个词,逐词精确复制,按消息顺序,主语优先,跳过请求类词汇”,输出被机械校验直到每个词都能在消息中逐字找到。教师模型的标题来自其正常生产运行。

数据来源与许可

  • 参考标题和标注:CC BY 4.0(© 2026 Paul Richez)
  • 原始消息保留其来源数据集的许可:
    • WildChat-4.8M(ODC-BY)
    • OASST2(Apache 2.0)
    • Aya(Apache 2.0)
    • MFAQ(CC0)
    • 英语和法语消息来自 WildChat-1M(ODC-BY)
搜集汇总
数据集介绍
aparte-titler-gold 数据集图片
构建方式
该数据集作为aparte-titler项目的黄金测试基准,精心构建以评估跨17种语言的抽取式对话标题生成能力。其数据源自WildChat、OASST2、Aya及MFAQ等大型语料库,依据消息长度均衡采样,确保覆盖短、中、长及超长消息。每个样本的首条消息均被截断至1200字符,并由前沿模型在盲测条件下撰写3至5个词的标题,经程序逐词核验确保词汇逐字来自原文。数据集包含4732条消息,其中4247条经过评分,每条消息配备一个或多个独立生成的参考标题,并辅以详细元数据,如语言、来源及不可用标记(impossible或off_language),从而保证评估的全面性与可追溯性。
特点
该数据集的核心特点在于其严苛的参考标题构建协议与多语言覆盖广度。参考标题由Claude、Gemma等顶尖模型匿名生成,要求严格遵循原文措辞与顺序,确保标题的抽取性质。数据集特别标注了无法生成有义标题的消息(如问候语、乱码),以及语言标注错误的样本,后者虽未删除但被标记以便审计。此外,数据集提供多样化的参考标题集合,反映了同一消息可能存在多种有效标题,并通过词级F1分数评估系统性能,同时指出高分在真实对话场景中可能不具区分度,凸显了任务的主观性。该数据集强调不可用于训练,专供测试,其设计兼顾了严格性与实用性。
使用方法
使用者可通过评估脚本score.py计算候选标题与参考标题之间的词级F1分数,需注意排除标记为impossible或off_language的行。数据以JSON Lines格式存储于gold/<lang>.jsonl文件中,每个对象包含消息文本、语言、长度分类、主要参考标题及所有可用参考及字符偏移。推荐利用多参考标题的最大F1分数以获得更公平的单条消息评分。该数据集集成于aparte-titler模型生态,适合在浏览器端测试轻量级模型性能,并支持跨语言基准比较。鉴于不同标注者之间的一致性有限(0.61-0.82),建议阅读结果时考虑参考标题的多样性,避免过高解读单一指标的绝对意义。
背景与挑战
背景概述
aparte-titler-gold数据集于2026年由Paul Richez及其团队构建,作为aparte-titler模型(一种轻量级浏览器端对话标题生成模型)的基准测试集。该数据集聚焦于提取式对话标题生成任务,涵盖17种语言,包含4,732条消息,其中4,247条经过评分,每条消息均配有由前沿模型盲写并经逐词验证的参考标题。其创建旨在评估模型能否从对话首条消息中提取3至5个词作为标题,推动多语言、低资源场景下的对话理解与摘要研究。该数据集整合了WildChat、OASST2、Aya及MFAQ等来源,并采用严格的标注协议,确保了数据质量与可审计性,对浏览器端高效NLP模型的发展具有重要影响。
当前挑战
该数据集所解决的领域问题包括多语言对话标题生成的歧义性与语言混杂挑战,例如消息中夹杂代码或跨语言内容时,如何准确提取标题。构建过程中遇到的主要挑战包括:1) 区分消息的真实语言与粘贴内容(如代码、英语系统提示),需设计功能词频率检测方法;2) 处理无法提取三个有用词的消息(如问候语、乱码),标记为'impossible';3) 确保参考标题的可靠性,通过机械验证避免标注错误;4) 平衡各语言样本量与质量,如部分语言因数据源问题导致有效样本减少。这些挑战促使开发了精细的语言检测与评分机制,为多语言NLP基准测试提供了方法论参考。
常用场景
经典使用场景
该数据集作为抽取式对话标题生成的基准测试集,其核心应用场景在于评估模型从对话首条消息中提取3至5个连续词以构成标题的能力。涵盖17种语言、4732条真实对话消息,每条消息均配有由前沿模型盲写并经逐词校验的参考标题,为跨语言对话摘要任务提供了标准化的评测平台。研究者通常利用该数据集验证模型在多语言环境下的抽取式标题生成性能,通过词级F1分数衡量候选标题与参考标题的吻合程度,从而推动对话理解与精简表达技术的进步。
衍生相关工作
该数据集催生了若干后续研究工作:在数据层面,其构建流程(包括语言识别陷阱分析、不可行样本判定规则)为其他多语言任务的数据集设计提供了参考模板;在方法层面,研究者基于该基准开发了更鲁棒的多语言抽取式标题模型,并探讨了跨语言函数词分布对任务的影响;此外,多参考标题的评估框架激发了“标题多样性”相关研究,引导学界重新审视自动摘要系统的一致性评价方法,并为无监督或半监督对话标题生成模型提供了验证依据。
数据集最近研究
最新研究方向
该数据集聚焦于多语言抽取式对话标题生成的前沿基准构建,其研究意义在于突破传统模型在资源稀缺语言上的性能瓶颈,推动轻量级模型在浏览器端实现实时语义理解。通过引入跨17种语言的盲审标注与多参考一致性评分机制,研究强调了标题提取的客观性指标与标注者间分歧问题,反映了当前对话系统研究中对于可审计性、低资源鲁棒性以及生成内容与原文保真度的多重关注。该基准的发布为评估生成式模型的语言无关性标题能力提供了严苛的测试床,进而促进对话摘要领域向更高效、更具跨语言泛化能力的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务