遇见数据集

SEAHORSE

收藏
arXiv2023-11-02 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

SEAHORSE数据集由谷歌深度思维创建,包含96,645条多语言摘要,旨在评估多方面摘要系统的性能。该数据集覆盖6种语言,涉及9个系统,包括参考文本,并从4个不同的摘要数据集中提取。数据集通过6个维度(可理解性、重复性、语法、归属、主要思想和简洁性)进行人工评分,以支持训练和评估学习型度量标准。SEAHORSE不仅作为基准用于评估学习型度量,还作为大规模资源用于训练此类度量,旨在解决自动摘要系统评估的挑战,特别是在多语言环境下的评估问题。

The SEAHORSE dataset was developed by Google DeepMind, which houses 96,645 multilingual summaries intended to assess the performance of multi-faceted summarization systems. Covering 6 languages, the dataset comprises summaries from 9 systems along with reference texts, and is extracted from 4 distinct summarization datasets. Manually annotated across 6 dimensions: comprehensibility, repetitiveness, grammar, attribution, main ideas, and conciseness, the dataset supports the training and evaluation of learned metrics. SEAHORSE not only serves as a benchmark for evaluating learned metrics but also acts as a large-scale resource for training such metrics, aiming to address the challenges in evaluating automatic summarization systems, particularly in multilingual settings.

提供机构:
谷歌深度思维
创建时间:
2023-05-23
搜集汇总
数据集介绍
SEAHORSE 数据集图片
构建方式
在文本摘要评估领域,由于任务的多面性和主观性,可靠的自动评估一直是一项挑战,尤其在英语以外的语言中,人工评估资源稀缺。为应对这一困境,SEAHORSE数据集应运而生。该数据集从XSum、XL-Sum、MLSum和WikiLingua四个摘要数据集的验证集和测试集中随机选取文章,并利用九种不同的摘要系统(包括参考摘要、不同规模的T5和mT5模型、PaLM模型等)生成摘要,从而构建了包含96,645条摘要的庞大规模。每条摘要均由经过专业培训的付费标注员,在无参考摘要的情况下,独立评估其可理解性、重复性、语法正确性、归因性、主旨涵盖性和简洁性这六个文本质量维度,确保了标注的独立性与专业性。
特点
SEAHORSE数据集的核心特点在于其多语言与多维度并重的设计。它覆盖了德语、英语、西班牙语、俄语、土耳其语和越南语六种语言,跨越四个不同的摘要任务数据集,并包含了从欠训练的小模型到大规模语言模型等九种质量参差的系统输出,极大丰富了错误类型的多样性。数据集特别将训练集和验证集取自原始数据的验证集,测试集则取自原始测试集,这一设计有效防止了训练评估指标时的测试集数据泄露问题。此外,其无参考的标注方式允许模型生成与参考摘要不同但同样相关的摘要,为训练无参考评估指标提供了坚实基础。
使用方法
SEAHORSE数据集兼具训练和基准测试的双重用途。研究者可将其作为大规模训练资源,例如通过微调mT5模型,针对每个质量维度训练独立的评估指标,模型以文章和摘要为输入,输出二元分类结果来预测人工评分。同时,该数据集也是一个强大的元评估基准,用于测试学习型指标的性能。实验表明,基于SEAHORSE训练的指标在自身测试集以及跨领域、跨语言的mFACE和TRUE基准上均表现出色,甚至能零样本泛化至未见过的高资源语言,显著优于ROUGE-L等传统方法,为多语言摘要评估研究提供了可靠的开源平台。
背景与挑战
背景概述
随着大规模语言模型在文本生成质量上的快速提升,如何可靠地评估自动摘要系统的输出成为一个日益严峻的挑战。传统的n-gram指标如ROUGE与人类判断的相关性有限,而人工评估又成本高昂且难以复现。在此背景下,Google DeepMind与Google Research的研究团队于2023年发布了SEAHORSE数据集,旨在为多语言、多维度摘要评估提供大规模训练与基准资源。该数据集由Elizabeth Clark等学者主导,涵盖6种语言、9种摘要系统(含人工参考摘要)及4个摘要数据集,共包含96,645条带有人工评分的数据,评分维度涵盖可理解性、重复性、语法、归因、主旨及简洁性。SEAHORSE的发布填补了多语言摘要评估资源的空白,为可学习评估指标的训练与跨语言泛化研究奠定了重要基础。
当前挑战
SEAHORSE所应对的核心挑战在于摘要评估任务的多面性与主观性,尤其是在非英语语言中,人工评估资源极为稀缺。传统指标难以捕捉归因错误、主旨缺失等细微问题,而SEAHORSE通过六维度评分体系为这些难题提供了细粒度标注。构建过程中,研究团队面临多重挑战:首先,需确保评估数据的无偏性,因此训练与验证集取自原始摘要语料的验证集,以避免测试集泄漏;其次,需控制不同语言与系统间的质量差异,通过引入不同规模与训练程度的模型(如未充分训练的mt5_small_250与大规模PaLM模型)来捕获多样的错误类型;此外,还需应对标注者之间的主观性差异,通过严格的培训流程与黄金标准集(109条摘要)筛选合格标注者,并移除不合格数据,最终将标注者间一致性维持在82%以上。
常用场景
经典使用场景
在自然语言处理领域,文本摘要质量的自动评估长期面临多维度和主观性的挑战,尤其是非英语语言的评估资源极度匮乏。SEAHORSE数据集应运而生,其经典使用场景在于作为多语言、多维度摘要评估的基准测试平台。研究者可利用该数据集对六种语言(德语、英语、西班牙语、俄语、土耳其语、越南语)下生成的摘要,从可理解性、重复性、语法正确性、归因准确性、主旨涵盖度及简洁性六个质量维度进行系统化评估。该数据集覆盖九种摘要生成系统及四种不同来源的摘要数据集,为衡量自动评估指标与人类判断的一致性提供了大规模、标准化的测试环境,从而推动更可靠评估方法的发展。
实际应用
在实际应用中,SEAHORSE数据集为多语言摘要系统的开发与优化提供了关键支撑。企业和研究机构可利用该数据集训练的评估指标,在模型开发阶段高效筛选超参数、比较不同架构的摘要生成模型,而无需依赖昂贵且耗时的人工评估。例如,在新闻聚合平台的多语言内容摘要服务中,该数据集训练的自动评估工具能够快速识别存在幻觉、归因错误或语法缺陷的摘要输出,辅助提升最终呈现给用户的信息质量。此外,其参考无关的评估特性使得评估指标可直接应用于推理阶段的重新排序,优化生成结果,在跨语言信息检索、多语言文档管理等场景中具有广阔的应用前景。
衍生相关工作
SEAHORSE数据集的发布催生了一系列重要的衍生研究工作。在其基础上,研究者进一步探索了将评估指标与大型语言模型结合的方法,如利用GPT-4等模型进行更精细化的文本质量评价(如G-Eval工作)。该数据集还启发了针对低资源语言摘要评估的跨语言迁移学习研究,以及将多维度评估指标整合到端到端摘要模型训练中的尝试。此外,TRUE和mFACE等基准测试的构建与完善也直接受益于SEAHORSE提供的评估方法论和训练数据,形成了从数据收集、指标训练到跨领域泛化验证的完整研究链条,推动了多语言自然语言生成评估领域的系统性进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务