遇见数据集

Gazeta

收藏
arXiv2021-10-05 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

Gazeta是由莫斯科物理技术学院创建的首个俄语新闻自动摘要数据集,旨在填补俄语领域自动文本摘要的空白。该数据集包含63435条新闻文本及其对应的摘要,数据来源于Gazeta.ru网站,确保了数据的人工生成和合法性。创建过程中,数据经过严格的清洗和统计处理,确保数据质量。Gazeta数据集主要用于评估和改进俄语文本摘要技术,特别是提取式和生成式模型的性能,为俄语新闻机构和读者提供高效的自动化摘要服务。

Gazeta is the first Russian-language news automatic summarization dataset developed by the Moscow Institute of Physics and Technology, aimed at filling the gap in automatic text summarization for the Russian language domain. This dataset comprises 63,435 news articles and their corresponding summaries, sourced from the Gazeta.ru website, with all data guaranteed to be manually generated and legally compliant. During its development, the data underwent rigorous cleaning and statistical processing to ensure high data quality. The Gazeta dataset is primarily utilized to evaluate and enhance Russian-language text summarization technologies, particularly the performance of extractive and generative models, thus providing efficient automated summarization services for Russian news organizations and readers.

创建时间:
2020-06-19
搜集汇总
数据集介绍
构建方式
Gazeta数据集是首个面向俄语新闻自动摘要任务的大规模语料库,其构建过程严格遵循了数据来源的合法性、摘要的人工生成性以及内容的抽象性要求。数据来源于俄语新闻网站Gazeta.ru,该网站明确允许将数据用于非商业目的。研究团队收集了自网站成立至2020年3月间的所有文章,并解析其中包含‘description’属性的‘meta’标签内容作为摘要。经过清洗,剔除了摘要词数少于15或多于85、文本词数超过1500、以及单字重叠率低于30%或高于92%的样本,同时移除了2010年6月1日之前的数据,最终保留了63435对高质量的文本-摘要对。数据集按时间顺序划分为训练集(52400对)、验证集(5265对)和测试集(5770对),其中训练集在模型训练前需随机打乱以消除时间偏差。
特点
Gazeta数据集具有鲜明的特点。其摘要长度适中,平均约48至54个词,文本平均约750至770个词。摘要展现出显著的抽象性,超过65%的二元组在原文中未出现,表明其并非简单的抽取式摘要。词形还原分析显示,摘要中几乎所有的词形均出现在原文中,但新颖n-gram的比例随n增大而上升,三元组新颖性高达84.5%,这为抽象式摘要模型提供了富有挑战性的基准。此外,数据集提供了基于字节对编码(BPE)的子词分词版本,以适应俄语丰富的形态变化,并保留了原始大小写版本以支持多样化的研究需求。
使用方法
Gazeta数据集的使用方法灵活多样,支持抽取式与抽象式摘要模型的评估。研究者可基于其公开的GitHub仓库获取数据,并利用论文中提供的基准模型(如TextRank、LexRank、SummaRuNNer、Pointer-Generator、CopyNet及微调后的mBART)进行对比。评估时推荐使用ROUGE、BLEU及METEOR等自动指标,并采用Razdel分词器统一处理参考摘要与生成摘要。此外,数据集的时间划分方式使其适用于时序相关的实验设计。对于抽象式模型,尤其是mBART,需将输入文本截断至600个token以适应GPU内存限制,并可使用<unk>标记替代语言代码进行条件生成。
背景与挑战
背景概述
自动文本摘要技术已在多种语言和领域中得到广泛探索,然而俄语这一重要语言在该方向的研究却长期处于空白状态。为填补这一缺口,Ilya Gusev于2020年提出了Gazeta数据集,这是首个专门面向俄语新闻摘要任务的大规模语料库。该数据集由俄罗斯莫斯科物理技术学院的研究人员构建,核心研究问题在于为俄语新闻文本提供高质量的自动摘要基准,并评估抽取式与生成式模型在该语言上的表现。Gazeta数据集包含超过63,000篇新闻文章及其人工撰写的摘要,覆盖2010年至2020年间来自Gazeta.ru的新闻内容。该数据集的发布不仅推动了俄语自然语言处理领域的发展,也为多语言摘要模型的迁移学习提供了宝贵资源,尤其验证了mBART模型在俄语摘要任务中的有效性。
当前挑战
Gazeta数据集所解决的领域问题在于俄语新闻自动摘要的稀缺性与多样性挑战。俄语形态丰富、句法复杂,传统摘要模型常面临词汇稀疏与生成不流畅的问题。在数据集构建过程中,研究人员面临多重挑战:首先,数据来源需满足法律合规性,最终仅获得Gazeta.ru的授权,限制了数据规模与多样性。其次,摘要质量把控困难,需通过严格的清洗流程剔除过长、过短或与原文重叠度过高(低于30%或高于92%)的低质量样本。此外,为确保摘要具备抽象性而非简单抽取,需平衡抽取式与生成式方法的评估难度。最后,模型训练中需处理俄语特有的词形变化,采用字节对编码(BPE)与词形还原技术以提升泛化能力,但计算资源与标注成本仍构成显著瓶颈。
常用场景
经典使用场景
Gazeta数据集是首个面向俄语新闻的自动摘要基准资源,其典型应用场景涵盖抽取式与生成式摘要模型的训练与评估。研究者可基于该数据集构建从无监督图排序方法(如TextRank、LexRank)到基于Transformer的预训练模型(如mBART)的完整技术栈,系统性地衡量不同范式在俄语新闻摘要任务上的表现。该数据集包含超过6.3万篇带有人工撰写摘要的新闻文章,其摘要具有较高的抽象性——超过65%的二元词组在原文中未曾出现,这为检验模型抽象化能力提供了严苛的测试环境。
实际应用
在实际应用中,Gazeta数据集直接服务于俄语新闻媒体与信息聚合平台的自动化摘要生成需求。新闻编辑室可利用基于该数据集训练的模型快速生成新闻导语或摘要,从而提升内容生产效率;新闻聚合器则能借助摘要技术为用户提供多源新闻的浓缩信息,改善阅读体验。此外,该数据集还可用于开发面向俄语用户的智能信息助手,例如在移动端或语音交互场景中生成简洁的新闻要点。由于数据来源于Gazeta.ru网站并获合法授权,其应用场景具有明确的合规基础,为俄语新闻行业的智能化转型提供了切实可行的技术路径。
衍生相关工作
Gazeta数据集的发布催生了多项后续研究工作。在模型层面,研究者基于该数据集进一步微调了多语言BART(mBART)模型,验证了其在俄语摘要任务中的优越性,并探索了将俄语标题生成作为预训练任务的可行性。在方法创新方面,该数据集被用于比较Pointer-Generator、CopyNet等经典生成式模型在俄语场景下的表现,推动了覆盖机制与复制机制在非英语语言上的适配研究。此外,Gazeta还启发了面向俄语的多文档摘要与跨语言摘要研究,为构建更通用的多语言文本生成系统提供了基础数据支持,并促进了俄语自然语言处理社区在摘要领域的技术积累与开源生态建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务