遇见数据集

community-datasets/psc

收藏
Hugging Face2024-06-26 更新2024-06-15 收录
官方服务:

资源简介:

波兰摘要语料库包含波兰语的新闻文章及其摘要。数据集中,同一篇文章的摘要被用作正样本,而不同文章的最相似摘要被采样为负样本。数据集的结构包括提取的文本、摘要文本以及标签,标签用于指示摘要是否与原文相似。数据集分为训练集和测试集,测试集没有标签列。数据集的创建目的是为了提供新闻文章摘要的对比分析,支持的任务是新闻文章摘要生成。数据集的许可证为CC BY-SA 3.0,并且提供了相关的引用信息。

The Polish Summarization Corpus consists of Polish-language news articles and their paired summaries. Within this dataset, the summary of the same source article serves as a positive sample, whereas the most similar summaries derived from distinct articles are sampled as negative samples. The dataset comprises extracted article text, summary text, and labels, where the labels are used to indicate whether a given summary is semantically similar to its corresponding original article. The dataset is partitioned into training and test subsets; notably, the test set does not include a label column. This corpus was developed to enable comparative analysis of news article summaries, supporting the news article summarization generation task. The dataset is licensed under CC BY-SA 3.0, and relevant citation information is provided.

提供机构:
community-datasets
原始信息汇总

数据集概述

数据集描述

  • 数据集名称: psc
  • 数据集摘要: 波兰摘要语料库包含新闻文章及其摘要。我们使用相同文章的摘要作为正样本对,并采样最相似的不同文章的摘要作为负样本。
  • 支持的任务和排行榜:
    • 任务类别: 摘要生成
    • 任务ID: 新闻文章摘要生成
  • 语言: 波兰语

数据集结构

数据实例

[更多信息待补充]

数据字段

  • extract_text: 待摘要的文本
  • summary_text: 提取文本的摘要
  • label: 1 表示摘要相似,0 表示不相似

数据分割

  • 训练集:
    • 字节数: 5026582
    • 样本数: 4302
  • 测试集:
    • 字节数: 1292103
    • 样本数: 1078

数据集创建

数据集来源

  • 初始数据收集和规范化: [更多信息待补充]
  • 源语言生产者: [更多信息待补充]

标注

  • 标注过程: [更多信息待补充]
  • 标注者: [更多信息待补充]

个人和敏感信息

[更多信息待补充]

使用数据的注意事项

数据集的社会影响

[更多信息待补充]

偏见的讨论

[更多信息待补充]

其他已知限制

[更多信息待补充]

附加信息

数据集策展人

[更多信息待补充]

许可信息

CC BY-SA 3.0

引用信息

@inproceedings{ogro:kop:14:lrec, title={The {P}olish {S}ummaries {C}orpus}, author={Ogrodniczuk, Maciej and Kope{c}, Mateusz}, booktitle = "Proceedings of the Ninth International {C}onference on {L}anguage {R}esources and {E}valuation, {LREC}~2014", year = "2014", }

贡献

感谢 @abecadel 添加此数据集。

搜集汇总
数据集介绍
community-datasets/psc 数据集图片
构建方式
波兰语摘要语料库(PSC)是面向新闻文本摘要任务的高质量数据集,其构建根植于自然语言处理领域中摘要生成与语义相似度判别的核心需求。该数据集通过采集波兰语新闻文章及其对应的专家撰写的摘要作为正样本对,并采用负采样策略,从不同文章中选取语义最为相近的摘要构成负样本对,从而形成用于训练摘要相似性判别模型的结构化数据。数据划分包含训练集(4302条)和测试集(1078条),其中测试集未提供标签列,以-1作为占位符。
特点
该数据集具有鲜明的领域特色与结构优势。首先,其标注由领域专家完成,确保了摘要与原文映射关系的权威性和准确性。其次,数据以三字段形式组织:extract_text为待摘要原文,summary_text为对应摘要,label为二元标签(1表示正例,0表示负例),这种设计使得数据集不仅适用于传统的摘要生成任务,更可支撑摘要语义匹配与对比学习等前沿研究方向。此外,数据集采用CC BY-SA 3.0许可协议,促进了学术共享与复现。
使用方法
研究者可通过HuggingFace Datasets库便捷加载该数据集,指定配置名称为“default”即可获取训练与测试分片。在典型使用场景中,可利用extract_text和summary_text字段训练序列到序列的摘要生成模型,或利用label字段训练二分类模型以判别摘要与原文的语义一致性。需注意测试集标签缺失,用户可根据任务需求自行构建评估指标或进行零样本推理。数据集加载代码示例为:from datasets import load_dataset; dataset = load_dataset('community-datasets/psc', split='train')。
背景与挑战
背景概述
波兰摘要语料库(Polish Summaries Corpus)由Maciej Ogrodniczuk和Mateusz Kopeć于2014年在第九届国际语言资源与评估会议(LREC)上提出,旨在为波兰语新闻文本的自动摘要研究提供标准化基准。该数据集由波兰科学院计算机科学研究所主导构建,核心研究问题聚焦于如何通过对比学习范式提升摘要一致性评估——将同一新闻的不同摘要视为正例,而不同新闻的相似摘要作为负例,从而推动文本相似度建模与摘要质量判别的交叉探索。作为波兰语自然语言处理领域的重要资源,它填补了非英语语种在摘要任务中缺乏高质量标注语料的空白,为后续波兰语新闻摘要系统的研发与评估奠定了数据基础。
当前挑战
该数据集面临的核心挑战在于领域问题与构建过程的双重复杂性。在领域层面,新闻摘要任务本身需应对文本冗余、信息层级差异及摘要抽象程度不一致等难题,而波兰语复杂的形态句法结构(如格变化与动词变位)进一步加剧了语义等价性判断的难度。构建过程中,负例采样策略需在语义相似性与文章差异性之间取得平衡,避免因过度依赖词重叠导致伪负例;同时,测试集缺失标注列(label)的设计虽模拟了真实评估场景,却限制了监督学习的验证能力。此外,标签仅以二元分类区分摘要相似性,未能捕捉摘要质量的多维特征(如忠实度、信息覆盖度),这为细粒度评估带来了挑战。
常用场景
经典使用场景
波兰语摘要语料库(Polish Summaries Corpus, PSC)作为面向波兰语的新闻文本摘要与语义相似性判别任务的核心资源,其经典使用场景集中于基于对比学习的摘要质量评估与文本匹配研究。该数据集通过构建同一新闻文章的正向摘要对,并采样不同文章间最相似的摘要作为负例,为模型提供了结构化训练信号,从而支持摘要一致性判别、可控文本生成以及跨文档语义对齐等前沿课题的探索。在自然语言处理领域,PSC不仅填补了低资源语言在抽象式摘要评估方面的空白,还推动了多语言摘要系统的鲁棒性提升,成为波兰语信息提取与知识压缩研究的重要基准。
衍生相关工作
PSC的发布催生了多项经典工作:研究者基于其正负样本结构开发了针对波兰语的对比学习摘要模型(如PL-BART与Polish Pegasus),显著提升了抽象式摘要的忠实度;此外,该数据集被扩展用于多任务学习框架,同步解决摘要生成与语义相似性判断。在评估方法论层面,PSC启发了面向低资源语言的对抗性测试集构建,例如通过混淆负样本难度来检验模型的鲁棒性,相关成果已被应用于国际语义评测任务(如PolEval),巩固了其在东欧自然语言处理领域的标杆地位。
数据集最近研究
最新研究方向
当前,波兰语摘要语料库(PSC)的前沿研究方向聚焦于多语言与低资源语言的文本摘要及语义相似性评估。该数据集通过构建新闻文章与其摘要的正负样本对,为波兰语的抽取式摘要和摘要一致性判别提供了基准。在生成式AI与跨语言NLP快速发展的背景下,PSC被用于训练和评估波兰语摘要模型的鲁棒性,特别是在对比学习框架下探索摘要的语义等价性。其意义在于填补了东欧语言在摘要任务中的资源空缺,推动了多语言摘要系统的公平性研究,并促进了波兰语新闻信息处理技术的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务