遇见数据集

summarization-250k

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

summarization-250k是一个面向文档摘要任务的英文数据集,旨在将源文档转化为摘要、关键点或亮点。数据集包含两个子集:训练集(train)包含269,939条来自英语新闻文章的样本;长文档集(long)包含60,000条来自科学/技术论文等长篇文档的样本,每条文档长度通常为8k-16k tokens。每条样本包含五个字段:id(示例ID)、task(任务类型,可选summarization、keypoints或highlights)、system(摘要助手指令)、user(仅包含文档文本)、assistant(生成的摘要、关键点或亮点)。数据以JSON Lines和Parquet格式提供,用户字段不包含额外提示或聊天模板标签。该数据集适用于文本摘要、关键点提取和亮点生成等自然语言处理任务。

summarization-250k is an English dataset for document summarization tasks, aiming to convert source documents into summaries, key points, or highlights. The dataset contains two subsets: the training set (train) includes 269,939 samples from English news articles; the long document set (long) includes 60,000 samples from long documents such as scientific/technical papers, with each document typically 8k-16k tokens. Each sample contains five fields: id (example ID), task (task type, optional summarization, keypoints, or highlights), system (summarization assistant instructions), user (only document text), and assistant (generated summary, key points, or highlights). Data is provided in JSON Lines and Parquet formats, and the user field does not contain extra prompts or chat template tags. This dataset is suitable for NLP tasks such as text summarization, key point extraction, and highlight generation.

创建时间:
2026-09-04
原始信息汇总

数据集概述

  • 数据集名称summarization-250k
  • 许可证:Apache-2.0
  • 任务类别:文本摘要(Summarization)
  • 语言:英语(en)
  • 规模:10万至100万条样本

数据集内容

该数据集包含文档-摘要对,每一行包含一个源文档及其对应的凝练文本(如摘要、要点或高亮)。task 字段用于区分生成的文本类型:summarization(摘要)、keypoints(要点)或 highlights(高亮)。

数据划分

划分名称 样本数量 数据来源
train 269,939 英文新闻文章
long 60,000 长文英文文档(如科学/技术论文,通常为8000–16000词元)

可通过 load_dataset("domofon/summarization-250k", split="train")split="long" 加载相应划分。

数据格式

数据提供 JSON Linesdata/{split}.json)与 Parquetdata/{split}.parquet)两种格式,二者列结构一致。Hub 查看器使用 Parquet 格式。

字段名 内容说明
system 摘要助手的指令文本
user 仅包含文档文本
assistant 生成的凝练文本(摘要/要点/高亮)
task 任务类型:summarizationkeypointshighlights
id 示例唯一标识符

user 字段即文档本身,不包含额外提示词或对话模板标签。

搜集汇总
数据集介绍
summarization-250k 数据集图片
构建方式
在自然语言处理领域,文本摘要任务长期依赖从新闻语料中自动抽取文档-摘要对,而summarization-250k的构建则体现了对多粒度摘要需求的系统化回应。该数据集以英文新闻文章和长篇科技文献为原始素材,分别构建train与long两个拆分。每一条样本均由源文档、任务类型(摘要、要点或亮点)以及对应的精简文本组成,通过统一格式组织为JSON Lines与Parquet文件。构建过程中,源文档被直接作为user字段内容,不附加额外提示或对话模板标记,助手回复则由摘要、要点或亮点构成,任务类型字段显式控制输出风格,从而在单一数据集中融合了多种摘要形式。
特点
该数据集的核心特征在于其规模与任务多样性的有机结合。train拆分涵盖269,939条英文新闻文章样本,long拆分则包含60,000条长篇英文文档,后者主要来源于科技论文,长度通常在8k至16k词元之间,为长文档摘要研究提供了充足资源。数据集通过task字段区分summarization、keypoints与highlights三种响应风格,使同一源文档可对应不同粒度的浓缩输出。字段设计简洁明确,system字段提供摘要助手指令,user字段仅含文档原文,assistant字段为浓缩结果,id字段用于样本标识。整体数据以Apache-2.0许可发布,兼具规模、领域覆盖与任务可控性。
使用方法
在使用层面,该数据集可通过Hugging Face数据集库便捷加载,用户调用load_dataset("domofon/summarization-250k", split="train")或split="long"即可分别获取新闻与长文档拆分。数据同时提供JSON Lines与Parquet两种格式,列结构一致,Hub查看器默认使用Parquet。研究者和开发者可直接利用user字段作为输入文档,system字段作为指令前缀,assistant字段作为监督目标,并借助task字段筛选或控制期望的摘要风格。该设计适用于训练和评估摘要模型、要点生成系统以及亮点提取任务,亦可用于长文档理解与多风格文本浓缩的对比研究,无需额外预处理即可融入标准监督学习流程。
背景与挑战
背景概述
自动文本摘要旨在将冗长文档压缩为简洁且信息完整的短文本,是自然语言处理领域的核心任务之一,广泛应用于新闻聚合、学术文献筛选与商业情报分析等场景。summarization-250k数据集于2024年前后发布,由domofon构建,包含约33万条英文文档与对应凝练结果,涵盖新闻与长篇科技论文两类来源,并支持摘要、要点与亮点三种输出风格。其大规模、多任务与长短文本兼顾的设计,为摘要模型的泛化能力评估提供了重要资源,推动了指令微调与长文档理解研究的进展。
当前挑战
该数据集所应对的领域挑战在于,摘要任务要求模型在保留核心信息的同时消除冗余,且需适应新闻与科技论文等不同体裁、不同长度文档的语义压缩需求。构建过程中的挑战更为具体:其一,需从海量原始文档中筛选高质量样本,确保源文本与摘要之间的忠实性与信息覆盖度;其二,针对长篇科技论文,需在8k至16k token的上下文窗口内维持摘要的连贯性与准确性;其三,三种输出风格(摘要、要点、亮点)的标注一致性难以保证,多任务混合训练亦增加了模型区分不同凝练方式的难度。
常用场景
经典使用场景
在自然语言处理领域,文本摘要任务始终占据着信息压缩与知识提炼的核心地位。summarization-250k数据集凭借其涵盖逾三十二万条样本的规模,以及区分短篇新闻与长篇科技文献的双重切分设计,为摘要模型的训练与评测提供了极具代表性的语料基础。其经典用法集中于以文档为输入、以摘要、要点或高亮为输出风格的生成式建模,研究者可借助task字段灵活切换三种凝聚形态,从而系统考察模型在不同压缩粒度与语义保真度之间的权衡能力。
衍生相关工作
以summarization-250k为基石,后续研究可望衍生出一系列围绕长文档理解与多风格摘要生成的经典工作。例如,基于其长文本切分开展的层次化编码与稀疏注意力机制探索,或将推动长上下文摘要模型的架构革新;借助task字段进行的多任务联合训练与指令微调,亦可能催生统一的摘要生成框架。此外,该数据集还可作为评测基准,用于检验大语言模型在忠实性与信息密度上的表现,进而激发对摘要幻觉抑制与事实一致性校验等方向的深入探究。
数据集最近研究
最新研究方向
在文本摘要领域,面向长文档与多任务统一建模的研究正成为前沿热点。summarization-250k数据集凭借其33万量级的训练实例,涵盖新闻与长篇幅科技论文,并支持摘要、要点与高亮三种生成范式,为指令微调与跨任务泛化能力评估提供了关键资源。当前研究聚焦于利用该数据集探索大语言模型在长上下文中的语义压缩效率,以及多任务信号对生成忠实度的协同增强机制。与此同时,长文档理解与高效推理需求日益迫切,该数据集的长文本分片有效弥补了公开资源在8k–16k token区间上的不足,对推动摘要系统在学术与新闻场景中的落地具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务