knkarthick/samsum
收藏资源简介:
SAMSum数据集包含约16k的类似即时通讯的对话及其摘要。对话由精通英语的语言学家创建,反映了他们日常生活中即时通讯对话的主题比例。对话的风格和语体多样,可能包含俚语、表情符号和拼写错误。每个对话都附有摘要,摘要要求简洁、提取重要信息、包含对话者姓名并以第三人称书写。数据集由三星波兰研发研究所准备,用于研究目的,采用非商业许可CC BY-NC-ND 4.0。
SAMSum dataset contains approximately 16k instant-messaging-like conversations and their corresponding summaries. The conversations were created by English-proficient linguists, and reflect the topic distribution of instant messaging conversations in their daily lives. The conversations feature diverse styles and linguistic registers, and may contain slang, emojis, and spelling mistakes. Each conversation is paired with a summary, which is required to be concise, extract key information, include the names of the speakers, and be written in the third person. This dataset was prepared by the Samsung R&D Institute Poland for research purposes, and is licensed under the non-commercial CC BY-NC-ND 4.0.
数据集概述
数据集名称
- 名称: SAMSum Corpus
- 别名: SAMSum
数据集属性
- 语言: 英语
- 多语言性: 单语种
- 许可证: CC BY-NC-ND 4.0(非商业用途)
- 大小: 10K<n<100K
- 源数据集: 原创数据
- 任务类别: 摘要生成
- 标签: 对话摘要
数据集内容
- 描述: SAMSum 数据集包含约16,000个类似即时通讯的对话及其摘要。这些对话由精通英语的语言学家创建和编写,旨在反映日常即时通讯对话的主题比例。对话风格多样,包括非正式、半正式或正式,可能包含俚语、表情符号和拼写错误。每个对话均附有人工编写的摘要,概述对话内容。
- 结构: 数据集包含16,369个对话,均匀分布在四个组中,根据对话中的话语数量划分。大多数对话涉及两个对话者。
- 数据字段:
- 对话: 对话文本
- 摘要: 对话的人工编写摘要
- ID: 示例的唯一文件ID
- 数据分割:
- 训练集: 14,732
- 验证集: 818
- 测试集: 819
数据集创建
- 来源语言生产者: 语言学家
- 注释者: 语言专家
- 注释过程: 每个对话由一名语言专家创建,随后由语言专家进行摘要注释,确保摘要简短、提取重要信息、包含对话者姓名并以第三人称编写。
许可证信息
- 许可证: CC BY-NC-ND 4.0(非商业用途)
引用信息
@inproceedings{gliwa-etal-2019-samsum, title = "{SAMS}um Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization", author = "Gliwa, Bogdan and Mochol, Iwona and Biesek, Maciej and Wawer, Aleksander", booktitle = "Proceedings of the 2nd Workshop on New Frontiers in Summarization", month = nov, year = "2019", address = "Hong Kong, China", publisher = "Association for Computational Linguistics", url = "https://www.aclweb.org/anthology/D19-5409", doi = "10.18653/v1/D19-5409", pages = "70--79" }




