GEM/squality
收藏资源简介:
SQuALITY(Summarization-format QUestion Answering with Long Input Texts, Yes!)是一个用于摘要生成任务的数据集,其特点是摘要生成、长输入、问题导向、多参考摘要和高质量。数据集包含3000到6000字的短篇故事,每个故事与多个问题-摘要对相关联,每个问题有4个摘要。摘要由经过培训的熟练写手通过众包方式生成。数据集主要用于摘要研究,支持的主要任务是摘要生成。数据集的创建者包括Alex Wang等人,数据集由纽约大学创建,并由Eric和Wendy Schmidt、Apple和NSF资助。
SQuALITY (Summarization-format QUestion Answering with Long Input Texts, Yes!) is a dataset dedicated to summarization tasks. It features five core characteristics: support for summarization generation, long input texts, question-orientation, multiple reference summaries, and high quality. The dataset comprises short stories ranging from 3,000 to 6,000 words in length, with each story linked to multiple question-summary pairs, and four summaries provided for each individual question. All summaries are crowdsourced from trained, skilled professional writers. Primarily developed for summarization research, its core supported task is summarization generation. The dataset was created by a team including Alex Wang et al. at New York University, and was funded by Eric and Wendy Schmidt, Apple, and the National Science Foundation (NSF).
数据集概述
数据集名称
- 名称: SQuALITY
- 全称: Summarization-format QUestion Answering with Long Input Texts, Yes!
数据集属性
- 类型: 摘要生成数据集
- 特点:
- 抽象性
- 长输入: 输入文档为3000-6000字的短篇小说
- 问题聚焦: 每个故事关联多个问题-摘要对
- 多参考: 每个问题配对4个摘要
- 高质量: 摘要由熟练和训练有素的作家众包完成
数据集内容
- 语言: 英语
- 许可: cc-by-4.0
- 任务类型: 摘要生成
数据集结构
- 数据字段:
- 元数据: 项目古腾堡ID, 内部UID, 项目古腾堡许可
- 文档: 故事文本
- 问题: 列表,每个元素包含问题文本、问题编号和响应列表
- 响应: 列表,每个元素包含工作者ID、内部UID和响应文本
数据集用途
- 目的: 用于摘要生成研究
- 主要任务: 摘要生成
- 通信目标: 给定关于短篇小说特定高层方面的提问,提供该方面的摘要(如情节、角色关系、设定、主题等)
数据集创建者
- 创建者:
- Alex Wang (NYU)
- Angelica Chen (NYU)
- Richard Yuanzhe Pang (NYU)
- Nitish Joshi (NYU)
- Samuel R. Bowman (NYU)
数据集联系信息
- 联系人: Alex Wang
- 联系方式: wangalexc@gmail.com




