MVPCorpus
收藏资源简介:
MVPCorpus是由中国人民大学于2022年6月发布的一个大规模自然语言生成(NLG)数据集。该数据集从11种不同的NLG任务中收集了77个数据集,涵盖了常识生成、数据到文本生成、开放式对话系统、释义生成、问答、问题生成、故事生成、任务导向对话系统、文本简化、文本风格转换和文本摘要等多种任务。MVPCorpus被用于多任务监督预训练(MVP)模型,通过将不同任务的输入数据统一转换为文本到文本的格式,以监督学习的方式预训练文本生成模型。
The MVPCorpus, released by Renmin University of China in June 2022, is a large-scale Natural Language Generation (NLG) dataset. It aggregates 77 datasets from 11 distinct NLG tasks, encompassing a wide range of applications such as commonsense generation, data-to-text generation, open-domain dialogue systems, paraphrase generation, question answering, question generation, story generation, task-oriented dialogue systems, text simplification, text style transfer, and text summarization. The MVPCorpus is utilized for multi-task supervised pre-training (MVP) models, where input data from various tasks are uniformly transformed into a text-to-text format to pre-train text generation models through supervised learning.
MVP数据集概述
数据集基本信息
- 名称:MVP (Multi-task Supervised Pre-training for Natural Language Generation)
- 架构:标准Transformer编码器-解码器结构
- 类型:监督预训练自然语言生成模型
- 特色:包含任务特定软提示(prompt)设计
支持任务与对应数据集
文本摘要
- CNN/Daily Mail (cnndm)
- XSum (xsum)
- SAMSum (samsum)
- WLE (wle)
开放式对话系统
- PersonaChat (pc)
- DailyDialog (dd)
- DSTC7-AVSD (da)
- SGD (sgd)
数据到文本生成
- WebNLG v2.1 (webnlg)
- WebNLG v3.0 (webnlg2)
- WikiBio (wikibio)
- E2E (e2e)
- DART (dart)
- ToTTo (totto)
问题生成
- SQuAD (squadqg)
- CoQA (coqaqg)
故事生成
- ROCStories (roc)
- WritingPrompts (wp)
问答系统
- SQuAD (squad)
- CoQA (coqa)
任务导向对话系统
- MultiWOZ 2.0 (multiwoz)
常识生成
- CommonGen (cg)
文本简化
- WikiAuto + Turk/ASSET (wia)
释义生成
- Quora (quora)
文本风格转换
- GYAFC-E&M (gyafc_em)
- GYAFC-F&R (gyafc_fr)
模型获取方式
- 基础模型:
RUCAIBox/mvp - 任务特定提示模型:
RUCAIBox/mvp-[task_name] - 多任务预训练变体:
RUCAIBox/mvp-multi-task
相关资源
- 论文地址:https://arxiv.org/abs/2206.12131
- 模型仓库:https://huggingface.co/models?filter=mvp
- 数据集下载:https://huggingface.co/RUCAIBox




