遇见数据集

WebBrain-Raw

收藏
arXiv2023-04-10 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

WebBrain-Raw数据集是由高瓴人工智能学院的研究团队构建的,旨在支持WEBBRAIN任务,即通过网络挖掘支持证据来生成针对查询的事实正确文章。该数据集从英文维基百科中提取了所有文章及其可访问的参考文献,规模达到1486万篇文章,是之前最大同类数据集的十倍。数据集的创建过程涉及从维基百科中提取文章和参考文献,并进行数据清洗以确保质量。WebBrain-Raw数据集的应用领域包括自动生成维基页面、智能写作辅助和知识密集型问答等,旨在解决如何从网络世界中自动获取知识并服务于人类更广泛的事实导向信息需求的问题。

The WebBrain-Raw dataset was constructed by the research team at the Gaoling School of Artificial Intelligence, aiming to support the WebBrain task, which focuses on generating factually accurate articles for user queries by mining supporting evidence from the web. This dataset extracts all articles and their accessible references from the English Wikipedia, totaling 14.86 million articles, which is 10 times the size of the largest prior similar dataset. The construction of the WebBrain-Raw dataset entails extracting articles and their references from Wikipedia, followed by data cleaning to ensure high data quality. Its application scenarios include automatic Wikipedia page generation, intelligent writing assistance, knowledge-intensive question answering, and other related fields. This dataset is developed to address the challenge of automatically extracting knowledge from the web and catering to the broader fact-oriented information needs of humans.

创建时间:
2023-04-10
搜集汇总
数据集介绍
WebBrain-Raw 数据集图片
构建方式
WebBrain-Raw 数据集通过系统性地提取所有英文维基百科文章及其可抓取的参考文献构建而成。构建过程中,首先对维基百科文章进行清洗,移除模板、特殊符号及无效文本;随后对参考文献进行过滤,剔除长度不足16词或非英语词汇比例过高的内容,并利用术语召回率(PST)筛选出与查询和文章句子高度相关的合理参考文献。为适配预训练语言模型的输入限制,从参考文献中选取PST值最高的段落作为支撑证据,最终构建出包含约1486万篇维基百科文章和2.595亿条参考文献的大规模语料库,其规模是此前最大同类数据集的十倍。
特点
WebBrain-Raw 数据集具有规模宏大、来源可靠及结构严谨的显著特点。其存储容量高达2.8TB,远超现有数据集,为研究提供了丰富的数据基础。数据源自维基百科这一权威百科全书,所有内容均经过众包编辑和审核,确保了事实准确性。数据集不仅包含完整的维基百科页面,还保留了可追溯的参考文献链接,使得每一条生成的事实性陈述都能找到对应的支撑证据。此外,WebBrain-Raw 覆盖了广泛的主题领域,为模型在开放域查询上的泛化能力提供了坚实的知识支撑。
使用方法
WebBrain-Raw 的使用方法灵活多样,研究者可根据任务需求从中衍生出两个专用子集:WebBrain-R 用于训练领域内检索器,WebBrain-G 用于训练生成器。在具体应用中,给定一个事实性查询,首先利用检索器从大规模网络语料库中挖掘支撑证据,随后将查询与检索到的证据拼接后输入生成模型,以产生流畅、信息丰富且事实准确的短文章。为提升生成的事实性,可引入 ReGen 框架,该框架通过主题一致性控制、引用标记引入以及面向事实的预训练任务来增强模型性能。数据集代码及完整数据已开源发布,便于社区复现与进一步探索。
背景与挑战
背景概述
在信息爆炸的互联网时代,用户从海量、碎片化的网页中快速获取准确事实信息的需求日益迫切。维基百科因其内容可靠、引用规范而成为用户查询事实性问题的首选,但其依赖人工编辑的模式严重制约了知识覆盖范围的扩展。为探索自动生成事实性文章的可行性,中国人民大学、蒙特利尔大学及华为泊松实验室的研究人员于2023年提出了WebBrain-Raw数据集。该数据集通过提取全部英文维基百科文章及其可抓取的参考文献,构建了规模达1486万篇维基页面与2.595亿篇参考文献的庞大语料库,其体量是此前最大同类数据集WikiSum的十倍。该数据集的核心研究问题在于探索如何使模型能够从大规模网络语料中挖掘支撑性证据,为未见过的查询生成流畅、信息丰富且事实正确的短篇事实性文章,对推动检索增强生成、知识密集型问答及智能写作辅助等领域具有深远影响。
当前挑战
WebBrain-Raw数据集所面临的挑战涉及多重维度。在领域问题层面,核心挑战在于如何克服预训练语言模型固有的幻觉现象,即模型仅依赖参数中存储的隐式知识生成事实错误的内容;该任务要求模型必须从开放域网络语料中检索并融合显式证据,以生成可被引用支持的事实性陈述,而非简单的文本跨度或单句答案。在数据集构建过程中,挑战同样严峻:首先,参考文献来源广泛且质量参差不齐,包含图像、表格、空内容等大量噪声,需设计严格的清洗流程,如过滤短文本、非英文内容及无效格式;其次,维基页面与参考文献篇幅冗长,需通过基于术语召回率的度量方法筛选出最相关的支撑段落,以适应预训练模型的输入长度限制;最后,构建检索器与生成器所需的子数据集时,需从海量候选样本中高效挖掘正负例对,并确保引用标记的准确性与生成目标的对应关系,这对数据规模与标注质量提出了极高要求。
常用场景
经典使用场景
在自然语言处理领域,WebBrain-Raw数据集主要用于训练和评估能够基于大规模网络语料库生成事实性短文的系统。其经典使用场景是给定一个事实性查询(如未在维基百科中收录的实体或事件名称),系统需从海量网络文档中挖掘支撑性证据,并生成一篇流畅、信息丰富且事实准确的短文。该数据集以维基百科文章及其可抓取的参考文献为基础构建,规模是此前最大同类数据集的十倍,为检索增强生成(Retrieval-Augmented Generation)任务提供了坚实的数据基础。研究者常利用该数据集训练检索器与生成器联合优化的端到端模型,以探索如何将外部显式知识融入文本生成过程。
衍生相关工作
基于WebBrain-Raw数据集,研究者衍生出多项具有影响力的工作。其中最具代表性的是ReGen框架,该框架通过结合SPLADE稀疏检索器与Fusion-in-Decoder生成器,并引入主题一致性控制、非对称稀疏性正则化以及句子-引用匹配预训练等策略,显著提升了生成内容的事实正确性。此外,该数据集催生了针对检索器性能改进的研究,如对比分析BM25、DPR与SPLADE在不同规模语料库上的表现差异。在生成模型方面,相关工作探索了引用标记增强解码策略,以更准确地标注生成文本中每个陈述的证据来源。这些衍生工作共同推动了检索增强文本生成从理论框架向实用系统的转化。
数据集最近研究
最新研究方向
在自然语言处理领域,基于检索增强的文本生成正成为克服大语言模型幻觉问题的关键路径。WebBrain-Raw数据集的问世,为这一前沿方向注入了新的活力——该数据集以维基百科为知识锚点,构建了规模空前的语料库,其体量较此前最大的同类数据集扩充了十倍有余,为模型从海量网络信息中挖掘支撑性证据、生成事实性短文提供了坚实的数据基石。当前研究的热点聚焦于如何通过精细化检索与生成框架的协同优化,如ReGen框架中引入的主题一致性控制与引用标记增强解码策略,来提升生成内容的事实准确性与信息丰度。这一探索不仅回应了自动构建维基百科条目等实际需求,更推动了人工智能从参数记忆向动态知识获取范式的转型,为搜索引擎的智能化演进开辟了新的可能。
相关研究论文
  • 1
    WebBrain: Learning to Generate Factually Correct Articles for Queries by Grounding on Large Web Corpus高瓴人工智能学院,中国人民大学,北京,中国 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务