five

MuSiQue|多跳问答数据集|自然语言处理数据集

收藏
arXiv2025-03-06 更新2025-03-08 收录
多跳问答
自然语言处理
下载链接:
https://github.com/shaharl6000/MoreDocsSameLen
下载链接
链接失效反馈
资源简介:
MuSiQue数据集是基于多跳问答任务构建的,包含2417个可回答问题,每个问题关联20个来自维基百科的文档摘录。数据集设计使得问题可以仅基于其中2-4个文档回答,其余文档作为干扰项。研究通过对文档数量的调整,探讨了文档数量对模型性能的影响。
提供机构:
耶路撒冷希伯来大学计算机科学与工程学院
创建时间:
2025-03-06
AI搜集汇总
数据集介绍
main_image_url
构建方式
MuSiQue数据集的构建方式是,首先选取一个问题,然后根据问题从维基百科文章中检索出20个相关文档的摘录。每个问题只需2-4个文档即可回答,其余的文档作为干扰项。在构建不同文档数量的数据集时,逐步移除干扰项文档,同时扩展剩余文档的内容,以保持总字符数不变。
使用方法
使用MuSiQue数据集时,研究者可以控制文档的数量,同时保持上下文长度和关键信息的固定位置不变。这种方法可以用来评估不同数量的文档对大型语言模型在多跳问答任务中的性能影响。
背景与挑战
背景概述
MuSiQue数据集,由Trivedi等人于2022年构建,是一个针对多跳问答任务的基准数据集。该数据集的创建旨在为大型语言模型提供一个包含20个文档摘要的问答环境,每个文档摘要源自维基百科文章,并根据输入问题检索得到。在这些文档中,仅有2至4个包含回答问题所需的信息,其余则作为干扰项。MuSiQue数据集的主要研究人员来自于希伯来大学计算机科学与工程学院,他们在研究中探讨了多文档检索对大型语言模型性能的影响。该数据集对相关领域产生了显著影响,特别是在理解长文本和多个文档处理方面。
当前挑战
该数据集在研究领域中提出了几个关键挑战。首先,如何处理多个文档中的信息冗余、冲突信息以及隐含的文档间关系,这对语言模型构成了独特挑战。其次,研究者在保持上下文长度不变的情况下,发现文档数量的增加会对模型的性能产生负面影响,这意味着在固定长度的输入下,模型处理更多文档的能力受限。此外,构建过程中,如何平衡检索到的文档的相关性和多样性,以减少信息冲突,也是一项重要挑战。
常用场景
经典使用场景
MuSiQue数据集在多文档检索任务中,提供了一个可控制的实验环境,允许研究者在固定长度的输入下,探讨不同数量的文档对大型语言模型(LLM)性能的影响。该数据集的经典使用场景在于,研究者可以通过减少或增加伴随问题相关的文档数量,来观察LLM在处理多文档时的性能变化,进而区分长文本上下文与多文档处理的挑战。
解决学术问题
该数据集解决了学术界在多文档检索增强生成(RAG)系统中存在的一个关键问题,即文档数量的增加可能会降低模型的性能。通过MuSiQue,研究者能够控制文档数量,同时保持上下文长度不变,从而分离出长文本上下文与多文档处理之间的挑战,这对于理解和优化RAG系统至关重要。
实际应用
在实用层面,MuSiQue数据集可以帮助开发者和研究人员理解和优化多文档处理系统,特别是在构建检索增强的生成模型时。该数据集的应用有助于提升模型在处理真实世界多文档情景下的性能,例如自动化问答、信息检索和文本摘要等。
数据集最近研究
最新研究方向
MuSiQue数据集最新研究方向关注于检索增强生成(RAG)方法中,多文档处理对大型语言模型性能的影响。研究通过控制输入长度内文档数量的变化,发现增加文档数量对LLM性能提出了显著挑战。此外,该研究揭示了多文档处理与处理长语境是两个独立的挑战。这些发现对于RAG系统的优化具有实际意义,并为未来多文档处理方法的研究提供了新的视角和数据集。
相关研究论文
  • 1
    More Documents, Same Length: Isolating the Challenge of Multiple Documents in RAG耶路撒冷希伯来大学计算机科学与工程学院 · 2025年
以上内容由AI搜集并总结生成
用户留言
有没有相关的论文或文献参考?
这个数据集是基于什么背景创建的?
数据集的作者是谁?
能帮我联系到这个数据集的作者吗?
这个数据集如何下载?
点击留言
数据主题
具身智能
数据集  4099个
机构  8个
大模型
数据集  439个
机构  10个
无人机
数据集  37个
机构  6个
指令微调
数据集  36个
机构  6个
蛋白质结构
数据集  50个
机构  8个
空间智能
数据集  21个
机构  5个
5,000+
优质数据集
54 个
任务类型
进入经典数据集
热门数据集

flames-and-smoke-datasets

该仓库总结了多个公开的火焰和烟雾数据集,包括DFS、D-Fire dataset、FASDD、FLAME、BoWFire、VisiFire、fire-smoke-detect-yolov4、Forest Fire等数据集。每个数据集都有详细的描述,包括数据来源、图像数量、标注信息等。

github 收录

Wind Turbine Data

该数据集包含风力涡轮机的运行数据,包括风速、风向、发电量等参数。数据记录了多个风力涡轮机在不同时间点的运行状态,适用于风能研究和风力发电系统的优化分析。

www.kaggle.com 收录

ShapeNet

ShapeNet 是由斯坦福大学、普林斯顿大学和美国芝加哥丰田技术研究所的研究人员开发的大型 3D CAD 模型存储库。该存储库包含超过 3 亿个模型,其中 220,000 个模型被分类为使用 WordNet 上位词-下位词关系排列的 3,135 个类。 ShapeNet Parts 子集包含 31,693 个网格,分为 16 个常见对象类(即桌子、椅子、平面等)。每个形状基本事实包含 2-5 个部分(总共 50 个部分类)。

OpenDataLab 收录

中国1km分辨率逐月降水量数据集(1901-2024)

该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2024.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。

国家青藏高原科学数据中心 收录

UAVDT Dataset

The authors constructed a new UAVDT Dataset focused on complex scenarios with new level challenges. Selected from 10 hours raw videos, about 80, 000 representative frames are fully annotated with bounding boxes as well as up to 14 kinds of attributes (e.g., weather condition, flying altitude, camera view, vehicle category, and occlusion) for three fundamental computer vision tasks: object detection, single object tracking, and multiple object tracking.

datasetninja.com 收录