Ameame1002/OPERA
收藏官方服务:
资源简介:
OPERA检索语料库是一个预构建的密集检索语料库,专为OPERA推理管道设计(OPERA:一种强化学习增强的编排规划器-执行器架构,用于面向推理的多跳检索)。该语料库包含1,780,294个文档,基于BGE-M3模型生成1024维密集嵌入,并使用FAISS IndexFlatIP进行索引。数据来源于三个公开的多跳问答基准:HotpotQA、2WikiMultiHopQA和MuSiQue的Wikipedia段落,不包含外部网络内容或基准标签。语料库以段落级文本形式组织,每个记录包括ID、标题和内容,适用于多跳问答、文本检索等任务,并支持研究用途。
Prebuilt dense retrieval corpus used by the OPERA inference pipeline (OPERA: A Reinforcement Learning–Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval).
提供机构:
Ameame1002


