遇见数据集

Ameame1002/OPERA

收藏
Hugging Face2026-05-25 更新2026-05-31 收录
官方服务:

资源简介:

OPERA检索语料库是一个预构建的密集检索语料库,专为OPERA推理管道设计(OPERA:一种强化学习增强的编排规划器-执行器架构,用于面向推理的多跳检索)。该语料库包含1,780,294个文档,基于BGE-M3模型生成1024维密集嵌入,并使用FAISS IndexFlatIP进行索引。数据来源于三个公开的多跳问答基准:HotpotQA、2WikiMultiHopQA和MuSiQue的Wikipedia段落,不包含外部网络内容或基准标签。语料库以段落级文本形式组织,每个记录包括ID、标题和内容,适用于多跳问答、文本检索等任务,并支持研究用途。

Prebuilt dense retrieval corpus used by the OPERA inference pipeline (OPERA: A Reinforcement Learning–Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval).

提供机构:
Ameame1002
二维码
社区交流群
二维码
科研交流群
商业服务