遇见数据集

commercial-tax-musique-embeddings

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集是论文“The Commercial Tax: Rent-vs-Own Blind Spots in Multi-Hop Retrieval Benchmarks”(Sanchez & Dehnad, 2026)的配套资源,提供了HippoRAG-2 MuSiQue协议语料库的密集嵌入矩阵。数据集包含11,656条维基百科段落和1,000个评估问题的嵌入向量,涵盖多种嵌入模型:NV-Embed-v2、Nemotron-3-Embed-8B、Cohere Embed v4、Google Gemini embedding-001、OpenAI text-embedding-3-large/small、voyage-3.5、Nemotron-3-Embed-1B、Llama-Nemotron-Embed-1B-v2、nv-embedqa-e5-v5、BGE-M3、mxbai-embed-large-v1和Qwen3-VL-Embedding-8B。所有嵌入矩阵以.npy文件格式存储,精度为float32(BGE-M3为float16),可直接通过numpy.load加载。数据集旨在支持多跳检索基准测试的可重复性,使研究人员无需重新嵌入语料库即可复现论文中的实验结果。此外,数据集提供了SHA256SUMS校验文件以确保数据完整性。许可协议为CC BY 4.0,但NV-Embed-v2嵌入继承其模型cc-by-nc-4.0许可,仅限非商业用途。

This dataset is the companion resource for the paper The Commercial Tax: Rent-vs-Own Blind Spots in Multi-Hop Retrieval Benchmarks (Sanchez & Dehnad, 2026), providing dense embedding matrices for the HippoRAG-2 MuSiQue protocol corpus. The dataset contains embeddings for 11,656 Wikipedia passages and 1,000 evaluation questions, covering multiple embedding models: NV-Embed-v2, Nemotron-3-Embed-8B, Cohere Embed v4, Google Gemini embedding-001, OpenAI text-embedding-3-large/small, voyage-3.5, Nemotron-3-Embed-1B, Llama-Nemotron-Embed-1B-v2, nv-embedqa-e5-v5, BGE-M3, mxbai-embed-large-v1, and Qwen3-VL-Embedding-8B. All embedding matrices are stored as .npy files with float32 precision (float16 for BGE-M3) and can be loaded directly via numpy.load. The dataset aims to support reproducibility of multi-hop retrieval benchmarks, allowing researchers to reproduce experimental results without re-embedding the corpus. Additionally, SHA256SUMS checksums are provided to ensure data integrity. The license is CC BY 4.0, but NV-Embed-v2 embeddings inherit the cc-by-nc-4.0 license of their model, restricting them to non-commercial use only.

创建时间:
2026-08-06
原始信息汇总

数据集概述

数据集名称:Commercial Tax — MuSiQue embedding matrices(13-embedder panel)

许可证:CC BY 4.0(自有向量与卡片);NV-Embed-v2 矩阵继承 cc-by-nc-4.0 非商业限制

语言:英语

数据规模:1K < n < 10K(实际包含 11,656 条维基百科段落及 1,000 条评估问题)

标签:检索(retrieval)、嵌入(embeddings)、MuSiQue、多跳(multi-hop)、基准测试(benchmark)、可复现性(reproducibility)


数据集内容

本数据集是论文 《The Commercial Tax: Rent-vs-Own Blind Spots in Multi-Hop Retrieval Benchmarks》(Sanchez & Dehnad, 2026; arXiv:2608.16096)的配套数据,提供 HippoRAG-2 MuSiQue 协议语料库的稠密嵌入矩阵,使论文中的全部表格可无需重新嵌入语料即可复现。

语料组成

  • 11,656 条维基百科段落(HippoRAG-2 MuSiQue 协议语料)
  • 1,000 条评估问题(源自 musique.json,当 harness 支持离线嵌入时)

矩阵格式

  • 所有矩阵均为 float32 类型(BGE-M3 为 float16
  • 可进行 L2 归一化,使用 numpy.load 直接加载
  • 行序与语料文件顺序一一对应

嵌入模型面板

目录 模型 语料格式 维度
embeddings/nvembed/ NV-Embed-v2(研究锚点) title + text(修正索引)/ 仅文本(缺陷早期索引) 11656×4096
embeddings/nvembed_replicate/ NV-Embed-v2(独立 GPU 复现) title + text 11656×4096
embeddings/nemotron3_8b/ Nemotron-3-Embed-8B 两种格式 11656×4096
embeddings/api_panel/ Cohere Embed v4、Gemini embedding-001、text-embedding-3-large/-small、voyage-3.5、Nemotron-3-Embed-1B、Llama-Nemotron-Embed-1B-v2、nv-embedqa-e5-v5 两种格式 + 查询向量 11656×d, 1000×d
embeddings/bge_m3/ BGE-M3 title + text 11656×1024 (fp16)
embeddings/kms_mxbai/ mxbai-embed-large-v1 title + text 11656×1024
embeddings/kms_qwen3vl/ Qwen3-VL-Embedding-8B title + text 11656×1024, 1000×1024

使用方式

python import numpy as np C = np.load("embeddings/nemotron3_8b/corpus_title_text.npy") # (11656, 4096)

可配合 GitHub 发布仓库中的 code/panel_*.py 脚本或 code/nvembed_encode_retrieve.py / code/api_embedder_panel_sweep.py 计算 Recall@k 等指标。

注意事项:查询侧嵌入(除 Qwen3-VL 外)由发布的 harness 实时重算,具体查询指令见 GitHub 仓库的 code/ 目录。


许可与溯源

  • 自有向量、数据集卡片与校验和:CC BY 4.0
  • NV-Embed-v2 矩阵:继承模型 cc-by-nc-4.0 非商业限制,仅供验证与研究
  • API 供应商矩阵:由相应服务返回,日期记录于发布仓库 results/provenance/;托管端点随时间可能漂移
  • 引用建议:引用论文并固定 revision SHA,而非仅引用数据集名称
搜集汇总
数据集介绍
commercial-tax-musique-embeddings 数据集图片
构建方式
该数据集源自HippoRAG-2 MuSiQue协议语料库,涵盖11,656篇维基百科篇章及1,000个评估问题。构建过程中,研究团队运用多种前沿嵌入模型,如NV-Embed-v2、Nemotron-3-Embed-8B及各类API服务,生成密集向量矩阵。所有矩阵均按统一格式存储,支持L2归一化处理,并附有SHA256校验和以确保数据完整性。特别地,数据集包含原始与修正后的索引版本,以及独立GPU重嵌入的复制品,为论文中的取证分析提供了坚实基础。
特点
此数据集的核心特色在于其多模型、多格式的嵌入矩阵集合,覆盖从自托管到商业API的广泛嵌入选项。每行对应一个语料库篇章或问题,便于直接进行检索性能评估。数据集不仅提供了原始嵌入,还包含了复制运行的结果,增强了研究的可复现性。此外,数据集的许可协议细致区分了不同模型输出的使用限制,尤其指出NV-Embed-v2矩阵的非商业用途,体现了对知识产权的尊重与学术规范。
使用方法
使用此数据集时,研究者可直接通过numpy加载嵌入矩阵,例如`np.load("embeddings/nemotron3_8b/corpus_title_text.npy")`获得形状为(11656, 4096)的矩阵。随后,配合发布仓库中的代码文件,如`code/panel_*.py`或`code/nvembed_encode_retrieve.py`,能够重现论文中的Recall@k指标或其他检索实验。数据集还提供了查询嵌入矩阵,支持离线评估,极大地简化了多跳检索基准测试的流程,确保实验结果的可比性与一致性。
背景与挑战
背景概述
该数据集由Sanchez与Dehnad于2026年创建,作为论文“The Commercial Tax: Rent-vs-Own Blind Spots in Multi-Hop Retrieval Benchmarks”(arXiv:2608.16096)的配套资源,由Toryx-AI机构发布。其核心研究问题聚焦于多跳检索基准中,商业API嵌入模型与自托管模型在可复现性上的隐蔽缺陷,即“租赁vs自有的盲点”。数据基于HippoRAG-2 MuSiQue协议语料,包含11,656篇维基百科段落及1,000个评估问题,并提供13种嵌入模型(如NV-Embed-v2、Cohere Embed v4、BGE-M3等)的预计算嵌入矩阵,使研究者无需重新嵌入语料即可复现论文全部表格。该数据集对信息检索领域具有重要影响力,尤其促进了多跳问答基准的可复现性研究,揭示了商业模型版本漂移对实验公平性的潜在威胁,为后续研究提供了关键基准资源。
当前挑战
该数据集面临的挑战集中于两个方面:领域层面,多跳检索基准长期受制于商业嵌入模型的非确定性,API端点更新导致实验结果难以精确复现,而现有基准忽略“租用”模型(如Cohere、Gemini)与“自有”模型(如NV-Embed-v2)在许可和性能上的差异,造成评估盲区;构建层面,数据构建需协调13种模型的异构输出(维度、数据类型、格式差异),并确保语料索引修正(如NV-Embed-v2的title+text版本)的准确性,同时部分模型(如NV-Embed-v2)采用非商业许可,限制了数据集的广泛传播,而API嵌入矩阵的时间戳性质要求严格版本锁定,增加了维护与验证的复杂性。
常用场景
经典使用场景
该数据集为多跳检索基准测试中的密集嵌入矩阵集合,其经典使用场景在于为研究者提供标准化的嵌入资源,以便在不重新嵌入语料库的前提下,复现论文中所有实验表格。通过加载预先计算好的嵌入矩阵,研究者可以快速执行检索实验,验证不同嵌入器(如NV-Embed-v2、BGE-M3等)在多跳问答任务中的表现,从而聚焦于算法改进而非数据预处理。
衍生相关工作
该数据集衍生了多项相关工作,包括对嵌入模型鲁棒性的深入研究、多跳检索中标题与文本信息影响的消融实验,以及针对API嵌入服务的时间漂移分析。此外,它催生了新的评估指标或基准,促使研究者探索检索系统的可复现性,并推动了开源嵌入模型与商业API服务之间性能对比的标准化流程。
数据集最近研究
最新研究方向
该数据集围绕多跳检索基准的鲁棒性与可复现性展开前沿探索,其核心贡献在于剖析‘商业税’现象——即依托商业API进行大规模嵌入计算时,因模型许可限制或端点漂移而导致的盲区。研究通过构建包含13种嵌入器、覆盖开源与商业模型的丰富矩阵面板,系统评估了检索性能对嵌入表示的敏感性,并揭示了索引格式(如标题+文本与纯文本)对结果的关键影响。这一工作呼应了当前检索增强生成(RAG)领域对基准可靠性与公平比较的迫切需求,并为多跳推理任务提供了可重算的标准化评估资源,对推动检索系统的透明化发展与可重复研究具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务