遇见数据集

jeb-rag

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

JEB-Bench 是一个公开的、用于自适应检索增强生成(RAG)管道的每查询×每配置 (correct?, joules, latency, tokens) 矩阵基准数据集,并附带生成该数据集的测量工具。该数据集旨在填补现有基准(如RAGRouter-Bench和HAKARI-Bench)中缺乏直接测量能量消耗的空白。现有自适应RAG文献通常以检索调用次数、步数、令牌数、延迟或美元成本来衡量效率,但从未直接测量能量。JEB-Bench 通过测量每个查询在不同配置下的实际能量消耗(以毫焦耳计)、正确性、延迟和令牌数,提供了直接的能量核算。数据集包含用于构建 oracle 矩阵的测量数据,包括索引构建能量日志、测量验证结果等。数据规模在10万到100万之间,涉及 NQ、HotpotQA、PopQA、TriviaQA 等数据集。该基准适用于评估自适应RAG方法的能量效率,特别关注两个关键问题:(1)路由器自身的能量消耗未被扣除;(2)索引构建能量未被摊销。修正这两个问题会改变已发表方法的效率排名。数据集使用 GPL 能量测量方法(基于NVML),在 NVIDIA T4 GPU 上运行,并提供了详细的测量方法论、已知限制(如单GPU模型、CPU能量建模等)和引用信息。

JEB-Bench is a public benchmark dataset providing a per-query × per-configuration (correct?, joules, latency, tokens) matrix for adaptive retrieval-augmented generation (RAG) pipelines, along with the measurement tools used to generate it. The dataset aims to fill the gap in existing benchmarks (e.g., RAGRouter-Bench and HAKARI-Bench) that lack direct energy consumption measurements. Existing adaptive RAG literature typically measures efficiency via retrieval calls, steps, tokens, latency, or dollar cost, but never directly measures energy. JEB-Bench provides direct energy accounting by measuring actual energy consumption (in millijoules), correctness, latency, and token count for each query under different configurations. The dataset includes measurement data for constructing oracle matrices, index building energy logs, measurement validation results, etc. The data size ranges from 100k to 1M, covering datasets such as NQ, HotpotQA, PopQA, TriviaQA. This benchmark is suitable for evaluating the energy efficiency of adaptive RAG methods, with particular attention to two key issues: (1) the energy consumption of the router itself is not deducted; (2) index building energy is not amortized. Correcting these two issues changes the efficiency ranking of published methods. The dataset uses the GPL energy measurement method (based on NVML), runs on NVIDIA T4 GPU, and provides detailed measurement methodology, known limitations (e.g., single GPU model, CPU energy modeling), and citation information.

创建时间:
2026-08-07
原始信息汇总

JEB-Bench 数据集概述

基本信息

  • 数据集名称: JEB-Bench (Charging the Gate Rent: Measured-Energy Accounting for Adaptive Retrieval-Augmented Generation)
  • 许可证: Apache-2.0
  • 语言: 英语
  • 任务类型: 问答、文本检索
  • 数据集规模: 100K < n < 1M
  • 配置: oracle_matrix 包含四个数据子集(NQ、HotpotQA、PopQA、TriviaQA),以 Parquet 格式存储

核心内容

这是首个公开的 每查询 × 每配置(正确性、焦耳、延迟、令牌数)矩阵,用于检索增强生成(RAG)管道,并附带产生该矩阵的测量工具。区别于现有基准(按令牌计价或仅关注检索质量),该数据集提供了直接测量的能量消耗数据。

关键动机

该数据集针对自适应 RAG 效率评估中的两个关键盲点:

  1. 路由能量未被计入:基于草稿的门控机制在做出二元决策时的自身能量消耗未被扣除
  2. 索引构建能量未被摊销:不同配置的比较忽略了向量索引构建的成本

这两项修正改变了已发表方法的效率排名。

仓库结构

  • harness/: 冻结的测量代码及版本清单,所有账户运行字节级一致的副本
  • phase0/: 测量验证结果(门控判定、能量读数、校准点、计数器探针、RAPL 探针等)
  • indices/: 索引变体及每次构建的能量日志
  • bench/oracle/: 核心结果——oracle 矩阵(Parquet 格式)
  • logs/: 运行树、检查点、来源追踪
  • registry/: 分片协调事件

测量方法论

方面 方法
GPU 能量 使用 NVML 毫焦耳计数器,运行时经验验证,必要时回退到功率积分
同步 每个测量区域前后均执行 torch.cuda.synchronize()
窗口长度 依据每种工作负载经验推导最小稳定窗口,通过批处理或重复达到
热管理 观察并记录温度、时钟、利用率、降频原因,不丢弃高温读数
热控制 随机化执行顺序 + 早-晚漂移统计门控(5% 容差)
CPU 能量 未直接测量(RAPL 不可访问),采用 TDP 估算并标记为 CPU

硬件环境

  • NVIDIA T4 GPU(Turing 架构)双卡,每卡 16 GB
  • 仅支持 fp16,不支持 bf16 或 FlashAttention-2

已知局限

  • 仅基于单一 GPU 型号,绝对焦耳数为 T4 特定值;可迁移的是排名和盈亏平衡点
  • CPU 能量为建模值而非实测值
  • NVML 功率读数可能偏离物理功率计
  • Phase 2 跨六个 Kaggle 账户运行,跨账户可比性依赖冻结工具的 SHA-256 断言
搜集汇总
数据集介绍
jeb-rag 数据集图片
构建方式
JEB-Bench数据集的构建基于一套严格校准的测量框架,旨在量化自适应检索增强生成(RAG)管道中每个查询与配置组合的能耗、延迟、正确性及令牌数。构建流程分为多个阶段:首先,在Phase 0中,通过NVIDIA T4 GPU上的NVML计数器直接测量GPU能量消耗,并验证测量精度,确保所有读数均满足严格的统计稳定性标准。其次,Phase 1构建了多种索引变体,并记录了每次构建的能耗,包括一次性语料编码成本。最后,在Phase 2中,生成核心的oracle矩阵,该矩阵针对多个标准问答数据集(如NQ、HotpotQA、PopQA、TriviaQA)提供每查询×每配置的完整指标。测量方法强调热管理、随机化执行顺序及漂移检测,以消除系统偏差,确保数据的可靠性与可比性。
使用方法
使用者可加载HuggingFace上的oracle矩阵数据(Parquet格式),按数据集名称(如nq、hotpotqa)分别获取查询级别的(正确性、焦耳数、延迟、令牌数)元组。该数据集适用于评估自适应RAG路由器的能耗效率,比较不同配置在真实能耗下的表现,或作为训练能耗预测模型的基准。需注意Phase 0与Phase 1数据(测量验证与索引构建能耗)可独立使用,但全套数据的完整性依赖于阶段状态。引用时请遵循提供的BibTeX条目,并注意底层语料库的原始许可条款。
背景与挑战
背景概述
JEB-Bench数据集由Shanmukesh Bonal于2026年创建,旨在填补自适应检索增强生成(RAG)领域能效评估的空白。现有基准多以令牌数、延迟或检索次数作为效率代理,从未直接测量能量消耗,且常忽略路由器自身推理成本与索引构建的摊销能耗。该数据集首次提供逐查询、逐配置的(正确性、焦耳、延迟、令牌)四元组矩阵,并配套标准化测量框架,通过严苛的验证流程确保数据可比性。其发布为绿色AI研究确立了能量核算的新范式,推动RAG系统从代理优化转向真实能效优化,对可持续机器学习领域具有开创性影响。
当前挑战
该数据集面临多重挑战。领域层面,自适应RAG的能效评估长期依赖未经实证的代理指标,路由器决策成本与索引构建能耗被系统性忽略,导致方法排序失真;现有基准如RAGRouter-Bench和HAKARI-Bench均未直接测量能量,亟需建立可复现的能耗核算体系。构建层面,GPU能量测量需验证NVML计数器可靠性并处理亚秒级窗口采样率不足;CPU能量因RAPL权限限制仅能建模,带来不确定性;热漂移与功率封顶需通过随机执行序与前后漂移统计控制;跨账户大规模运行依赖哈希校验确保一致性。此外,单一GPU型号限制绝对焦耳值的普适性,但相对排序与盈亏平衡点仍具参考价值。
常用场景
经典使用场景
JEB-Bench数据集为检索增强生成(RAG)领域提供了一项前所未有的基准资源,其核心在于构建了首个逐查询、逐配置的(正确性,焦耳,延迟,令牌数)四元组矩阵。该数据集专为自适应RAG系统的能源效率评估而设计,研究者可借此精确度量不同检索策略与生成配置在真实硬件上的能耗表现。其经典使用场景包括:对多种自适应RAG路由算法进行能源感知的性能对比,验证以令牌数或延迟作为能耗代理指标的可靠性,以及评估索引构建与路由决策本身所消耗的能源对整体效率的影响。通过提供冻结的测量工具链和校准数据,该数据集确保了跨实验的能耗数据可比性,为RAG系统的绿色AI研究树立了新的评测范式。
解决学术问题
该数据集直面自适应RAG研究中长期存在的能耗核算缺失问题,解决了两个关键的学术痛点:其一,路由决策(即“门控”)本身的计算能耗从未被计入总开销,导致能源节省被高估;其二,向量索引的构建能耗从未被摊销到每次查询中,使得不同配置的效率排名失真。JEB-Bench通过精确测量每查询的GPU焦耳数,并强制纳入路由能耗与索引摊销,修正了既有方法学上的系统性偏差。这一贡献为研究者提供了可复现的测量基准,促使学术界重新审视现有自适应RAG方法的真实效率,推动更严谨的能源感知评估方法的发展。
实际应用
在实际应用中,JEB-Bench数据集可服务于工业界与学术界的多个层面。对于部署RAG系统的企业,该数据集提供的能耗基准可指导硬件选型与模型配置优化,例如在NVIDIA T4等受限GPU环境下,根据能耗-性能权衡选择最合适的路由策略或索引类型,从而降低运营成本与碳足迹。同时,其测量方法论可被集成到云服务商的能耗监控工具中,为按需计费或绿色计算认证提供参考。此外,数据集的校准流程与能量测量工具链可直接用于实验室的能耗测试,帮助研究者在模型开发阶段即评估能源效率,推动环境可持续的AI实践落地。
数据集最近研究
最新研究方向
当前检索增强生成(RAG)领域正经历从性能优化向能效评估的范式转变,传统基准多以token数、延迟或美元成本作为代理指标,而JEB-Bench开创性地引入实测能量消耗核算,构建了首个按查询与配置细粒度的(正确性、焦耳、延迟、令牌)四维矩阵。该数据集紧扣绿色AI与气候友好的前沿议题,针对自适应RAG中路由决策能耗被忽视、索引构建能耗未摊销两大核算漏洞,提出修正方案,从而重塑既有方法的效率排序。其测量流程涵盖GPU能量计数器的运行时验证、热漂移控制与短窗口采样校准,为可复现的能效基准树立新标尺,对推动低能耗RAG系统研发及可持续发展具有重要指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务