遇见数据集

BC-Plus-Eval-Results

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

BC-Plus A Leaderboard Results数据集存储了XIR Competition 1170 BC-Plus A排行榜的公共评估结果,专门用于信息检索领域的竞赛评估。它包含四个核心文件:公共A榜(每支队伍的最佳结果及基线数据)、队伍最佳结果与最新提交结果的对比表、仅追加模式的提交历史记录以及基线结果数据。公开版本的文件移除了检索器仓库标识符以保护隐私,而内部维护版本则保留了完整的私有仓库映射。评估采用综合评分公式:总得分 = 0.4 * 召回率 + 0.4 * 成功率 + 0.2 * (1 - 平均步骤数 / 50) * 100。A榜竞赛设定使用Qwen3.5-4B作为代理模型,并配备search和get_document两种工具,最大工具调用步数限制为50步。

The BC-Plus A Leaderboard Results dataset stores the public evaluation results of the XIR Competition 1170 BC-Plus A leaderboard, specifically designed for competition evaluation in the field of information retrieval. It includes four core files: the public A leaderboard (best results and baseline data for each team), a comparison table between the best team results and the latest submission results, an append-only submission history record, and baseline result data. The public version of the files removes the retriever repository identifiers to protect privacy, while the internally maintained version retains the complete private repository mapping. Evaluation uses a comprehensive scoring formula: total score = 0.4 * recall + 0.4 * success rate + 0.2 * (1 - average steps / 50) * 100. The A leaderboard competition is set up using Qwen3.5-4B as the agent model, equipped with search and get_document tools, with a maximum tool call step limit of 50 steps.

创建时间:
2026-07-09
原始信息汇总

BC-Plus A Leaderboard 排行榜结果数据集

基本信息

  • 数据集名称: BC-Plus A Leaderboard Results (pretty_name)
  • 许可证: other
  • 标签: leaderboard, browsecomp-plus, information-retrieval

数据集内容

该数据集存储了 XIR Competition 1170 BC-Plus A 排行榜的公开评估结果,包含以下文件:

文件名 说明
leaderboard-public.csv 公开A榜,每个团队取最佳结果及基线结果
leaderboard-best-latest.csv 每个团队的最佳结果与最新提交结果并列展示
submission-results-history.csv 仅追加的提交历史记录
baseline-results.csv 基线行数据

评分公式

total_score = 0.4 * Recall + 0.4 * Success_Rate + 0.2 * (1 - Avg_Steps / 50) * 100

评估配置

  • Agent模型: Qwen3.5-4B
  • 工具: search 和 get_document
  • 最大工具步数: 50

隐私说明

公开文件已省略检索器仓库标识符,内部评估文件保留私有仓库映射用于维护。

搜集汇总
数据集介绍
BC-Plus-Eval-Results 数据集图片
构建方式
BC-Plus-Eval-Results数据集专为XIR竞赛1170的BC-Plus A排行榜设计,系统化地收录了评估过程中的各类公开构件。其构建包含四个核心表格:leaderboard-public.csv记录每支队伍在A榜上的最佳成绩及基线结果,leaderboard-best-latest.csv并列呈现各队的最佳与最新提交,submission-results-history.csv以追加方式存储完整提交历史,baseline-results.csv则固定基线数据行。所有公开文件均隐去了检索器仓库标识,而内部评估文件保留私有映射以便维护。
特点
该数据集最显著的特征在于其结构化的排行榜机制与透明的评分体系。评分函数综合了召回率(Recall,权重0.4)、成功率(Success_Rate,权重0.4)以及平均步骤效率(1 - Avg_Steps / 50,权重0.2),形成总分,其中步骤数上限为50。A榜采用Qwen3.5-4B作为智能体模型,配备搜索与文档获取工具,凸显了多轮交互与工具调用能力在评估中的核心地位。此外,历史记录仅可追加,确保了评估过程的不可篡改与可追溯性。
使用方法
该数据集的使用主要面向竞赛参与者与研究人员,用于分析模型在信息检索任务中的表现。用户可直接访问leaderboard-public.csv获取各队公开成绩,或通过submission-results-history.csv追踪多次提交的演化趋势,以优化自身策略。基线表格提供了对比基准,便于评估改进幅度。对于深层分析,内部评估文件需在维护目录下访问,支持对特定检索器性能的细粒度探查。配合公开的评分公式,用户可以复现得分计算,验证结果一致性。
背景与挑战
背景概述
BC-Plus-Eval-Results 数据集诞生于信息检索与智能体系统交叉领域的前沿探索,由相关研究团队于近期创建,旨在为浏览式复合检索任务(BrowseComp Plus)提供标准化的评测基准。该数据集的核心研究问题聚焦于如何通过多工具协作的智能体模型,准确且高效地从海量信息中定位目标,其评估指标综合了召回率、成功率及步骤效率,体现了对检索质量与资源消耗的双重考量。作为 XIR Competition 1170 的官方榜单数据,BC-Plus-Eval-Results 不仅记录了各参赛团队与基线的表现,更推动了基于大语言模型的检索智能体在真实场景下的性能优化与比较,对信息检索领域的技术演进具有重要影响力。
当前挑战
该数据集所应对的领域挑战在于:传统的检索评价多关注单一维度的准确率,而 BrowseComp Plus 任务要求智能体在有限步骤内(最多50步)兼顾信息的全面召回(Recall)与精确命中(Success Rate),并以步骤效率作为重要惩罚项,这使得设计既能快速决策又能修正错误的检索策略成为难题。构建过程中,挑战体现在对实验设置的高度标准化与隐私保护的平衡上:需确保每个团队使用相同的底层模型(Qwen3.5-4B)和工具集,同时隐藏检索器仓库标识以避免策略泄露;此外,维护追加式提交历史与实时更新多类榜单(如最佳结果与最新提交)的工程复杂性,也对数据集的持续可信性构成了考验。
常用场景
经典使用场景
BC-Plus-Eval-Results数据集专为信息检索与智能体评估领域而设计,其核心应用场景在于衡量检索增强型大语言模型在复杂查询环境下的综合表现。通过整合召回率、成功率及平均工具步数等关键指标,该数据集为多轮交互式检索任务提供了标准化评测基准,尤其适用于需要调用外部工具(如搜索与文档获取)的智能体系统,成为验证检索模型与代理策略协同效能的重要平台。
解决学术问题
该数据集有效解决了学术界在评估检索智能体时面临的评测标准不统一、难以兼顾效果与效率的难题。其复合评分机制(兼顾召回率、成功率与步骤效率)揭示了模型在信息获取精准度与任务完成经济性之间的权衡关系,为研究工具使用策略、检索规划及多步推理优化提供了可量化的分析框架,推动了检索增强生成与自主智能体领域的实验方法论进步。
衍生相关工作
该数据集衍生出一系列聚焦于检索智能体效率优化的经典工作,例如基于步骤预算约束的检索规划算法、多工具协同调度的强化学习框架,以及面向长尾查询的递归过滤策略。研究者利用其公开的排行榜与基线数据,对比分析不同智能体架构在相同评测条件下的性能差异,进而催生了混合检索路径、自适应停止决策等创新方法论,共同推动了检索增强型自主系统的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务