遇见数据集

Harbor-Index

收藏
arXiv2026-09-09 更新2026-09-11 收录
官方服务:

资源简介:

Harbor-Index是由Harbor项目团队精心策划的元数据集,专为大规模语言模型智能体评估设计,旨在提供经济高效的挑战性基准。该数据集从80余个适配基准测试中,经难度过滤、AI与人工审计及修复循环,精选出82个高难度、多样化的任务,覆盖软件工程、数学推理、科学研究和工具使用等29个领域。创建过程强调任务质量的严格把控,确保失败反映模型局限而非任务缺陷。当前最强模型配置通过率仅28%,避免了快速饱和,为智能体能力的可靠性评估与进步提供了统一平台。

Harbor-Index is a curated metadata dataset developed by the Harbor Project team, specifically designed for large language model (LLM) agent evaluation, aiming to provide a cost-effective and challenging benchmark. This dataset selects 82 high-difficulty, diverse tasks from over 80 adapted benchmark tests through difficulty filtering, AI and human auditing, and iterative repair cycles, covering 29 domains including software engineering, mathematical reasoning, scientific research, tool utilization and more. The development process emphasizes strict quality control over the tasks, ensuring that any failures encountered stem from the model's limitations rather than inherent flaws in the tasks. The current pass rate of state-of-the-art model configurations is merely 28%, which prevents rapid performance saturation, providing a unified platform for reliable evaluation and advancement of agent capabilities.

创建时间:
2026-09-04
原始信息汇总

Harbor Index 数据集概述

基本信息

  • 数据集名称:Harbor Index
  • 数据集地址:https://github.com/harbor-framework/harbor-index
  • 任务规模:80 个任务
  • 任务类型:面向智能体(agentic)评估的基准测试

数据集来源与构建

  • 从超过 6,000 个候选任务中提炼而来
  • 提炼方式包括:
    • 重复的模型运行
    • 自动化损坏任务识别
    • 人工审计
    • 奖励黑客(reward hacking)监督

提交至排行榜(Leaderboard)流程

1. 运行基准测试并上传结果

  • 要求:运行每个任务,每个任务至少 5 次试验,且结果需公开可读
  • 运行命令示例:

sh uv run harbor run -c job-config.yaml -a <agent> -m <provider/model> --ak reasoning_effort=<effort> -e <sandbox> --ve OPENAI_API_KEY="$OPENAI_API_KEY" --ve ANTHROPIC_API_KEY="$ANTHROPIC_API_KEY" --ve GEMINI_API_KEY="$GEMINI_API_KEY" --upload --public

  • API 密钥用途:用于对部分任务进行评分的 LLM-judge 集成
  • 模板文件:job-config.yaml 固定了所需的 judge verifier 设置
  • 若此前未使用 --upload 运行,可在事后上传作业目录:

sh uv run harbor upload ./jobs/<job-dir> --public

2. 提交 PR

sh cd leaderboard uv run lb submit https://hub.harborframework.com/jobs/<uuid> [more...]

3. 跟进 PR

  • CI 会验证提交
  • 维护者会审查轨迹(trajectories)
  • 合并后,提交将成为排行榜上的新行
  • 排行榜地址:https://hub.harborframework.com/datasets/harbor-index/harbor-index/latest?tab=leaderboard&leaderboard=harbor-index-1-3
  • 技术细节参见:leaderboard/SUBMIT.md

发布版本(Cutting a release)

  • 面向维护者:通过让智能体执行发布(例如 "cut harbor-index v1.3")
  • 使用技能文件:.agents/skills/harbor-index-release/SKILL.md
  • 注意:没有一次性发布工作流
  • 工具细节参见:scripts/README-build-push-pin.md

任务维护

  • 在添加或更改长时间运行的 verifier 时,需遵循 verifier 超时余量政策
  • 政策文件:VERIFIER_TIMEOUTS.md
  • 该政策内容:
    • 将评估预算与外部 verifier 截止时间分离
    • 记录了如何根据发布 oracle 时间重新校准余量
搜集汇总
数据集介绍
Harbor-Index 数据集图片
构建方式
在智能体评估基准日趋碎片化的背景下,Harbor-Index的构建依托Harbor Adapters统一基础设施,将逾80个异构基准移植至共享的“指令—环境—测试—解答”任务模式,形成包含6627项任务的初始池。随后通过多阶段漏斗式筛选:先以三个前沿模型在两种执行框架下各三次重复、共18次试验的通过率不超过33%为难度门槛,保留1311项候选;再经AI审计器依据指令—验证对齐与本质难度评分,筛至307项;继由14名领域经验丰富的人类评审复审计,保留逾110项;最后由三人资深小组依据难度、多样性与洞察力选出100项,并通过轨迹归因的审计—修复循环剔除结构性缺陷任务,最终发布82项覆盖29个基准的高质量任务。
使用方法
Harbor-Index以开源形式发布,用户可通过GitHub与Harbor Hub获取全部任务、适配器与评估工具。使用时,研究者可在Harbor框架下配置待评估的模型与智能体框架,每个模型在Terminus-2与一种原生框架下运行,形成模型—框架组合。评测在隔离的Docker沙箱中执行,支持GPU交互、LLM-as-a-judge验证及多种沙箱后端。自由回答任务采用LLM评判,其余任务通过单元测试、精确匹配或阈值化连续指标进行程序化评分。全部轨迹、分数与任务级审计材料在Harbor-Index网站公开,支持复现、再审计与扩展分析,为语言模型智能体的可靠、可扩展评估提供轻量且高质量的测试平台。
背景与挑战
背景概述
随着语言模型由静态问答向具备规划、工具调用与长程执行能力的智能体演进,智能体评测亟需跨域统一的基础设施。Harbor-Index由Cornell Tech、北京大学、斯坦福大学等机构的研究人员联合构建,并于2026年随Harbor Adapters框架一并发布,旨在解决异构智能体基准在任务格式、环境依赖与评分协议上的碎片化问题。该数据集从6627项Harbor任务中,经难度过滤、AI与人类双重审核及审计修复循环,提炼出82项高难度、多样且高质量的任务,覆盖29个基准与软件工程、科学研究、数学推理等八大领域,为大规模智能体评测提供了可负担且可复现的标准化测试平台。
当前挑战
Harbor-Index所直面的领域难题在于智能体评测从静态问答向交互式、长程任务的范式迁移:异构基准各自定义动作空间、运行时假设与评分逻辑,致使集成成本随基准与智能体数量呈O(mn)增长,跨域进展难以被统一度量;构建过程中,任务设计缺陷尤为突出,约三分之一的候选难题并非源于真实复杂度,而是指令与验证器错位、隐藏测试回归、验证器越权乃至参考答案错误等结构性缺陷,同时代理可通过答案外泄、容器挂载泄漏或共享环境篡改验证器而虚假得分,如何在压缩评测成本的同时确保任务定义严谨、评分确定且难以被策略性利用,构成该数据集持续面临的核心挑战。
常用场景
经典使用场景
在大规模语言模型智能体评估的实践中,Harbor-Index 最经典的使用场景是作为一套轻量、可复现的基准测试集,对具备工具调用与长程规划能力的智能体进行跨域能力诊断。研究者借助 Harbor Adapters 将异构基准统一接入 Harbor 运行时,随后以 Harbor-Index 中覆盖软件工程、数学推理、科学计算、数据分析与安全等领域的 82 项精选任务为统一测试床,在固定执行契约与资源预算下并行运行多种模型-脚手架组合,从而在有限算力开销内获得对智能体综合能力的细粒度刻画与失败模式归因。
解决学术问题
该数据集精准回应了智能体评估中长期存在的碎片化与可比性缺失问题。此前基准各自为政,环境、动作空间与评分协议互不兼容,导致基准与智能体之间的集成复杂度高达 O(mn),且低分辨率任务常被误判为模型能力不足,实则为结构性设计缺陷。Harbor-Index 通过难度过滤、AI 与人类双重审计及审计-修复闭环,系统性地剔除指令-验证错配、可博弈测试与错误金标任务,使评估信号真正反映推理、领域知识与长程执行能力的差异,从而为模型能力排序与失败归因提供更可靠、更公平的学术测量工具。
实际应用
在工业研发与模型选型场景中,Harbor-Index 为团队提供了一套成本可控、结果可比的智能体能力评估方案。开发团队可在持续集成流程中定期运行 Harbor-Index,追踪模型在软件工程、金融分析、临床信息检索等专业任务上的表现变化,并依据成本-性能帕累托前沿选择适配的模型-脚手架组合。其开源适配器与轨迹数据亦支持企业复现评测结果、审计具体失败案例,从而在部署前识别智能体在真实业务环境中的能力边界与潜在风险。
数据集最近研究
最新研究方向
在大规模智能体评估领域,Harbor-Index 正引领以“紧凑性、多样性与高难度”为核心的前沿方向。它通过统一适配层汇聚 82 项跨 29 个基准的高质任务,并借助难度过滤、AI 与人工审计及修复闭环,剔除因设计缺陷而虚假困难的样本,确保失败真实反映能力短板。其影响在于重塑评估范式:借助低秩结构与 Pareto 前沿分析,揭示模型能力比脚手架更关键,而多数基准存在冗余信号,从而推动更可靠、可负担且以能力轴覆盖为优先的下一代智能体评测。
相关研究论文
  • 1
    Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation康奈尔大学; 北京大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务