遇见数据集

deepdesk-bench

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

DeepDesk-Bench 是一个用于评估 AI agent 在真实欧洲天然气分析师工作流程中表现的新基准测试。该基准测试要求 agent 检查一个合成 LNG 运营门户,协调船舶和货物证据,并更新现有的 Excel 供需模型,同时确保不破坏模型结构。本次发布聚焦于 LNG 调度和电子表格执行,所有市场数据均为合成数据。基准测试包含四个任务:01-船舶协调(生成 JSON 格式的入境货物列表及证据)、02-货物协调(生成 LNG 调度的 JSON 决策表)、03-调度更新(根据提供的货物决策更新工作簿)、04-完整更新(从门户和前期收盘模型生成更新后的工作簿)。评分采用确定性方法,不依赖语言模型作为裁判,总分为 100 分,涵盖运营 LNG 调度决策、数值平衡准确性、出处与截止纪律、工作簿完整性与公式保留、不确定性处理等维度。该基准测试目前为早期概念验证,不适用于模型在商品工作领域的通用排名。

DeepDesk-Bench is a new benchmark for evaluating the performance of AI agents in real-world European gas analyst workflows. The benchmark requires agents to inspect a synthetic LNG operations portal, reconcile vessel and cargo evidence, and update an existing Excel supply-demand model while ensuring the model structure is not disrupted. This release focuses on LNG scheduling and spreadsheet execution, with all market data being synthetic. The benchmark consists of four tasks: 01-Vessel Reconciliation (generate a JSON list of inbound cargoes with evidence), 02-Cargo Reconciliation (generate a JSON decision table for LNG scheduling), 03-Scheduling Update (update the workbook based on provided cargo decisions), 04-Full Update (generate an updated workbook from the portal and prior close model). Scoring uses a deterministic method, without relying on language models as judges, with a total score of 100, covering dimensions such as operational LNG scheduling decisions, numerical balance accuracy, provenance and cut-off discipline, workbook integrity and formula preservation, and uncertainty handling. This benchmark is currently an early proof of concept and is not suitable for general ranking of models in the commodity domain.

创建时间:
2026-09-04
原始信息汇总

DeepDesk-Bench 数据集概述

DeepDesk-Bench 是一个用于测试 AI 代理在现实欧洲天然气分析师工作流程中表现的基准测试,核心场景为:检查合成 LNG 运营门户、核对船舶与货物证据,并在不破坏现有模型的前提下更新 Excel 供需模型。当前首版聚焦于 LNG 调度与电子表格执行,所有市场数据均为合成数据。

任务构成

数据集包含四个任务,旨在分别测试证据收集、分析判断和电子表格执行能力,其中任务 04 综合测试完整工作流:

任务 目标产出
01-vessel-recon 具有重大影响入港货物的 JSON 列表及支撑证据
02-cargo-reconciliation LNG 调度的 JSON 决策表
03-schedule-update 使用给定货物决策更新后的工作簿
04-full-update 基于门户信息和上期收盘模型生成更新后的工作簿

运行方式

基准通过 Harbor 运行,可从 GitHub 仓库获取规范注册表,运行命令示例:

bash harbor run --repo qrlow/evals -d snd-floaters -a <agent> -m <model>

每个任务会在候选环境中启动一个本地 LNG-PortalSim 实例(http://localhost:8000),且该门户为唯一允许访问的外部信息来源。

数据集内容

  • 四个自包含的 Harbor 任务包
  • 合成 LNG-PortalSim 门户及冻结的取证记录
  • 起始 Excel 工作簿及确定性评分代码
  • Oracle 解决方案与验证测试
  • 2026 年 8 月测评活动的精简结果
  • benchmark_tasks.jsonl 任务索引文件

评分方式

评分完全确定性,不依赖语言模型评判。JSON 任务与冻结参考数据比对;工作簿任务直接检查货物决策、数值输出、证据、公式保留及不确定性处理。任务 04 采用百分制:

类别 分值
运营 LNG 调度决策 40
数值平衡准确性 25
溯源及截止日期纪律 20
工作簿完整性与公式保留 10
不确定性处理 5

关键罚分项包括:使用截止日期后的证据、无依据或重复计算货物、将未解决货物计入平衡,以及硬编码 LNG 输出单元格。

使用说明

此为早期概念验证,不构成对模型在商品领域表现的一般性排名。每对模型任务仅运行一次,公布的分数应视作初步诊断结果,而非稳定的模型质量估计。

搜集汇总
数据集介绍
deepdesk-bench 数据集图片
构建方式
该数据集是针对欧洲天然气分析师工作流程设计的综合性基准测试,其构建方式独具匠心。它模拟了一个真实的LNG调度场景,包含合成市场数据、一个模拟的LNG业务门户(LNG-PortalSim)以及一个预填充的Excel供需模型。数据集被精心拆分为四个递进的任务:从船只证据核查、货物对账,到基于决策的表格更新,最终实现端到端的全流程操作。每项任务均包含独立的Harbor评测包、起始Excel文件、冻结的参考数据以及非LLM的确定性评分代码,确保了评估的客观性与可复现性。
特点
DeepDesk-Bench的核心特色在于其真实性与严谨性的结合。它要求智能体在受限环境下进行证据收集、逻辑推理与电子表格操作,杜绝了外部信息源的干扰。其评分体系独树一帜,完全基于规则,细致考察货物决策、数值准确性、来源标注、截止时间纪律及公式完整性等多个维度,并设置了严苛的惩罚项,如处理截止后信息或硬编码输出。此外,所有市场数据均为合成数据,避免了版权与泄露风险,而其透明的打分机制(例如任务四的百分制构成)使得模型性能评估变得清晰可鉴。
使用方法
使用者可通过Harbor基准测试框架便捷地运行这一评估套件。典型流程为,从GitHub仓库获取任务包,利用'python harbor run'命令行指定待评估的智能体与模型,即可一键执行全部四个任务。每个任务都会在候选环境中启动一个本地LNG-PortalSim实例,允许智能体将其作为唯一外部信息源进行交互。系统还提供了Oracle参考解决方案,便于对照测试或验证环境准备。最终的评分得分会依据公开的评分标准自动计算,为研究者在商品分析领域的人工智能体表现评估提供了一套标准化的诊断手段。
背景与挑战
背景概述
DeepDesk-Bench是一个针对能源商品分析领域的AI代理评估基准,于2026年8月由qrlow团队创建。该基准的核心研究问题是检验AI代理能否执行真实的欧洲天然气分析师工作流程,包括检查合成LNG运营门户、核对船只和货物证据,以及在不损害现有模型的前提下更新Excel供需模型。该基准的发布填补了能源商品领域缺乏标准化AI代理评估工具的空白,为后续研究提供了可复现的实验基础,对推动AI在商品分析中的应用具有潜在影响力。
当前挑战
该基准面临的挑战涵盖两个层面。在领域层面,能源商品分析工作流程涉及数据异构、证据链复杂、模型维护要求高,要求AI代理具备多步骤推理与工具调用能力;在构建层面,基准需确保环境隔离与评估确定性,同时通过冻结证据记录和确定性评分代码来消除语言模型评判的主观性。此外,基准对跨截止时间证据、重复货物、硬编码输出等特定错误行为设置了严格惩罚,以确保评估的精确性和可靠性。
常用场景
经典使用场景
DeepDesk-Bench作为一项专为评估AI智能体在真实欧洲天然气分析师工作流中表现而设计的基准测试,其经典使用场景聚焦于模拟完整的LNG调度与电子表格执行流程。智能体需访问合成LNG运营门户,核验船舶与货物证据,并在不损坏既有模型的前提下,更新Excel供需平衡表。该基准通过四个递进任务(船舶证据核验、货物对账决策、排程更新及端到端整体更新)逐步考察智能体在信息检索、分析判断与工具操作方面的综合能力。此场景为检验智能体在特定垂直领域(大宗商品、金融)中执行多步骤专业任务的能力提供了严苛的标准化测试环境。
解决学术问题
该数据集精准回应了当前AI智能体评估中缺乏领域深度与操作真实性并重的基准这一问题。它突破了传统问答或单步工具调用评测的局限,转而探究智能体在复杂工作流中平衡证据收集、判断决策与电子表格操作的能力,尤其关注工作簿完整性保持与不确定性处理。通过确定性评分机制(非LLM评判)直接审查输出数值与公式保留情况,它科学地量化了智能体在数据溯源、截止日期纪律及安全处理不确定性方面的表现。此设计为智能体在专业流程中的可靠性评估提供了新范式。
衍生相关工作
该数据集的开创性工作催生了若干可预期的衍生研究方向。其一,基于其任务分解逻辑,可引申出面向其他大宗商品(如原油、电力)或更广泛金融工作流的专项基准开发,以形成行业化的智能体能力评估体系。其二,其任务中强调的证据溯源与公式保持的评估指标,为构建更细致的智能体操作审计工具提供了出发点。其三,由于该基准为概念验证,未来工作可能侧重扩展其规模与难度,引入更复杂的工作簿逻辑或多步跨系统交互,推动智能体在结构化数据操作领域持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务