遇见数据集

EDA Benchmark

收藏
github2026-07-14 更新2026-07-16 收录
官方服务:

资源简介:

EDA Benchmark是一个用于测试AI代理能否准确且可重复地解决结构化分析问题的基准,包含10个合成数据分析任务,涵盖环境监测、医疗保健、工业系统、金融、运营、数据清理、异常检测和结构化推理等领域。

EDA Benchmark is a benchmark developed to assess whether AI Agents can accurately and reproducibly solve structured analytical problems. It includes 10 synthetic data analysis tasks covering domains such as environmental monitoring, healthcare, industrial systems, finance, operations, data cleaning, anomaly detection, and structured reasoning.

创建时间:
2026-07-09
原始信息汇总

EDA Benchmark:合成数据与分析评估方法,用于可靠的数据分析智能体

基准概述

EDA Benchmark 是一个用于测试 AI 模型(特别是智能体系统)在合成数据分析任务上表现是否准确且可重复的基准。它衡量模型在多次运行中解决结构化分析问题的能力,并报告结合了平均分析质量与可重复性的可靠性调整分数

可用示例数据集(共10个)

该仓库公开提供 10 个合成数据分析任务,覆盖环境监测、医疗、工业系统、金融、运营、数据清洗、异常检测和结构化推理等不同领域。每个任务都包含合成数据、明确的目标定义以及用于可重复评估的真实标准答案。

数据集 分析任务
air-quality-audit 识别空气质量监测网络中的故障站点
cleaning-service 从不一致的运营记录中计算员工薪资
hospital 从赔偿登记表中推断可能的已故患者
identify-unusual-values 在合成中风数据集中检测异常值
parsing-values-task 解析不一致的交易值并识别异常记录
reactor-meltdown 重建反应堆子系统的故障传播过程
solar-farm-daily-yield 从不一致的太阳能遥测数据中计算每日能量产出
store-audit 在销售点系统中断后重建商店收入
tax-fraud-detection 从注册和发票数据中识别异常公司
the-heirs-estate 追踪继承关系并计算账户余额

这些任务测试实际的数据分析能力,包括:数据清洗、解析、聚合、异常检测、时间序列分析、因果重建以及结构化记录推理。

评估方法

基准报告以下三个关键指标:

  • ms(Mean Score,平均分):作为平均分析质量的估计值。
  • CoV(Coefficient of Variation,变异系数):用于捕获多次运行中的相对不稳定性。
  • 可靠性调整分数(Reliability-adjusted score):结合平均分析质量和可重复性的综合分数。

计算公式可靠性调整分数 = ms * exp(-2.25 * CoV^0.88)

该分数介于 01 之间,奖励准确且稳定的模型,同时非线性地惩罚表现不稳定(即重复性差)的模型。

评分机制

  • 每个模型在每个问题上进行 5 次运行(trajectories)
  • 每次运行需输出符合预期 JSON 格式的答案。
  • 答案与真实标准答案进行对比,使用专用指标(如 Jaccard 分数)计算得分。
  • 失败的运行(无法生成有效 JSON 或超时)得分为 0.0
  • 所有模型均使用其默认温度设置和最高可用的推理努力配置(如 highxhigh)。

基准评估的三个核心问题

  1. 模型能否正确解决分析任务? — 衡量答案是否与真实标准答案匹配,而非仅仅推理听起来合理。
  2. 模型能否可靠地处理现实数据的不完美性? — 任务可能包含不一致的格式、不完整的记录、多个数据源、噪声或混淆模式。
  3. 性能是否可重复? — 模型在多次运行中的表现是否稳定,避免间歇性成功但整体不可靠的情况。

仓库结构

  • harbor/ — 基准配置和 Harbor 设置
  • results/ — 评估结果、运行轨迹和工件
  • tasks/ — 10 个合成数据分析任务
  • Makefile — 运行基准的便捷命令

许可协议

该数据集采用 Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License(CC BY-NC-ND 4.0) 许可。允许以原始、未修改的形式共享并给予适当署名,但禁止修改、转换或商业用途。商业许可请联系 deepsense.ai。

相关资源

  • 可靠性调整方法基于 deepsense.ai 先前发布的 Business Utility Evaluation work
  • 方法论也在研究论文中描述:https://deepsense.ai/resource/business-utility-of-large-language-models-as-exploratory-data-analysis-agents/?utm_source=GitHub&utm_medium=Post_BU_Eval_11_06_26&utm_campaign=Readme
搜集汇总
数据集介绍
EDA Benchmark 数据集图片
构建方式
EDA Benchmark由deepsense.ai团队构建,旨在评估AI代理在结构化数据分析任务中的准确性与可重复性。该基准通过合成数据生成器创建了10个公开的跨领域数据分析任务,涵盖空气质量监测、医疗补偿、工业系统故障重建、金融异常检测等场景。每个任务均提供合成数据集、明确的解析目标以及可量化评估的真实答案,确保评价过程的可复现性。数据集基于领域模拟器生成,可调控任务难度、数据结构与约束条件,避免了直接使用或简单变换现有数据源,保证了数据的新颖性与可控性。
特点
该基准的核心特色在于其独创的可靠性调整评分体系,综合衡量模型的分析质量与跨多次运行的重复性稳定性。它采用平均得分与变异系数相结合的非线性惩罚机制,准确反映模型在实际部署中的可信赖度。10个公开任务覆盖数据清洗、异常检测、因果重构等多元分析技能,且设计有明确的失败判定标准,如超时或格式错误。合成数据具备原始性、可控性、真实性与可定制性,能够针对特定能力进行定向生成与难度调节。
使用方法
用户可通过Harbor框架在本地复现基准评估。首先需配置Python 3.12+环境并安装uv与Docker,运行make init初始化依赖。随后在harbor/.env中填入模型提供商的API密钥。支持单任务单模型测试,例如执行make run TASK=air-quality-audit AGENT=codex MODEL=openai/gpt-5.5,或通过make run-benchmark TASK=air-quality-audit运行完整的多模型评估。结果以JSON格式输出并存储于results/目录,可通过make ui启动可视化界面进行浏览与分析。
背景与挑战
背景概述
随着大语言模型从对话式交互向自主智能体演进,如何确保AI系统在结构化数据分析任务中兼具精确性与可重复性成为关键议题。由deepsense.ai团队于2025年发布的EDA Benchmark,正是针对这一核心挑战而设计的评估基准。该基准聚焦于衡量AI智能体在环境监测、医疗健康、工业系统、金融运营等多元领域完成数据分析任务时的综合能力,不仅关注单次答案的准确率,更着重评估跨多次运行的结果稳定性。通过提供可控的合成数据集与明确的真实答案,该基准为前沿模型开发者提供了一种可复现、可比较的能力评估框架,填补了现有评测体系在实用数据推理与可靠性度量方面的空白。
当前挑战
当前数据分析智能体面临的双重挑战在于:其一,任务解析的稳定性不足,模型可能偶然解决某类分析问题,却在相似情境下反复失误,这种间歇性成功增加了实际部署中的验证成本与信任风险;其二,真实世界数据的不完美性构成天然障碍,包括格式不一、记录缺失、多源异构噪声以及因果关系的模糊性。此外,构建该基准本身亦存在困难,需要设计能精准调控难度与领域覆盖度的合成数据生成器,同时建立兼顾平均得分与变异系数的可靠性调整评分机制,以非线性方式准确反映可重复性对实用价值的影响。
常用场景
经典使用场景
在人工智能体从对话式交互迈向自主数据分析的进程中,EDA Benchmark被广泛用于评测大语言模型及智能体系统在结构化分析任务上的准确性与可复现性。研究者利用其提供的10项合成数据分析任务,涵盖空气质量监测站故障识别、医院补偿登记表推断、反应堆故障传播重构、太阳能发电场日产量计算、税务欺诈检测等多元领域,系统地检验模型在数据清洗、异常检测、时序分析、因果推断与结构化推理等核心能力上的表现。该基准通过控制任务难度与数据生成过程,确保评估结果具备高度可比性与归因性,成为衡量智能体实际分析效能的标杆性工具。
实际应用
在工业界,EDA Benchmark所定义的分析任务直接映射了企业日常运营中的关键数据工作流。金融领域可借助其税务欺诈检测与交易异常识别任务来评估智能体在合规审查和风险管控中的可靠性;制造业与能源行业能够利用反应堆故障传播与太阳能场产量计算场景,检验模型在设备运维与产能预测中的决策支持能力;医院管理则可通过患者推断与薪资计算任务,验证智能体在复杂异构数据源整合与结构化输出方面的实用性。该基准强调的可重复性指标,对于需要低人工验证成本的自动化数据分析场景尤为重要,显著降低了智能体从研发到生产部署之间的不确定性。
衍生相关工作
基于EDA Benchmark的评估框架,衍生出了一系列聚焦于智能体可靠性的研究工作。其采用的可靠性调整方法源自deepsense.ai先前在商业效用评估中的探索,并被进一步扩展至更广泛的合成数据分析场景,形成了一套跨领域的质量与可复现性原则。同行研究者受此启发,开始围绕任务难度可控的生成器构建领域特定的评测集,并探索将变异系数与调整分数纳入模型训练损失函数,以提升智能体在多次运行中的一致性。此外,该基准的线性化任务结构与标准化输出格式,为开发元评估工具、自动化调试工作流以及多步推理仿真环境奠定了可供复用的技术基座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务