EDA Benchmark
收藏资源简介:
EDA Benchmark是一个用于测试AI代理能否准确且可重复地解决结构化分析问题的基准,包含10个合成数据分析任务,涵盖环境监测、医疗保健、工业系统、金融、运营、数据清理、异常检测和结构化推理等领域。
EDA Benchmark is a benchmark developed to assess whether AI Agents can accurately and reproducibly solve structured analytical problems. It includes 10 synthetic data analysis tasks covering domains such as environmental monitoring, healthcare, industrial systems, finance, operations, data cleaning, anomaly detection, and structured reasoning.
EDA Benchmark:合成数据与分析评估方法,用于可靠的数据分析智能体
基准概述
EDA Benchmark 是一个用于测试 AI 模型(特别是智能体系统)在合成数据分析任务上表现是否准确且可重复的基准。它衡量模型在多次运行中解决结构化分析问题的能力,并报告结合了平均分析质量与可重复性的可靠性调整分数。
可用示例数据集(共10个)
该仓库公开提供 10 个合成数据分析任务,覆盖环境监测、医疗、工业系统、金融、运营、数据清洗、异常检测和结构化推理等不同领域。每个任务都包含合成数据、明确的目标定义以及用于可重复评估的真实标准答案。
| 数据集 | 分析任务 |
|---|---|
air-quality-audit |
识别空气质量监测网络中的故障站点 |
cleaning-service |
从不一致的运营记录中计算员工薪资 |
hospital |
从赔偿登记表中推断可能的已故患者 |
identify-unusual-values |
在合成中风数据集中检测异常值 |
parsing-values-task |
解析不一致的交易值并识别异常记录 |
reactor-meltdown |
重建反应堆子系统的故障传播过程 |
solar-farm-daily-yield |
从不一致的太阳能遥测数据中计算每日能量产出 |
store-audit |
在销售点系统中断后重建商店收入 |
tax-fraud-detection |
从注册和发票数据中识别异常公司 |
the-heirs-estate |
追踪继承关系并计算账户余额 |
这些任务测试实际的数据分析能力,包括:数据清洗、解析、聚合、异常检测、时间序列分析、因果重建以及结构化记录推理。
评估方法
基准报告以下三个关键指标:
- ms(Mean Score,平均分):作为平均分析质量的估计值。
- CoV(Coefficient of Variation,变异系数):用于捕获多次运行中的相对不稳定性。
- 可靠性调整分数(Reliability-adjusted score):结合平均分析质量和可重复性的综合分数。
计算公式:可靠性调整分数 = ms * exp(-2.25 * CoV^0.88)
该分数介于 0 和 1 之间,奖励准确且稳定的模型,同时非线性地惩罚表现不稳定(即重复性差)的模型。
评分机制
- 每个模型在每个问题上进行 5 次运行(trajectories)。
- 每次运行需输出符合预期 JSON 格式的答案。
- 答案与真实标准答案进行对比,使用专用指标(如 Jaccard 分数)计算得分。
- 失败的运行(无法生成有效 JSON 或超时)得分为
0.0。 - 所有模型均使用其默认温度设置和最高可用的推理努力配置(如
high或xhigh)。
基准评估的三个核心问题
- 模型能否正确解决分析任务? — 衡量答案是否与真实标准答案匹配,而非仅仅推理听起来合理。
- 模型能否可靠地处理现实数据的不完美性? — 任务可能包含不一致的格式、不完整的记录、多个数据源、噪声或混淆模式。
- 性能是否可重复? — 模型在多次运行中的表现是否稳定,避免间歇性成功但整体不可靠的情况。
仓库结构
harbor/— 基准配置和 Harbor 设置results/— 评估结果、运行轨迹和工件tasks/— 10 个合成数据分析任务Makefile— 运行基准的便捷命令
许可协议
该数据集采用 Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License(CC BY-NC-ND 4.0) 许可。允许以原始、未修改的形式共享并给予适当署名,但禁止修改、转换或商业用途。商业许可请联系 deepsense.ai。
相关资源
- 可靠性调整方法基于 deepsense.ai 先前发布的 Business Utility Evaluation work
- 方法论也在研究论文中描述:https://deepsense.ai/resource/business-utility-of-large-language-models-as-exploratory-data-analysis-agents/?utm_source=GitHub&utm_medium=Post_BU_Eval_11_06_26&utm_campaign=Readme




