遇见数据集

allenai/discoverybench

收藏
Hugging Face2024-07-15 更新2024-06-15 收录
官方服务:

资源简介:

DiscoveryBench数据集旨在系统地评估当前模型在数据驱动发现任务中的能力,并提供一个改进这些能力的资源。每个DiscoveryBench任务由一个目标和数据集组成,解决任务需要统计分析和语义推理。数据集包含真实和合成的基准测试,每个基准测试都有训练和测试分区,且每个分区包含查询数据集文件和元数据文件。元数据文件包含一个或多个查询,这些查询都可以通过答案键中的黄金假设来回答。答案键中的每个记录由数据集文件夹名称、元数据ID和查询ID索引。

DiscoveryBench is designed to systematically assess current model capabilities in data-driven discovery tasks and provide a useful resource for improving them. Each DiscoveryBench task consists of a goal and dataset(s). Solving the task requires both statistical analysis and semantic reasoning. The dataset contains both real and synthetic benchmarks, each with train and test partitions. Each partition includes query dataset files and metadata files. The metadata files contain one or more queries that can all be answered by the gold hypothesis present in the answer keys. Each record in the answer key is indexed by the dataset folder name, metadata ID, and query ID.

提供机构:
allenai
原始信息汇总

数据集概述

许可证

  • 许可证类型:odc-by

任务类别

  • 文本生成

数据配置

  • 配置名称:default
    • 数据文件:
      • 训练集路径:discoverybench/real/train/evolution_freshwater_fish/*.json
      • 测试集路径:discoverybench/real/test/archaeology/*.json

数据结构

  • discoverybench:包含真实和合成基准测试文件夹。每个基准测试都有训练和测试分区。每个文件夹包含常见的查询-数据集文件(通常是csv)和多个metadata_*.json文件。每个metadata_*.json文件包含一个或多个查询,这些查询都可以通过answer_key中的黄金假设来回答。
  • answer_key:真实和合成发现任务的黄金假设。每个记录通过数据集文件夹名称、metadata_idqid进行索引。
搜集汇总
数据集介绍
allenai/discoverybench 数据集图片
构建方式
DiscoveryBench数据集源自同名论文《DiscoveryBench: Towards Data-Driven Discovery with Large Language Models》,由艾伦人工智能研究院(Allen Institute for AI)构建。该数据集旨在系统评估大型语言模型在数据驱动发现任务中的能力,每个任务包含一个明确的目标和若干数据集。构建过程中,数据集被划分为真实与合成两大基准,每个基准均设有训练集和测试集。训练与测试数据分别存储于train_relevant.csv和test_relevant.csv文件中,每个任务文件夹内包含通用的查询-数据集文件(通常为CSV格式)及多个metadata_*.json文件,每个元数据文件包含一个或多个可通过答案键中黄金假设解答的查询。答案键为真实与合成发现任务提供黄金标准假设,每条记录由数据集文件夹名称、元数据标识符和查询ID唯一索引。
特点
DiscoveryBench的显著特点在于其任务设计融合了统计分析与语义推理,要求模型同时具备定量计算与定性理解能力。每个任务的目标开放且多元,采用分面评估机制对最终答案进行严格评判,确保评估的全面性与客观性。数据集涵盖真实与合成两类场景,增强了任务的多样性与挑战性。此外,其结构化的元数据文件与答案键设计,使得每个查询均可追溯至特定的黄金假设,便于验证模型推理的正确性。这种设计不仅捕捉了数据驱动发现的复杂性,还为改进模型能力提供了宝贵的资源。
使用方法
使用DiscoveryBench时,研究者可首先从HuggingFace页面加载默认配置下的训练与测试分割数据。通过遍历每个任务文件夹中的CSV文件与metadata_*.json文件,获取查询及对应数据集。为执行发现任务,可参考GitHub仓库中提供的discovery_agent.py代码,该代码支持集成不同大型语言模型构建发现代理。评估阶段则利用discovery_eval.py中的脚本,根据答案键中的黄金假设对代理输出进行分面评估。详细运行指南与评估协议已在README中说明,确保用户能高效复现实验并评估模型在数据驱动发现任务中的表现。
背景与挑战
背景概述
在科学发现日益依赖数据驱动的时代,大型语言模型(LLM)的推理能力为自动化知识发现开辟了新路径。然而,现有基准测试多聚焦于封闭式问答或简单推理,难以评估模型在真实科研场景中的综合能力。为解决这一空白,艾伦人工智能研究所(Allen Institute for AI)的研究团队于2024年提出了DiscoveryBench数据集。该数据集由Bodhisattwa Prasad Majumder、Harshit Surana等学者联合构建,核心研究问题在于系统评估LLM在数据驱动发现任务中的表现——即模型是否能够结合统计分析与语义推理,从给定数据中提炼出可验证的科学假设。作为首个面向开放结局式发现的综合基准,DiscoveryBench通过分面评估机制,对模型在真实科研流程中的推理、整合与创新潜力进行了严谨度量,为人工智能辅助科学发现领域提供了关键评估工具与推动力。
当前挑战
DiscoveryBench所解决的领域问题在于,现有模型在数据驱动发现任务中普遍缺乏将统计分析与领域知识深度融合的能力,导致生成假设的可靠性与可解释性不足。具体挑战包括:第一,任务要求模型同时执行多步统计推理(如相关性检验、因果推断)与语义理解(如识别变量间的逻辑关系),这对LLM的跨模态推理能力构成严峻考验;第二,开放结局式的任务设计使得答案空间无限,传统封闭式评估指标失效,需设计分面评估协议以兼顾正确性、完整性与新颖性;第三,构建过程中,研究团队需确保真实与合成数据集中的假设具有可验证性,同时平衡任务难度以避免天花板效应,这要求对数据来源、噪声分布及假设复杂度进行精细控制。这些挑战共同指向当前LLM在科学发现自动化中的核心瓶颈。
常用场景
经典使用场景
DiscoveryBench作为数据驱动发现领域的标杆性基准,其经典使用场景集中于评估大语言模型在科学发现任务中的综合能力。该基准将每个任务精心设计为一个包含具体目标与配套数据集的复合体,要求模型不仅需要执行统计分析与模式识别,还需融合语义推理以提出可验证的假设。通过其特有的分面评估机制,能够对开放式的最终答案进行严格量化考核,从而系统性地揭示当前模型在数据驱动发现流程中的优势与局限。研究者常利用该基准测试模型从原始数据中自主提炼科学规律、构建因果解释链的潜力,为理解语言模型在科学推理中的认知边界提供了标准化测试平台。
实际应用
在实际应用层面,DiscoveryBench为多个高价值领域提供了技术验证的试验场。在药物发现场景中,研究人员可借助该基准评估模型从化合物活性数据中自主推导构效关系的能力;在气候科学领域,它可用于检验模型从多源观测数据中识别环境因子间非线性关联的效能。此外,该数据集在金融风控、材料基因组学等需要从海量数据中挖掘隐蔽模式的场景中同样具有重要应用价值。通过模拟真实科研流程中的数据分析与假设检验环节,DiscoveryBench帮助开发团队迭代优化算法在数据清洗、特征工程到结论验证全链条上的表现,加速从数据到决策的转化效率。
衍生相关工作
基于DiscoveryBench已衍生出一系列具有影响力的学术工作。研究者针对该基准中统计推理与语义理解交织的挑战,开发了多智能体协作框架,其中不同模型分别负责数据清洗、模式识别与假设验证等专业模块,显著提升了复杂任务的完成质量。另有工作聚焦于评估协议的优化,提出了基于信息论的分面评分方法,能够更精细地刻画模型在发现任务各阶段的贡献度。在模型架构创新方面,受该基准启发,学界涌现出融合符号推理与神经网络的混合系统,通过显式知识图谱增强语言模型在因果推断中的可靠性。这些衍生工作共同推动了数据驱动科学发现领域从能力评估向方法论创新的纵深发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务