遇见数据集

deepresearch-bench

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集是一个用于评估文本生成模型性能的基准数据集,特别关注文章写作任务。数据集包含三个配置:default(100个样本)、en(50个英文样本)和zh(50个中文样本)。每个数据样本包含唯一标识符(id)、语言类型(language)、主题(topic)、生成指令(prompt)、参考文章(reference_article)以及结构化的评估标准(criteria)。评估标准体系包含四个核心维度:可读性(readability)、洞察力(insight)、全面性(comprehensiveness)和指令遵循(instruction_following),每个维度都有明确的权重分配和具体的评判准则列表,准则包含标准描述、解释说明和权重值。数据集适用于训练或评估文本生成模型在文章写作任务上的表现,提供细粒度、多维度的人工标注评估框架,可用于模型输出质量的全方位量化评估。

This dataset is a benchmark dataset for evaluating the performance of text generation models, with a specific focus on article writing tasks. It includes three configurations: default (100 samples), en (50 English samples), and zh (50 Chinese samples). Each data sample contains a unique identifier (id), language type (language), topic, generation prompt, reference article, and structured evaluation criteria. The evaluation criteria system consists of four core dimensions: readability, insight, comprehensiveness, and instruction_following, each with clear weight allocations and specific judgment criteria lists that include standard descriptions, explanations, and weight values. The dataset is suitable for training or evaluating text generation models on article writing tasks, providing a fine-grained, multi-dimensional human-annotated evaluation framework for comprehensive quantitative assessment of model output quality.

提供机构:
Allen Institute for AI
创建时间:
2026-07-23
原始信息汇总

数据集概述:DeepResearch-Bench

该数据集名为 DeepResearch-Bench,由 allenai 提供,旨在用于评估或训练模型在深度研究任务上的表现。

数据集配置

数据集包含三个配置(config),每个配置对应一种语言或混合版本:

  • default:默认配置,包含100个测试样本。
  • en:英文配置,包含50个测试样本。
  • zh:中文配置,包含50个测试样本。

所有配置均仅包含 test 拆分(split),无训练或验证集。

数据集特征

每个样本包含以下字段:

字段 类型 描述
id int64 样本的唯一标识符
language string 样本语言(如 "en" 或 "zh")
topic string 主题或标题
prompt string 给模型的任务提示
criteria struct 评估标准,包含维度权重和具体准则
reference_article string 参考文章或标准答案文本

criteria 字段的详细结构:

  • dimension_weight:四个评估维度的权重(float64)
    • readability:可读性
    • insight:洞察力
    • comprehensiveness:全面性
    • instruction_following:指令遵循
  • criterions:每个维度的具体评估准则,包含:
    • criterion:准则名称(string)
    • explanation:准则的解释(string)
    • weight:该准则的权重(float64)
    • 部分配置(default 和 zh)中 readability 维度还额外包含:
      • comment:备注(string)
      • aspect:方面(string)
      • rationale_for_weight:权重依据(string)

数据集规模

配置 样本数 数据集大小
default 100 6,964,126 bytes
en 50 3,974,252 bytes
zh 50 2,985,308 bytes

总下载大小约 4.16 MB(default 约 4.16 MB,en 约 2.31 MB,zh 约 1.87 MB)。

数据文件

数据以文件形式存储,路径模式如下:

  • defaultdata/test-*
  • enen/test-*
  • zhzh/test-*
搜集汇总
数据集介绍
deepresearch-bench 数据集图片
构建方式
在大型语言模型迅猛发展的背景下,评估其深度研究能力成为一项关键挑战。deepresearch-bench数据集应运而生,旨在为这一评估提供标准化基准。该数据集通过精心设计的多维度评估体系构建而成,涵盖可读性、洞察力、全面性与指令遵循四个核心维度。每个维度下设有细化的评价准则及对应的权重,确保评估的严谨性与可解释性。数据集中包含100条测试样本(默认配置),每条样本由唯一标识、语言标签、主题、提示词、评估标准及参考文章组成。为拓展多语言评估能力,还提供了英语与中文两个子集,各包含50条样本,从而实现对模型跨语言深度研究性能的全面考察。
使用方法
使用deepresearch-bench数据集时,研究人员可根据需求选择合适的配置:'default'包含100条多语言样本,'en'与'zh'则分别提供50条纯英语或纯中文样本。评估流程围绕样本中的'prompt'字段,要求模型生成深度研究报告,随后依据'criteria'字段设定的多维标准进行评分。每条样本的'reference_article'可作为生成报告的参考基线。通过计算模型输出在各维度上的得分,并综合维度权重,可获得模型在深度研究任务上的整体性能指标。数据集以test split形式提供,便于直接用于测评实验,无需额外划分训练与验证集。
背景与挑战
背景概述
在大语言模型迅猛发展的当下,如何评估模型执行深度研究与综合分析的能力成为一个关键课题。为此,deepresearch-bench数据集应运而生。该数据集由研究团队针对大模型在复杂研究任务中的表现评估需求而构建,涵盖了跨语言(中文与英文)的多主题测试样本。其核心设计围绕可读性、洞察力、全面性与指令遵循四个维度,通过细致的加权评分标准来衡量生成内容的质量。作为大模型深度研究能力基准测试的重要资源,该数据集为衡量模型在多信息源整合、逻辑推理与高质量内容生成方面的表现提供了标准化依据。
当前挑战
该数据集面对的首要挑战在于大模型所解决的领域问题:如何确保模型在深度研究任务中生成的内容兼具全面性与深刻洞察力,避免表面化或信息碎片化,同时严格遵循复杂指令。此外,构建过程中亦存在诸多难点:包括确定多维度评估指标的合理权重分配、设计跨语言一致性的评判标准,以及构建兼具多样性与代表性的测试样本。这些挑战要求数据集在细粒度评价体系与跨领域适配能力之间取得平衡,为后续模型优化与评估奠定坚实基础。
常用场景
经典使用场景
在生成式人工智能领域,深度研究报告的自动生成与评估是一项极具挑战性的任务。deepresearch-bench数据集为研究者提供了一个多维度、结构化的评估基准,专门用于衡量大型语言模型在撰写深度研究报告时的综合能力。该数据集的经典使用场景包括:评估模型在给定主题下生成研究报告的可读性、洞察力、全面性以及指令遵循能力,通过预设的维度权重和详细评价标准,实现对模型输出的精细化打分。研究者可以利用该数据集的测试集,对多种语言模型进行横向对比,以揭示不同模型在研究报告生成任务中的优劣表现。
解决学术问题
当前学术界面临的核心问题之一是如何客观、系统地评估语言模型在复杂知识密集型任务中的表现,尤其是深度研究报告的自动生成。传统评估方法往往依赖人工审核,效率低下且难以复现,而deepresearch-bench数据集通过构建包含可读性、洞察力、全面性和指令遵循四大维度的加权评价体系,有效解决了这一困境。该数据集引入的细粒度评价标准与权重设定,使得模型生成报告的各个层面均可量化比对,从而推动了自动文本评估方法论的发展,为建立更加严谨、可复现的生成式模型评估框架提供了重要数据支撑。
实际应用
在实际应用层面,deepresearch-bench数据集能够服务于众多需要高质量自动报告生成的场景。例如,在金融分析领域,研究人员可利用该数据集训练模型,使其能够自动生成包含市场洞察、风险评估的深度分析报告;在学术研究环境中,该数据集可用于辅助文献综述的自动化撰写,提升科研效率;在商业智能系统内,可帮助企业快速生成行业趋势研究报告。通过该数据集的评估标准,开发者能够迭代优化模型在内容全面性与见解深刻性之间的平衡,从而满足真实世界中对于高质量、可读性强的专业报告的需求。
数据集最近研究
最新研究方向
在大型语言模型快速迭代的当下,如何系统性地评估其在进行多维度、长文本深度研究任务时的输出质量,已成为学界与工业界共同攻关的前沿议题。DeepResearch-Bench数据集应运而生,它通过构建涵盖可读性、洞察力、全面性及指令遵循性四个核心维度的细粒度评价体系,为严苛的研究场景提供了标准化的测试基准。该数据集专注于引导模型产出类似学术综述的深度回答,其独特的加权准则结构使得对不同研究主题下的模型表现进行量化比较成为可能。这一工具的发布,不仅推动了信息检索与文本生成领域向着更强调综合分析与批判性思考的方向演进,也标志着对模型智能水平的衡量正从简单的问答准确性,迈向对逻辑深度与知识广度的更高层级要求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务