deepresearch-bench
收藏资源简介:
该数据集是一个用于评估文本生成模型性能的基准数据集,特别关注文章写作任务。数据集包含三个配置:default(100个样本)、en(50个英文样本)和zh(50个中文样本)。每个数据样本包含唯一标识符(id)、语言类型(language)、主题(topic)、生成指令(prompt)、参考文章(reference_article)以及结构化的评估标准(criteria)。评估标准体系包含四个核心维度:可读性(readability)、洞察力(insight)、全面性(comprehensiveness)和指令遵循(instruction_following),每个维度都有明确的权重分配和具体的评判准则列表,准则包含标准描述、解释说明和权重值。数据集适用于训练或评估文本生成模型在文章写作任务上的表现,提供细粒度、多维度的人工标注评估框架,可用于模型输出质量的全方位量化评估。
This dataset is a benchmark dataset for evaluating the performance of text generation models, with a specific focus on article writing tasks. It includes three configurations: default (100 samples), en (50 English samples), and zh (50 Chinese samples). Each data sample contains a unique identifier (id), language type (language), topic, generation prompt, reference article, and structured evaluation criteria. The evaluation criteria system consists of four core dimensions: readability, insight, comprehensiveness, and instruction_following, each with clear weight allocations and specific judgment criteria lists that include standard descriptions, explanations, and weight values. The dataset is suitable for training or evaluating text generation models on article writing tasks, providing a fine-grained, multi-dimensional human-annotated evaluation framework for comprehensive quantitative assessment of model output quality.
数据集概述:DeepResearch-Bench
该数据集名为 DeepResearch-Bench,由 allenai 提供,旨在用于评估或训练模型在深度研究任务上的表现。
数据集配置
数据集包含三个配置(config),每个配置对应一种语言或混合版本:
- default:默认配置,包含100个测试样本。
- en:英文配置,包含50个测试样本。
- zh:中文配置,包含50个测试样本。
所有配置均仅包含 test 拆分(split),无训练或验证集。
数据集特征
每个样本包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
id |
int64 | 样本的唯一标识符 |
language |
string | 样本语言(如 "en" 或 "zh") |
topic |
string | 主题或标题 |
prompt |
string | 给模型的任务提示 |
criteria |
struct | 评估标准,包含维度权重和具体准则 |
reference_article |
string | 参考文章或标准答案文本 |
criteria 字段的详细结构:
- dimension_weight:四个评估维度的权重(float64)
readability:可读性insight:洞察力comprehensiveness:全面性instruction_following:指令遵循
- criterions:每个维度的具体评估准则,包含:
criterion:准则名称(string)explanation:准则的解释(string)weight:该准则的权重(float64)- 部分配置(default 和 zh)中
readability维度还额外包含:comment:备注(string)aspect:方面(string)rationale_for_weight:权重依据(string)
数据集规模
| 配置 | 样本数 | 数据集大小 |
|---|---|---|
| default | 100 | 6,964,126 bytes |
| en | 50 | 3,974,252 bytes |
| zh | 50 | 2,985,308 bytes |
总下载大小约 4.16 MB(default 约 4.16 MB,en 约 2.31 MB,zh 约 1.87 MB)。
数据文件
数据以文件形式存储,路径模式如下:
default:data/test-*en:en/test-*zh:zh/test-*




