DeepConsult
收藏资源简介:
DeepConsult数据集包含商业和咨询相关提示的集合,设计用于深度研究。这些查询涵盖了市场分析、投资机会、行业特定评估、财务建模和评估、技术趋势分析以及战略业务规划等多个主题。数据集还包括来自OpenAI DeepResearch和ARI的响应,用于评估脚本。
The DeepConsult dataset is a curated collection of business and consulting-focused prompts developed for deep research purposes. These prompts span a diverse array of topics including market analysis, investment opportunities, industry-specific assessments, financial modeling and valuation, technical trend analysis, and strategic business planning. Furthermore, the dataset incorporates responses generated by OpenAI DeepResearch and ARI for use in evaluation scripts.
DeepConsult 数据集概述
数据集简介
DeepConsult 是一个用于评估深度研究报告的基准数据集,专注于商业和咨询领域的复杂查询。该数据集旨在评估语言模型在执行深度研究方面的能力,特别是针对专业咨询报告的分析、综合和洞察力。
数据集内容
主要文件
-
queries.csv- 包含为深度研究设计的商业和咨询相关提示
- 涵盖主题范围:
- 市场分析和投资机会
- 行业特定评估
- 财务建模和评估
- 技术趋势分析
- 战略业务规划
-
responses_OpenAI-DeepResearch_vs_ARI_2025-05-15.csv- 包含来自 OpenAI DeepResearch 和 ARI 的响应
- 文件格式:
question: 原始研究问题/提示baseline_answer: OpenAI Deep Research 的参考响应candidate_answer: 待评估的 ARI 响应
评估维度
- 指令遵循: 评估响应与用户指定指令和约束的符合程度
- 全面性: 衡量响应中信息覆盖的广度和范围
- 完整性: 衡量报告中涉及主题的信息深度和彻底性
- 写作质量: 评估报告的清晰度、简洁性、逻辑组织和整体可读性
数据集用途
- 基准测试和评估语言模型在复杂商业和咨询查询上的深度研究能力
- 比较不同模型生成的研究报告质量
- 评估模型提供全面、结构良好且具有洞察力的分析能力
技术细节
- 评估脚本:
deep_research_pairwise_evals.py - 输入数据格式要求:
- CSV文件必须包含
question、baseline_answer和candidate_answer列
- CSV文件必须包含
- 输出格式:
- JSONL格式的评估结果
- 包含每个评估维度的分数和聚合指标
系统要求
- Python 3.10+
- OpenAI API访问权限
- Git LFS (用于下载数据集)




