MiroEval
收藏资源简介:
MiroEval是由MiroMind团队开发的多模态深度研究代理评估基准,包含100个任务(70个纯文本和30个多模态),旨在解决现有评估方法在覆盖范围、真实性和时效性方面的不足。数据集通过双路径管道构建,结合了真实用户查询模式和实时网络趋势,支持定期更新以保持时效性。该数据集应用于评估深度研究系统在多维度上的性能,包括合成质量、事实准确性和研究过程严谨性,特别适用于金融、医疗和法律分析等高风险领域。
MiroEval is a multimodal deep research agent evaluation benchmark developed by the MiroMind team. It comprises 100 tasks, including 70 purely textual and 30 multimodal ones, and is designed to address the shortcomings of existing evaluation methods in terms of coverage, authenticity and timeliness. The dataset is constructed via a two-path pipeline that integrates real-world user query patterns and real-time web trends, and supports regular updates to maintain its timeliness. It is applied to evaluate the performance of deep research systems across multiple dimensions, including synthesis quality, factual accuracy and research process rigor, and is particularly suitable for high-stakes domains such as finance, healthcare and legal analysis.
MiroEval 数据集概述
数据集基本信息
- 数据集名称:MiroEval
- 核心定位:一个用于深度研究系统的综合性评估框架,提供自动化的任务生成和跨三个互补维度的评估。
- 评估维度:
- 事实性评估:基于事实正确性。
- 要点质量评估:基于点对点的质量。
- 过程评估:基于研究过程质量。
数据内容与结构
-
数据总量:包含100个评估查询。
- 纯文本查询集 (
mirobench_text.json):70个。 - 多模态查询集 (
mirobench_multimodal.json):30个,附带图像/文档等附件。
- 纯文本查询集 (
-
数据目录结构:
MiroEval/ ├── task_generation/ # 评估任务生成流水线 ├── data/ # 共享数据目录 │ ├── input_queries/ # 评估查询集 + 多模态附件 │ └── detail_results/ # 每个任务、每个模型的中间分数 ├── factual_eval/ # 事实性评估(基于MiroFlow的事实核查智能体) ├── point_quality/ # 质量评估(自适应点对点评分) └── process_eval/ # 过程评估(内在过程质量 + 报告一致性)
-
附件文件:多模态查询的附件文件存储在
data/input_queries/multimodal-attachments/目录下,按查询ID组织。
数据格式规范
- 查询模式:
- 纯文本查询模式:包含
id,chat_id,rewritten_query,annotation等字段。annotation中包含category,language,pattern,domain等信息。 - 多模态查询模式:在纯文本模式基础上,增加
files字段以引用附件文件。
- 纯文本查询模式:包含
- 模式分类(适用于约50%的文本查询):
- T1: 全景概览
- T2: 对比评估
- T5: 决策分析
- T6: 方案设计
- 领域分布:科技、金融、医疗、工程、商业、人文、科学、生活方式、网络安全、教育、能源、地缘政治、健康、法律、政策、贸易、其他。
- 模型结果格式:每个模型一个JSON文件,包含完整的查询-响应对数组。每个条目需包含
id,chat_id,rewritten_query,annotation,response(模型生成的最终研究报告),process(模型的中介研究过程追踪)等字段。
评估模块详情
1. 事实性评估
- 方法:基于 MiroFlow 智能体框架进行主动事实核查。通过搜索引擎自动提取和验证报告中的关键事实陈述。
- 验证标签:
Right(正确)/Wrong(错误)/Unknown(无法验证)。多模态评估增加Conflict(冲突)标签。 - 核心指标:正确陈述比率 = Right / (Right + Wrong + Unknown + Conflict)。
- 输出格式:每个查询生成包含
core_state列表的JSON结果,其中包含statement,verification,evidence,reasoning等信息。
2. 要点质量评估
- 方法:动态为每个查询任务生成评估维度、标准和权重的综合性自适应点对点质量评估。
- 固定维度(4个):
- 覆盖度:覆盖的广度、深度和相关性。
- 洞察力:深度、原创性、逻辑和分析价值。
- 指令遵循:满足所有查询要求的准确性。
- 清晰度:可读性、流畅性、结构和易于理解的程度。
- 流程:包含维度生成、权重分配、标准生成、逐项评分、分层聚合5个阶段。
- 输出格式:包含模型平均总分、查询总数、各维度平均分等摘要信息,以及详细的查询结果。
3. 过程评估
- 方法:评估模型研究过程的质量以及过程与最终报告之间的一致性。
- 评估阶段:
- 结构化阶段:自动检测不同模型的过程追踪格式,并将其统一为结构化JSON模式。
- 评估阶段:
- 内在评估:5个维度评估研究过程本身的质量。
- 一致性评估:3个维度评估过程与报告之间的一致性。
- 评估维度(8个):
- 内在维度:搜索广度、分析深度、渐进式优化、批判性思维、效率。
- 一致性维度:研究发现到报告的覆盖度、报告到过程的可追溯性、矛盾性(一致性)。
- 输出格式:包含各维度平均分、内在平均分、一致性平均分、总体平均分等摘要信息,以及详细的条目结果。
使用前提与数据准备
- 用户需自行创建
data/method_results/(纯文本)和data/method_multimodal_results/(多模态)目录,并将模型输出文件(每个模型一个JSON数组文件)放置其中。 - 各评估子项目管理自己的
.env文件以配置API密钥。 - 事实性评估需先将模型结果JSON数组转换为每项一个的独立文件。




