MARCH
收藏资源简介:
MARCH是一个用于评估歧义解释和多跳推理交叉的基准数据集。它包含2,209个歧义多跳问题,涵盖语义、句法和约束三种歧义类型。每个示例提供歧义类型、每个解释的澄清问题、支持证据段落、每个解释的简短答案以及整合所有有效解释的合成长期答案。
MARCH is a benchmark dataset for evaluating the intersection of ambiguous interpretation and multi-hop reasoning. It contains 2,209 ambiguous multi-hop questions covering three types of ambiguity: semantic, syntactic, and constraint ambiguity. Each example includes the ambiguity type, clarification questions for each interpretation, supporting evidence paragraphs, short answers for each interpretation, and a synthetic long answer that integrates all valid interpretations.
MARCH 数据集概述
数据集基本信息
- 数据集名称:MARCH (Multi-hop Ambiguity Reasoning CHain)
- 核心目标:评估歧义解释与多跳推理的交集。
- 数据来源:基于 MuSiQue 数据集衍生。
- 数据规模:包含 2,209 个模糊的多跳问题。
- 构建机构:忠南大学与 Adobe Research 合作构建。
数据集内容与结构
歧义类型
数据集涵盖三种歧义类型:
- 语义歧义:由同形异义词/别名或实体名称冲突引起。模型需进行解释。
- 句法歧义:由同一查询存在多个有效的句法解析引起。模型需进行消解。
- 约束歧义:查询过于具体,更宽泛的表述更能匹配意图。模型需进行泛化。
数据示例结构
每个数据示例包含以下信息:
- 歧义类型。
- 针对每种解释的澄清后问题。
- 支持证据段落。
- 针对每种解释的简短答案。
- 一个综合了所有有效解释的长篇答案。
文件位置
数据集主文件位于仓库的 dataset/MARCH.jsonl。
数据集构建与质量
构建流程
- 歧义检测与问题澄清:使用 4 个 LLM 进行全票同意检测,并生成澄清问题。
- 子问题分解与文档检索:对澄清后的问题进行分解,并从英文维基百科检索支持段落。
- 答案生成:生成简短答案和综合长篇答案。
- 过滤:经过多 LLM 和人工过滤,确保高质量。
质量验证
- 人工验证:由 5 位标注者对 60 个抽样实例进行验证。
- 一致性指标:Fleiss‘ κ 值最高达 0.95,表明标注者间一致性高。
- 验证内容:包括问题歧义性、澄清问题是否解决歧义、长篇答案是否匹配简短答案。
数据集统计信息
| 阶段/类型 | 语义歧义 | 句法歧义 | 约束歧义 | 总计 |
|---|---|---|---|---|
| 原始 MuSiQue 数据 | 24,834 | 24,834 | 24,834 | — |
| 检测与澄清后 | 9,544 | 8,642 | 11,703 | 29,889 |
| 答案生成后 | 7,034 | 6,675 | 8,433 | 22,142 |
| 过滤前 | 1,651 | 1,239 | 1,440 | 4,330 |
| 最终过滤后 | 734 | 739 | 736 | 2,209 |
- 平均跳数:语义 2.44, 句法 2.95, 约束 2.11。
- 平均问题长度:语义 14.92, 句法 18.17, 约束 16.18。
评估方法
评估基准
- CLARION:一个明确将歧义规划与证据驱动推理解耦的两阶段智能体框架。
- 基线方法:包括 NaiveRAG 和 ReAct。
评估指标
- STR-EM:严格精确匹配,黄金简短答案出现在生成长篇答案中的百分比。
- Disambig-F1:提取的片段与黄金简短答案之间的词元级 F1 分数。
- LLM-as-a-Judge:GPT-4.1 法官在相关性、忠实度、信息量、正确性上给出 0-5 分。
主要结果
| 模型 | 方法 | STR-EM | Disambig-F1 | 平均分 | LLM-Judge 分数 |
|---|---|---|---|---|---|
| Qwen3-235b | CLARION | 38.73 | 28.38 | 33.56 | 3.474 |
| Qwen3-235b | NaiveRAG | 25.10 | 26.20 | 25.65 | 2.752 |
| Qwen3-235b | ReAct | 20.98 | 21.00 | 20.99 | 2.832 |
使用与复现
数据获取
最终数据集已提供,可直接使用 dataset/MARCH.jsonl 文件。
完整流程复现
复现完整构建流程需要访问 OpenRouter API 和相应的预算。主要步骤包括:
- 下载原始 MuSiQue 数据。
- 运行三种歧义类型的检测与澄清脚本。
- 运行文档检索与答案生成脚本。
- 执行过滤步骤。
依赖环境
主要 Python 依赖包:torch, transformers, sentence-transformers, faiss-gpu, requests, tqdm, aiohttp, scikit-learn。如需本地模型推理,还需安装 vllm。
相关资源
- 论文地址:https://arxiv.org/abs/2509.22750
- 原始数据源:https://github.com/StonyBrookNLP/musique
- API 服务:https://openrouter.ai




