遇见数据集

cmass

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

CMASS 是一个针对 ClimbMix 语料库重新构建的 QA 基准数据集。其核心目标是将现有 QA 基准(BrowseComp-plus 和 DeepSearchQA)中的问题投影到 ClimbMix 语料库上,确保每个问题的完整推理链都有可检索的文档支持。数据集通过自动化管道生成,并经过完全人工审查确认。当前版本包含两个子集:BrowseComp-plus(bcp,57 个问题)和 DeepSearchQA(dsqa,64 个问题)。数据以 Hugging Face Datasets 格式组织,包含三个配置:queries(存储问题及其答案)、qrels(存储相关性判断,每个查询相关的 ClimbMix 文档的扁平列表)、corpus_duplicates(描述 ClimbMix 语料库中的文档重复情况,包含精确副本和近似副本列表)。构建过程:bcp 来自 BrowseComp-plus 测试集,通过管道(跳分解、BM25 检索、全文文档验证)将问题投影到 ClimbMix,经可回答性检查、全跳验证和人工审查得到最终集合;dsqa 来自 Google DeepSearchQA,处理 900 个提示,经四轮审查最终得到 64 个问题,答案分为单一答案和集合答案。语料库文档 ID 引用 karpathy/climbmix-400b-shuffle 数据集,qrels 对重复进行了扩展以确保检索时不扣分。

CMASS is a QA benchmark dataset rebuilt for the ClimbMix corpus. Its core goal is to project questions from existing QA benchmarks (BrowseComp-plus and DeepSearchQA) onto the ClimbMix corpus, ensuring that the complete reasoning chain for each question has retrievable document support. The dataset is generated via an automated pipeline and fully verified by human review. The current version contains two subsets: BrowseComp-plus (bcp, 57 questions) and DeepSearchQA (dsqa, 64 questions). The data is organized in Hugging Face Datasets format, with three configurations: queries (stores questions and their answers), qrels (stores relevance judgments, a flat list of ClimbMix documents relevant to each query), and corpus_duplicates (describes duplicate documents in the ClimbMix corpus, including exact and near duplicate lists). Construction process: bcp from the BrowseComp-plus test set, projected onto ClimbMix via a pipeline (hop decomposition, BM25 retrieval, full-text document verification), followed by answerability checks, full-hop verification, and human review to obtain the final set; dsqa from Google DeepSearchQA, processing 900 prompts through four rounds of review (informative phrases as hops, hop coherence, end-to-end reading, and serious issue adjudication) to yield 64 questions, with answers categorized as single answers (12) and set answers (52). Corpus document IDs reference the karpathy/climbmix-400b-shuffle dataset, and qrels are expanded for duplicates to avoid penalizing retrieval of copies.

提供机构:
Castorini
创建时间:
2026-08-18
原始信息汇总

数据集概述:CMASS

CMASS 是一个将现有问答基准重新锚定到 ClimbMix 语料库(climbmix-400b)上的数据集。其核心设计原则是:仅当问题的完整推理链能够由可检索的文档支持时,才保留该问题,确保每个信息线索都有至少一个 ClimbMix 文档作为支撑。所有判断由智能体流水线生成,并经完整的人工审查确认。

当前发布内容

  • BrowseComp-plus (bcp):57 个问题
  • DeepSearchQA (dsqa):64 个问题

数据布局

每个投影数据集存放在独立文件夹中,并作为 queriesqrels 配置的一个分割出现。

  • queries 配置
    • bcp:57 行,字段包括 idquestionanswercanary
    • dsqa:64 行,字段同上
  • qrels 配置
    • bcp:6,695 行,字段包括 query_iditerationdoc_idrelevance(值为 1)、canary
    • dsqa:558 行,字段同上
    • 每个查询对应一个扁平的相关 ClimbMix 文档列表,不区分证据与黄金文档,也不包含负样本。dsqa 的 qrels 未做重复扩展。
  • queries.idqrels.query_id 使用相同编码,两个配置可直接通过编码值连接。

构建流程

bcp — BrowseComp-plus

问题源自 BrowseComp-plus 测试集。智能体流水线执行跳数分解、BM25 检索和每跳的全文档接地。可回答性检查将 830 个问题缩减至 326 个,全跳验证进一步缩减至 65 个,最终经人工逐跳-文档对审查得到 57 个。

dsqa — DeepSearchQA

问题源自 Google DeepSearchQA。同一流水线处理了 900 个提示,随后进行四轮审查:

  1. 每个信息承载短语必须成为一个接地于全文的跳
  2. 跳之间必须连贯,即命名来源需授权其他跳读取的数据,且跳在实体、版本、年份、单位和范围上保持一致
  3. 每个问题以人类标注者的方式通读
  4. 带严重标志的问题在文档层面进行裁定

数量变化过程:900 → 170 → 84 → 70 → 66 → 64。所有发布的片段均与实时文档文本逐字验证。

DeepSearchQA 的答案分为单一答案(12 个)或集合答案(52 个)。对于集合答案,遵循“任一成员”规则:至少一个黄金列表成员满足所有约束,但不声称列表完整性。

语料说明

文档 ID 指向 karpathy/climbmix-400b-shuffle 发布的 ClimbMix 语料,本数据集不重新分发语料本身。文档 ID 编码了语料中的位置(shard_{shard:05d}_{row:05d}),因此仅能针对该特定排序的副本解析。

ClimbMix 存在大量重复:其 553,240,576 个文档中 39.60% 至少有一个重复,但大部分是样板内容而非实质内容。被判断的文档受影响较小,qrels 已按重复扩展,使得检索到副本的智能体不会因未找到原文档而失分。

对于 bcp 的 6,669 个被判断文档:

重复情况 数量 比例
完全无重复 5,095 76.4%
至少一个重复 1,574 23.6%
— 有字节相同副本 90 1.3%

有重复的文档中,重复数中位数为 1,最大为 31(语料最大为 6,376),因此扩展为 bcp 增加了 5,445 行(6,695 → 12,140),而非引入大型簇。这些比例仅针对 bcp,其他投影数据集会有所不同。

重复信息配置

corpus_duplicates 配置的 corpus 分割共 219,066,180 行,每行对应一个至少有一个重复的 ClimbMix 文档。无重复的文档不包含任何行

字段 类型 内容
doc_id string 该行对应的文档,如 shard_00877_14962
exact_duplicates list<string> 与其字节相同的所有文档 ID
near_duplicates list<struct<doc_id: string, jaccard: float32>> 与其 Jaccard ≥ 0.7 的所有文档 ID 及相似度,按最高优先排序
n_exact int32 exact_duplicates 中的条目数
n_near int32 near_duplicates 中的条目数

该配置与 qrels 扩展使用同一映射,因此判断结果可复现,也可在更严格的阈值下重新推导。

代码与工具

  • 流水线代码与反混淆脚本:https://github.com/castorini/cmass
  • 重复计算与验证详情、分析代码及测试:https://github.com/castorini/cmass/tree/main/corpus_analysis

许可证

MIT

搜集汇总
数据集介绍
cmass 数据集图片
构建方式
CMASS数据集将现有问答基准重新植根于ClimbMix语料库,其构建遵循严格的证据支撑原则:仅当问题的完整推理链可由可检索文档支持时,该问题才被保留,确保每条信息线索都能在ClimbMix中找到对应文档。针对BrowseComp-plus(bcp)与DeepSearchQA(dsqa)两个子集,采用代理管线进行问题投影,基于BM25检索与整文档逐段接地,再经可回答性筛选与全跳验证,最后通过人工逐跳-文档对审核,分别从830与900个候选问题中精炼出57与64个高质量问题。dsqa额外经历四轮人工评审,确保命名来源授权数据、实体与时间等要素一致,且每个问题均按人类标注者的阅读方式端到端核查。qrels标注通过代理管线生成并经全量人工复核,按去重扩展,避免检索到副本被判为漏检。
特点
CMASS数据集的独特之处在于其问题与ClimbMix语料库的深度绑定,每个信息承载短语均至少有一个对应文档支持,保障了推理链条的完整性与可追溯性。当前发布包含bcp(57问)与dsqa(64问)两个子集,qrels标注为单一扁平列表,无证据/黄金分离,无负例,便于聚焦于检索相关性。dsqa的答案类型涵盖单一答案与集合答案,后者遵循任一成员规则,不强求列表完备。此外,语料库重复分析揭示ClimbMix中39.60%的文档存在重复,但判定文档受影响较小,qrels已针对字节级重复进行扩展,如bcp的判定文档中76.4%无重复,扩展后仅增加5,445行,避免大规模簇引入。这为评估检索系统对重复文档的鲁棒性提供了独特视角。
使用方法
数据集以HuggingFace格式发布,包含queries、qrels与corpus_duplicates三个配置。queries存储问题-答案对,qrels提供查询与相关文档的映射,二者通过共享的编码ID(queries.id与qrels.query_id)可直接连接。corpus_duplicates提供文档重复映射,每行代表一个具有至少一个重复的文档,列出其字节级精确与Jaccard≥0.7的近似重复,可用于复现qrels扩展或调整严格度。文档ID格式为shard_{编号}_{行号},需对照karpathy/climbmix-400b-shuffle原始语料库解析。用户可通过标准数据集加载工具导入,按查询检索相关文档,或分析语料库重复结构。管道代码与反混淆脚本公开于GitHub,便于深入验证或扩展新数据集。
背景与挑战
背景概述
CMASS数据集由卡斯特里尼研究团队于2024年创建,旨在解决大语言模型在复杂问答任务中证据链不完整的问题。该数据集将现有问答基准(BrowseComp-plus和DeepSearchQA)重新锚定在ClimbMix-400B语料库上,通过严苛的流水线确保每个推理步骤都有可检索文档支撑。其核心研究问题在于如何构建可验证、无幻觉的问答评估环境,以推动检索增强生成(RAG)技术的可信度评估。该数据集因其严谨的构建方法论和公开的管道代码,对开放域问答和事实验证领域产生了显著影响,为后续研究提供了高标准的基准参考。
当前挑战
CMASS数据集面临的挑战多维且深刻。领域层面,当前问答系统普遍存在证据链断裂和幻觉问题,CMASS通过‘完全文档接地’的投射方式,要求每个信息线索都能追溯至语料库文档,从而严格评估模型的推理与检索能力。构建过程中,团队遭遇了多重障碍:原始问题数量(830和900)经多轮筛选骤降至57和64,反映了问题可回答性与证据完整性之间的尖锐矛盾;ClimbMix语料库的高重复率(39.60%)及其噪声特性(如导航标题、抓取失败页面)对去重和相关性判断构成严重干扰,团队不得不开发去重并扩展qrels确保评分公平;此外,人工审查和跨文档一致性验证(如实体、年份、单位统一)耗费巨大人力,但最终实现了逐字验证的可靠性。
常用场景
经典使用场景
CMASS数据集作为信息检索与问题回答交叉领域的基准测试集,其经典使用场景聚焦于评估检索增强生成(RAG)系统在复杂多跳问答任务上的性能。该数据集通过将BrowseComp-plus与DeepSearchQA的测试问题重新锚定至ClimbMix大规模语料库,确保了每道题目的完整推理链均可由可检索文档支撑,从而为检验模型在真实世界知识密集型场景下的证据溯源与综合推理能力提供了严苛的测试平台。研究者常利用其queries与qrels配置,对稀疏相关文档条件下的排序模型、生成式问答系统以及混合检索策略进行标准化评测,尤其适用于分析系统在面对需要多文档协同推理的开放式问题时的鲁棒性与精确度。
衍生相关工作
CMASS的发布催生了若干前沿研究方向:其一,基于其qrels中细粒度的文档-查询关联,可衍生出针对多跳检索的强化学习奖励建模工作,优化检索策略的长期收益;其二,其重复文档映射表(corpus_duplicates)被用作大规模语料去噪与近重复检测算法的标准评估数据,推动了高效索引压缩与语义去重技术的发展;其三,由bcp与dsqa的构建流程启发,研究者将其agentic管道泛化为自动生成高质量检索基准的半自动框架,加速了垂直领域问答数据集的构建;此外,针对Set Answer类型问题,其‘任一中奖成员’的判定规则也激发了对部分标注学习与模糊问答评估方法的进一步探索。
数据集最近研究
最新研究方向
CMASS数据集的发布标志着检索增强生成(RAG)领域在问答基准测试上的重要突破,其核心创新在于将现有问答任务(如BrowseComp-plus和DeepSearchQA)重新锚定于ClimbMix大规模语料库,确保每个推理步骤都有可检索文档的支撑。当前研究聚焦于多跳推理的鲁棒性验证与文档去重对评估公平性的影响,通过代理管道与人工审查相结合的方式,构建了高度可信的评估基准。该数据集为评估AI系统在复杂信息检索与推理协同能力方面提供了新的范式,尤其强调了在重复内容泛滥的语料中保持评估有效性的策略,对推动更真实、更严苛的问答系统评测具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务