遇见数据集

t-tech/SynthComp

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

SynthComp是一个合成的类BrowseComp-Plus检索基准,旨在评估语言模型和搜索代理是否能够为困难的组合问题检索完整的支持证据集。该基准包含两个语言版本:SynthComp-Ru(俄语)和SynthComp-En(英语),每个版本包含395个多跳短答案问题。与手动编写的基准(如TRuST)不同,SynthComp是完全合成的:问题由LLM作曲器基于从真实网络语料库中采样的受控子图生成,并通过程序和模型门控的对抗级联进行过滤。目标是仅保留那些所有支持证据都是必要的、没有单个广泛查询能直接检索到答案、且在最终固定索引中不存在替代检索路径的问题。基准包含四种合成挑战机制:桥接(通过共享实体或桥接事实进行多跳链接)、星型(约束的交集)、容器(候选集构建)和时序(时间依赖问题)。数据集的构建过程包括子图挖掘、增量组合、转述事实图、可解性门控、表面泄漏门控、广泛搜索捷径门控、k-of-k消融门控、后修剪、去重和碰撞清理、干扰项重新挖掘、泄漏筛查、难度分层以及检索索引构建。评估使用原始的BrowseComp-Plus评估框架,要求解密基准文件并映射到BrowseComp-Plus仓库中运行。数据集预览包含加密的问题和答案,仅供本地检查使用,不应用于模型训练。

SynthComp is a synthetic BrowseComp-Plus-like retrieval benchmark designed to evaluate whether language models and search agents can retrieve a complete set of supporting evidence for hard compositional questions. The benchmark contains two language versions: SynthComp-Ru and SynthComp-En, each with 395 multi-hop short-answer questions. Unlike manually written benchmarks such as TRuST, SynthComp is fully synthetic. Questions are generated by an LLM composer over controlled subgraphs sampled from real web corpora, and then filtered through an adversarial cascade of programmatic and model-based gates. The goal is to keep only questions where all supporting evidence is necessary, no single broad query retrieves the answer directly, and no alternative retrievable path to the answer exists in the final fixed index. The benchmark includes 4 synthetic challenge mechanisms: Bridge (multi-hop linking through shared entities or bridge facts), Star (intersection of constraints), Container (candidate-set construction), and Temporal (time-dependent questions). The construction pipeline involves subgraph mining, incremental composition, paraphrased fact graph, solvability gate, surface-leak gate, broad-search shortcut gate, k-of-k ablation gate, post-pruning, deduplication and collision cleanup, distractor re-mining, leak screening, difficulty stratification, and retrieval index construction. Evaluation uses the original BrowseComp-Plus evaluation framework, requiring decryption of benchmark files and mapping into the BrowseComp-Plus repository. Dataset previews contain encrypted questions and answers for local inspection only and should not be used for model training.

提供机构:
t-tech
搜集汇总
数据集介绍
t-tech/SynthComp 数据集图片
构建方式
SynthComp数据集的构建依托于一个合成式对抗生成与过滤流水线。首先,从真实网络语料库中采样出孤立的子图,作为每个问题的证据链基础;随后,利用Qwen3.6-27B大语言模型作为合成器,通过递增式组合逐步增加推理深度,并融入新的桥接实体,生成多跳问题。在问题生成过程中,原始事实先经过释义处理形成事实图,再基于该图进行最终组合,以降低关键词泄漏。生成的候选任务需依次通过可解性门控、表层泄漏门控、宽泛搜索捷径门控、逐项消融门控等一系列程序化与模型化过滤关卡,确保每个问题均依赖完整的支持证据集且不存在替代检索路径。最后,经过去重、碰撞清理、困难负例挖掘、泄漏筛查及难度分层,并使用Qwen3-Embedding-8B嵌入构建固定稠密检索索引,形成最终的基准测试集。
特点
SynthComp数据集以合成方式构建,包含俄语与英语两个版本,各含395个多跳短答案问题,旨在严谨评估语言模型与搜索代理在复合性问题上的证据完备检索能力。其核心特点在于设计了四种合成挑战机制:桥接式需通过共享实体进行多跳链接;星型式要求多点约束交集指向同一目标;容器式需构建并缩小候选集以定位正确答案;时序式则涉及时间依赖的推理。这些机制共同确保检索器无法依赖单一显著文档、宽泛查询捷径或参数化知识,而必须组装完整的必要证据集。此外,数据集通过多层过滤极大减少了替代答案路径,并在固定索引上直接验证了检索的唯一性。
使用方法
使用SynthComp进行评测需依托其原始BrowseComp-Plus评估框架。用户首先通过Git LFS克隆完整数据仓库,运行提供的解密脚本对加密的基准文件进行解密,获得查询、问答对等文件。随后,将解密后的文件按指定路径映射至BrowseComp-Plus仓库中,覆盖原有的查询、相关判断、索引及语料库文件,并替换自定义的FAISS检索器脚本。最后,通过设置环境变量指向语料目录,即可使用BrowseComp-Plus的评估命令运行基准测试。评测过程中,系统作为检索器在固定语料和索引上操作,而下游的答案生成与判断流水线保持固定,从而单独衡量检索组件的表现。
背景与挑战
背景概述
SynthComp是一个由T-Tech团队于2025年创建的合成检索基准测试,旨在评估语言模型与搜索代理在复合性问题上的证据检索能力。该研究背景源于现有基准如TRuST依赖人工构建,难以规模化覆盖复杂推理场景。SynthComp通过全合成流程,在真实网页语料上采样受控子图,并由Qwen3.6-27B模型逐步构建多跳问题,再经对抗性过滤管道筛选,确保每个问题均需完整支持证据集方可解答。数据集包含英俄两个版本,各395道题目,覆盖桥接、星型、容器和时间四种合成挑战机制,为多跳检索研究提供了高难度、可复现的评估平台。其影响力体现在推动了从单文档检索到证据集组合推理的范式转变,成为语言模型代理研究的重要基准之一。
当前挑战
SynthComp所解决的领域核心挑战是复合性检索的证据完备性问题:现有检索系统往往依赖单一显著文档或宽泛查询获取答案,难以应对需要跨文档组合证据的多跳推理场景。具体体现在桥梁任务要求连接多个中间实体,星型任务需合并独立线索锁定同一目标,容器任务需在候选中筛选,时间任务则涉及时序依赖。构建过程中,团队面临多重技术挑战:如何从语料中采样不包含捷径的孤立子图,如何通过释义事实图避免关键词泄露,如何设计k-of-k消融门控确保每块证据的必要性,以及如何在固定索引中消除跨问题的文档碰撞和替代路径。此外,对抗性筛选管道需平衡难度与可解性,最终保留至少三个必要支持块的任务,形成了严格而稳健的评测标准。
常用场景
经典使用场景
SynthComp作为一项合成生成的多跳检索基准,其核心用途在于评估语言模型与搜索代理在面对复杂组合性问题时,能否从固定语料库中完整召回支撑答案的全部证据片段。该基准通过精心设计的桥接、星型、容器与时间四类合成挑战机制,模拟了真实世界中需要链接中间实体、约束交叉定位、候选集筛选以及时间条件推理的检索场景。研究者可利用此基准系统性地测试检索系统在缺乏显式关键词匹配、且不存在替代检索路径的严苛条件下的证据完备性获取能力。
实际应用
在实际部署中,SynthComp可作为检索增强生成系统、智能搜索代理及大语言模型工具调用能力的压力测试平台。例如,在构建面向专业领域(如法律文档串联事实、医疗文献交叉验证)的问答系统时,该基准能够识别出那些仅依赖语义相似性排序而无法进行多步证据链溯源的检索短板。其俄语与英语双版本设计,亦支持跨语言检索能力的诊断,助力开发者在多语言商用搜索引擎与知识库问答服务上线前进行针对性的性能调优与鲁棒性加固。
衍生相关工作
基于SynthComp的设计理念与生成管线,学术界已衍生出多项重要工作。其前置研究BrowseComp-Plus提供了统一的评测框架与评估指标,而SynthComp则进一步引入了合成可控性与难度分层机制。数据集的对抗性过滤策略启发了后续关于检索捷径检测与证据必要性验证的研究。此外,该基准中使用的子图采样与组合式问题生成方法,已被推广至跨文档推理与多语言检索增强生成任务中,成为构建标准化合成评测数据集的重要范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务