遇见数据集

SearchTome

收藏
arXiv2026-09-03 更新2026-09-05 收录
官方服务:

资源简介:

SearchTome是由IBM创建的多领域基准数据集,旨在评估基于目录(Table of Contents)的检索能力。该数据集包含18本来自教育、金融、法律、医学、自然科学和社会科学六个领域的教科书,共计190,209条查询-目录叶节点对应样本,并已提取清晰的目录结构。创建过程利用PyMuPDF解析PDF提取目录,并以Mixtral 8x7b模型为每个段落生成多个人工问题,按比例划分为训练、开发、测试集。该数据集旨在解决长文本检索中缺乏全局语义结构的问题,促进基于目录的检索系统研究,从而提升检索精度并降低生成模型中的幻觉风险。

SearchTome is a multi-domain benchmark dataset developed by IBM, which aims to evaluate table-of-contents-based retrieval capabilities. This dataset includes 18 textbooks from six fields: education, finance, law, medicine, natural sciences, and social sciences, with a total of 190,209 query-table-of-contents leaf node corresponding samples, and clear table-of-contents structures have been extracted. During the dataset creation process, PyMuPDF was used to parse PDF files and extract table-of-contents structures, while the Mixtral 8x7b model was utilized to generate multiple artificial questions for each paragraph. The samples were then split into training, development, and test sets at a predefined ratio. This dataset is designed to address the problem of missing global semantic structure in long-text retrieval, promote research on table-of-contents-based retrieval systems, and ultimately improve retrieval accuracy while reducing hallucination risks in generative models.

提供机构:
IBM
创建时间:
2026-09-03
搜集汇总
数据集介绍
SearchTome 数据集图片
构建方式
SearchTome数据集的构建源于对长文本检索中结构信息缺失问题的深刻洞察。研究团队精心筛选了横跨教育、金融、法律、医学、自然科学与社会科学六大领域的十八本开源教科书,利用pymupdf工具解析PDF并提取每本书的目录结构,确保每条目录项与其对应章节内容的语义一致性。随后,借助强大的Mixtral 8x7b模型,针对每个段落自动生成多元化问题,并为其标注最相关的目录叶节点作为标准答案。数据集按书籍划分训练集、开发集与测试集,形成了覆盖万余条查询的大规模基准,为基于目录的检索任务奠定了坚实基础。
使用方法
SearchTome数据集主要用于训练与评估基于目录的检索模型,特别适用于检索增强生成系统。使用者可参照STAIR框架,将查询与完整的目录结构拼接作为输入,通过监督微调使大语言模型学会直接生成与查询最相关的叶节点标题。数据集提供标准的训练、开发与测试划分,便于复现实验与对比分析。评估指标可选用Recall@1、Recall@3及nDCG@3,借助BeIR库进行标准化计算。该数据集亦支持与BM25、DPR及DSI等主流基线进行性能对照,从而验证结构感知策略在长上下文检索中的显著优势。
背景与挑战
背景概述
SearchTome基准数据集由IBM研究团队于2026年提出,旨在解决检索增强生成(RAG)系统中长文本检索精度不足的问题。该数据集由18本涵盖教育、金融、法律、医学、自然科学和社会科学六大领域的书籍构成,通过解析目录(Table of Contents)结构,将章节标题映射至具体文本内容,并利用Mixtral 8x7b模型生成大量查询-章节标题对。其核心研究问题在于探索利用目录层次结构提升检索系统对长文档的语义理解与精准定位能力,从而缓解现有基于长度分块方法导致的语义割裂问题。SearchTome的发布填补了结构化检索基准的空白,为基于目录的检索研究提供了标准化评估平台,其配套的STAIR模型在该基准上取得82.6%的Recall@1成绩,显著超越多种基线模型,推动了生成式信息检索系统的发展。
当前挑战
SearchTome所应对的领域挑战是:传统检索系统(如BM25、DPR)在处理长文档时采用长度分块,破坏了文档内在的语义结构,导致检索结果缺乏连贯性;大型语言模型虽能处理长上下文,却存在“lost in the middle”问题,影响精准回答。构建过程中,须从异构PDF书籍中准确提取目录与文本对应关系,处理跨域的格式差异,并借助LLM生成覆盖面广且语义精准的合成问题,同时确保数据集的平衡性与代表性。此外,需要应对模型参数索引时面临的低样本泛化与幻觉抑制难题,STAIR通过引入目录结构极大降低了无效输出(幻觉率低于0.05%),但在未见结构或动态语料上仍面临挑战。
常用场景
经典使用场景
SearchTome数据集的经典使用场景聚焦于基于目录(ToC)的检索任务,尤其适用于长文档(如教科书、技术报告)中的信息定位。该数据集模拟人类查阅书籍目录来快速定位答案的检索模式,将目录节点作为检索单元,为查询匹配最相关的章节标题。这一场景在检索增强生成(RAG)系统中尤为突出,旨在缓解大语言模型在处理长上下文时的“迷失中间”问题,通过结构化全局视角提升信息检索的精度和效率。此外,SearchTome也支持生成式信息检索(如DSI)的评估,推动模型直接生成文档标识符以响应查询。
解决学术问题
SearchTome解决了长文档检索中结构信息被忽视的问题,填补了缺乏结构化检索基准的空白。传统方法通常按长度切分文本,丢失了全局语义结构,导致检索质量欠佳。该数据集提供了涵盖6个领域、18本书的结构化语料,使研究者能够系统评估和对比不同检索模型(如BM25、DPR、DSI)在利用目录信息时的表现。它助推了模型记忆与检索能力的研究,尤其在低资源情况下减少幻觉、提高泛化性,为生成式IR系统提供了可复现的评测标准。
实际应用
SearchTome的实际应用覆盖教育、法律、医学等多个专业领域的知识库服务,可助力企业级帮助文档、在线教科书和学术资源平台构建高效的问答系统。在智能教育与数字图书馆中,基于ToC的检索能精准定位用户查询对应的章节,提升信息获取体验。在金融、法律等长文档密集型行业,该数据集支持构建低幻觉的RAG系统,加速信息抽取与合规审查流程。此外,SearchTome为智能代理(Agentic)框架提供多跳检索与推理的基础,实现精细化的信息导航。
数据集最近研究
最新研究方向
SearchTome基准的提出,标志着信息检索领域在利用全局结构化知识增强检索精度方面迈出了关键一步。当前研究焦点集中于设计一种结构感知的检索机制,通过将文档目录(ToC)作为语义单元,引导大型语言模型精准定位用户查询对应的最细粒度章节节点。这一方向旨在解决长文本检索中因语义边界缺失导致的“上下文迷失”问题,并显著降低检索系统在生成标识符时的幻觉现象。SearchTome涵盖多领域书籍数据,为评估此类结构化检索方法提供了标准化测试平台,推动了基于模型参数化索引与全局结构先验融合的探索,从而提升复杂文档(如技术手册与学术巨著)的知识获取效率与可靠性。
相关研究论文
  • 1
    STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever for document structure augmentationIBM · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务