遇见数据集

Tevatron/browsecomp-plus-md-toc-gpt5.4-nano

收藏
Hugging Face2026-07-07 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是BrowseComp-Plus 100k语料库的一个官方格式变体,用于RISE Agent实验。它保留了原始语料库的行数(100,195行)、文档ID、URL和列名,但将每个文档的text字段替换为结构化版本,增加了生成的目录(TOC)和章节标题(使用##标记)。结构化文本通过GPT-5.4-nano模型生成章节提议,并经过后处理器验证和实现,确保原始文本不被修改,仅添加导航辅助。数据集旨在用于受控的代理搜索和检索实验,其中语料库与BrowseComp-Plus对齐,但文档提供轻量级导航结构以支持行范围阅读。数据集文件为Parquet格式,包含docid、text和url三列,可用于加载和检索任务。

This dataset is a drop-in, official-format variant of the BrowseComp-Plus 100k corpus used in RISE Agent experiments. It keeps the same row count (100,195 rows), document ids, URLs, and column names as the original BrowseComp-Plus corpus, but replaces each documents text field with a structured version that adds a generated table of contents (TOC) and section headings (marked with ##). The structured text is generated using a GPT-5.4-nano model for section proposals, validated and materialized by a deterministic postprocessor, preserving the original text while adding navigation aids. The dataset is intended for controlled agentic-search and retrieval experiments where the corpus remains aligned with BrowseComp-Plus, but documents expose a lightweight navigation structure for line-range reading. The dataset is in Parquet format with three columns: docid, text, and url, suitable for loading and retrieval tasks.

提供机构:
Tevatron
搜集汇总
数据集介绍
Tevatron/browsecomp-plus-md-toc-gpt5.4-nano 数据集图片
构建方式
本数据集是对BrowseComp-Plus十万级语料库的结构化增强变体。在构建过程中,每篇原始文档被送入轻量级章节提案模型gpt-5.4-nano,通过OpenAI Batch API以低推理成本获取JSON格式的章节标题、单句描述及锚定字符串。对于超长文档,模型仅获取前20万字符(尽量在段落边界截断),原始全文则完整保留供后续验证与实体化。随后,确定性后处理器依次执行精确匹配、空白归一化匹配及缩短前缀匹配来定位锚点,仅跳过缺失、歧义或顺序错乱的锚点,仅在验证通过的锚点位置插入“## 章节标题”,并在文件顶部YAML元数据后添加包含线号范围与简短描述的“## 目录”区块,最后以“=== DOCUMENT BODY ===”标记分隔。原始文本未被摘要、删改或重写,仅作为导航辅助存在。
特点
数据集包含100,195行,docid与URL严格对齐原始BrowseComp-Plus语料库,列式结构(docid、text、url)完全兼容。所有文档均保留完整原文,目录与标题仅为结构化导航标志,答案证据仍需在正文中核实。94.5%的文档包含至少一个有效目录条目,验证通过的章节锚点比例高达99.3%,仅极少数文档因模型未返回章节或所有锚点验证失败而缺失目录。生成过程无API故障或后处理失败,经SHA-256校验确保文件完整性。该数据集尤其适用于代理式搜索与检索实验,在保持与原生语料库一致性的同时,为文档赋予轻量级行级导航结构。
使用方法
用户可通过HuggingFace Datasets库直接加载:`load_dataset("Tevatron/browsecomp-plus-md-toc-gpt5.4-nano", split="train")`,获取包含docid、text、url三列的训练集。该数据集设计为检索后处理阶段的文件表示,在RISE Agent工作空间中通过硬链接使用,而BM25检索系统仍基于原始文档文本构建。建议在问答与文本检索任务中,利用其结构化目录快速定位相关段落,再深入原文验证答案证据。数据集的私有性(private: true)需要用户具备相应访问权限,加载前应确认认证配置。
背景与挑战
背景概述
在信息检索与智能问答领域,如何从海量非结构化文档中高效定位并提取精确信息始终是核心挑战。随着大规模语料库如BrowseComp-Plus的涌现,传统基于全文检索的方法在应对复杂查询时往往力不从心。为此,RISE Agent实验团队于2026年利用前沿语言模型gpt-5.4-nano,在低推理成本下通过OpenAI批处理API对原始文档进行结构化增强,创建了BrowseComp-Plus Markdown with TOC数据集。该数据集保留了原语料的10万条记录、文档标识符与URL映射,但将纯文本字段替换为包含自动生成目录与标题的Markdown格式,旨在为智能体搜索与检索实验提供轻量级导航结构,从而在不改变底层语料对齐性的前提下提升段落级读取效率。这一工作由Tevatron研究机构主导,其生成流水线的严谨性体现在对802,177个锚点的99.3%验证通过率上,为结构化文档检索研究树立了新基准。
当前挑战
该数据集所解决的领域问题核心在于:传统扁平化检索模型(如BM25)虽能快速召回相关文档,却无法提供文档内部的细粒度定位,导致智能体在长文档中逐行搜索答案时效率低下。构建过程中面临的主要挑战包括:1)对于超长文档(超过20万字符)只能截取前段输入模型,可能丢失后续关键信息;2)模型输出的章节提议需经严格的锚点验证——需依次尝试精确匹配、归一化匹配及前缀匹配,任何越界、歧义或顺序错乱的锚点均被跳过,这导致5,458篇短文档因模型未返回有效章节而缺乏目录,另有22篇因全部锚点验证失败而仅保留全文;3)需确保结构化生成不篡改原始正文,所有导航元素仅为辅助标记,最终答案仍需回归原文核实。这些技术挑战在100,195篇文档的零失败生成中得以克服,验证了该流水线的鲁棒性。
常用场景
经典使用场景
在信息检索与智能问答领域,browsecomp-plus-md-toc-gpt5.4-nano数据集为结构化文档的检索与理解提供了标准化的测试平台。该数据集在保持原始BrowseComp-Plus语料库文档标识符、统一资源定位符及条目数量的基础上,将原始文本替换为包含自动生成的目录与节标题的结构化版本。研究者可借此探索如何利用文档内部层级结构提升检索系统对长文档的定位精度,特别是在代理式搜索场景中,通过目录索引与段落标题辅助实现逐行精准读取,而非单纯依赖全文的稠密或稀疏向量匹配。该设计使得经典检索模型如BM25能够与结构化导航相结合,进而验证结构化预处理对下游问答任务中证据片段定位效率的增益。
实际应用
在实际应用层面,该数据集所代表的结构化文档处理范式对现代搜索引擎与知识获取系统具有显著的赋能作用。例如,在金融报告分析、法律文书审查及科研文献综述等场景中,用户往往需要从数百页文档中快速定位与查询相关的具体段落。借助该数据集训练或评估的检索系统,能够基于自动构建的目录与标题索引,在返回相关文档的同时提供关键章节的跳转链接,大幅降低人工检索的时间成本。此外,在智能客服与教育平台的知识库构建中,结构化文档的引入使得大语言模型在进行检索增强生成时能够更精准地引用特定段落,从而提升生成答案的可信度与可追溯性。
衍生相关工作
该数据集的诞生衍生了一系列围绕结构化文档检索与代理式阅读的重要研究工作。基于其对目录与节标题的标准化处理,学术界已涌现出多种利用章节锚点进行文档级检索重排序的算法,以及融合层级注意力机制的阅读理解模型。部分后续工作进一步将结构化表示与细粒度行级定位相结合,发展出如‘章节感知的稠密检索’与‘基于TOC的段落图遍历’等创新架构。此外,该数据集还催生了关于‘检索过程中文档内锚点验证策略’的深入研究,即如何通过精确匹配、归一化匹配与截断前缀匹配等多级验证机制,确保自动化构建的结构索引具备高保真度,这些工作共同推动了检索增强生成系统在复杂文档环境中的落地与优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务