遇见数据集

ProRetrieval

收藏
arXiv2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

ProRetrieval数据集是由华东师范大学、纽约大学等机构联合构建的混合检索基准,旨在评估结合结构化过滤与语义检索的检索系统。该数据集包含两个子集:电商数据集基于Amazon ESCI和Reviews,涵盖3000个商品的结构化字段、文本和图像;邮件数据集基于Enron语料,包含5000封邮件的结构化字段和文本。每个子集由20000条训练查询和3000条测试查询组成,查询按复杂度分为单条件、二至三条件和四至五条件(含否定与嵌套)三个层级。数据集通过自动化管道生成,从候选集中采样条件并编译为可执行的混合DSL程序,再经LLM改写为自然语言查询,旨在解决真实场景中需同时处理结构化约束与语义意图的复杂检索问题,为混合检索系统的训练与评估提供标准化基准。

The ProRetrieval dataset is a hybrid retrieval benchmark jointly constructed by institutions including East China Normal University, New York University and other organizations. It is designed to evaluate retrieval systems that combine structured filtering and semantic retrieval. This dataset contains two subsets: the e-commerce dataset, based on Amazon ESCI and Reviews, covers structured fields, text and images of 3000 products; the email dataset, based on the Enron corpus, contains structured fields and text of 5000 emails. Each subset consists of 20,000 training queries and 3,000 test queries, which are divided into three complexity levels: single-condition, two-to-three-condition, and four-to-five-condition (including negation and nesting). The dataset is generated through an automated pipeline: conditions are sampled from candidate sets and compiled into executable hybrid DSL programs, which are then rewritten into natural language queries by LLMs. It aims to solve complex retrieval problems that require simultaneous processing of structured constraints and semantic intentions in real-world scenarios, providing a standardized benchmark for the training and evaluation of hybrid retrieval systems.

创建时间:
2026-08-27
搜集汇总
数据集介绍
ProRetrieval 数据集图片
构建方式
ProRetrieval数据集的构建依托于两条公开语料——Amazon ESCI与评论数据构成的电商场景,以及Enron邮件语料构成的邮件场景,通过自动化、复杂度驱动的高效流水线生成。构建过程始于对查询结构的设计,从固定分布中采样叶节点数量N(1至5),并按照两层布尔模板将叶节点划分为K组,覆盖从单一条件到嵌套或非逻辑的多样组合。随后,从语料中抽取少量锚定文档,为每个叶节点分配字段并标注正负属性,其中正例取值直接源于锚定文档,负例则取违反约束的值,确保查询语义的真实性。这些条件随后被编译为融合SQL谓词与向量检索占位符的混合DSL程序,并执行于语料之上以获取真实结果集,通过结构性子查询预筛选来剔除空集或过大集合的实例。最终,利用GPT-4o将程序改写为自然语言查询,并附上完整的元数据标注。
使用方法
ProRetrieval数据集既可作为监督微调的基准,也可作为强化学习训练与评估的平台。使用者可先利用其中的自然语言查询与黄金DSL程序对语言模型进行监督微调,使其习得从查询到程序映射的基础能力;随后在相同的实例上,通过强化学习算法(如GRPO或DAPO)进一步优化策略,借助格式、可执行性、结果正确性及长度四元奖励信号来鼓励模型探索更优的编排策略。数据集的元数据信息支持按查询复杂度或模态进行分层评估,便于洞察模型在不同子任务上的强弱项。此外,数据集还可作为统一的测试床,用于对比不同检索范式(如纯向量检索、规则融合或知识图谱方法)的性能,其标准的Hit@1、MRR等指标计算方式确保了实验结果的可比性与可复现性。
背景与挑战
背景概述
ProRetrieval数据集由华东师范大学、纽约大学等机构的研究人员于2026年提出,旨在应对现实世界检索中结构化约束与语义意图通过任意布尔逻辑组合的挑战。该数据集基于Amazon电商和Enron邮件构建了混合检索基准,涵盖结构化字段、文本与图像模态,并支持从单条件到嵌套布尔表达式的查询。其核心创新在于将语言模型重塑为检索编排器,通过合成可执行的混合DSL程序(结合SQL与向量检索原语)实现跨模态的逻辑融合。该数据集推动了检索范式从固定融合或单一后端向可学习程序合成的转变,在电商与邮件场景中均显著超越GPT-5.5等前沿商业模型,为混合检索研究提供了全新基准与训练框架。
当前挑战
ProRetrieval面临的挑战首先源于领域根本难题:真实查询常需跨异构后端(关系字段、文本与图像索引)组合任意布尔连接(析取、否定与嵌套),而现有方法如纯检索器仅覆盖单一模态,融合管道仅表达加权析取,自查询检索器无法处理否定或嵌套谓词,导致编排能力缺失。其次,构建过程中需解决多模态联合学习与优化困难,4B模型在SFT阶段因多任务干扰难以同时掌握三种检索模态(图像查询Hit@1仅0.323),且RL训练易出现奖励黑客现象(GRPO在长输出中性能退化),需设计分层奖励与稳定算法(如DAPO)。此外,DSL语法学习、SQL转义错误处理、OOD泛化及大规模语料下的执行延迟均构成显著挑战,凸显了在动作空间复杂度与模型容量间的权衡。
常用场景
经典使用场景
ProRetrieval数据集针对现实世界中普遍存在的混合检索场景而构建,其核心任务要求模型在给定的结构化字段、文本语义与图像特征之间进行协同查询。该数据集精心设计了从单一条件到嵌套布尔逻辑的多层次查询,涵盖电子商务产品检索与企业邮件检索两大典型领域,为评估模型在异构信息源上进行逻辑编排与程序合成能力提供了标准化的测试平台。研究者可基于此基准衡量检索系统在精确过滤与语义匹配融合上的综合表现,从而推动混合检索技术的范式革新。
解决学术问题
该数据集直面传统检索方法在表达力与编排能力上的双重瓶颈,系统性地解决了现有混合检索管线仅支持固定组合形式、难以处理析取、否定及嵌套谓词的学术难题。通过将SQL逻辑代数与向量检索原语统一至可执行程序空间,ProRetrieval为多模态、多后端的复杂查询提供了逻辑完备的解决方案,并验证了强化学习在训练小规模模型掌握复杂动作空间时的关键作用,为神经检索与符号推理的深度融合提供了坚实的数据支撑与实证依据。
实际应用
在实际应用层面,ProRetrieval所模拟的检索场景广泛对应于电商平台商品搜索与企业级邮件信息管理系统。例如,用户可自然语言表述“预算内且具备降噪功能的索尼或Bose无线耳机”等融合多条件约束的查询,系统需即时将结构化筛选、文本语义匹配及视觉特征检索有机整合,并返回精准排序结果。该数据集能够有效驱动此类智能检索系统的研发与评测,助力构建具备高度逻辑编排能力的生产级混合搜索引擎,切实提升复杂查询条件下的信息获取效率。
数据集最近研究
最新研究方向
ProRetrieval数据集标志着检索系统从固定管道向可执行程序合成的范式跃迁,其前沿研究聚焦于将大规模语言模型重塑为检索编排器,通过混合领域特定语言(DSL)熔合SQL的结构化操作与文本、图像向量的语义原语,从而在异构数据源间实现任意布尔逻辑的组合编排。该方向的核心创新在于引入分层四元奖励机制(格式、执行、结果、长度)与GRPO/DAPO强化学习策略,使仅40亿参数的开源模型在电商与邮件双基准上超越GPT-5.5等前沿商用模型,揭示了奖励驱动的探索能有效克服多模态行动空间下的优化干扰,尤其将图像检索命中率提升39.3个百分点。这一研究路径不仅拓展了检索智能体的能力边界,更确立了“程序即检索策略”的新方法论,为跨模态统一检索与复杂查询理解开辟了极具潜力的演进方向。
相关研究论文
  • 1
    ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis华东师范大学; 纽约大学; Matter Innovation Inc.; ThinRedLine; 山东科技大学; 暨南大学; 独立研究者; 复旦大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务