MultiConIR
收藏资源简介:
MultiConIR(多条件信息检索)是一个全面的基准数据集,旨在评估涉及多条件查询的检索模型。与传统的单条件检索任务不同,MultiConIR反映了五个领域(书籍、电影、人物、医疗案例和法律文件)中现实且复杂的搜索场景。
MultiConIR (Multi-Condition Information Retrieval) is a comprehensive benchmark dataset designed to evaluate retrieval models involving multi-condition queries. Unlike traditional single-condition retrieval tasks, MultiConIR reflects the realistic and complex search scenarios in five domains (books, movies, individuals, medical cases, and legal documents).
MultiConIR: 多条件信息检索数据集概述
数据集简介
MultiConIR(多条件信息检索)是一个专门设计用于评估多条件检索场景下检索和重排序模型性能的基准数据集。该数据集针对现实世界中复杂的搜索需求,覆盖五个不同领域:
- 书籍
- 电影
- 人物
- 医疗案例
- 法律文件
核心特性
- 复杂度鲁棒性:评估检索模型处理查询条件数量增加(1至10个条件)时的有效性。
- 相关性单调性:评估模型在条件逐步增加时保持相关性排序一致性的能力。
- 查询格式敏感性:评估模型在不同查询格式(指令式和描述式)下的性能稳定性。
数据集构建流程
- 条件句子提取:使用GPT-4o从真实文档中提取十个关键且非冗余的条件句子。
- 查询生成:生成包含1至10个条件的指令式和描述式查询。
- 困难负样本生成:生成语义相似但存在细微差异的负样本句子以挑战检索系统。
基准任务
- 复杂度鲁棒性:测量查询条件数量增加对检索性能的影响。
- 相关性单调性:评估模型根据匹配条件数量对文档进行一致性排序的能力。
- 查询格式不变性:评估模型对不同查询格式的敏感性。
性能亮点
- 传统IR系统在查询条件增加时性能下降,重排序模型受影响更严重。
- 模型在保持条件间相关性单调性方面存在系统性失败。
- 重排序模型在简单查询上优于检索模型,但随着查询复杂度增加性能显著下降。
- GritLM-7B在应对查询复杂度增加时表现出最高的鲁棒性。
- NV-Embed在长文档适应性方面表现优异,性能稳定性优于其他模型。
引用信息
bibtex @misc{lu2025multiconirmulticonditioninformationretrieval, title={MultiConIR: Towards multi-condition Information Retrieval}, author={Xuan Lu and Sifan Liu and Bochao Yin and Yongqi Li and Xinghao Chen and Hui Su and Yaohui Jin and Wenjun Zeng and Xiaoyu Shen}, year={2025}, eprint={2503.08046}, archivePrefix={arXiv}, primaryClass={cs.IR}, url={https://arxiv.org/abs/2503.08046}, }
联系方式
如有问题或反馈,请联系:lux1997@sjtu.edu.cn




