遇见数据集

Cognitive-Lab/NayanaIR-MonoBench-zh

收藏
Hugging Face2025-12-01 更新2026-01-03 收录
官方服务:

资源简介:

--- dataset_info: - config_name: corpus features: - name: corpus-id dtype: int64 - name: image dtype: image - name: doc-id dtype: string splits: - name: test num_bytes: 494690023 num_examples: 1000 download_size: 419898404 dataset_size: 494690023 - config_name: qrels features: - name: query-id dtype: int64 - name: corpus-id dtype: int64 - name: is-answerable dtype: string - name: answer dtype: string - name: score dtype: int64 splits: - name: test num_bytes: 11472 num_examples: 239 download_size: 4891 dataset_size: 11472 - config_name: queries features: - name: query-id dtype: int64 - name: query dtype: string - name: language dtype: string - name: gpt-4o-reasoning dtype: string - name: answer dtype: string splits: - name: test num_bytes: 36213 num_examples: 200 download_size: 29089 dataset_size: 36213 configs: - config_name: corpus data_files: - split: test path: corpus/test-* - config_name: qrels data_files: - split: test path: qrels/test-* - config_name: queries data_files: - split: test path: queries/test-* ---

数据集信息: - 配置名称:语料库(corpus) 特征字段: 1. 语料库ID(corpus-id):数据类型为64位整数 2. 图像(image):数据类型为图像 3. 文档ID(doc-id):数据类型为字符串 数据集划分: - 划分名称:测试集(test),占用字节数:494690023,样本数量:1000 下载大小:419898404,数据集总大小:494690023 - 配置名称:查询相关度标注集(qrels) 特征字段: 1. 查询ID(query-id):数据类型为64位整数 2. 语料库ID(corpus-id):数据类型为64位整数 3. 是否可回答(is-answerable):数据类型为字符串 4. 答案(answer):数据类型为字符串 5. 得分(score):数据类型为64位整数 数据集划分: - 划分名称:测试集(test),占用字节数:11472,样本数量:239 下载大小:4891,数据集总大小:11472 - 配置名称:查询集(queries) 特征字段: 1. 查询ID(query-id):数据类型为64位整数 2. 查询内容(query):数据类型为字符串 3. 语言(language):数据类型为字符串 4. GPT-4o推理内容(gpt-4o-reasoning):数据类型为字符串 5. 答案(answer):数据类型为字符串 数据集划分: - 划分名称:测试集(test),占用字节数:36213,样本数量:200 下载大小:29089,数据集总大小:36213 配置列表: - 配置名称:语料库(corpus),数据文件: - 划分:测试集,路径:corpus/test-* - 配置名称:查询相关度标注集(qrels),数据文件: - 划分:测试集,路径:qrels/test-* - 配置名称:查询集(queries),数据文件: - 划分:测试集,路径:queries/test-*

提供机构:
Cognitive-Lab
搜集汇总
数据集介绍
Cognitive-Lab/NayanaIR-MonoBench-zh 数据集图片
构建方式
在信息检索与多模态理解交叉领域,构建一个兼具图像语义与文本查询的评测数据集尤为关键。Cognitive-Lab/NayanaIR-MonoBench-zh数据集基于多模态检索范式精心设计,其语料库(corpus)包含1000个样本,每个样本由唯一标识符、图像及文档ID组成。相关性判断集(qrels)则通过239条记录构建了查询与语料之间的映射关系,标注了是否可回答、答案文本及得分。查询集(queries)包含200条中文问题,每条问题均附带GPT-4o生成的推理过程,增强了数据集的解释性。三部分数据均以test分割形式存储,确保了评测的标准化与可复现性。
使用方法
该数据集适用于多模态检索与问答系统的基准测试。使用者可通过HuggingFace Datasets库加载三个config(corpus、queries、qrels),并利用corpus-id与query-id字段建立查询与文档的关联。在评估环节,可基于qrels中的score字段计算NDCG、MAP等检索指标,或利用is-answerable字段进行二分类任务。图像数据以PIL格式加载,便于与视觉模型集成。建议将查询的gpt-4o-reasoning作为辅助特征,或作为可解释性分析的参考标准,以深入评估模型对中文多模态语义的理解能力。
背景与挑战
背景概述
在信息检索与多模态理解交叉领域,构建高质量的中文基准数据集是推动模型发展的关键基石。Cognitive-Lab/NayanaIR-MonoBench-zh数据集由Cognitive Lab团队于近年创建,旨在解决中文环境下基于图像的单模态检索任务。该数据集包含1000张图像、200条查询及其对应的239条相关性标注,每条查询还附有GPT-4o的推理过程与标准答案,为评估检索模型的准确性与可解释性提供了独特资源。其核心研究问题聚焦于如何衡量检索系统在中文语境下对图像语义的匹配能力,填补了该领域缺乏大规模、高质量中文图像检索基准的空白,对推动多语言信息检索与视觉语言模型的本地化评估具有重要影响力。
当前挑战
该数据集所解决的领域问题在于,现有图像检索基准多以英文为主,中文图像检索面临语义歧义、文化特异性及细粒度匹配等挑战,而NayanaIR-MonoBench-zh通过精心设计的查询与标注,为评估模型在这类复杂场景下的表现提供了标准化测试平台。构建过程中,团队需应对多重困难:首先,确保图像与查询的语义对齐需要大量人工审核以消除噪声;其次,GPT-4o推理结果的引入虽增强可解释性,但如何保证其推理逻辑的准确性与一致性成为标注质量控制的关键;此外,数据规模有限(仅200条查询),如何在有限样本上实现具有统计意义的评估结论,对实验设计提出了更高要求。
常用场景
经典使用场景
在信息检索与多模态理解交叉领域,Cognitive-Lab/NayanaIR-MonoBench-zh 数据集为评估中文场景下的图文检索系统提供了标准化的测试基准。该数据集包含1000个图文对(corpus)与200个查询(queries),并附带由GPT-4o生成的推理路径及人工标注的答案,特别适用于评测模型在图像与文本之间进行精确匹配与语义对齐的能力。研究者可基于该数据集的qrels标注,开展零样本或微调场景下的检索任务,从而验证模型在复杂中文语境下的多模态理解水平。
解决学术问题
该数据集系统性地回应了中文多模态检索领域长期缺乏高质量评测基准的困境。现有英文数据集如MS-COCO、Flickr30k难以直接迁移至中文场景,而中文数据集又往往缺乏细粒度的查询-文档相关性标注。NayanaIR-MonoBench-zh通过提供包含推理路径的查询集合,使得学术研究能够深入探究模型在理解中文视觉语言任务时的决策过程。它不仅支持传统的检索任务,还为可解释性研究、跨模态推理能力评估提供了数据基础,推动了中文多模态信息检索的理论发展。
实际应用
在实际应用中,该数据集可服务于中文环境下的视觉搜索引擎优化、电商平台图文匹配、以及智能客服系统中的图片问答等场景。例如,电商平台可利用该数据集训练的模型,实现用户输入中文商品描述后精准返回匹配的商品图片;新闻媒体平台则可用于根据文字摘要检索相关新闻图片。此外,该数据集的推理路径标注还为构建可解释的检索系统提供了训练素材,有助于提升用户对AI检索结果的信任度。
数据集最近研究
最新研究方向
当前,多模态信息检索与视觉问答领域正迎来以中文为核心语料的研究热潮。Cognitive-Lab/NayanaIR-MonoBench-zh 数据集应运而生,聚焦于构建中文单模态检索基准,其设计融合了图像、文档与查询三元组结构,并引入 GPT-4o 推理路径作为增强查询理解的手段。该数据集不仅为评估大语言模型在中文场景下的图文检索能力提供了标准化测试集,更推动了跨模态推理与可解释性检索的深度融合。在检索增强生成(RAG)与多模态大模型快速演进的大背景下,该资源为探索中文语境下的细粒度相关性判断、答案可回答性判定以及基于视觉内容的推理任务奠定了关键基础,对促进中文信息检索系统的前沿研究具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务