multimodal-dataset
收藏资源简介:
该数据集专为文本和图像检索任务设计,包含解析的文档(语料库)、生成的查询和相关判断(qrels)。数据集结构分为三个部分:1) 语料库(corpus):包含带有文本和图像内容的文档页面,图像直接存储在Parquet文件中;2) 查询(queries):包含用于检索评估的搜索查询;3) 相关判断(qrels):包含将查询与语料库文档链接的相关性判断。
This dataset is specifically designed for text and image retrieval tasks, containing parsed documents (corpus), generated queries, and relevance judgments (qrels). It is structured into three components: 1) Corpus: Consists of document pages with both text and image content, where images are directly stored in Parquet files. 2) Queries: Includes search queries intended for retrieval evaluation. 3) Relevance judgments (qrels): Contains relevance judgments that link queries to documents in the corpus.
数据集概述
基本信息
- 数据集名称: multimodal-dataset
- 发布者: eagerworks
- 主要用途: 文本和图像检索任务
- 数据格式: Parquet文件
- 加载方式: 可通过Hugging Face
datasets库加载
数据集结构
数据集包含三个独立的配置(config),每个配置对应一个数据文件。
1. 语料库 (corpus)
包含带有文本和图像内容的文档页面。图像直接存储在Parquet文件中。
- 数据量: 134条记录(测试集)
- 特征:
corpus_id(string): 文档页面的唯一标识符(例如 "D1")filename(string): 源文档文件名text(string): 从页面提取的文本内容image(image): 页面图像(以PIL.Image格式加载)
- 数据文件:
corpus.parquet
2. 查询集 (queries)
包含为检索评估生成的搜索查询。
- 数据量: 88条记录(测试集)
- 特征:
query_id(string): 查询的唯一标识符(例如 "Q1")text(string): 查询文本pages(list): 相关页面列表(用于调试),每个项目包含:num(int): 页码score(int): 相关性分数
- 数据文件:
queries.parquet
3. 相关性标注集 (qrels)
包含将查询与语料库文档相关联的相关性判断。
- 数据量: 197条记录(测试集)
- 特征:
query_id(string): 查询标识符corpus_id(string): 语料库文档标识符score(int): 相关性分数(例如,1 = 相关,2 = 高度相关)
- 数据文件:
qrels.parquet
使用示例
python from datasets import load_dataset
dataset_name = "eagerworks/multimodal-dataset"
加载语料库
corpus = load_dataset(dataset_name, "corpus", split="test")
访问数据项
item = corpus[0] print(f"ID: {item[corpus_id]}") print(f"Text: {item[text]}") item["image"].show() # 显示PIL图像
加载查询集和相关性标注集
queries = load_dataset(dataset_name, "queries", split="test") qrels = load_dataset(dataset_name, "qrels", split="test")




