遇见数据集

CUP Dataset

收藏
arXiv2026-07-23 更新2026-07-27 收录
官方服务:

资源简介:

CUP数据集是由希腊研究与技术基金会和克里特大学出版社联合构建的希腊语图书检索基准,包含868条涵盖科学、人文与艺术等主题的图书元数据记录,每条记录包含标题、作者、描述及目录等结构化与自由文本字段,其中描述字段平均约225词,目录字段平均226词且长度变异较大。该数据集通过专家人工标注构建了104条多样化查询及其分级相关性判断,旨在评估稀疏、稠密及混合检索方法在希腊语这一形态丰富低资源语言中的性能,特别针对词汇、语义、噪声及跨语言查询场景,为希腊语信息检索研究提供了现实世界的评估基础。

CUP Dataset is a Greek-language book retrieval benchmark jointly constructed by the Foundation for Research & Technology – Hellas and University of Crete Press. It contains 868 book metadata records covering topics including science, humanities and arts. Each record includes structured and free-text fields such as title, author, description and table of contents, where the description field averages approximately 225 words, while the table of contents field averages 226 words with considerable length variability. The dataset includes 104 diversified queries paired with graded relevance judgments developed via expert manual annotation, aiming to evaluate the performance of sparse, dense and hybrid retrieval methods in morphologically rich low-resource languages such as Greek. It specifically targets lexical, semantic, noisy and cross-lingual query scenarios, providing a real-world evaluation foundation for Greek-language information retrieval research.

创建时间:
2026-07-23
搜集汇总
数据集介绍
CUP Dataset 数据集图片
构建方式
在希腊语等形态丰富但资源匮乏的语言环境中,图书检索领域长期缺乏高质量的评测基准。针对这一空白,本研究构建了CUP数据集,基于克里特大学出版社的真实馆藏,收录了868条包含标题、作者、内容描述、目录等多字段的图书记录。数据集的查询集由四名领域专家手工构建,涵盖104条多样化信息需求,包括短关键词、自然语言请求、跨语言查询、包含拼写错误或缺失变音符号的噪声查询,以及带约束条件的复杂查询。每条查询均经过全库人工筛查,并赋予分级相关性标签,平均每查询对应4.81本相关图书,确保了标注的精细度与可靠性。
特点
CUP数据集的核心特征在于其真实世界场景下的多维挑战性。其查询类型丰富,覆盖单字词、多字词、命名实体、自然语言、类别、推理、跨语言及噪声查询等八类,全面反映了实际图书搜索中用户意图的多样性。语料本身亦具复杂性:图书元数据既包含结构化的标题与类别,也包含自由文本的描述与目录,其中目录字段长度差异极大(从空值到近2000词)。此外,数据集提供了五种大语言模型生成的目录摘要,为探索文档表征增强提供了独特资源。实验表明,多语言嵌入模型整体优于希腊语专用模型,且混合检索(稀疏与密集融合)在多数场景下表现最佳。
使用方法
该数据集适用于评估和比较多种检索策略。使用时可基于图书的标题、作者、类别、描述和目录等字段构建索引,采用BM25进行稀疏检索,或利用Sentence-Transformers等工具加载嵌入模型(如nemotron、nomic)进行密集检索。推荐通过加权融合或倒数排序融合实现混合检索,以兼顾词汇匹配与语义理解。研究者亦可利用提供的LLM目录摘要替换原始目录字段进行检索增强,或对检索结果实施LLM后过滤与重排序以提升早期精度。所有代码、查询及详细结果已在公开仓库中发布,便于复现与扩展研究。
背景与挑战
背景概述
在信息检索领域,面对形态丰富但资源稀缺的语言(如希腊语),大规模基准测试的匮乏与领域适配模型的不足长期制约着研究进展。2025年,由希腊研究与技术基金会(ICS-FORTH)研究员Katerina Papantoniou、Panagiotis Papadakos、Theodore Patkos联合克里特大学出版社(Crete University Press)的Dimitris Garefalakis与Nikos Vardakis共同创建的CUP数据集应运而生。该数据集聚焦于希腊语图书检索场景,收录了868条图书目录记录及104条由领域专家标注的分级相关性查询,旨在系统评估稀疏检索(如BM25)、稠密检索(基于句嵌入的多语言模型)、混合检索及大语言模型辅助检索方法在真实图书出版环境中的表现。CUP数据集的出现,填补了希腊语信息检索领域缺乏标准化基准的空白,不仅为低资源语言的检索研究提供了关键测试平台,更通过多维度查询设计推动了跨语言、语义及噪声环境下检索算法的实证比较与进步。
当前挑战
CUP数据集的构建与研究所面对的挑战可从两个层面剖析。在领域问题层面,希腊语作为形态复杂且资源匮乏的语言,其图书检索面临词形屈折、重音符号、词汇与语义变化及领域专业术语的多重干扰,同时查询类型涵盖短关键词、自然语言请求、跨语言表达及含拼写错误的噪声查询,这使得单一检索策略难以在所有场景中取得最优效果——BM25虽精于命名实体匹配,却在语义理解、噪声容忍及跨语言查询上力不从心。在构建过程中,挑战同样显著:图书目录元数据包含长度不一、格式不规范的自由文本(如描述和目录),其中342本书的目录超过200词,而部分字段甚至为空;此外,手工构建104条查询及其全语料库分级相关性判断需耗费大量人力,且需确保评估者间的一致性以保障标注质量,这些都对数据集的规模、多样性与可靠性提出了严苛要求。
常用场景
经典使用场景
在信息检索与自然语言处理领域,CUP Dataset 被广泛用于评估面向形态丰富、资源稀缺语言的书籍检索系统。该数据集涵盖了从简短关键词查询到复杂自然语言请求等多种检索难度,允许研究者系统性地比较稀疏检索、密集检索、混合检索以及基于大语言模型的检索策略在希腊语书籍目录上的表现。其经典使用场景是作为希腊语书籍检索的标准基准,用以测试和对比不同嵌入模型与检索架构在处理词形变化、拼写错误、多语言查询和领域特定术语时的鲁棒性与有效性。
实际应用
在实际应用场景中,CUP Dataset 为数字图书馆、出版社在线目录以及学术资源门户构建可扩展的希腊语搜索服务提供了验证平台。出版社可利用该数据集测试并优化其图书检索系统,以应对用户输入中常见的拼写错误、缺失变音符号、多语言表达乃至推理类查询。此外,基于大语言模型的目录摘要生成与后过滤技术,可显著提升检索的早期精度,尽管面临较高计算开销,但仍为实时检索与个性化推荐场景提供了有价值的参考,尤其适用于需要兼顾精确匹配与语义理解的文化与学术机构。
衍生相关工作
CUP Dataset 的发布催生了多项与之紧密相关的经典研究工作。在嵌入模型方面,研究者将其用于验证多语言句子变换器(如 BGE-M3、Qwen3、Nemotron)相较于希腊语专用编码器的优越性,促进了跨语言表示学习的进一步发展。在检索策略上,该数据集推动了加权混合检索与互惠排名融合方法的深入对比,阐明了混合模型中稀疏与密集信号的最佳融合方式。此外,基于大语言模型的目录摘要生成和检索后过滤技术也因 CUP 提供的标准化评估环境而得以系统研究,相关成果为低资源语言中的检索增强生成与交互式问答系统的开发奠定了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务