遇见数据集

SkMTEB

收藏
arXiv2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

SkMTEB是由夸美纽斯大学·布拉迪斯拉发等机构联合创建的首个斯洛伐克语大规模文本嵌入基准,旨在填补低资源西斯拉夫语言在语义表示评估领域的空白。该基准包含31个数据集,涵盖检索、重排序、分类等七类任务,数据来源包括新闻、政府文件、社交媒体及百科全书等多领域文本,时间跨度从2000年至2025年,其中包含七个全新构建的本地化数据集。基准通过整合现有语料库与人工标注流程构建,特别针对斯洛伐克语的语言特性进行优化,主要应用于评估嵌入模型在语义搜索、文本聚类及跨语言检索等任务中的性能,为低资源语言的模型适配与效率优化提供关键基础设施。

SkMTEB is the first large-scale Slovak text embedding benchmark jointly created by Comenius University Bratislava and other institutions, aiming to fill the gap in semantic representation evaluation for low-resource West Slavic languages. This benchmark includes 31 datasets covering seven types of tasks such as retrieval, reranking, classification and more. Its data sources cover multi-domain texts including news, government documents, social media, encyclopedias and other materials, with a time span from 2000 to 2025, and it contains seven newly constructed localized datasets. Built by integrating existing corpora and manual annotation workflows, the benchmark is specially optimized for the linguistic characteristics of Slovak. It is mainly used to evaluate the performance of embedding models on tasks like semantic search, text clustering and cross-lingual retrieval, providing key infrastructure for model adaptation and efficiency optimization of low-resource languages.

创建时间:
2026-06-12
搜集汇总
数据集介绍
SkMTEB 数据集图片
构建方式
SkMTEB的构建基于MTEB框架,涵盖了7类任务共计31个数据集。为弥补斯洛伐克语资源的匮乏,研究团队不仅整合了现有数据集,还针对新任务改编了多个已有的数据集,并全新创建了7个数据集。这些数据集覆盖新闻、政府、社交媒体、评论及百科全书等多种领域,时间跨度从2000年至2025年。每个数据集均经过精心筛选与标准化处理,以确保评估的全面性与可靠性。
特点
SkMTEB的特点在于其深度与广度的平衡。与仅包含8个任务的MMTEB相比,SkMTEB提供了近4倍的覆盖深度,专为斯洛伐克语设计。其包含的31个数据集横跨检索、重排序、分类、聚类、平行语料挖掘、句对分类及语义文本相似度等任务,并引入了医疗、事实核查等本地化场景。此外,该基准还包含7个全新的数据集,如基于药房问答的重排序数据集,极大丰富了斯洛伐克语嵌入模型的评估维度。
使用方法
SkMTEB集成于mteb库中,用户可通过单一命令' mteb run -m <model-id> -b "MTEB(slk, v1)" '对任意嵌入模型进行端到端评估。每个任务在Hugging Face上均固定了数据集版本哈希值,以确保评估结果的可复现性。研究团队已公开所有模型、数据集及代码,并计划在Hugging Face上维护公共排行榜,鼓励社区持续贡献与评测。
背景与挑战
背景概述
SkMTEB(斯洛伐克大规模文本嵌入基准)由斯洛伐克夸美纽斯大学、思科系统、科希策技术大学及肯佩伦智能技术研究所于2026年联合创建,主要研究人员包括Marek Šuppa等。该数据集针对斯洛伐克语这一低资源西斯拉夫语言,填补了其在文本嵌入评估领域的空白。核心研究问题在于:尽管大型多语言模型在理论上支持斯洛伐克语,但其词汇表与训练数据多集中于高资源语言,导致性能显著下降。SkMTEB整合了31个数据集、覆盖7类任务(检索、重排序、分类、聚类、双语文本挖掘、句对分类及语义文本相似性),其深度约为现有多语言基准MMTEB的4倍,为斯洛伐克语嵌入模型的系统性评估与优化提供了标准化框架,对低资源语言的自然语言处理研究具有标杆意义。
当前挑战
SkMTEB所应对的领域挑战在于:斯洛伐克语作为低资源语言,现有大型多语言模型虽支持其处理,但受限于词汇表分配不均衡、训练数据匮乏,导致在语义搜索与检索增强生成等嵌入任务中表现欠佳;同时,已有的斯洛伐克语NLU模型难以直接迁移至嵌入任务,亟需专用基准来诊断模型短板。在构建过程中,团队面临数据集严重不足的困境,为此采取了多项策略:将现有数据集适配至新任务(如将摘要数据集重构为检索任务),并创建了7个全新数据集(如来自药房问答的重排序数据)。此外,数据质量把控亦为一大挑战,例如在生成语义相似性合成数据时,需通过人工标注与校对来消除翻译腔与LLM生成的偏差,确保标注者间一致性达到中等以上水平(Fleiss' kappa为0.56)。
常用场景
经典使用场景
SkMTEB作为首个面向斯洛伐克语的大规模文本嵌入基准,其经典使用场景在于系统性地评估和比较各类嵌入模型在低资源斯拉夫语言上的表现。该基准涵盖31个数据集和7种任务类型——包括检索、重排序、分类、聚类、语义文本相似度、平行语料挖掘及句子对分类——为研究者提供了前所未有的评价深度。通过统一框架下的标准化评测,SkMTEB揭示了指令微调的多语言大模型在斯洛伐克语上表现最优,而现有的斯洛伐克语NLU模型在嵌入任务中泛化能力不足,为多语言嵌入研究提供了关键参照。
衍生相关工作
围绕SkMTEB已衍生出一系列前沿工作:在建模层面,基于词汇剪枝技术(Ushio et al., 2023)与荷兰语E5-NL(Banar et al., 2025)的成功验证,团队将裁剪策略从NLU推广至嵌入领域,证明了跨语言迁移性能损失可控制在1个F1点以内。在评测层面,SkMTEB与MMTEB互为补充——前者提供斯洛伐克语深度评测,后者保障跨250+语言的广度覆盖。此外,该工作揭示的“4B-8B模型未见得优于500M-600M模型”的发现,为嵌入模型规模效应研究提供了反例,挑战了单纯增大参数量的主流趋势。
数据集最近研究
最新研究方向
SkMTEB作为首个斯洛伐克语文本嵌入综合基准,聚焦于低资源语言在语义搜索与检索增强生成(RAG)场景下的评估体系建设。前沿研究通过词汇裁剪与定向微调策略,将多语言E5模型参数量压缩62%,在保持与闭源API相当性能的同时实现本地化高效部署。该工作揭示了指令调优的多语言大模型显著优于现有斯洛伐克语NLU模型在嵌入任务上的迁移表现,并验证了基于频率统计的词汇裁剪对跨语言对齐性能的保全效应。这一范式为其他弱势语言提供了可复现的基准构建-模型适配-效率优化全链路模板,推动多语言嵌入模型研究从规模竞赛向资源高效的语言专精化方向演进。
相关研究论文
  • 1
    SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation夸美纽斯大学·布拉迪斯拉发; 思科系统; 科希策技术大学; 肯佩伦智能技术研究所 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务