遇见数据集

mteb/MMTEB-Multilingual-v2

收藏
Hugging Face2026-06-20 更新2026-05-10 收录
官方服务:

资源简介:

MTEB (Multilingual, v2) 是一个大规模多语言文本嵌入基准测试,被称为MMTEB。它主要由社区贡献驱动,覆盖了250多种语言,旨在评估多语言文本嵌入模型的性能。该基准测试包含多种任务,如语义相似性、分类、聚类和检索,涵盖了从新闻、社交媒体到法律文档等多个领域的多语言数据。

MTEB (Multilingual, v2), also referred to as MMTEB, is a large-scale multilingual text embedding benchmark. It is primarily driven by community contributions, covers over 250 languages, and aims to evaluate the performance of multilingual text embedding models. This benchmark includes a diverse set of tasks such as semantic similarity, classification, clustering and retrieval, and encompasses multilingual datasets spanning multiple domains ranging from news, social media to legal documents.

提供机构:
mteb
原始信息汇总

数据集概述:MMTEB-Multilingual-v2

数据集名称:MMTEB-Multilingual-v2
所属组织:mteb
引用量:1
简介:MTEB(Massive Text Embedding Benchmark)的大规模多语言扩展版本,称为MMTEB,主要由高度精选的社区贡献驱动,覆盖250多种语言。

任务列表

该基准测试包含以下任务,按类型分类:

任务类型 任务名称 描述
语义相似度(BitextMining) BornholmBitextMining 丹麦语-博恩霍尔姆语并行语料库
BibleNLPBitextMining 829种语言的圣经部分翻译,按经节对齐
BUCC.v2 BUCC双文本挖掘数据集(仅黄金集)
DiaBlaBitextMining 英语-法语非正式书面对话平行语料库
FloresBitextMining 英语与低资源语言间的机器翻译基准
IN22GenBitextMining 英语和22种印度语言的多领域通用并行基准
IndicGenBenchFloresBitextMining Flores数据集扩展到印度语言
NollySentiBitextMining 尼日利亚五种语言的电影评论
NorwegianCourtsBitextMining 挪威法院的尼诺斯克语和博克马尔语平行语料库
NTREXBitextMining 英语到128种语言的新闻翻译测试参考
NusaTranslationBitextMining 11种印尼语言与英语的平行数据集
NusaXBitextMining 12种语言的平行语料库(含10种印尼本地语言)
Tatoeba 每种语言1000个英语对齐句子对
分类(Classification) BulgarianStoreReviewSentimentClassfication 保加利亚在线商店评论情感分类
CzechProductReviewSentimentClassification 捷克电商评论情感分类(3类)
GreekLegalCodeClassification 希腊法律代码分类
DBpediaClassification 维基百科文章分类(14类)
FinancialPhrasebankClassification 金融新闻情感极性分类
PoemSentimentClassification 诗句情感分类
ToxicConversationsClassification 评论毒性检测
TweetTopicSingleClassification Twitter话题分类(6个标签)
EstonianValenceClassification 爱沙尼亚新闻情感注释
FilipinoShopeeReviewsClassification 菲律宾Shopee评论评分分类
GujaratiNewsClassification 古吉拉特语新闻3类分类
SentimentAnalysisHindi 印地语情感分析
IndonesianIdClickbaitClassification 印尼新闻标题点击诱饵检测
ItaCaseholdClassification 意大利司法判决分类(64个主题)
KorSarcasmClassification 韩语讽刺检测
KurdishSentimentClassification 库尔德语情感数据集
MacedonianTweetSentimentClassification 马其顿语推文情感分类
AfriSentiClassification 非洲语言情感分析
AmazonCounterfactualClassification 亚马逊评论反事实检测
CataloniaTweetClassification 西班牙加泰罗尼亚独立立场检测
CyrillicTurkicLangClassification 西里尔字母的8种突厥语言分类
IndicLangClassification 22种印度语言识别测试集
MasakhaNEWSClassification 16种非洲语言新闻主题分类
MassiveIntentClassification 51种语言的NLU意图分类
MultiHateClassification 11种语言的仇恨言论检测
NordicLangClassification 北欧语言识别数据集
NusaParagraphEmotionClassification 10种印尼语言的多类情感分类
NusaX-senti 12种语言的情感分析(3类)
ScalaClassification 斯堪的纳维亚语言可接受性判断
SwissJudgementClassification 瑞士联邦法院判决结果二分类
NepaliNewsClassification 尼泊尔语新闻文章分类
OdiaNewsClassification 奥里亚语新闻3类分类
PunjabiNewsClassification 旁遮普语新闻2类分类
PolEmo2.0-OUT 波兰语领域外评论情感预测
PAC 波兰语释义语料库
SinhalaNewsClassification 僧伽罗语新闻5类分类
CSFDSKMovieReviewSentimentClassification 斯洛伐克语电影评论情感分类
SiswatiNewsClassification 斯瓦蒂语新闻分类
SlovakMovieReviewSentimentClassification 斯洛伐克电影评论情感分类(2类)
SwahiliNewsClassification 斯瓦希里语新闻6类分类
DalajClassification 瑞典语语言可接受性判断
TswanaNewsClassification 茨瓦纳语新闻分类
IsiZuluNewsClassification 祖鲁语新闻分类
KorHateSpeechMLClassification 韩语多标签仇恨言论分类(8类+非仇恨)
MalteseNewsClassification 马耳他语新闻多标签主题分类
MultiEURLEXMultilabelClassification 23种欧盟语言的EUROVOC概念标注
BrazilianToxicTweetsClassification 巴西葡萄牙语毒性推文分类(6类)
CEDRClassification 情绪分类(5类:喜悦、悲伤等)
聚类(Clustering) WikiCitiesClustering 按国家聚类维基百科城市文章(126国,3531城市)
MasakhaNEWSClusteringS2S 新闻标题聚类(10个集合)
RomaniBibleClustering 罗姆语圣经经节按书卷聚类
ArXivHierarchicalClusteringP2P ArXiv标题+摘要聚类(30个集合)
ArXivHierarchicalClusteringS2S ArXiv标题聚类(30个集合)
BigPatentClustering.v2 专利文档聚类(9个类别)
BiorxivClusteringP2P.v2 Biorxiv标题+摘要聚类(26个类别)
MedrxivClusteringP2P.v2 Medrxiv标题+摘要聚类(51个类别)
StackExchangeClustering.v2 Stack Exchange标题聚类(25个集合)
AlloProfClusteringS2S.v2 Allo Prof文档标题聚类(10个集合)
HALClusteringS2S.v2 HAL标题聚类
SIB200ClusteringS2S 205种语言的专题分类聚类(7个主题)
WikiClusteringP2P.v2 维基百科文章聚类(按顶级类别)
PlscClusteringP2P.v2 波兰科学文章按领域聚类
SwednClusteringP2P 瑞典新闻文章按类别聚类
CLSClusteringP2P.v2 CLS数据集标题+摘要聚类(13个集合)
检索(Retrieval) StackOverflowQA 从Stack Overflow检索相关问题与回答
TwitterHjerneRetrieval 丹麦语Twitter问题与答案检索
AILAStatutes 检索最相关法律条文
ArguAna 检索最佳反驳论点
HagridRetrieval 信息检索场景中的相关段落检索
LegalBenchCorporateLobbying 企业游说法案标题与摘要检索
LEMBPasskeyRetrieval LongEmbed的passkey子集检索
SCIDOCS 科学文档级别检索任务
SpartQA 推理问题答案检索
TempReasonL1 时间推理问题答案检索
TRECCOVID 新冠肺炎科学文献搜索
WinoGrande 常识推理问题答案检索
BelebeleRetrieval 122种语言变体的多项选择阅读理解检索
MLQARetrieval 7种语言的跨语言抽取式问答检索
StatcanDialogueDatasetRetrieval 通过对话检索数据表(英法双语)
WikipediaRetrievalMultilingual 多语言维基百科合成查询检索
CovidRetrieval 新冠肺炎新闻文章检索
Core17InstructionRetrieval Core17叙事检索指令遵循
News21InstructionRetrieval News21叙事检索指令遵循
Robust04InstructionRetrieval Robust04叙事检索指令遵循
搜集汇总
数据集介绍
mteb/MMTEB-Multilingual-v2 数据集图片
构建方式
MMTEB(Multilingual Text Embedding Benchmark,多语种文本嵌入基准)的第二次迭代版本,由社区精心策划贡献构建而成,覆盖超过250种语言。该数据集通过整合来自不同研究领域的多语种平行语料和标注数据,构建了一系列评估任务。其构建过程基于对现有高质量数据集的系统性收集与整理,例如BornholmBitextMining丹麦语方言平行语料、BibleNLPBitextMining多语种圣经对齐语料,以及FloresBitextMining低资源语言机器翻译基准等。每个任务均源自公开发表的学术成果,确保了数据来源的可靠性与标注质量。
特点
MMTEB-v2作为迄今为止规模最大的多语种文本嵌入评估基准,其显著特点在于语言覆盖的广度与任务的多样性。数据集囊括了从语义相似性、文本分类到聚类与检索等九大类评估任务,整合了如AfriSenti非洲语言情感分析、MasakhaNEWS非洲语言新闻分类,以及NusaX印度尼西亚地方语言情感分析等区域特色数据集。同时包含丹麦博恩霍尔姆方言、罗马尼亚卡尔德拉什罗姆语圣经文本等稀有语种资源,为跨语言嵌入模型的泛化能力提供了全面且极具挑战性的测试基准。
使用方法
MMTEB-v2设计为MTEB评估框架的标准组件,研究者可通过Python的mteb库直接调用该基准。使用时需先安装MTEB工具包,并通过指定任务列表或使用默认配置加载全部评估项。每个任务包含标准化的数据分割与评估指标,例如分类任务采用准确率、F1分数,聚类任务采用归一化互信息等。建议使用者参考官方文档,根据自身模型的特点选择适合的子任务集进行评测,尤其注意在评估前对多语种数据进行适当的预处理,以充分发挥模型在跨语言场景下的表现能力。
背景与挑战
背景概述
MMTEB-Multilingual-v2数据集是Massive Text Embedding Benchmark(MTEB)的大规模多语言扩展版本,由社区高度精选的贡献驱动,覆盖超过250种语言。该基准于近年来由多位研究人员和机构协作构建,旨在评估文本嵌入模型在多语言场景下的语义相似性、分类、聚类、检索等任务性能。其核心研究问题在于如何构建一个覆盖广泛语言、语言类型多样且任务全面的嵌入评估体系。作为MTEB生态的重要组成部分,MMTEB填补了多语言文本嵌入评估领域的空白,对推动跨语言自然语言处理研究具有显著影响,尤其为低资源语言模型的发展提供了关键评价依据。
当前挑战
MMTEB所应对的领域挑战在于现有文本嵌入基准多聚焦于英语,缺乏对多语言尤其是低资源语言覆盖的评估能力,这限制了跨语言文本表示模型的通用性与公平性评价。数据集构建过程中面临的挑战包括:收集和整理数百种语言的标注数据,确保语言类型多样性、任务覆盖全面性及数据质量一致性;协调社区贡献以维护基准的可持续性与权威性;处理不同语言间的语义对齐问题,如跨语言对偶文本挖掘中的对齐准确度。这些挑战不仅考验资源整合能力,更要求设计精细的评估协议以反映多语言嵌入的真实性能差异。
常用场景
经典使用场景
MMTEB-Multilingual-v2作为大规模多语言文本嵌入基准的迭代版本,其核心应用场景在于系统性地评估与比较不同语言模型在跨语言语义表示上的表现。该数据集覆盖250余种语言,囊括了从平行语料挖掘、文本分类到聚类与检索等多元任务,为研究者提供了统一且全面的评测平台。通过在诸如BibleNLP、Flores、Tatoeba等经典双语挖掘任务上衡量模型的对齐能力,同时借助AfriSenti、MasakhaNEWS等资源稀缺语言的情感与主题分类任务检验模型的多语言泛化性能,MMTEB成为探索现代嵌入模型在真实多语言世界中鲁棒性的基石工具。
解决学术问题
MMTEB-Multilingual-v2直面自然语言处理领域长期存在的语言偏差与资源不均衡问题。传统嵌入基准多以英语为中心,忽视了对低资源语言与方言的覆盖,导致模型在多语言场景下的真实能力被高估。该数据集通过囊括如Bornholmsk、Kalderash Romani等方言以及斯瓦希里语、祖鲁语等非洲语言,弥补了评测体系中的语种缺失。它解决了跨语言语义对齐的可量化难题,使得研究者能够在统一框架下诊断模型在双语挖掘、跨语言迁移学习中的瓶颈,推动了多语言NLP从英语主导走向真正的语言多样性,其意义在于为公平且可复现的模型对比设定了新标准。
衍生相关工作
MMTEB-Multilingual-v2的发布催生了一系列重要的衍生研究,深刻影响了嵌入模型的评估范式。其前身MTEB启发了诸如E5、BGE、GTR等顶尖嵌入模型的性能优化与发布,而本多语言版本则直接服务于大规模多语言模型如mE5、mBGE以及XLM-R等架构的微调与验证。众多工作利用该基准分析了跨语言对比学习策略的有效性,例如通过SimCSE和LaBSE的扩展版本在MMTEB上的表现来探索语言间负迁移的缓解方法。此外,该数据集也促进了面向低资源语言的主动学习与数据增强技术的进步,催生了如AfroLM、IndicBERT等区域专用模型的性能基准,成为多语言自然语言理解领域不可或缺的可靠性测试床。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务