mteb/MMTEB-Multilingual-v2
收藏资源简介:
MTEB (Multilingual, v2) 是一个大规模多语言文本嵌入基准测试,被称为MMTEB。它主要由社区贡献驱动,覆盖了250多种语言,旨在评估多语言文本嵌入模型的性能。该基准测试包含多种任务,如语义相似性、分类、聚类和检索,涵盖了从新闻、社交媒体到法律文档等多个领域的多语言数据。
MTEB (Multilingual, v2), also referred to as MMTEB, is a large-scale multilingual text embedding benchmark. It is primarily driven by community contributions, covers over 250 languages, and aims to evaluate the performance of multilingual text embedding models. This benchmark includes a diverse set of tasks such as semantic similarity, classification, clustering and retrieval, and encompasses multilingual datasets spanning multiple domains ranging from news, social media to legal documents.
数据集概述:MMTEB-Multilingual-v2
数据集名称:MMTEB-Multilingual-v2
所属组织:mteb
引用量:1
简介:MTEB(Massive Text Embedding Benchmark)的大规模多语言扩展版本,称为MMTEB,主要由高度精选的社区贡献驱动,覆盖250多种语言。
任务列表
该基准测试包含以下任务,按类型分类:
| 任务类型 | 任务名称 | 描述 |
|---|---|---|
| 语义相似度(BitextMining) | BornholmBitextMining | 丹麦语-博恩霍尔姆语并行语料库 |
| BibleNLPBitextMining | 829种语言的圣经部分翻译,按经节对齐 | |
| BUCC.v2 | BUCC双文本挖掘数据集(仅黄金集) | |
| DiaBlaBitextMining | 英语-法语非正式书面对话平行语料库 | |
| FloresBitextMining | 英语与低资源语言间的机器翻译基准 | |
| IN22GenBitextMining | 英语和22种印度语言的多领域通用并行基准 | |
| IndicGenBenchFloresBitextMining | Flores数据集扩展到印度语言 | |
| NollySentiBitextMining | 尼日利亚五种语言的电影评论 | |
| NorwegianCourtsBitextMining | 挪威法院的尼诺斯克语和博克马尔语平行语料库 | |
| NTREXBitextMining | 英语到128种语言的新闻翻译测试参考 | |
| NusaTranslationBitextMining | 11种印尼语言与英语的平行数据集 | |
| NusaXBitextMining | 12种语言的平行语料库(含10种印尼本地语言) | |
| Tatoeba | 每种语言1000个英语对齐句子对 | |
| 分类(Classification) | BulgarianStoreReviewSentimentClassfication | 保加利亚在线商店评论情感分类 |
| CzechProductReviewSentimentClassification | 捷克电商评论情感分类(3类) | |
| GreekLegalCodeClassification | 希腊法律代码分类 | |
| DBpediaClassification | 维基百科文章分类(14类) | |
| FinancialPhrasebankClassification | 金融新闻情感极性分类 | |
| PoemSentimentClassification | 诗句情感分类 | |
| ToxicConversationsClassification | 评论毒性检测 | |
| TweetTopicSingleClassification | Twitter话题分类(6个标签) | |
| EstonianValenceClassification | 爱沙尼亚新闻情感注释 | |
| FilipinoShopeeReviewsClassification | 菲律宾Shopee评论评分分类 | |
| GujaratiNewsClassification | 古吉拉特语新闻3类分类 | |
| SentimentAnalysisHindi | 印地语情感分析 | |
| IndonesianIdClickbaitClassification | 印尼新闻标题点击诱饵检测 | |
| ItaCaseholdClassification | 意大利司法判决分类(64个主题) | |
| KorSarcasmClassification | 韩语讽刺检测 | |
| KurdishSentimentClassification | 库尔德语情感数据集 | |
| MacedonianTweetSentimentClassification | 马其顿语推文情感分类 | |
| AfriSentiClassification | 非洲语言情感分析 | |
| AmazonCounterfactualClassification | 亚马逊评论反事实检测 | |
| CataloniaTweetClassification | 西班牙加泰罗尼亚独立立场检测 | |
| CyrillicTurkicLangClassification | 西里尔字母的8种突厥语言分类 | |
| IndicLangClassification | 22种印度语言识别测试集 | |
| MasakhaNEWSClassification | 16种非洲语言新闻主题分类 | |
| MassiveIntentClassification | 51种语言的NLU意图分类 | |
| MultiHateClassification | 11种语言的仇恨言论检测 | |
| NordicLangClassification | 北欧语言识别数据集 | |
| NusaParagraphEmotionClassification | 10种印尼语言的多类情感分类 | |
| NusaX-senti | 12种语言的情感分析(3类) | |
| ScalaClassification | 斯堪的纳维亚语言可接受性判断 | |
| SwissJudgementClassification | 瑞士联邦法院判决结果二分类 | |
| NepaliNewsClassification | 尼泊尔语新闻文章分类 | |
| OdiaNewsClassification | 奥里亚语新闻3类分类 | |
| PunjabiNewsClassification | 旁遮普语新闻2类分类 | |
| PolEmo2.0-OUT | 波兰语领域外评论情感预测 | |
| PAC | 波兰语释义语料库 | |
| SinhalaNewsClassification | 僧伽罗语新闻5类分类 | |
| CSFDSKMovieReviewSentimentClassification | 斯洛伐克语电影评论情感分类 | |
| SiswatiNewsClassification | 斯瓦蒂语新闻分类 | |
| SlovakMovieReviewSentimentClassification | 斯洛伐克电影评论情感分类(2类) | |
| SwahiliNewsClassification | 斯瓦希里语新闻6类分类 | |
| DalajClassification | 瑞典语语言可接受性判断 | |
| TswanaNewsClassification | 茨瓦纳语新闻分类 | |
| IsiZuluNewsClassification | 祖鲁语新闻分类 | |
| KorHateSpeechMLClassification | 韩语多标签仇恨言论分类(8类+非仇恨) | |
| MalteseNewsClassification | 马耳他语新闻多标签主题分类 | |
| MultiEURLEXMultilabelClassification | 23种欧盟语言的EUROVOC概念标注 | |
| BrazilianToxicTweetsClassification | 巴西葡萄牙语毒性推文分类(6类) | |
| CEDRClassification | 情绪分类(5类:喜悦、悲伤等) | |
| 聚类(Clustering) | WikiCitiesClustering | 按国家聚类维基百科城市文章(126国,3531城市) |
| MasakhaNEWSClusteringS2S | 新闻标题聚类(10个集合) | |
| RomaniBibleClustering | 罗姆语圣经经节按书卷聚类 | |
| ArXivHierarchicalClusteringP2P | ArXiv标题+摘要聚类(30个集合) | |
| ArXivHierarchicalClusteringS2S | ArXiv标题聚类(30个集合) | |
| BigPatentClustering.v2 | 专利文档聚类(9个类别) | |
| BiorxivClusteringP2P.v2 | Biorxiv标题+摘要聚类(26个类别) | |
| MedrxivClusteringP2P.v2 | Medrxiv标题+摘要聚类(51个类别) | |
| StackExchangeClustering.v2 | Stack Exchange标题聚类(25个集合) | |
| AlloProfClusteringS2S.v2 | Allo Prof文档标题聚类(10个集合) | |
| HALClusteringS2S.v2 | HAL标题聚类 | |
| SIB200ClusteringS2S | 205种语言的专题分类聚类(7个主题) | |
| WikiClusteringP2P.v2 | 维基百科文章聚类(按顶级类别) | |
| PlscClusteringP2P.v2 | 波兰科学文章按领域聚类 | |
| SwednClusteringP2P | 瑞典新闻文章按类别聚类 | |
| CLSClusteringP2P.v2 | CLS数据集标题+摘要聚类(13个集合) | |
| 检索(Retrieval) | StackOverflowQA | 从Stack Overflow检索相关问题与回答 |
| TwitterHjerneRetrieval | 丹麦语Twitter问题与答案检索 | |
| AILAStatutes | 检索最相关法律条文 | |
| ArguAna | 检索最佳反驳论点 | |
| HagridRetrieval | 信息检索场景中的相关段落检索 | |
| LegalBenchCorporateLobbying | 企业游说法案标题与摘要检索 | |
| LEMBPasskeyRetrieval | LongEmbed的passkey子集检索 | |
| SCIDOCS | 科学文档级别检索任务 | |
| SpartQA | 推理问题答案检索 | |
| TempReasonL1 | 时间推理问题答案检索 | |
| TRECCOVID | 新冠肺炎科学文献搜索 | |
| WinoGrande | 常识推理问题答案检索 | |
| BelebeleRetrieval | 122种语言变体的多项选择阅读理解检索 | |
| MLQARetrieval | 7种语言的跨语言抽取式问答检索 | |
| StatcanDialogueDatasetRetrieval | 通过对话检索数据表(英法双语) | |
| WikipediaRetrievalMultilingual | 多语言维基百科合成查询检索 | |
| CovidRetrieval | 新冠肺炎新闻文章检索 | |
| Core17InstructionRetrieval | Core17叙事检索指令遵循 | |
| News21InstructionRetrieval | News21叙事检索指令遵循 | |
| Robust04InstructionRetrieval | Robust04叙事检索指令遵循 |




