MTEB-BR (Massive Text Embedding Benchmark for Brazilian Portuguese)
收藏资源简介:
MTEB-BR是一个针对巴西葡萄牙语的大规模文本嵌入基准数据集,包含22个来自本地葡萄牙语源的任务(无机器翻译),涵盖分类、多标签分类、配对分类、语义文本相似性、聚类、检索和重排序等7种任务类型,评估了93个模型(73个开源权重和20个商业API模型),覆盖仇恨言论、毒性、事实核查、法律、医疗、金融、科学、百科全书和编程文本等多个领域。
MTEB-BR is a large-scale text embedding benchmark dataset tailored for Brazilian Portuguese. It contains 22 tasks exclusively sourced from local Brazilian Portuguese language resources, with no machine-translated content involved. Covering seven task types including classification, multi-label classification, pairwise classification, semantic textual similarity, clustering, retrieval, and re-ranking, this benchmark evaluates 93 models in total: 73 open-source weight-based models and 20 commercial API-based models. The dataset spans multiple domains such as hate speech, toxicity, fact-checking, legal, medical, financial, scientific, encyclopedic, and programming texts.
MTEB-BR 数据集概述
基本信息
- 名称: MTEB-BR (Massive Text Embedding Benchmark for Brazilian Portuguese)
- 用途: 评估文本嵌入模型在原生巴西葡萄牙语上的表现
- 开发语言: Python
- 许可证: 代码为 Apache-2.0,结果为 CC-BY-4.0,各任务数据集遵循各自原始许可证
- DOI: 10.5281/zenodo.21087217
- 在线排行榜: Hugging Face Leaderboard
数据集构成
任务规模
- 22 个任务,全部来自原生巴西葡萄牙语来源(无机器翻译)
- 7 种 MTEB 任务类型: 分类、多标签分类、句子对分类、语义文本相似度、聚类、检索、重排序
- 93 个模型已评估(73 个开源模型 + 20 个商业 API 模型)
领域覆盖
涵盖仇恨言论、毒性、事实核查、法律、医学、金融、科学、百科全书和编程文本等多个领域。
任务列表(22 个)
分类任务
| 任务 | 类型 | 数据来源 |
|---|---|---|
| HateBR | 分类 | Vargas et al. 2022 — 仇恨言论 |
| ToxSynPT | 分类 | AKCIT — 毒性(葡萄牙语合成) |
| FactckBrClassification | 分类 | FACTCK.BR 事实核查声明 |
| PortuLexRRIP | 分类 | PortuLex — 法律修辞角色识别(8 类) |
多标签分类任务
| 任务 | 数据来源 |
|---|---|
| BrighterEmotionMultilabelClassification | BRIGHTER — 多情感分类 |
句子对分类任务
| 任务 | 数据来源 |
|---|---|
| AssinRTE | Real et al. 2020 — 自然语言推理 |
| InferBR | Rodrigues et al. 2024 — 自然语言推理 |
语义文本相似度任务
| 任务 | 数据来源 |
|---|---|
| AssinSTS | Real et al. 2020 |
| Assin2STS | ASSIN 2 (NILC) — 上游 mteb |
聚类任务
| 任务 | 数据来源 |
|---|---|
| WikipediaPTCategoriesClusteringP2P | 维基百科派生的分类 |
| MedPTClustering | AKCIT — 医学领域 |
| JurisTCUClusteringP2P | TCU 裁决 |
| SciELOClusteringP2P | SciELO 摘要 |
| StackoverflowPtClustering | Stack Overflow em Português (CC-BY-SA) |
检索任务
| 任务 | 数据来源 |
|---|---|
| Quati | Bueno et al. 2024 — 50K 子样本 |
| JurisTCU | Ribeiro et al. — TCU 裁决 |
| BRTaxQAR | UNICAMP-DL — 税法问答 |
| FaQuADIR | Sayama et al. 2019 — 高等教育 FAQ |
| MedPTRetrieval | AKCIT — 医学领域 |
| FaqBacenRetrieval | 巴西中央银行 FAQ |
重排序任务
| 任务 | 数据来源 |
|---|---|
| QuatiReranking | Bueno et al. 2024 — BM25 困难负样本 |
| JurisTCUReranking | TCU 裁决 — BM25 困难负样本 |
使用方法
安装
bash pip install git+https://github.com/tardellirs/mteb-br.git
评估单个模型
python import mteb_pt.register import mteb
model = mteb.get_model("intfloat/multilingual-e5-large-instruct") task = mteb.get_task("HateBR") mteb.evaluate(model, tasks=[task])
运行完整 22 任务套件
bash python scripts/run_mteb_por_v2.py intfloat/multilingual-e5-large-instruct
支持断点续跑,兼容抢占式/块存储环境。
模型提交
- 通过 Hugging Face Leaderboard 讨论区提交
- 或通过 GitHub Issue 使用模型提交模板
- 需要提供:model_id、22 个任务的 JSON 结果文件、可复现的评估命令
- 接受闭源 API 模型
新任务提议
候选任务需满足:
- 数据来源于原生巴西葡萄牙语(非机器翻译)
- 具有清晰、宽松的许可协议
- 能够区分不同嵌入模型的性能差异
维护者
Tardelli Stekel — IFSP, São Paulo, Brazil 邮箱: stekel@ifsp.edu.br
引用
bibtex @misc{mteb-br-2026, title = {MTEB-BR: A Text Embedding Benchmark for Brazilian Portuguese}, author = {Stekel, Tardelli R. C.}, year = {2026}, doi = {10.5281/zenodo.21087217}, url = {https://doi.org/10.5281/zenodo.21087217} }



