遇见数据集

mteb/eurlex-multilingual

收藏
Hugging Face2025-05-04 更新2024-06-12 收录
官方服务:

资源简介:

这是一个多语言文本分类和主题分类数据集,由专家进行标注。数据集包含多种语言,包括保加利亚语、捷克语、丹麦语、德语、希腊语、英语、爱沙尼亚语、芬兰语、法语、克罗地亚语、匈牙利语、意大利语、拉脱维亚语、立陶宛语、马耳他语、荷兰语、波兰语、葡萄牙语、罗马尼亚语、斯洛伐克语、斯洛文尼亚语、西班牙语和瑞典语。每种语言都有自己的配置,具有相同的特征:id(字符串)、text(字符串)和label(类标签序列)。数据集分为训练集、测试集和验证集,每个集合的示例数量和文件大小都有指定。数据集遵循CC BY-SA 4.0许可证。

This is a multilingual dataset for text classification and topic classification tasks, annotated by experts. The dataset includes various languages such as Bulgarian, Czech, Danish, German, Greek, English, Estonian, Finnish, French, Croatian, Hungarian, Italian, Latvian, Lithuanian, Maltese, Dutch, Polish, Portuguese, Romanian, Slovak, Slovenian, Spanish, and Swedish. Each language has its own configuration with the same features: id (string), text (string), and label (sequence of class labels). The dataset is split into train, test, and validation sets, with specified number of examples and file sizes for each. The dataset is licensed under CC BY-SA 4.0.

提供机构:
mteb
原始信息汇总

数据集概述

数据集配置

  • config_name: bg, cs, da, de, el, en, es, et, fi, fr, hr, hu, it, lt, lv, mt, nl, pl, pt, ro, sk, sl
  • features:
    • id: string
    • text: string
    • label: sequence with class labels

数据集分割

  • splits:
    • train: 训练集,包含不同数量的字节和示例数
    • test: 测试集,包含不同数量的字节和示例数
    • validation: 验证集,包含不同数量的字节和示例数

数据集大小

  • download_size: 下载大小,不同配置下大小不同
  • dataset_size: 数据集总大小,不同配置下大小不同

数据集详细信息

配置 bg

  • features: id, text, label
  • splits:
    • train: 273160232 bytes, 15986 examples
    • test: 109874757 bytes, 5000 examples
    • validation: 76892269 bytes, 5000 examples
  • download_size: 164279141 bytes
  • dataset_size: 459927258 bytes

配置 cs

  • features: id, text, label
  • splits:
    • train: 189826374 bytes, 23187 examples
    • test: 60702802 bytes, 5000 examples
    • validation: 42764231 bytes, 5000 examples
  • download_size: 132410678 bytes
  • dataset_size: 293293407 bytes

配置 da

  • features: id, text, label
  • splits:
    • train: 395774705 bytes, 55000 examples
    • test: 60343684 bytes, 5000 examples
    • validation: 42366378 bytes, 5000 examples
  • download_size: 215873874 bytes
  • dataset_size: 498484767 bytes

配置 de

  • features: id, text, label
  • splits:
    • train: 425489833 bytes, 55000 examples
    • test: 65739062 bytes, 5000 examples
    • validation: 46079562 bytes, 5000 examples
  • download_size: 232088949 bytes
  • dataset_size: 537308457 bytes

配置 el

  • features: id, text, label
  • splits:
    • train: 768224671 bytes, 55000 examples
    • test: 117209300 bytes, 5000 examples
    • validation: 81923354 bytes, 5000 examples
  • download_size: 364222506 bytes
  • dataset_size: 967357325 bytes

配置 en

  • features: id, text, label
  • splits:
    • train: 389250111 bytes, 55000 examples
    • test: 58966951 bytes, 5000 examples
    • validation: 41516153 bytes, 5000 examples
  • download_size: 206929929 bytes
  • dataset_size: 489733215 bytes

配置 es

  • features: id, text, label
  • splits:
    • train: 433955311 bytes, 52785 examples
    • test: 66884992 bytes, 5000 examples
    • validation: 47178809 bytes, 5000 examples
  • download_size: 231655673 bytes
  • dataset_size: 548019112 bytes

配置 et

  • features: id, text, label
  • splits:
    • train: 173878667 bytes, 23126 examples
    • test: 56535275 bytes, 5000 examples
    • validation: 39580854 bytes, 5000 examples
  • download_size: 121905437 bytes
  • dataset_size: 269994796 bytes

配置 fi

  • features: id, text, label
  • splits:
    • train: 336145889 bytes, 42497 examples
    • test: 63280908 bytes, 5000 examples
    • validation: 44500028 bytes, 5000 examples
  • download_size: 195677552 bytes
  • dataset_size: 443926825 bytes

配置 fr

  • features: id, text, label
  • splits:
    • train: 442358833 bytes, 55000 examples
    • test: 68520115 bytes, 5000 examples
    • validation: 48408926 bytes, 5000 examples
  • download_size: 238411609 bytes
  • dataset_size: 559287874 bytes

配置 hr

  • features: id, text, label
  • splits:
    • train: 80808161 bytes, 7944 examples
    • test: 56790818 bytes, 5000 examples
    • validation: 23881820 bytes, 2500 examples
  • download_size: 75125597 bytes
  • dataset_size: 161480799 bytes

配置 hu

  • features: id, text, label
  • splits:
    • train: 208805826 bytes, 22664 examples
    • test: 68990654 bytes, 5000 examples
    • validation: 48101011 bytes, 5000 examples
  • download_size: 139218484 bytes
  • dataset_size: 325897491 bytes

配置 it

  • features: id, text, label
  • splits:
    • train: 429495741 bytes, 55000 examples
    • test: 64731758 bytes, 5000 examples
    • validation: 45886525 bytes, 5000 examples
  • download_size: 234660000 bytes
  • dataset_size: 540114024 bytes

配置 lt

  • features: id, text, label
  • splits:
    • train: 185211655 bytes, 23188 examples
    • test: 59484699 bytes, 5000 examples
    • validation: 41841012 bytes, 5000 examples
  • download_size: 129472683 bytes
  • dataset_size: 286537366 bytes

配置 lv

  • features: id, text, label
  • splits:
    • train: 186396216 bytes, 23208 examples
    • test: 59814081 bytes, 5000 examples
    • validation: 42002715 bytes, 5000 examples
  • download_size: 128328277 bytes
  • dataset_size: 288213012 bytes

配置 mt

  • features: id, text, label
  • splits:
    • train: 179866757 bytes, 17521 examples
    • test: 65831218 bytes, 5000 examples
    • validation: 46737902 bytes, 5000 examples
  • download_size: 124555157 bytes
  • dataset_size: 292435877 bytes

配置 nl

  • features: id, text, label
  • splits:
    • train: 430232711 bytes, 55000 examples
    • test: 64728022 bytes, 5000 examples
    • validation: 45452538 bytes, 5000 examples
  • download_size: 230198155 bytes
  • dataset_size: 540413271 bytes

配置 pl

  • features: id, text, label
  • splits:
    • train: 202211442 bytes, 23197 examples
    • test: 64654967 bytes, 5000 examples
    • validation: 45545505 bytes, 5000 examples
  • download_size: 139057595 bytes
  • dataset_size: 312411914 bytes

配置 pt

  • features: id, text, label
  • splits:
    • train: 419281855 bytes, 52370 examples
    • test: 64771235 bytes, 5000 examples
    • validation: 45897219 bytes, 5000 examples
  • download_size: 227523733 bytes
  • dataset_size: 529950309 bytes

配置 ro

  • features: id, text, label
  • splits:
    • train: 164966652 bytes, 15921 examples
    • test: 67248460 bytes, 5000 examples
    • validation: 46968058 bytes, 5000 examples
  • download_size: 118725499 bytes
  • dataset_size: 279183170 bytes

配置 sk

  • features: id, text, label
  • splits:
    • train: 188126733 bytes, 22971 examples
    • test: 60922674 bytes, 5000 examples
    • validation: 42786781 bytes, 5000 examples
  • download_size: 134874710 bytes
  • dataset_size: 291836188 bytes

配置 sl

  • features: id, text, label
  • splits:
    • train: 数据未提供
    • test: 数据未提供
    • validation: 数据未提供
  • download_size: 数据未提供
  • dataset_size: 数据未提供
搜集汇总
数据集介绍
mteb/eurlex-multilingual 数据集图片
构建方式
在法律文本分析与多语言自然语言处理领域,mteb/eurlex-multilingual数据集应运而生,旨在为跨语言法律文档分类提供标准化基准。该数据集源自欧洲联盟官方法律数据库EUR-Lex,由领域专家对法律条目进行精细标注,赋予每条文本一个或多个主题类别标签,形成多标签分类任务。其构建过程覆盖了24种欧洲官方语言,包括保加利亚语、捷克语、丹麦语、德语、希腊语、英语等,每种语言独立配置,确保语言特性得以保留。数据划分为训练、验证和测试三个子集,其中多数语言配置包含5万条训练样本、5千条验证样本和5千条测试样本,部分小语种样本量略有缩减,但整体规模均衡,为多语言模型评估提供了坚实基础。
特点
该数据集的核心特点在于其广泛的多语言覆盖与专家级标注质量。涵盖24种欧洲语言,从英语、德语等大语种到马耳他语、拉脱维亚语等低资源语言,为研究跨语言迁移学习和低资源场景下的模型性能提供了宝贵资源。所有文本均经过专家手工标注,标签体系统一,包含21个法律主题类别,确保跨语言标签一致性。多标签分类的设定使每条文本可关联多个主题,真实反映了法律文档的复杂语义结构。此外,数据集采用CC-BY-SA-4.0许可协议,开放共享,促进学术研究与工业应用的可持续发展。
使用方法
使用mteb/eurlex-multilingual数据集时,研究者可通过HuggingFace Datasets库便捷加载,指定语言配置名称(如'en'、'de')获取对应子集。数据以标准格式提供,包含唯一标识符、文本内容及整数编码的标签序列,适用于多标签文本分类任务。典型应用流程包括:加载数据后,对文本进行预处理与分词,构建分类模型(如基于Transformer的架构),利用训练集进行模型优化,通过验证集调整超参数,最终在测试集上评估宏平均F1分数等指标。该数据集亦支持跨语言实验,如使用英语数据训练模型,直接评估其在其他语言上的零样本迁移能力,为法律智能检索与自动化文书处理提供实验平台。
背景与挑战
背景概述
在自然语言处理与法律人工智能交叉领域,多语言法律文本分类任务长期受限于标注资源的匮乏与语言覆盖的碎片化。mteb/eurlex-multilingual数据集应运而生,由欧洲多国法律专家联合标注,依托欧盟法律体系中的EUR-Lex数据库,覆盖保加利亚语、捷克语、丹麦语、德语等23种欧盟官方语言,旨在推动跨语言法律文档的多标签主题分类研究。该数据集创建于大规模预训练语言模型蓬勃发展的时期,其核心研究问题在于如何利用统一的多标签分类框架,实现对不同语种法律文本中21个细粒度主题类别的精准识别,为跨国法律检索、法规对齐与司法智能辅助提供基准资源。凭借其专家标注的权威性、多语言均衡的语料分布以及标准化的评估协议(包含训练、验证与测试集),eurlex-multilingual已成为评估多语言法律文本理解模型性能的关键标杆,显著促进了法律NLP领域从单语向多语范式的跨越。
当前挑战
该数据集所面临的挑战首先体现在法律领域文本分类本身的复杂性上:法律条文具有高度结构化的句法特征、专业术语密集以及跨条款的语义关联性,使得21个主题标签之间常存在重叠与层级依赖,对多标签分类模型捕捉细粒度语义边界的能力提出严苛要求。在构建过程中,挑战尤为突出:其一,需确保23种语言的法律文本在主题标注体系上严格对齐,但不同语言版本的法律表述存在句式差异与术语不对称,专家标注需反复校准以维持标签一致性;其二,语料规模因语言而异,例如克罗地亚语训练集仅含7944条样本,而丹麦语、德语等语言则拥有55000条,这种不平衡分布加剧了低资源语言上的过拟合风险;其三,法律文本的版权保护与隐私敏感性限制了公开数据的采集范围,部分语种的原始文档需经脱敏处理后方可纳入数据集。这些挑战共同构成了多语言法律NLP研究的核心瓶颈。
常用场景
经典使用场景
Eurolex多语言法律文本分类数据集由专家标注,覆盖欧盟24种官方语言,聚焦于法律文书的多标签主题分类任务。其经典使用场景在于训练和评估跨语言文本分类模型,尤其是在低资源语言场景下,研究者可借助该数据集探索多语言预训练模型(如XLM-R、mBERT)的迁移学习能力,从而实现对欧洲法律体系下繁杂文档的自动化归类与检索。
衍生相关工作
该数据集衍生了一系列经典工作,包括XLM-R在24种语言上的多标签分类基线实验、Legal-BERT等法律领域预训练模型的跨语言版本微调,以及基于对比学习的跨语言语义匹配研究。此外,它还被用于构建多语言法律信息检索系统,推动了EuroVoc主题词表自动标注技术的迭代与评估。
数据集最近研究
最新研究方向
在跨语言法律文本分类的前沿探索中,mteb/eurlex-multilingual数据集凭借其覆盖24种欧盟官方语言的专家标注特性,已成为评估多语言语义理解模型的核心基准。当前研究热点聚焦于利用该数据集推动零样本跨语言迁移学习,尤其是在低资源语言(如马耳他语、拉脱维亚语)上验证预训练语言模型(如mBERT、XLM-R)的泛化能力。伴随欧盟《人工智能法案》等监管框架的推进,该数据集在司法文档自动归类、法律合规审查等场景中意义凸显,为构建公平、可解释的多语言法律AI系统提供了关键支撑,促进了多语言自然语言处理技术从学术研究向实际法律应用的跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务