遇见数据集

mteb/MultiEupSlovakPartyClassification

收藏
Hugging Face2026-06-18 更新2026-06-21 收录
官方服务:

资源简介:

该数据集是一个多类文本分类任务,旨在基于Multi-EuP v2语料库中斯洛伐克语原声演讲,预测欧洲议会的政治团体。它仅使用最初以斯洛伐克语发表的演讲,属于政府和政治领域,涉及口语文本。数据集包含训练集(502个样本)和测试集(126个样本),总样本数为628个,每个样本包括文本和标签(整数类型),标签对应5个独特的类别(政治团体)。数据集来源于unimelb-nlp/MultiEup-v2,并作为MTEB(大规模文本嵌入基准)的一部分,用于评估嵌入模型在斯洛伐克语文本分类任务上的性能。

Multi-class classification task to predict the European Parliament political group from native Slovak speeches in the Multi-EuP v2 corpus. Uses only speeches originally delivered in Slovak.

提供机构:
mteb
搜集汇总
数据集介绍
mteb/MultiEupSlovakPartyClassification 数据集图片
构建方式
MultiEupSlovakPartyClassification数据集源自Multi-EuP v2语料库,专注于斯洛伐克语的原生演讲文本。其构建过程首先从该多语料库中筛选出所有原始语种为斯洛伐克语的发言,再以欧洲议会的政治党团类别作为多分类标签。数据被划分为训练集(502条)和测试集(126条),每个样本均包含单一标签,确保分类任务的纯净性。该数据集是MTEB基准套件的一部分,旨在评估文本嵌入模型在特定语言上的党派分类能力。
特点
该数据集的核心特点在于其语言与领域的专一性:所有文本均出自斯洛伐克语母语者的演讲,覆盖政府与口语两大领域,真实反映了政治语境下的语言使用。类别分布虽不均衡(如“2”类占比最高),但5个标签完整映射了欧洲议会的主要政治党团。文本长度差异显著(最短176字符,最长3306字符),平均约1115字符,这种多样性可有效检验模型对长文本语义的抽取与泛化能力。
使用方法
使用该数据集时,推荐通过MTEB框架一键调用。用户只需导入mteb库,利用get_task函数加载任务实例,再结合自定义的嵌入模型执行评估。代码简洁高效,支持自动拆分数据并计算分类指标。对于进阶研究,可在HuggingFace上直接下载原始train与test文件,结合自身流程进行模型训练或微调,尤其适合探索低资源语言的政治文本分类场景。
背景与挑战
背景概述
多语言文本嵌入基准(MTEB)的持续扩展催生了一系列面向低资源语言与特定领域的评估数据集。在此背景下,由墨尔本大学Jinrui Yang等人于2024年构建的MultiEupSlovakPartyClassification数据集应运而生,旨在填补斯洛伐克语政治话语中文本分类任务的评估空白。该数据集源自Multi-EuP v2语料库,筛选出斯洛伐克语原声演讲,并标注为欧洲议会的五个政治团体类别,共计628个样本。作为MTEB框架下的斯洛伐克语首个政党分类基准,它为评测多语言嵌入模型在政府与口语领域、低资源语言上的表现提供了关键参考,推动了自然语言处理在政治文本分析中的发展。
当前挑战
该数据集首先面临领域层面的核心挑战:斯洛伐克语作为低资源语言,政治演讲文本具有高度专业性与隐含意识形态特征,传统分类模型常因语言稀缺与语义复杂性而性能不佳,亟需鲁棒的深层语义表示方法。其次,构建过程中遭遇显著困难:原始Multi-EuP v2语料仅包含源语言标识,需人工精准筛选斯洛伐克语片段并确保类别平衡,而政治团体标签的多样性(五类)与数据规模有限(训练集502例)进一步加剧了类别不均衡问题,对评估结果的泛化性与可靠性构成了严峻考验。
常用场景
经典使用场景
在自然语言处理与政治文本分析的交汇领域,MultiEupSlovakPartyClassification数据集为研究者提供了一个独特的基准测试平台。该数据集从Multi-EuP v2语料库中精选出以斯洛伐克语原创的欧洲议会演讲,并要求模型根据演讲内容预测演讲者所属的欧洲议会政治党团。这一多类文本分类任务将斯洛伐克语这一低资源语言置于政治话语分析的核心,推动了多语言嵌入模型在处理非英语、非高资源语言政治文本时的能力边界。
衍生相关工作
该数据集作为MTEB(大规模文本嵌入基准)的组件,催生了一系列聚焦多语言嵌入评估与改进的经典研究。例如,Yang等人(2024)在MRL会议上基于此数据集揭示了多语言检索任务中的语言偏倚本质,并提出缓解方法;MMTEB(2025)则进一步将斯洛伐克语政治分类纳入更大规模的多语言评测体系,通过跨语种对比验证了嵌入模型在小语种场景下的泛化局限。这些工作共同构建了从基准构建、偏倚分析到模型优化的完整学术链条。
数据集最近研究
最新研究方向
当前,多语言文本嵌入基准测试(MTEB)已成为评估多语言自然语言处理模型核心能力的标杆平台。在此背景下,MultiEupSlovakPartyClassification数据集聚焦于源自本土斯洛伐克语的欧洲议会演讲文本,通过多类别分类任务将发言映射至欧洲议会政治党团,揭示了语言多样性在政治话语分析中的关键作用。该数据集的前沿研究深度契合了多语言信息检索领域对语言偏误本质的拷问——Yang等人(2024)正是利用此类资源剖析了多语言检索中源语言对目标语言性能的系统性偏差,并提出了针对性缓解策略。同时,随着MMTEB大规模多语言文本嵌入基准的发布,该数据集被纳入其中,不仅推动了涵盖更多低资源语言的嵌入评估体系建设,也为政治学中的跨语言意识形态自动识别、政党话语聚类等热点议题提供了坚实的数据基石,其影响力正从计算语言学辐射至比较政治研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务