遇见数据集

mteb/MultiEupSlovakGenderClassification

收藏
Hugging Face2026-06-18 更新2026-06-21 收录
官方服务:

资源简介:

MultiEupSlovakGenderClassification是一个用于文本分类的数据集,属于MTEB(大规模文本嵌入基准)的一部分。该数据集专注于二元分类任务,旨在根据欧洲议会议员在Multi-EuP v2语料库中的斯洛伐克语原生演讲,预测议员的性别。数据仅包含最初以斯洛伐克语发表的演讲,涉及政府和口语领域。数据集包含训练集(508个样本)和测试集(128个样本),每个样本包括文本和标签(0或1,代表不同性别)。标签分布显示训练集中标签1有435个样本,标签0有73个样本;测试集中标签1有109个样本,标签0有19个样本。文本长度平均约1017个字符(训练集)和1107个字符(测试集)。该数据集基于源数据集unimelb-nlp/MultiEup-v2派生而来,适用于评估嵌入模型在斯洛伐克语性别分类任务上的性能。

MultiEupSlovakGenderClassification is a dataset for text classification, part of the MTEB (Massive Text Embedding Benchmark). It focuses on a binary classification task to predict the gender of Members of the European Parliament from native Slovak speeches in the Multi-EuP v2 corpus. The data includes only speeches originally delivered in Slovak, covering government and spoken domains. The dataset consists of a training set (508 examples) and a test set (128 examples), each with text and label (0 or 1, representing different genders). Label distribution shows 435 samples with label 1 and 73 with label 0 in the training set, and 109 with label 1 and 19 with label 0 in the test set. Average text length is approximately 1017 characters for training and 1107 for test. Derived from the source dataset unimelb-nlp/MultiEup-v2, it is designed for evaluating embedding models on Slovak gender classification tasks.

提供机构:
mteb
搜集汇总
数据集介绍
mteb/MultiEupSlovakGenderClassification 数据集图片
构建方式
MultiEupSlovakGenderClassification数据集源自Multi-EuP v2语料库,专注于斯洛伐克语演讲文本。构建过程中,研究者从欧洲议会成员的斯洛伐克语母语发言中提取数据,仅保留原始斯洛伐克语内容,并通过人工标注的方式为每段文本赋予性别标签,形成一个二分类任务。数据集划分为训练集与测试集,分别包含508和128个样本,确保了模型评估的可靠性。
特点
该数据集作为MTEB(大规模文本嵌入基准)的一部分,具有鲜明的领域特色,聚焦于政府与口语场景。其文本长度分布广泛,平均长度约为1017个字符,为嵌入模型提供了丰富的语义信息。标签分布存在一定不平衡(男性样本居多),但这一特性恰好模拟了现实场景中的性别偏差,增强了数据集的实用价值。
使用方法
用户可通过MTEB框架无缝调用该数据集。只需加载'MultiEupSlovakGenderClassification'任务,并配合预训练的嵌入模型,即可执行评估。具体而言,使用mteb库中的get_task与get_model函数,结合evaluate方法,能轻松完成性别分类任务的测试。这一流程简化了基准测试,便于研究者聚焦于模型性能的优化。
背景与挑战
背景概述
MultiEupSlovakGenderClassification数据集由墨尔本大学的研究人员于2024年创建,旨在利用斯洛伐克语演讲文本预测欧洲议会议员的性别。该数据集归属于大规模文本嵌入基准(MTEB)框架,源自Multi-EuP v2语料库,专注于斯洛伐克母语发言内容。核心研究问题在于探索多语言文本表示模型在性别分类任务上的表现,尤其针对资源较少的斯拉夫语言。该数据集的出现填补了斯洛伐克语在文本分类基准中的空白,为评估多语言嵌入模型在特定语言任务上的泛化能力提供了重要参考。通过将政治演讲与性别标签关联,它推动了自然语言处理技术在社会科学研究中的应用。作为MTEB的一部分,该数据集对低资源语言文本分类基准的发展具有里程碑式意义,助力全球多语言理解系统的进步。
当前挑战
该数据集面临的挑战首先体现在领域问题上:斯洛伐克语属于低资源语言,现有预训练模型对其语法和语义表征能力有限,性别分类任务易受语言歧义和语料不平衡影响。数据集中训练样本仅508个,测试样本128个,且标签分布严重失衡(女性样本远少于男性),导致模型难以学习鲁棒的性别特征。其次,构建过程中的挑战源于源语料Multi-EuP v2的筛选与标注:需从欧盟议会多语言演讲话语中精确提取唯一斯洛伐克语片段,并确保演讲者性别信息的准确性。此外,数据量小增加了过拟合风险,使得模型在跨领域或跨语言场景下的泛化能力受限。这些挑战共同凸显了低资源语言性别分类任务在数据稀缺与语料平衡方面的研究瓶颈。
常用场景
经典使用场景
MultiEupSlovakGenderClassification数据集专注于从斯洛伐克语演讲文本中预测欧洲议会议员的性别,是一项经典的文本二分类任务。它基于Multi-EuP v2语料库,仅使用以斯洛伐克语为母语的发言内容,为低资源语言中的性别归属研究提供了精细化的测试平台。在自然语言处理领域,该数据集常被用于评估文本嵌入模型在跨语言和跨文化背景下的性别分类能力,尤其关注语言特征如何编码社会性别信息。研究人员通过此数据集探索基于语音内容的性别推断,验证模型在特定语言族群中的泛化性能,进而推动多语言表征学习与公平性分析的发展。
衍生相关工作
该数据集衍生了多项重要的学术工作,其中最经典的研究发表于第四届多语言表征学习研讨会(MRL 2024),论文深入探讨了多语言信息检索中的语言偏差问题及其缓解策略。作为MTEB(大规模文本嵌入基准测试)的重要组成部分,该数据集被整合进MMTEB(大规模多语言文本嵌入基准测试)框架中,用于系统评估文本嵌入模型在多语言环境下的鲁棒性。相关工作已发表于arXiv(2502.13595),进一步拓展了多语言表征学习的评估维度。此外,数据集的设计理念启发了对其他低资源语言性别分类任务的探索,促进了跨语言公平性研究范式的发展,并为后续构建多语言、多领域的细粒度分类基准提供了实践范例。
数据集最近研究
最新研究方向
在自然语言处理与社会计算交叉的前沿领域,该数据集聚焦于基于多语言文本嵌入的性别预测任务,其核心应用场景在于从斯洛伐克语议会演讲中推断欧洲议会议员的性别身份。这一研究方向与近年来备受瞩目的大型文本嵌入基准(MTEB)及其多语言扩展(MMTEB)紧密交织,为评估多语言嵌入模型在低资源语言上的公平性与效能提供了关键试金石。随着学术界对信息检索中语言偏见的持续关注,MultiEupSlovakGenderClassification通过构建小样本、类别不平衡的二元分类任务,揭示了当前模型在捕捉斯拉夫语系形态特征时的潜在缺陷,进而推动了更具包容性的多语言表征学习方法的迭代升级。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务