遇见数据集

classla/COPA-SR_lat

收藏
Hugging Face2023-11-02 更新2024-03-04 收录
官方服务:

资源简介:

COPA-SR_lat数据集是英文COPA数据集的塞尔维亚语翻译版本,并转换为拉丁字母。该数据集包含1000个前提,每个前提都有一个问题和两个选择,以及一个标签指示哪个选择更合理。数据集分为训练、验证和测试三个部分,分别包含400、100和500个实例。数据集的翻译由ReLDI Centre Belgrade完成。

The COPA-SR_lat dataset is the Serbian translation of the English COPA dataset, converted to Latin script. This dataset contains 1000 premises, each paired with a question, two candidate options, and a label indicating which option is more plausible. The dataset is split into three subsets: training, validation, and test, which contain 400, 100, and 500 instances respectively. The translation of this dataset was completed by the ReLDI Centre Belgrade.

提供机构:
classla
原始信息汇总

COPA-SR_lat

数据集概述

COPA-SR数据集(塞尔维亚语中的合理替代选择)是根据XCOPA数据集翻译方法论英语COPA数据集翻译并转写为拉丁字母的版本。

数据内容

数据集包含1,000个前提(例如:“我的身体在草地上投下了影子”),每个前提都有一个问题(“原因是什么?”或“结果是什么?”),以及两个选项(例如:“太阳正在升起”;“草被割了”),并有一个标签指示哪个选项在给定注释者或翻译者的情况下更合理(例如:“太阳正在升起”)。

数据格式

数据集遵循与克罗地亚COPA-HR数据集马其顿COPA-MK数据集相同的格式。数据被分为训练(400个实例)、验证(100个实例)和测试(500个实例)的JSONL文件。

数据集分割

  • 训练集:400个实例
  • 验证集:100个实例
  • 测试集:500个实例

翻译机构

数据集的翻译工作由ReLDI Centre Belgrade完成。

作者信息

  • Ljubešić, Nikola
  • Starović, Mirjana
  • Kuzman, Taja
  • Samardžić, Tanja

引用信息

@misc{11356/1708, title = {Choice of plausible alternatives dataset in Serbian {COPA}-{SR}}, author = {Ljube{v s}i{c}, Nikola and Starovi{c}, Mirjana and Kuzman, Taja and Samard{v z}i{c}, Tanja}, url = {http://hdl.handle.net/11356/1708}, note = {Slovenian language resource repository {CLARIN}.{SI}}, copyright = {Creative Commons - Attribution-{ShareAlike} 4.0 International ({CC} {BY}-{SA} 4.0)}, issn = {2820-4042}, year = {2022} }

搜集汇总
数据集介绍
classla/COPA-SR_lat 数据集图片
构建方式
COPA-SR_lat数据集是塞尔维亚语中合理选项选择任务的基准资源,其构建基于对英文COPA数据集的翻译与转写。研究团队严格遵循XCOPA数据集的翻译方法论,首先将原始英文前提、问题及候选答案翻译为塞尔维亚语,随后将西里尔字母文本转写为拉丁字母形式,形成该拉丁版本。数据集包含1000个样本,每个样本由一条前提、一个因果方向问题及两个选项构成,由标注者或译者判定更合理的选项并赋予标签。数据按400、100、500的规模划分为训练、验证和测试集,以JSONL格式存储,确保与克罗地亚语COPA-HR及马其顿语COPA-MK数据集格式一致。
特点
该数据集的核心特点在于其跨语言因果推理评估能力,专为塞尔维亚语文本分类任务设计。通过将英文常识推理任务本地化,它填补了塞尔维亚语自然语言理解中因果选择任务的空白。数据集采用拉丁字母转写,便于与主流计算工具兼容,同时保留了原始语义的完整性。其样本规模虽小(不足1000条),但结构紧凑,每个实例均包含明确的因果逻辑关系,可用于训练和评估模型在有限资源下的推理性能。此外,数据集遵循CC-BY-SA-4.0许可,支持学术共享与复用。
使用方法
使用该数据集时,研究者可直接从HuggingFace平台加载预划分的JSONL文件,通过文本分类范式进行模型训练与评估。典型应用包括微调预训练语言模型(如BERTić或XLM-R)以完成因果选项选择任务。输入格式需将前提、问题和选项拼接为序列,标签为二进制指示合理选项。评估指标可选用准确率,因其测试集包含500个独立样本,能有效反映模型泛化能力。数据集支持直接通过HuggingFace Datasets库加载,并可与塞尔维亚语西里尔版本交叉验证,以分析文字系统对推理任务的影响。
背景与挑战
背景概述
在自然语言处理领域,因果推理与常识理解是评估语言模型能力的重要维度,而Choice of Plausible Alternatives(COPA)任务正是为此设计的经典基准。COPA-SR_lat数据集由贝尔格莱德ReLDI中心的研究团队于2022年创建,成员包括Ljubešić、Starović、Kuzman和Samardžić等学者。该数据集是英语COPA数据集在塞尔维亚语中的翻译版本,采用拉丁字母转写,遵循XCOPA翻译方法论,旨在为低资源语言提供因果推理评测资源。其核心研究问题在于检验模型能否基于前提句,从两个候选选项中选出更合理的因果或结果关系,对推动塞尔维亚语自然语言理解研究具有重要影响力,并与克罗地亚语COPA-HR、马其顿语COPA-MK数据集形成南斯拉夫语族评测体系。
当前挑战
该数据集所解决的领域挑战在于因果推理任务的复杂性,模型需理解隐含的常识关系而非简单模式匹配,这对语言模型的语义理解与逻辑推断能力提出严峻考验。构建过程中的挑战主要包括:翻译阶段需确保英语原意与塞尔维亚语表达的文化适配性,避免因果歧义;拉丁字母转写需统一规范,以兼容塞尔维亚语双字母系统;标注一致性难以保障,因为不同翻译者可能对“更合理”选项存在主观判断差异;此外,数据集规模较小(仅1000条样本),训练集仅400例,容易导致模型过拟合,难以泛化至真实场景中的多样化因果推理需求。
常用场景
经典使用场景
COPA-SR_lat数据集作为塞尔维亚语因果推理任务的基准语料,核心应用场景在于评估和训练自然语言处理模型对因果关系的理解能力。该数据集包含1000条前提句,每条伴随一个因果导向的问题(如“原因是什么?”或“结果是什么?”)以及两个候选选项,模型需从中选择更合理的因果解释。这一设计使得COPA-SR_lat成为检验语言模型在跨语言因果推理上泛化性能的重要工具,尤其适用于低资源语言场景下的常识推理研究。
衍生相关工作
COPA-SR_lat的衍生工作主要包括与克罗地亚语COPA-HR和北马其顿语COPA-MK数据集的联合分析,形成了南斯拉夫语系因果推理资源集群。研究者基于此数据集探索了跨语言迁移学习策略,如利用英语COPA预训练模型微调塞尔维亚语任务,并评估了多语言BERT类模型(如mBERT、XLM-R)在该基准上的表现。此外,该数据集催生了针对巴尔干语言区域的语言特异性因果推理机制研究,推动了低资源语言常识推理基准的标准化构建。
数据集最近研究
最新研究方向
COPA-SR_lat数据集作为塞尔维亚语因果推理基准的拉丁化版本,当前聚焦于低资源语言中常识因果关系的跨语言迁移学习与多模态理解前沿。在自然语言处理领域,该数据集紧随XCOPA翻译方法论,为巴尔干语系(塞尔维亚语、克罗地亚语、马其顿语)构建了统一的因果推理评测体系,尤其关注拉丁字母与西里尔字母双系统下的语义一致性挑战。近期研究将其应用于多语言预训练模型的零样本推理能力评估,例如在mT5、XLM-R等模型上验证因果选择任务的语言间泛化性能,并与COPA-HR、COPA-MK形成区域语料联盟,推动南斯拉夫语支的跨文化常识建模。该数据集对理解塞尔维亚语中语法性别与因果关系的交互作用具有独特价值,其拉丁化版本更便于非西里尔字母用户参与研究,为巴尔干地区人工智能伦理中的文化特异性推理提供了关键基准,相关成果已支撑CLARIN.SI平台的多语种因果推理资源建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务