遇见数据集

DravidianCodeMix

收藏
arXiv2021-06-17 更新2024-06-21 收录
官方服务:

资源简介:

DravidianCodeMix是一个多语言数据集,由Insight SFI研究中心开发,专注于达罗毗荼语系中的三种语言(泰米尔语、卡纳达语、马拉雅拉姆语)与英语混合文本的情感分析和攻击性语言识别。该数据集包含超过60,000条来自社交媒体的评论,这些评论经过志愿者标注,具有高的一致性。数据集不仅涵盖了各种代码混合现象,还为每种语言提供了详细的情感和攻击性标签,适用于多种自然语言处理任务,特别是在处理低资源语言和社交媒体内容分析方面具有重要价值。

DravidianCodeMix is a multilingual dataset developed by the Insight SFI Research Centre, focusing on sentiment analysis and offensive language recognition for code-mixed texts combining three Dravidian languages (Tamil, Kannada, Malayalam) with English. This dataset contains over 60,000 social media comments, which were annotated by volunteers with high annotation consistency. It covers various code-mixing phenomena, and provides detailed sentiment and offensive labels for each target language, making it applicable to a wide range of natural language processing tasks. It is particularly valuable for low-resource language processing and social media content analysis.

创建时间:
2021-06-17
搜集汇总
数据集介绍
DravidianCodeMix 数据集图片
构建方式
DravidianCodeMix数据集的构建始于从YouTube平台上收集泰米尔语、卡纳达语和马拉雅拉姆语电影预告片下方的用户评论,时间跨度为2019年。研究者利用YouTube评论抓取工具获取原始数据,并通过langdetect库进行语言过滤,剔除无关语种。为忠实保留真实世界的语码混合现象,所有类型的混合文本——包括纯单语、语码间混合、语码内混合乃至形态层面的混合——均被完整保留。随后,通过Google表单招募双语志愿者进行人工标注,每条评论至少由三位标注者独立完成情感分析与 offensive 语言识别两个任务的标签赋予。最终,经过一致性检验与争议解决机制,形成了包含约44,000条泰米尔语-英语、7,000条卡纳达语-英语及20,000条马拉雅拉姆语-英语评论的标注语料库,以制表符分隔的TSV文件形式存储并公开发布。
特点
该数据集的核心特色在于其全面覆盖了低资源达罗毗荼语言在社交媒体情境下的真实语码混合现象,囊括从纯单语到跨句、句内、形态层面的所有混合类型,并同时包含拉丁字母与本土文字书写。其规模宏大,总计超过60,000条YouTube评论,为情感分析与 offensive 语言识别两大任务提供了精细的多级标注体系:情感维度涵盖积极、消极、中性、混合情绪及非目标语言五类;offensive 维度则细分为非 offensive、无目标 offensive、针对个人、针对群体、针对其他及非目标语言六类。数据由双语母语者经严格质量控制流程标注,Krippendorff's alpha 系数显示标注者间一致性较高,确保了标签的可靠性与权威性。此外,数据集还呈现了类别分布的不平衡性——积极与 non-offensive 类别占据多数,这一特性真实反映了电影预告片评论的舆论生态。
使用方法
研究者可直接从GitHub或Zenodo平台下载该数据集,其以制表符分隔的TSV格式存储,首列为评论文本,次列为最终标注标签。数据集已按90%、5%、5%的比例划分为训练集、开发集与测试集,便于直接开展实验。使用时可将其作为文本分类任务的标准输入,应用逻辑回归、支持向量机、朴素贝叶斯、K近邻、决策树及随机森林等传统机器学习方法建立基线。为应对语码混合带来的拼写非标准化与语言边界模糊问题,建议采用基于TF-IDF的n-gram特征提取方式。该数据集特别适用于研究低资源语言在非正式社交媒体语境下的情感倾向与 offensive 内容检测,亦可用于探索跨语言表示学习与语码混合建模等前沿课题。
背景与挑战
背景概述
在自然语言处理领域,情感分析与 offensive 语言识别是两项至关重要的任务,广泛应用于社交媒体内容审核、舆情监控及用户反馈分析。然而,现有研究多聚焦于高资源语言的单语文本,对于低资源语言(尤其是达罗毗荼语系)的代码混合文本研究严重不足。达罗毗荼语系涵盖泰米尔语、卡纳达语和马拉雅拉姆语等,其使用者超过2.15亿,但受限于标注语料匮乏与语言形态高度黏着的特性,相关 NLP 工具发展缓慢。为填补这一空白,Bharathi Raja Chakravarthi 等研究者于2021年发布了 DravidianCodeMix 数据集,该数据集包含超过60,000条来自 YouTube 电影预告片评论的代码混合文本,覆盖泰米尔语-英语、卡纳达语-英语和马拉雅拉姆语-英语三种语言对,并针对情感分析与 offensive 语言识别任务进行了人工标注。该数据集不仅首次系统性地涵盖了各类代码混合现象(如语码转换于句间、词内及拼写层面),还通过高信度的 Krippendorff's alpha 一致性检验确保了标注质量,为低资源达罗毗荼语言的社交媒体文本分析提供了关键基准资源,并催生了后续多项国际评测任务。
当前挑战
DravidianCodeMix 数据集面临的挑战主要体现在两个层面。其一,所解决的领域问题本身具有高度复杂性:代码混合文本中常出现非标准拼写、跨语言语素融合以及语境依赖的语义歧义,例如泰米尔语评论中夹杂泰卢固语敬语词导致情感极性判断困难,或看似中立的比较句隐含 offensive 意味。其二,数据构建过程亦充满障碍:从 YouTube 海量评论中筛选出真正的代码混合内容需借助语言检测工具剔除无关语言,而招募具备双语能力且熟悉多种文字体系(天城文、拉丁文等)的志愿者进行标注极为耗时,且需应对不同方言区对词汇 offensive 程度认知的差异。此外,类别分布严重不均衡——如泰米尔语数据中正向情感占比56.5%,而混合情感仅占11.2%——使得机器学习模型在少数类上的性能显著偏低,现有基线实验(如逻辑回归、随机森林)的宏平均 F1 分数多在0.3至0.6之间,远未达到实用水平,亟需更鲁棒的编码方法与数据增强策略来突破这一瓶颈。
常用场景
经典使用场景
在社交媒体文本分析领域,DravidianCodeMix数据集主要用于泰米尔语-英语、卡纳达语-英语和马拉雅拉姆语-英语三种德拉维达语系的代码混合文本的情感分析与 offensive语言识别任务。该数据集包含超过60,000条来自YouTube电影预告片评论的真实用户生成内容,涵盖了从纯单语到跨句、词内及形态层面的多种代码混合现象。研究者利用这一资源训练和评估机器学习模型,以理解多语言社交平台中用户表达的极性(正面、负面、中性)以及识别具有攻击性或冒犯性的言论,从而推动低资源语言在自然语言处理领域的研究进展。
实际应用
在实际应用层面,DravidianCodeMix数据集可服务于社交媒体平台的内容审核与舆情监控系统。通过训练情感分类和 offensive语言检测模型,平台能够自动识别并过滤含有攻击性、歧视性或仇恨言论的评论,维护健康的在线交流环境。此外,该数据集还能用于品牌声誉管理,帮助企业从多语言用户反馈中提取情感倾向,优化产品与服务。在印度等多元语言国家,此类系统尤其重要,因为用户常混合使用本地语言与英语,而传统单语模型难以准确理解其真实意图。
衍生相关工作
基于DravidianCodeMix数据集,学术界已衍生出一系列重要工作。例如,研究者在该数据集上组织了共享任务(如FIRE 2020和HASOC 2020),吸引了全球团队参与情感分析和 offensive语言识别的竞赛,推动了多种先进模型(包括基于BERT的多语言变体)的提出与改进。此外,该数据集还被用于探索代码混合文本中的词级语言识别、跨语言迁移学习以及元嵌入技术,进一步拓展了低资源语言在自然语言处理中的研究边界,并催生了针对其他德拉维达语言(如泰卢固语)的类似语料构建工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务