ltg/norec_tsa
收藏官方服务:
资源简介:
NoReC TSA数据集是一个用于挪威语针对性情感分析(TSA)的数据集,包含标记了情感极性的挪威语句子。数据集来源于NoReC_fine数据集,后者又来源于挪威评论语料库(NoReC)。数据集由奥斯陆大学的语言技术组(LTG)和SANT项目(挪威文本情感分析)创建和维护,并由挪威研究理事会资助。数据集包含两个配置:默认配置和强度配置,分别提供二元情感标签和带有情感强度的标签。数据集不包含个人或敏感信息,但可能存在原始评论作者的偏见。
NoReC TSA数据集是一个用于挪威语针对性情感分析(TSA)的数据集,包含标记了情感极性的挪威语句子。数据集来源于NoReC_fine数据集,后者又来源于挪威评论语料库(NoReC)。数据集由奥斯陆大学的语言技术组(LTG)和SANT项目(挪威文本情感分析)创建和维护,并由挪威研究理事会资助。数据集包含两个配置:默认配置和强度配置,分别提供二元情感标签和带有情感强度的标签。数据集不包含个人或敏感信息,但可能存在原始评论作者的偏见。
提供机构:
ltg原始信息汇总
数据集概述
名称: NoReC TSA
语言: 挪威语(主要为Bokmål变体)
许可: Creative Commons Attribution-NonCommercial 4.0 (CC BY-NC 4.0)
大小类别: 10K<n<100K
任务类别: 令牌分类
配置:
- 默认配置: 提供二元情感描述(正面/负面)
- 强度配置: 提供情感强度标签(轻微、标准、强烈)
数据集大小:
- 默认配置: 下载大小899078字节,数据集大小3054326字节
- 强度配置: 下载大小902284字节,数据集大小3080506字节
分割:
- 训练集: 默认配置8634个样本,强度配置8634个样本
- 验证集: 默认配置1531个样本,强度配置1531个样本
- 测试集: 默认配置1272个样本,强度配置1272个样本
数据实例特征:
- idx (str): 唯一文档和句子标识符
- tokens (List[str]): 句子中的令牌列表
- tsa_tags (List[str]): 每个令牌的BIO格式标签列表
数据集来源:
- 源数据: 来自Norwegian Review Corpus (NoReC) 的子集,包含来自多个领域的专业评论
- 注释者: 由语言技术研究项目的学生进行注释
使用目的: 用于训练和测试针对挪威语句子的目标情感分析(TSA)模型,识别和分类情感目标
数据集结构:
- 包含预定义的训练、验证和测试分割
- 数据实例示例包括令牌及其对应的情感标签
注意事项:
- 数据集可能不涵盖所有文本域或类型,模型训练结果可能存在偏差
- 数据不包含个人信息或敏感信息
搜集汇总
数据集介绍
构建方式
在自然语言处理领域,情感分析任务正日益精细化,而针对特定目标的情感极性判别更是研究热点。NoReC TSA数据集正是为此而生,它源自挪威语细粒度情感语料库NoReC_fine,后者又脱胎于涵盖文学、电影、餐饮、音乐等多领域的挪威评论语料库NoReC。构建过程中,研究者将原始评论中的复杂情感标注通过特定脚本进行解析与聚合,当同一目标同时接收正负情感时,以强度更高者为准;若强度持平,则采纳最后出现的情感极性。最终形成面向目标情感分析的标注数据,每个句子中的词元均被赋予BIO格式的情感标签,从而实现了从篇章级情感分析到词元级目标情感识别的跨越。
特点
该数据集的核心特色在于其双配置设计,提供了两种粒度迥异的标签体系。默认配置仅输出二值化的正面或负面极性,简洁明了;而强度配置则额外引入1至3级的情感强度标注,分别为轻微、标准与强烈,为研究者提供了更丰富的情感层次。数据规模适中,训练集包含8634个句子,验证集与测试集分别拥有1531和1272个句子,主要涵盖书面挪威语(Bokmål),并辅以少量新挪威语(Nynorsk)样本。此外,数据集严格遵循非商业性使用许可,但基于其训练的模型、提取的词典等衍生资源不受此限,兼顾了学术研究与商业应用的需求。
使用方法
使用该数据集进行模型训练时,研究者可通过HuggingFace的datasets库便捷加载。加载默认配置时,直接调用load_dataset('ltg/norec_tsa')即可获得二元情感标签;若需启用强度标注,则需指定配置参数:load_dataset('ltg/norec_tsa', 'intensity')。数据集已预设训练、验证与测试三部分划分,可直接用于序列标注任务的训练与评估。每个样本包含唯一标识符idx、分词后的词元列表tokens以及对应的BIO格式情感标签序列tsa_tags。研究者可基于此数据微调挪威语预训练语言模型,实现针对特定情感目标的精准分类,相关预训练模型示例已在HuggingFace模型库中开放获取。
背景与挑战
背景概述
情感分析作为自然语言处理领域的核心任务之一,其细粒度研究对于理解文本中蕴含的复杂情感倾向至关重要。NoReC TSA(Targeted Sentiment Analysis)数据集由挪威奥斯陆大学语言技术组的SANT项目于2020年构建,旨在为挪威语提供面向目标的情感分析资源。该数据集源自NoReC_fine细粒度情感标注,覆盖文学、电影、餐饮、音乐等多领域专业评论,语料时间跨度自2003年至2019年,包含约1.1万条标注句子。其核心研究问题在于如何通过序列标注识别句子中特定情感目标的极性(正面或负面)及强度(轻微、标准、强烈),从而推动低资源语言在情感分析领域的发展。该数据集在LREC 2020发表后,成为挪威语情感分析研究的重要基准,对多语言情感分析方法的推广具有显著影响力。
当前挑战
NoReC TSA数据集面临多重挑战。在领域问题层面,面向目标的情感分析需精准区分同一句子中多个实体的情感倾向,并解决情感极性冲突(如目标同时接收正负情感时需通过强度或顺序决断),这要求模型具备细粒度语义理解能力。此外,挪威语包含书面语变体(如博克马尔语和新挪威语),数据分布极不均衡,新挪威语仅占训练集的0.9%,导致模型泛化困难。在构建过程中,原始NoReC_fine的细粒度标注需通过复杂转换脚本聚合为最终极性,此过程可能引入标注歧义;同时,数据来源于专业评论,其文体风格与日常用语差异显著,限制了模型在非正式文本中的迁移能力。这些挑战共同制约了数据集在真实场景中的鲁棒性应用。
常用场景
经典使用场景
在自然语言处理领域,NoReC TSA数据集专为挪威语的细粒度目标情感分析(Targeted Sentiment Analysis, TSA)任务而设计,其核心应用场景是基于令牌级序列标注的模型训练与评测。该数据集源自NoReC_fine的精细情感标注,将句子中的每个令牌标注为情感目标或非目标,并赋予其正面或负面极性(及强度)。研究者常利用其默认配置进行二分类情感目标识别,或利用intensity配置探索情感强度的层次化建模,从而推动多语言情感分析技术在低资源语言中的发展。
衍生相关工作
NoReC TSA衍生了多项经典研究工作,包括基于挪威语BERT模型(如NB-BERT)的微调实验,验证了预训练语言模型在目标情感分析任务上的有效性。相关研究还探索了跨语言迁移学习,利用该数据集作为目标域,测试从英语等资源丰富语言迁移情感分析能力的可行性。此外,情感强度配置催生了关于情感强度预测的专项研究,推动了细粒度情感分析从二分类向多级量化的演进。这些工作共同丰富了低资源语言情感分析的理论体系,并为后续的零样本学习与多任务联合建模提供了数据支撑。
数据集最近研究
最新研究方向
在自然语言处理领域,针对低资源语言的细粒度情感分析正成为前沿热点,而挪威语作为北欧语系中资源相对稀缺的语言,其情感分析研究尤为关键。NoReC TSA数据集源自NoReC_fine的精细标注,专门用于面向目标的情感分析(TSA),通过BIO标注体系将情感极性(积极/消极)及强度(轻微、标准、强烈)直接映射到句子中的每个词元。该数据集的出现填补了挪威语在细粒度情感分析方面的空白,其基于专业评论语料(涵盖文学、电影、餐饮等多领域)的构建方式,为多领域情感迁移学习提供了坚实基础。当前研究趋势聚焦于利用预训练语言模型(如挪威语BERT)在该数据集上进行微调,以提升对复杂情感表达(如多目标、混合极性)的识别能力,同时探索跨语言迁移方法,将挪威语的情感分析成果推广至其他斯堪的纳维亚语言,推动北欧语系自然语言处理技术的整体进步。
以上内容由遇见数据集搜集并总结生成



