遇见数据集

Djacon/ru-izard-emotions

收藏
Hugging Face2023-11-23 更新2024-03-04 收录
官方服务:

资源简介:

--- language: - ru license: - mit multilinguality: - russian task_categories: - text-classification task_ids: - sentiment-classification - multi-class-classification - multi-label-classification pretty_name: RuIzardEmotions tags: - emotion size_categories: - 10K<n<100K --- # Dataset Card for RuIzardEmotions ## Table of Contents - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Dataset Creation](#dataset-creation) - [Curation Rationale](#curation-rationale) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Social Impact of Dataset](#social-impact-of-dataset) - [Discussion of Biases](#discussion-of-biases) - [Other Known Limitations](#other-known-limitations) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) - [Contributions](#contributions) ### Dataset Summary The RuIzardEmotions dataset is a high-quality translation of the [go-emotions](https://huggingface.co/datasets/go_emotions) dataset and the other [emotion-detection](https://www.kaggle.com/datasets/ishantjuyal/emotions-in-text/data) dataset. It contains 30k Reddit comments labeled for 10 emotion categories (__joy__, __sadness__, __anger__, __enthusiasm__, __surprise__, __disgust__, __fear__, __guilt__, __shame__ and __neutral__). The datasets were translated using the accurate translator [DeepL](https://www.deepl.com/translator) and additional processing. The idea for the dataset was inspired by the [Izard's model](https://en.wikipedia.org/wiki/Differential_Emotions_Scale) of human emotions. The dataset already with predefined train/val/test splits. ### Supported Tasks and Leaderboards This dataset is intended for multi-class, multi-label emotion classification. ### Languages The data is in Russian. ## Dataset Structure ### Data Instances Each instance is a reddit comment with one or more emotion annotations (or neutral). ### Data Splits The simplified data includes a set of train/val/test splits with 24k, 3k, and 3k examples respectively. ## Considerations for Using the Data ### Social Impact of Dataset Emotion detection is a worthwhile problem which can potentially lead to improvements such as better human/computer interaction. However, emotion detection algorithms (particularly in computer vision) have been abused in some cases to make erroneous inferences in human monitoring and assessment applications such as hiring decisions, insurance pricing, and student attentiveness ## Additional Information ### Licensing Information The GitHub repository which houses this dataset has an [Apache License 2.0](https://github.com/Djacon/russian-emotion-detection/blob/main/LICENSE). ### Citation Information ``` @inproceedings{Djacon, author={Djacon}, title={RuIzardEmotions: A Dataset of Fine-Grained Emotions}, year={2023} } ```

--- 语言: - 俄语 许可协议: - MIT 多语言属性: - 俄语 任务类别: - 文本分类 任务子任务: - 情感分类 - 多类别分类 - 多标签分类 友好名称:RuIzardEmotions 标签: - 情感 样本规模区间: - 10K<n<100K --- # RuIzardEmotions 数据集卡片 ## 目录 - [数据集描述](#dataset-description) - [数据集摘要](#dataset-summary) - [支持的任务与基准榜单](#supported-tasks-and-leaderboards) - [语言](#languages) - [数据集结构](#dataset-structure) - [数据实例](#data-instances) - [数据字段](#data-fields) - [数据划分](#data-splits) - [数据集构建](#dataset-creation) - [构建初衷](#curation-rationale) - [源数据](#source-data) - [标注信息](#annotations) - [个人与敏感信息](#personal-and-sensitive-information) - [数据集使用注意事项](#considerations-for-using-the-data) - [数据集的社会影响](#social-impact-of-dataset) - [偏差讨论](#discussion-of-biases) - [其他已知局限性](#other-known-limitations) - [附加信息](#additional-information) - [数据集策展人](#dataset-curators) - [许可协议信息](#licensing-information) - [引用信息](#citation-information) - [贡献说明](#contributions) ### 数据集摘要 RuIzardEmotions 数据集是 [go-emotions](https://huggingface.co/datasets/go_emotions) 数据集与另一款 [emotion-detection](https://www.kaggle.com/datasets/ishantjuyal/emotions-in-text/data) 数据集的高质量译制版。本数据集包含3万条Reddit评论,涵盖10个情感类别的标注:**喜悦(joy)**、**悲伤(sadness)**、**愤怒(anger)**、**热情(enthusiasm)**、**惊讶(surprise)**、**厌恶(disgust)**、**恐惧(fear)**、**内疚(guilt)**、**羞愧(shame)** 与 **中性(neutral)**。 数据集通过高精度翻译工具 [DeepL](https://www.deepl.com/translator) 完成翻译,并经过额外预处理。本数据集的设计灵感源自伊扎德(Izard)的人类情感模型[情绪分化量表(Differential Emotions Scale)](https://en.wikipedia.org/wiki/Differential_Emotions_Scale)。 该数据集已预先划分训练集、验证集与测试集。 ### 支持的任务与基准榜单 本数据集适用于多类别、多标签情感分类任务。 ### 语言 本数据集的数据均为俄语。 ## 数据集结构 ### 数据实例 每条数据实例为一条Reddit评论,附带一个或多个情感标注(或中性标注)。 ### 数据字段 (无额外说明) ### 数据划分 精简版数据集已预设训练集、验证集与测试集划分,样本量分别为2.4万、3千与3千。 ## 数据集构建 ### 构建初衷 (无相关说明) ### 源数据 (无相关说明) ### 标注信息 (无相关说明) ### 个人与敏感信息 (无相关说明) ## 数据集使用注意事项 ### 数据集的社会影响 情感检测是一项极具价值的研究课题,有望推动人机交互等领域的优化升级。但需注意,情感检测算法(尤其是计算机视觉方向的此类算法)曾被滥用,在招聘决策、保险定价、学生关注度评估等人类监测与评估场景中得出错误推断。 ### 偏差讨论 (无相关说明) ### 其他已知局限性 (无相关说明) ## 附加信息 ### 数据集策展人 (无相关说明) ### 许可协议信息 本数据集所在的GitHub仓库采用 [Apache许可证2.0(Apache License 2.0)](https://github.com/Djacon/russian-emotion-detection/blob/main/LICENSE) 协议。 ### 引用信息 @inproceedings{Djacon, author={Djacon}, title={RuIzardEmotions: A Dataset of Fine-Grained Emotions}, year={2023} } ### 贡献说明 (无相关说明)

提供机构:
Djacon
原始信息汇总

数据集卡片 for RuIzardEmotions

数据集描述

数据集摘要

RuIzardEmotions数据集是go-emotions数据集和其他emotion-detection数据集的高质量翻译版本。它包含30k条Reddit评论,标注了10种情感类别(joysadnessangerenthusiasmsurprisedisgustfearguiltshame__和__neutral)。数据集使用精确的翻译器DeepL进行翻译并进行了额外处理。该数据集的灵感来源于Izards model的人类情感模型。

数据集已经包含了预定义的train/val/test分割。

支持的任务和排行榜

该数据集旨在用于多类别、多标签情感分类。

语言

数据为俄语。

数据集结构

数据实例

每个实例是一条Reddit评论,带有一个或多个情感标注(或中性)。

数据分割

简化数据包括一组train/val/test分割,分别为24k、3k和3k个示例。

使用数据的注意事项

数据集的社会影响

情感检测是一个有价值的问题,可能会带来改进,例如更好的人机交互。然而,情感检测算法(特别是在计算机视觉中)有时会被滥用,在招聘决策、保险定价和学生注意力评估等人类监控和评估应用中做出错误推断。

附加信息

许可信息

该数据集所在的GitHub仓库拥有Apache License 2.0

引用信息

@inproceedings{Djacon, author={Djacon}, title={RuIzardEmotions: A Dataset of Fine-Grained Emotions}, year={2023} }

搜集汇总
数据集介绍
Djacon/ru-izard-emotions 数据集图片
构建方式
在情感计算与自然语言处理交叉领域中,数据集的构建质量直接影响下游任务的性能。RuIzardEmotions数据集基于go-emotions与emotion-in-text两大公开语料库,通过高精度机器翻译引擎DeepL将其内容转换为俄语,并辅以人工后处理确保语义保真度。该数据集严格遵循Izard的人类情感差异模型,对原始Reddit评论进行了细粒度情感标注,涵盖喜悦、悲伤、愤怒、热情、惊讶、厌恶、恐惧、内疚、羞愧及中性共10类情感标签,形成多标签多分类的标注体系。
使用方法
该数据集适用于多标签、多类别的俄语情感分类任务。研究者可直接加载预定义的训练集、验证集与测试集进行模型训练与评估。在使用时,应注意到情感标签的非互斥特性,即一条评论可能同时包含多种情感,因此推荐采用二元交叉熵损失函数或适用于多标签分类的评估指标,如宏平均F1分数。数据集以标准格式提供,可便捷地与HuggingFace Transformers等深度学习框架集成,支持微调预训练语言模型以完成俄语情感识别任务。
背景与挑战
背景概述
情感计算作为自然语言处理领域的重要分支,致力于使机器能够理解和模拟人类的情感状态。然而,现有情感数据集多集中于英语等资源丰富语言,俄语等低资源语言的情感分析研究仍面临数据匮乏的困境。在此背景下,RuIzardEmotions数据集于2023年由研究者Djacon创建,旨在为俄语情感识别提供高质量的标注资源。该数据集基于Izard的人类情感分化理论,通过对go-emotions等英文情感数据集进行精确翻译与后处理,构建了包含30,000条Reddit评论的多标签情感分类语料,覆盖喜悦、悲伤、愤怒、热情、惊讶、厌恶、恐惧、内疚、羞耻及中性共十类情感。其发布填补了俄语细粒度情感分析领域的空白,为跨语言情感迁移学习及俄语人机交互系统的研究提供了关键基准。
当前挑战
RuIzardEmotions数据集面临的核心挑战体现在多维度上。首先,在领域问题层面,俄语情感分析需应对语言特异性带来的困境,如俄语丰富的词形变化、口语化表达及文化语境差异,使得情感标签的准确映射比英语更具复杂性。其次,在构建过程中,数据集的翻译质量是首要难题,虽然采用DeepL进行高精度翻译,但情感表达的细微差别(如讽刺、反语)在跨语言转换中易失真,需依赖人工校对与语义一致性验证。此外,多标签分类任务中情感共现模式的稀疏性(如同时标注喜悦与惊讶)导致标注一致性维护困难,而Reddit评论的匿名性虽缓解隐私问题,却可能引入网络用语的非标准化偏差,进一步加剧了模型泛化的挑战。
常用场景
经典使用场景
RuIzardEmotions数据集为俄语情感分析领域注入了新的活力,其核心应用场景在于细粒度情感分类任务。该数据集基于Izard的人类情感模型,精心标注了10种情感类别,包括喜悦、悲伤、愤怒、热情、惊讶、厌恶、恐惧、内疚、羞愧以及中性。通过涵盖多标签、多分类的文本分类任务,它使得研究者能够训练模型精准识别俄语文本中交织的复杂情感,从而推动俄语自然语言处理中情感理解的深度与精度。
解决学术问题
在学术研究中,RuIzardEmotions数据集解决了俄语情感资源匮乏的困境,特别是细粒度情感标注语料稀缺的问题。它填补了俄语多标签情感分类基准的空白,为情感计算、心理语言学及跨文化情感建模提供了可靠的实验平台。该数据集的发布促进了模型在俄语环境下对情感细微差别的捕捉能力,并助力于探讨不同语言中情感表达的异同,对情感理论的实证验证与多语言情感系统的构建具有深远意义。
实际应用
实际应用中,RuIzardEmotions数据集赋能于俄语社交媒体的舆情监控,帮助企业精准洞察用户对产品的情感反馈,例如识别愤怒或失望情绪以快速应对危机。此外,它在人机交互领域扮演关键角色,支持俄语虚拟助手和客服系统理解用户情绪状态,从而提供更具同理心的响应。在心理健康监测方面,该数据集还可用于开发识别抑郁或焦虑倾向的文本分析工具,提升早期干预的可行性。
数据集最近研究
最新研究方向
在自然语言处理与情感计算交叉领域,RuIzardEmotions数据集为俄语情感识别研究提供了精细化的标注资源。基于Izard的微分情绪理论,该数据集将30万条Reddit评论映射至10种基本情感类别,突破了传统正负二分类的局限。近期研究前沿聚焦于多标签情感分类模型的跨语言泛化能力,该数据集通过高质量机器翻译构建的俄语版本,成为检验多模态情感理解算法在斯拉夫语系中表现的关键基准。其与go-emotions等英语资源的对齐设计,推动了情感标签体系在跨文化场景下的可比性研究,尤其在社交媒体舆情监控、心理状态自动评估等热点应用中具有显著价值,为构建更具包容性的情感计算系统奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务