遇见数据集

filesystem_huggingface_terminal_git_5089_campaign_source

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

该数据集是由Lumina Analytics数据团队发布的金融新闻情感数据集。它包含200条金融新闻短语样本,每条样本由情感标签(label)和句子文本(sentence)组成。数据集源自上游公共语料库takala/financial_phrasebank,经过清洗和重新分割,仅包装方式不同,文本内容保持不变。该数据集适用于金融情感分析任务,如情感分类。许可证为CC BY-NC-SA 3.0(知识共享署名-非商业性使用-相同方式共享3.0未本地化版本),禁止商业用途,要求署名原作者(Malo等人)及上游数据集,且衍生作品必须以相同许可证发布且仅限非商业目的。

This dataset is a financial news sentiment dataset released by the Lumina Analytics data team. It contains 200 samples of financial news phrases, each consisting of a sentiment label and a sentence text. The dataset is derived from the upstream public corpus takala/financial_phrasebank, after cleaning and re-splitting, with only a different packaging method, while the text content remains unchanged. It is suitable for financial sentiment analysis tasks, such as sentiment classification. The license is CC BY-NC-SA 3.0 (Creative Commons Attribution-NonCommercial-ShareAlike 3.0 Unported), which prohibits commercial use, requires attribution to the original authors (Malo et al.) and the upstream dataset, and derivative works must be released under the same license and for non-commercial purposes only.

创建时间:
2026-08-15
原始信息汇总

数据集概述

数据集名称:Financial News Sentiment Dataset(金融新闻情感数据集)

发布方:Lumina Analytics 数据团队

数据集类型:派生数据集,基于公开上游语料库进行清洗和重新划分,文本内容保持原样,仅改变数据打包方式。


数据内容

  • 文件data.csv
  • 样本数量:200 条金融短语样本
  • 字段
    • label:情感标签
    • sentence:句子内容

来源声明

  • 声明的源仓库:takala/financial_phrasebank
  • 上游来源:Hugging Face Hub 上的 takala/financial_phrasebank

许可信息

项目 说明
已解决许可 CC BY-NC-SA 3.0(知识共享 署名-非商业性使用-相同方式共享 3.0 未本地化版本)
商业使用 不允许
署名要求 必须标注原作者(Malo 等人)及上游数据集(takala/financial_phrasebank)
限制条款 非商业性(NC)和相同方式共享(SA)限制适用;禁止任何商业用途;修改和再分发仅允许在相同许可条款下进行,且仅限非商业目的
商业用途说明 如需商业使用,必须向原作者另行申请许可
使用判定 该数据集为受限数据集,禁止商业使用

审计日期:2026-08-24


注意事项

  • 上游来源的许可状态需进一步核实,最终许可认定请联系数据治理团队。
搜集汇总
数据集介绍
filesystem_huggingface_terminal_git_5089_campaign_source 数据集图片
构建方式
该数据集源自公开上游语料库takala/financial_phrasebank,由Lumina Analytics数据团队进行清洗与重新划分后发布。构建过程中保持了原始文本内容不变,仅对数据包结构进行调整,最终生成包含200条金融新闻短语样本的data.csv文件,每条样本均标注情感标签(label)与对应句子(sentence)。该衍生数据集在发布时声明了上游来源与许可状态,并注明需经上游验证后方可最终确定许可,体现了对数据溯源与合规性的重视。
特点
数据集聚焦金融领域情感分析任务,提供经人工标注的金融新闻短语样本,标签与句子一一对应,便于直接用于模型训练与评估。其文本内容源自公开语料库,具有领域专业性与标注可靠性。数据规模为200条,适用于小样本学习或快速验证场景。许可方面采用CC BY-NC-SA 3.0协议,明确限制商业用途,要求署名原作者及上游数据集,并遵循相同方式共享,属于受限使用类型。
使用方法
使用者可通过加载data.csv文件读取数据,利用sentence列作为输入文本,label列作为情感分类目标。该数据集适用于金融情感分析模型的训练、微调或基准测试,尤其适合在非商业研究场景中使用。使用时应遵守CC BY-NC-SA 3.0许可条款,注明数据来源为takala/financial_phrasebank及原作者Malo等人,不得用于商业目的。若需商业应用,须另行联系原始作者获取授权。
背景与挑战
背景概述
金融文本的情感分析长期受制于领域标注语料的稀缺,2006年前后,Malo等学者在赫尔辛基经济学院(现阿尔托大学)启动了金融短语库(Financial PhraseBank)的构建工作,从英文财经新闻中抽取短语并经由金融分析师人工标注情感极性。该语料库成为金融情感计算领域引用最广的基准资源之一,为投资者情绪度量、市场波动预测及舆情监测研究提供了关键支撑。本条数据集系Lumina Analytics数据团队对该上游语料的重新清洗与切分产物,保留原始文本内容,仅调整封装形式,共计200条样本,适用于金融情感分类模型的训练与评估。
当前挑战
金融情感分析所面临的领域难题在于:财经语言表述含蓄、情感强度细微,且高度依赖行业语境,通用情感词典与模型难以准确判别,同时样本类别分布不均易导致模型偏向多数类。就本数据集的构建过程而言,其挑战体现为:上游语料需经人工逐条校验与清洗,以保证标签一致性;许可状态尚待最终核定,商业使用受到非商业性条款的严格限制;样本规模有限(仅200条),难以支撑深度模型的充分训练;此外,领域术语密集与标注主观性亦对情感极性判定的稳定性构成考验。
常用场景
经典使用场景
金融文本情感分析领域长期面临标注语料稀缺的困境,该数据集承袭自takala/financial_phrasebank的原始语料,以200条金融新闻短语及其情感标签构成精简而规范的样本集合,其最经典的使用场景在于作为基准语料驱动情感分类器的训练与评估。研究者往往将其用于构建句子级情感极性判别模型,借助标签与句子两列的简洁结构,快速验证词袋模型、循环神经网络及预训练语言模型在金融语境下的性能差异,从而在低资源条件下完成方法论的对比实验。
实际应用
在实际应用层面,该数据集可服务于金融机构的市场情绪监测与投资决策辅助系统。量化交易团队可借助其训练的情感分类模块,对财经新闻、公司公告及研报摘要进行实时情绪打分,进而将情绪指标纳入多因子模型以捕捉市场预期的微妙变化。风险管理与合规部门亦可利用该语料微调模型,自动识别文本中的悲观表述,从而在舆情预警与信用评估中实现半自动化的信息筛选,提升金融信息处理的时效性与一致性。
衍生相关工作
围绕该数据集及其上游来源,学界衍生出一系列具有影响力的工作。研究者在此基础上探索了领域预训练语言模型的微调策略,如FinBERT等金融专用模型即借鉴了此类标注语料进行情感分类头的训练与验证。此外,该数据集常被用作迁移学习与多任务学习的基准,催生了跨领域情感知识蒸馏、对抗性领域适应以及提示学习在金融文本中的应用研究,为金融情感分析的方法论演进提供了持续的实验土壤。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务