遇见数据集

finbert-financial-news-sentiment-dataset

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

该数据集是一个专为算法交易设计的金融新闻情感分析数据集,由Lumen Models提供。它通过聚合全球主要经济媒体的金融新闻标题,利用专门针对金融文本分析训练的FinBERT模型进行自动情感分析,为每一条新闻标题赋予积极、中性或消极的情感标签,并附带一个AI置信度百分比分数。数据集每日自动更新,确保包含最新的市场动态新闻。免费公开的样本(financial_news_FREE.csv)包含最近7天内的新闻数据,采用分号分隔的CSV格式,以避免与金融文本中常见的逗号冲突。数据集包含以下字段:发布日期(Date)、清理后的标题文本(Title)、来源媒体(Source)、指向原文的短链接(Short_URL)、情感标签(Sentiment)以及置信度分数(Confidence_Percent)。该数据集适用于算法交易策略开发、量化金融研究、市场情绪分析以及机器学习模型(特别是金融领域NLP模型)的训练与验证。此外,提供商还提供包含完整历史记录的商业高级数据库,用于策略回测和专有模型训练。数据集采用MIT许可证发布。

This financial news sentiment analysis dataset is tailored for algorithmic trading and provided by Lumen Models. It aggregates financial news headlines from major global economic media, and leverages the FinBERT model specifically trained for financial text analysis to conduct automated sentiment analysis, assigning each news headline a sentiment label of 'positive', 'neutral' or 'negative' alongside an AI confidence percentage score. The dataset is automatically updated on a daily basis to ensure it includes the latest market news and trends. The freely available sample (financial_news_FREE.csv) contains news data from the past 7 days, and adopts a semicolon-separated CSV format to avoid conflicts with commas commonly present in financial text. The dataset includes the following fields: Publication Date (Date), cleaned headline text (Title), source media (Source), short URL linking to the original article (Short_URL), sentiment label (Sentiment), and confidence percentage score (Confidence_Percent). This dataset is applicable to algorithmic trading strategy development, quantitative finance research, market sentiment analysis, as well as the training and validation of machine learning models, particularly financial domain NLP models. Additionally, the provider offers a commercial premium database containing complete historical records for strategy backtesting and proprietary model training. The dataset is released under the MIT License.

创建时间:
2026-06-10
原始信息汇总

数据集概述

数据集名称:Financial News Sentiment Dataset (FinBERT Powered)
发布方:Lumen Models
许可证:MIT License
语言:英语
任务类型:文本分类
数据集规模:小于 1,000 条样本
数据集大小类别:n<1K

核心特性

  • 每日更新:每 24 小时自动刷新,提供最新的市场头条新闻。
  • FinBERT 情感分析:每条新闻通过 FinBERT 模型自动分类为 positivenegativeneutral,并附带 AI 置信度百分比。
  • 数据清洗与优化:包含来源元数据和短追踪链接(Short_URL),适合算法交易流程和轻量数据摄入。
  • 分隔符:使用分号(;)作为字段分隔符,避免金融文本中逗号的冲突。

数据内容与版本

1. 免费样本(financial_news_FREE.csv

  • 范围:包含最近 7 天 的金融新闻滚动窗口。
  • 用途:供开发者、研究人员和对冲基金测试数据结构、验证 AI 准确性及构建交易策略原型。

2. 付费历史数据库(商业访问)

  • 范围:完整的档案记录(自项目启动以来从未截断)。
  • 用途:用于回测量化策略、训练专有机器学习模型及大规模市场研究。
  • 获取方式:需通过 Hugging Face 讨论或直接商务邮件联系 Lumen Models 购买或租赁。

数据模式(Schema)

列名 类型 描述
Date 日期(YYYY-MM-DD 新闻头条的发布日期
Title 字符串 清洗后的新闻标题文本
Source 字符串 来源的金融媒体机构
Short_URL URL 字符串 指向原始文章的压缩链接
Sentiment 字符串 AI 标注的情感标签(positiveneutralnegative
Confidence_Percent 浮点数 AI 对情感分析的置信度(0% 到 100%)

免责声明

该公开样本仅用于信息和教育目的,不构成金融、投资或法律建议。算法交易涉及重大风险。

搜集汇总
数据集介绍
finbert-financial-news-sentiment-dataset 数据集图片
构建方式
该数据集名为finbert-financial-news-sentiment-dataset,由Lumen Models构建,专注于实时高频的全球金融新闻标题流。数据源自主要经济媒体,经过清洗与优化后,采用分号分隔符以避免金融文本中逗号造成的冲突。每条新闻标题通过FinBERT模型进行情感分析,FinBERT是专为金融文本分析训练的BERT变体,能够以数学精度将新闻分类为正面、负面或中性,并输出AI置信度百分比。数据集每日自动更新,提供最近7天的滚动窗口作为免费样本,而完整历史档案则作为商业版存储于私有服务器。
特点
该数据集的核心特点在于其实时性与高精度。每日更新机制确保用户始终获取最新的市场驱动新闻,适合算法交易与量化金融应用。FinBERT模型赋予每条新闻精确的情感标签,并附带置信度评分,为策略制定提供可靠依据。数据结构简洁明了,包含日期、标题、来源、压缩URL、情感标签及置信度六个字段,便于轻量级数据摄取与管道集成。此外,免费样本版采用MIT许可证公开分发,降低了研究门槛,而商业版则提供完整历史数据用于回测与模型训练。
使用方法
该数据集可直接用于文本分类任务的情感分析研究。用户可通过加载CSV文件读取数据,利用情感标签和置信度分数进行金融新闻情绪分析。对于算法交易平台,可将每日更新的新闻标题与情感预测集成至交易策略中,作为市场情绪信号。研究人员可基于免费样本验证模型性能或构建原型策略;商业用户则可通过联系Lumen Models获取完整历史数据,用于深度回测与机器学习模型训练。数据集采用逗号无关的分号分隔符,确保解析兼容性,尤其适合Python的pandas库或Spark等大数据框架导入处理。
背景与挑战
背景概述
在金融市场的量化投资与算法交易领域,实时、高精度的新闻情感分析已成为驱动交易策略的核心技术之一。FinBERT金融新闻情感数据集由Lumen Models机构创建,专注于提供每日更新的全球金融新闻头条及其基于FinBERT模型的情感标签(正面、负面、中性),辅以置信度评分,旨在为研究人员和量化开发者提供标准化、机器可读的情感信号数据源。该数据集自创建以来,凭借其高频率更新与专为金融领域优化的NLP处理流程,显著推动了金融情感分析与算法交易策略的研究进展,成为学术界与工业界在金融文本挖掘领域的重要基准资源。
当前挑战
该数据集在应用与构建过程中面临多重挑战。首先,金融文本中大量存在的专业术语、市场特定习语及细微语义差异(如‘看涨’与‘回调’的隐含情绪)对情感分类模型的准确性提出了严苛要求,传统通用情感分析算法在此场景下表现不佳,需要像FinBERT这样经过金融语料微调的专用模型。其次,数据集的构建需确保每日抓取全球主要经济媒体的实时头条,处理跨时区、多来源的数据去重与清洗,同时维持低延迟的更新周期,这对数据管道的基础设施与工程效率构成挑战。此外,为适应算法交易系统的轻量化需求,数据集采用分号分隔格式以避免金融文本中逗号冲突,并嵌入短链接以减少存储开销,但这些优化措施要求下游用例严格遵循特定数据模式,增加了集成的门槛。
常用场景
经典使用场景
在金融文本情感分析领域,FinBERT金融新闻情感数据集常被用作训练和评估监督式情感分类模型的黄金标准。研究者利用该数据集中每日更新的全球财经头条,结合FinBERT预训练模型,对新闻标题进行正性、负性或中性的三分类标注。其标准化的半角分号分隔格式与置信度评分机制,为构建端到端的文本处理流水线提供了极大便利,尤其适用于高频交易策略中新闻事件的即时情感解析。
衍生相关工作
围绕该数据集衍生了一系列经典工作,包括基于FinBERT情感特征改进的传统机器学习模型(如XGBoost、LSTM)用于股票涨跌预测,以及将情感信号与知识图谱结合的混合推理系统。部分研究在此基础上提出了动态情感阈值调整算法,以应对市场非理性波动。此外,该数据集还被用于对比不同预训练语言模型(如RoBERTa、ELECTRA)在金融领域的情感识别鲁棒性,推动了领域特定模型微调方法的持续优化。
数据集最近研究
最新研究方向
当前,金融情绪分析领域的前沿研究方向聚焦于利用大规模预训练语言模型对实时新闻流进行高精度情感解析,以赋能量化交易与算法投资策略。该数据集通过FinBERT模型对全球主要经济新闻头条进行每日高频更新与二分类及中性情感标注,并附带置信度评分,为研究者提供了兼具时效性与数学严谨性的结构化语料。其应用不仅涵盖高频交易信号的动态生成,还延伸至金融舆情监控与风险预警系统的构建,在金融市场微观结构与行为金融学交叉领域开辟了新的实证路径。此数据集的发布标志着金融自然语言处理从静态基准测试向动态、可操作性市场情报的范式转变,对推动智能投顾与适应性市场假说的量化验证具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务