遇见数据集

finance-news-sentiment-35k

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

该数据集包含39,965条英文财经新闻标题,来自公开的Telegram财经新闻频道。每条标题由两个LLM(Claude Opus 5和OpenAI gpt-5.6-sol)进行三分类情感标注(正面/负面/中性)和二级主题标签标注,分歧由更强模型仲裁。数据覆盖8个频道,95%来自两个频道,约99%的行来自最近12个月(2025年6月至2026年6月)。划分为训练集(32,970行)、验证集(3,495行)和测试集(3,500行),按情感分层。情感分布:训练集中正面16.5%、负面23.2%、中性60.3%。主题标签分布:地缘政治15,533、宏观10,385、股票7,687、大宗商品2,763、其他1,682、加密货币1,132、监管783。适用于金融新闻情感分类和主题分类任务。

This dataset contains 39,965 English financial news headlines collected from public Telegram financial news channels. Each headline is annotated by two independent LLM judges (Claude Opus 5 and OpenAI gpt-5.6-sol) with three-class sentiment (positive/negative/neutral) and secondary topic labels according to a unified rulebook. Disagreements are resolved by a stronger model (Claude Fable 5). Data comes from 8 channels, with two channels contributing about 95% of the data, and about 99% of rows from the last 12 months (June 2025 to June 2026). The dataset is split into training (32,970 rows), validation (3,495 rows), and test (3,500 rows), stratified by sentiment. Sentiment distribution: training set has 16.5% positive, 23.2% negative, 60.3% neutral. Topic label distribution: geopolitics 15,533, macro 10,385, stocks 7,687, commodities 2,763, other 1,682, crypto 1,132, regulation 783. Suitable for financial news sentiment classification and topic classification tasks.

创建时间:
2026-09-03
原始信息汇总

Finance News Sentiment 40k 数据集总结

基本信息

  • 数据集名称:Finance News Sentiment 40k
  • 规模:39,965 条英文金融新闻标题(符合 10K<n<100K 规模类别)
  • 许可证:CC BY-NC 4.0(仅针对标注内容,新闻文本归属原始来源)
  • 语言:英文
  • 任务类型:文本分类(情感分类)
  • 标签:金融、金融新闻、Telegram、情感、LLM 标注、FinBERT

数据内容

数据集划分

划分 行数 positive negative neutral
train 32,970 16.5% 23.2% 60.3%
validation 3,495 16.1% 23.0% 60.9%
test 3,500 16.1% 23.0% 60.9%

字段说明

  • message_id:Telegram 频道内消息 ID
  • channel_username:信息来源频道
  • date:发布时间戳(UTC)
  • text:英文新闻标题/短文本
  • viewsforwards:采集时的互动计数
  • sentiment:三分类情感标签(positive/negative/neutral),定义针对投资者视角的新闻好坏
  • reason:主题分类,包括 geopolitics(15,533)、macro(10,385)、equities(7,687)、commodities(2,763)、other(1,682)、crypto(1,132)、regulatory(783)

数据来源

  • 来自 8 个公开 Telegram 金融新闻频道(2023年2月至2026年6月)
  • 经去重的 142k 消息池中采样生成
  • 两个主要频道占总数据 95%(firstsquaw 83.0%,WalterBloomberg 12.2%)
  • 约 99% 的数据来自最近 12 个月(2025年6月-2026年6月),地理政治(伊朗/霍尔木兹)、关税和美联储政策相关新闻占比较高

标注方法

  1. 盲标打包:数据随机打乱后以 40 条为一组,仅包含 ID 和文本
  2. 双模型独立标注:Claude Opus 5 与 OpenAI gpt-5.6-sol(通过 Codex)遵循同一书面规则独立标注
  3. 仲裁机制:分歧数据由更强模型 Claude Fable 5 逐条仲裁
  4. v1 标注一致性:两模型在 v1 数据上同意率为 85.4%,盲审计同意率为 91.3%-94.3%
  5. v2 主动学习扩充:新增 4,997 行(基于 v1 模型最不确定的 3,999 条 + 1,001 条随机样本),两模型同意率降至 81.0%

版本信息

版本 行数 训练集 特点
v1(2026-09-03) 34,968 27,973 随机样本,80/10/10 分层划分
v2(2026-09-04) 39,965 32,970 基于主动学习增加 4,997 行

验证集和测试集在两版本中字节级一致,可保持测试结果可比。

模型性能

基于该数据集微调的 FinBERT 模型达到测试准确率 0.847 / 宏平均 F1 0.810

标注质量审计发现

  • 分歧主要是阈值问题:11% 的样本存在情感分歧,其中 94% 是中性↔方向性的边界问题
  • 置信度可预测分歧:双方模型均给出"高置信度"时(占 41%),分歧率仅 0.4%
  • 仲裁偏向受会话影响:仲裁者对 Opus 5 的 ~70% 偏向属于特定生产会话特征,新会话中该偏向接近随机
  • 模型误差与标注模糊性相关:在双方高置信度一致的样本上模型错误率 3.4%,仲裁样本上错误率高达 42.9%

局限性

  • 无人工金标准:标签由 LLM 生成,预期模型在该数据上测试集准确率上限约为 0.85
  • 中性类别宽泛:日常数据发布、政治声明和小幅价格变动被设计性地归为中性
  • 来源与时间集中:单一频道占主导,数据集中于特定地缘政治和宏观经济时期
  • v2 选择偏差:新增样本为非随机采样,过度代表边界案例

参考文献与代码

  • 标注管道开源代码:https://github.com/RemeDegen/finance-news-sentiment
  • 标签可靠性审计研究:https://github.com/RemeDegen/nlp-judge-audit
  • 微调模型:https://huggingface.co/remehostingservices/finbert-finance-news-sentiment
搜集汇总
数据集介绍
finance-news-sentiment-35k 数据集图片
构建方式
在金融文本分析领域,高质量标注语料的稀缺长期制约着情感计算模型的性能边界。该数据集立足于公开电报财经新闻频道,通过系统化流水线构建标注资源。原始数据取自八个公开频道于2023年2月至2026年6月间发布的去重消息池,经抽样与筛选后形成基础语料,并引入主动学习策略补充模型决策边界附近的疑难样本。标注环节采用双盲评审机制,由来自不同模型家族的两个独立大语言模型依据统一规则手册进行情感与主题双重标注,分歧样本交由更强模型仲裁。整个流程包含盲包封装、独立评判、仲裁裁决与事后审计等阶段,确保标注决策可追溯、可复核。
特点
该数据集的核心特征体现在标注架构的严谨性与数据构成的领域聚焦性上。语料涵盖英语财经新闻标题及短讯,情感标签以投资者视角为基准划分为正向、负向与中性三类,并附带地缘政治、宏观经济、股票、大宗商品、加密资产、监管等主题标注。全部约四万条样本按训练、验证与测试集划分,各集合情感分布保持均衡,且不存在跨集合文本重复。数据字段保留消息标识、来源频道、时间戳、互动计数等元信息,为多维度分析提供支撑。值得注意的是,标注过程的多轮盲审显示评委间一致率在较难样本上有所下降,这一特性本身为研究标签可靠性提供了透明依据。
使用方法
该数据集可通过Hugging Face datasets库便捷加载,用户调用标准接口即可获取预设划分的数据集实例,并按照配置访问训练、验证与测试子集。使用者在开展情感分类任务时,建议以测试集报告结果以保证与基线模型的可比性;由于标注由大语言模型生成,模型性能上限受标签质量制约,约在百分之八十五准确率附近。对于需要精细评估的研究,可将仲裁样本与高置信度一致样本分开汇报,以揭示模型在歧义边界上的表现差异。此外,数据加载时支持指定版本修订号,便于复现历史实验结果。
背景与挑战
背景概述
金融文本情感分析长期受困于高质量标注数据的稀缺,传统人工标注成本高昂且难以覆盖高频新闻流的规模。在此背景下,finance-news-sentiment-35k数据集于2026年9月由remehostingservices创建并发布,旨在为金融新闻标题的三分类情感识别(正面、负面、中性)及主题标注提供大规模、可复现的基准资源。该数据集汇聚八个公开Telegram财经新闻频道自2023年2月至2026年6月间的39,965条英文新闻标题,采用跨模型家族的双盲大模型标注与仲裁机制,并配套开源完整标注流程与可靠性审计报告,为金融NLP领域的情感分类研究提供了兼具规模与可追溯性的重要基准。
当前挑战
该数据集所应对的领域核心难题在于金融新闻情感的高度语境依赖性:同一措辞在投资者视角下可能因主体、时效与市场预期不同而呈现截然相反的极性,中性边界的划定尤为模糊。构建过程中,双模型标注者在11%的样本上出现分歧,其中94%集中于中性方向性边界,仲裁环节亦存在系统性偏倚,独立审计显示仲裁者约七成倾向某一模型且该倾向难以在复现条件下稳定重现,而主动学习补充的困难样本使标注一致性进一步下降至81%。标注天花板而非数据体量成为模型性能的约束瓶颈,微调FinBERT在测试集上的准确率仅为0.847,且仲裁样本的错误率高达42.9%,凸显了规则手册对中性边界分辨力的根本性挑战。
常用场景
经典使用场景
在金融自然语言处理领域,该数据集最经典的用法是金融新闻标题的三分类情感分析。研究者可直接加载训练、验证与测试划分,在统一的投资者影响标注框架下,训练与评测FinBERT等预训练语言模型,完成正向、负向与中性的情感判别任务。其测试集固定不变,便于横向比较不同模型架构与训练策略的性能,现已成为金融文本情感分类基准测试的常用资源之一。
衍生相关工作
围绕该数据集已衍生出多项相关工作。基于其微调的FinBERT模型在测试集上达到0.847准确率与0.810宏平均F1值,成为该数据集的代表性基线。同时,配套发布的标注可靠性审计研究,系统分析了大模型裁判间的分歧模式、置信度与争议率的关系以及仲裁者的偏向性,为后续大模型标注质量评估提供了方法学参照。这些工作共同构成了金融情感分析领域从数据构建、模型训练到标签审计的完整研究链条。
数据集最近研究
最新研究方向
在金融文本情感分析领域,标注质量与模型可信度正成为核心议题,finance-news-sentiment-35k数据集的前沿探索集中于多智能体大模型协同标注范式的可靠性审计。该数据集采用Claude与GPT双模型独立盲标、第三方模型仲裁的三级管线,并对仲裁决策进行独立复现审计,揭示了置信度对争议的预测能力显著优于文本特征,且仲裁偏好源于生产会话而非模型家族本身。相关研究进一步发现,微调FinBERT的测试误差在双标一致高置信样本上仅为3.4%,而在仲裁样本上高达42.9%,表明标签模糊性而非数据规模构成性能瓶颈。这一方向推动了LLM标注管线的可解释性评估与主动学习策略在边界样本上的应用,为金融情感分析的可复现基准建立提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务