遇见数据集

intl-market-news

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

该数据集是一个专门为台湾(TWSE)和巴西(B3/Bovespa)股票市场构建的国际金融市场新闻与公司公告集合,主要用于非印度市场的情感分析回测。数据集包含两个核心组成部分:1) 从GDELT事件数据库获取的金融新闻数据,涵盖台湾(490篇文章)和巴西(318篇文章),时间范围为2026年3月至6月,每篇文章均包含发布时间(UTC)、标题、匹配的公司名称或股票代码、新闻来源域名、完整URL、语言代码以及GDELT标准化的情感分数(-100至+100);2) 配套的股票代码映射文件,分别收录了台湾和巴西各20家主要上市公司(如台积电、联发科、华硕;巴西石油、淡水河谷、伊塔乌银行等)的yfinance股票代码(后缀分别为.TW和.SA)、本地语言公司名称及别名,用于新闻文章中的实体匹配。数据集采用统一的Parquet格式,数据模式标准化,便于与现有数据处理流程集成。当前数据主要基于英文新闻源,已知限制包括缺乏中文和葡萄牙语本地公司公告源、时间窗口较短,但为原型验证和回测提供了基础。适用任务包括金融市场情感分析、事件驱动回测、跨市场比较研究等。

This dataset is an international financial market news and corporate announcement collection specifically built for the Taiwan (TWSE) and Brazil (B3/Bovespa) stock markets, primarily used for sentiment analysis backtesting in non-Indian markets. The dataset consists of two core components: 1) Financial news data obtained from the GDELT event database, covering Taiwan (490 articles) and Brazil (318 articles) with a time range from March to June 2026. Each article includes publication time (UTC), title, matched company name or stock ticker, news source domain, full URL, language code, and GDELT-standardized sentiment scores (-100 to +100); 2) A supporting stock ticker mapping file that records 20 major listed companies each from Taiwan and Brazil (e.g., TSMC, MediaTek, Asus; Petrobras, Vale, Itaú Unibanco) with yfinance stock tickers (suffixes .TW and .SA), local language company names, and aliases, used for entity matching in news articles. The dataset adopts a unified Parquet format with standardized data schemas, facilitating integration with existing data processing workflows. Currently, the data is primarily based on English news sources, with known limitations including a lack of local Chinese and Portuguese corporate announcement sources and a short time window, but it provides a foundation for prototype validation and backtesting. Applicable tasks include financial market sentiment analysis, event-driven backtesting, and cross-market comparative research.

创建时间:
2026-06-11
原始信息汇总

数据集概述

数据集名称: International Market News Data
用途: 用于非印度市场的情绪分析回测,涵盖台湾(TWSE)和巴西(B3)股票市场新闻及公司披露信息。

数据来源

  • 台湾(TWSE):

    • 数据文件: taiwan_gdelt.parquet,包含490篇文章,时间范围2026年3月至2026年6月。
    • 来源: GDELT事件数据库(全球新闻聚合)。
    • 语言: 英语。
    • 情绪分数: GDELT标准化情绪得分,范围-100到+100。
    • 覆盖公司: 30+个TWSE股票代码引用(模糊匹配)。
    • 备注: 短时间窗口,仅用于原型/回测验证。
  • 巴西(B3):

    • 数据文件: brazil_gdelt.parquet,包含318篇文章,时间范围2026年3月至2026年6月。
    • 来源: GDELT事件数据库。
    • 语言: 英语。
    • 情绪分数: GDELT标准化情绪得分。
    • 覆盖公司: 30+个B3股票代码引用。
    • 备注: 短时间窗口,仅用于原型/回测验证。

辅助数据文件

  • taiwan_ticker_map.json: 包含20家主要台湾公司(如台积电、联发科、华硕等)的yfinance符号(.TW后缀)、中文名称和别名,用于文章实体匹配。
  • brazil_ticker_map.json: 包含20家主要巴西公司(如巴西国家石油公司、淡水河谷、伊塔乌银行等)的yfinance符号(.SA后缀)、葡萄牙语名称和别名,用于文章实体匹配。

数据架构

所有parquet文件遵循统一架构,包含以下字段:

列名 类型 说明
date datetime[UTC] 发布时戳(GDELT格式: YYYYMMDDTHHMMSSZ)
headline string 文章标题
company_or_ticker string 匹配的公司名称或股票代码
source string 新闻域名/出版商(如“focustaiwan.tw”、“finance.yahoo.com”)
url string 文章完整URL
language string 语言代码(如EN、ZH、PT)
tone float 情绪得分(-100到+100)

已知限制

  1. 缺乏中文来源: GDELT主要聚合英文来源,台湾MOPS(公开资讯观测站)需自行爬取,HuggingFace中文新闻数据集缺乏金融聚焦。当前方案使用GDELT的约490篇文章,必要时补充MOPS爬取。
  2. 缺乏葡萄牙语来源: 巴西公司披露信息为葡萄牙语,CVM(巴西证券委员会)提供开放数据集,HuggingFace葡萄牙语数据集缺乏金融聚焦。Kaggle数据集“brasilems/brazilian-financial-news”截止至2020年且需凭证。当前方案使用GDELT的约318篇文章,CVM爬取推迟至第二阶段。
  3. 时间窗口短: 仅覆盖2026年3月至6月,回测理想窗口为3-5年。GDELT为实时数据,历史转储未自动化。Kaggle巴西数据集(2020年截止)可用但需凭证。

生产环境建议

  • 台湾扩展: 爬取MOPS(网址: mops.twse.com.tw/mops/web/t058sr01)获取公告;下载HuggingFace中文新闻并使用NLLB-200翻译;目标: 3年以上超过5000篇文章。
  • 巴西扩展: 使用凭证下载Kaggle数据集(命令: kaggle datasets download -d brasilems/brazilian-financial-news);爬取CVM API(网址: dados.cvm.gov.br/dataset/fatos-relevantes)获取公告;目标: 3年以上超过5000篇文章。
  • 本地化: 使用已有项目中的NLLB-200将非英语文章翻译为英语,并使用FinBERT对翻译文本重新评分以确保一致性。

文件清单

data/raw/intl/ ├── taiwan_gdelt.parquet # 490行,0.04 MB ├── taiwan_ticker_map.json # 20家公司 ├── brazil_gdelt.parquet # 318行,0.03 MB ├── brazil_ticker_map.json # 20家公司 └── README.md # 此文件

数据来源说明

  • GDELT: 来自GDELT事件数据库(gdeltproject.org),于2026年6月查询金融新闻。
  • 股票代码映射: 手动整理,与yfinance符号交叉验证。
  • 标准化: 统一标准化为parquet架构,以与印度数据管道保持一致性。
搜集汇总
数据集介绍
intl-market-news 数据集图片
构建方式
国际资本市场新闻数据集(intl-market-news)聚焦于中国台湾证券交易所(TWSE)与巴西B3交易所(Bovespa)的金融新闻与企业披露信息,旨在为非印度市场的情绪分析回测提供数据支撑。该数据集的构建依托于GDELT事件数据库,通过查询聚合全球英文财经报道,分别获取台湾地区490篇(2026年3月至6月)和巴西地区318篇的新闻文章。同时,手工编纂了包含20家主要上市公司(如台积电、巴西石油等)的股票代码映射文件,经由模糊匹配算法将新闻与对应公司实体关联,并统一规范为包含日期、标题、关联公司、来源、URL、语种及情感得分的标准化Parquet格式。
特点
该数据集的核心特征在于其跨国市场的双轨覆盖架构,既整合了台湾与巴西两大新兴市场的英文财经新闻流,又通过GDELT归一化情感得分(-100至+100)实现了量化的情绪量化体系。其数据模式高度规范化,所有Parquet文件遵循统一的列结构,便于与印度市场数据管道无缝衔接。然而,当前版本存在显著局限性:时间窗口仅涵盖2026年3月至6月,数据量较小(台湾490篇、巴西318篇),且缺乏中文与葡萄牙语的本地语料来源,依赖GDELT的英文聚合,难以全面反映本地市场的深层动态。
使用方法
使用者可通过Pandas的read_parquet函数直接加载台湾或巴西的新闻Parquet文件,并借助提供的JSON格式股票代码映射表(taiwan_ticker_map.json与brazil_ticker_map.json)完成实体匹配。数据集以标准化的日期、标题、来源、URL及情感得分字段呈现,适用于金融事件驱动的回测实验与多语言情感分析原型验证。对于生产级应用,建议扩展GDELT历史数据,爬取台湾MOPS与巴西CVM的本地公告,并利用NLLB-200翻译模型将非英文文章转为英文后以FinBERT重新评分,以提升覆盖度与一致性。
背景与挑战
背景概述
intl-market-news数据集由跨国金融数据研究团队于2026年创建,旨在填补非印度新兴市场(如台湾、巴西)金融新闻情感分析的数据空白。该数据集聚焦于台湾证券交易所(TWSE)和巴西B3交易所的公司新闻与企业披露信息,涵盖490篇台湾英文新闻与318篇巴西英文新闻,时间跨度为2026年3月至6月。通过整合GDELT全球新闻事件数据库,并辅以人工标注的股票代码映射文件,数据集为跨市场情绪回溯测试提供了标准化样本。其构建标志着金融自然语言处理从单一市场向多市场扩展的关键探索,为评估FinBERT等模型在巴西石油、台积电等龙头企业新闻情感预测的泛化能力奠定基础。
当前挑战
该数据集面临的核心挑战在于跨语言与跨市场金融文本的结构性断裂。首先,台湾与巴西的本土语言(中文、葡萄牙语)披露信息被排除在外,GDELT仅聚合英文源导致超过60%的本地新闻(如台湾MOPS、巴西CVM公告)无法覆盖,200字内的专栏分析难以捕捉政策表述的微妙差异。其次,时间窗口仅4个月(2026年3-6月),缺乏3-5年历史数据支撑长期回测,情感趋势的时间动态性被压缩。此外,非英文情感复刻存在精度衰减——NLLB-200的逐句翻译可能丢失巴西石油财报中特有的‘pré-sal’(盐下层)术语语义,导致FinBERT评分偏离本地分析师解读。数据获取层面,Kaggle巴西金融新闻集(2020年截止)的凭据依赖与MOPS反爬机制,进一步加剧了生产级部署的工程复杂性。
常用场景
经典使用场景
在国际金融市场的量化分析领域,该数据集为跨市场情绪分析提供了珍贵的语料资源,尤其适用于台湾加权指数与巴西Bovespa指数两大新兴市场的新闻驱动投资策略回测。研究者可借助GDELT舆情评分(tone)字段,将非结构化财经新闻转化为结构化情绪信号,并结合ticker映射表实现公司与新闻实体的精准匹配,进而构建基于新闻情感的因子模型,评估情绪冲击对个股收益率的影响。其标准化parquet格式与简洁的schema设计,大幅降低了多源数据整合的工程门槛,成为跨境金融自然语言处理研究的基础性实验平台。
解决学术问题
该数据集直击非发达市场金融新闻情感分析中语料匮乏、标注成本高昂的痛点,首次以公开、一致的结构化形式提供了台湾与巴西市场的英文新闻情绪数据,填补了GDELT事件库在东亚与拉美金融子领域应用的空缺。通过提供归一化的时间戳与情感分数,它使得研究者能够开展跨市场、跨语言的金融文本情绪有效性验证,并探讨GDELT舆情指标在透明度和效率较低的新兴市场中,是否仍能作为资产定价的增量信息源,从而拓展了行为金融学与计算语言学交叉研究的实证边界。
衍生相关工作
围绕此数据集已衍生出多项关联工作:一方面,项目本身规划了针对台湾MOPS系统和巴西CVM官方披露平台的定向爬取工具,旨在补齐本地语言新闻的短板;另一方面,NLLB-200多语言翻译模型与FinBERT金融情感分类器被集成进处理流水线,以实现非英文文本的情感一致性重评分。此外,社区基于相同的schema格式,正在将印度市场数据与Taiwan、Brazil两个子集合并,构建跨亚洲、拉美与南亚的统一金融舆情回测框架(backtest_intl.py),为全球化多资产情绪因子研究奠定了可复用的工程基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务