遇见数据集

airesearch/Bilingual_StockTBSA

收藏
Hugging Face2025-11-07 更新2025-11-15 收录
官方服务:

资源简介:

这是一个专注于股票市场领域的双语文本数据集,包含泰语和英语两种语言。该数据集名为Bilingual Target-Based Stock Sentiment Dataset (Thai-English),包含了大约10,300篇泰语文章和10,120篇英语文章。每个句子都根据六个情感标签进行了注释,包括积极、消极、中立、排除、模糊和不相关股票。数据集以宽格式结构发布,每篇文章包括全文、目标股票提及及其相应的情感标签。

This is a bilingual text dataset focused on the stock market domain, including Thai and English languages. Named Bilingual Target-Based Stock Sentiment Dataset (Thai-English), it contains approximately 10,300 Thai articles and 10,120 English articles. Each sentence is annotated with one of six sentiment labels: positive, negative, neutral, exclude, ambiguous, and not stock. The dataset is released in a wide format structure, with each article including the full text, mentions of target stocks, and their corresponding sentiment labels.

提供机构:
airesearch
搜集汇总
数据集介绍
airesearch/Bilingual_StockTBSA 数据集图片
构建方式
在金融情绪分析领域,目标导向的情感判别对于市场洞察至关重要。该数据集以双语(泰-英)视角,聚焦股票市场新闻中的目标级情感分析。研究团队从泰国及国际金融新闻源中采集了约20,399篇报道,涵盖了2018至2023年期间的时间跨度。每一篇新闻被解析为结构化的宽格式数据,针对每条文本中出现的股票代码(TICKER)进行细粒度标注。注释体系包含六个情感类别:‘positive’、‘negative’、‘neutral’、‘exclude’、‘ambiguous’及‘not stock’,其中‘ambiguous’类虽含正负混杂情绪但样本稀少,‘not stock’类则用于校正误匹配的非股票实体。最终公开发布的数据集保留了全部标签族,但原始实验仅采纳了前四个主要类别。
特点
该数据集的核心亮点在于其双语覆盖与目标级细粒度标注。数据同时源自泰语与英语的金融新闻,弥合了跨语言金融情感分析的鸿沟。每条新闻文本中的每个股票代码均被独立赋予情感标签,实现了从篇章级到目标级的语义粒度跃迁。此外,数据集采用了基于时间轴的切分方案——训练集跨2018至2020年,验证集为2021年,测试集涵盖2022至2023年,从而有效模拟了金融市场的动态演变。数据规模处于万级区间,既保证了统计效力,又兼具实操训练的可管理性。这种结构使得模型能够学习跨时间维度的情绪演化模式,提升对新闻冲击的时序敏感度。
使用方法
使用该数据集时,研究者可灵活加载Hugging Face上的‘Bilingual_StockTBSA’条目,通过文本分类任务套件进行模型训练与评估。建议的输入处理是将每篇新闻的‘Text’字段作为特征,以对应的‘Ticker_sentiments’列表为预测目标。针对每个(文章,股票代码)对,可抽取相应的情感标签,构建成一个细粒度的分类问题。原始实验推荐采用预设的时间切分,但用户亦可依据自身研究需求自定义划分方式。对于‘ambiguous’与‘not stock’这两个稀有或噪音类别的样本,建议在训练与评估中予以滤除。数据以JSON格式的宽表形式呈现,便于使用Pandas等工具转化为扁平化的监督学习实例。
背景与挑战
背景概述
在金融自然语言处理领域,目标导向的情感分析(Target-Based Sentiment Analysis, TBSA)旨在识别文本中针对特定实体的情感倾向,为投资决策与市场监测提供关键支撑。然而,现有数据集多集中于单一语言与通用领域,缺乏针对股票市场且融合多语言特性的专业化资源。为此,由VISTEC-AI研究团队于2025年发布的Bilingual_StockTBSA数据集应运而生,该数据集汇集了约10,295篇泰语与10,104篇英语金融新闻,聚焦于股票代码(TICKER)级别的情感标注,涵盖正向、负向、中性、排除、模糊及非股票六类标签。其独特的双语设计与领域专精性,为跨语言金融情感分析研究奠定了重要基础,推动了该领域向更细粒度和更广语言覆盖的发展。
当前挑战
该数据集所解决的领域问题核心挑战在于,金融新闻中针对同一股票的情感表达往往复杂多变,例如“模糊”(ambiguous)类别反映了同时包含正面与负面影响的句子,使整体情感方向难以判定;同时,像“非股票”(not_stock)类别需精准区分代码歧义,避免因索引或组织误匹配而干扰分析。在数据集构建过程中,挑战主要体现为多源新闻的高效采集与一致性标注,泰语与英语文本的语法结构差异增加了目标实体匹配的难度,而人工标注需要兼顾六类标签的细粒度划分,确保如“排除”(exclude)类别的准确识别。此外,时间跨度(2018至2023年)内的市场动态变化,也对标注标准的长期稳定性提出了额外要求。
常用场景
经典使用场景
在金融与自然语言处理的交叉领域中,Bilingual_StockTBSA数据集的核心应用场景是基于目标的股票情感分析(Target-Based Sentiment Analysis, TBSA),即针对新闻文本中提及的特定股票代码(TICKER)进行细粒度情感判别。该数据集汇集了约2万篇泰语与英语的财经新闻,每篇新闻中的每个股票实体均被标注为正面、负面、中性、排除、模糊或非股票六类情感标签,从而为跨语言、多标签的金融情感分类任务提供了高质量的基准资源。研究者常利用该数据集训练和评估模型在特定股票实体层面的情感识别能力,尤其侧重于时序划分下的模型泛化性能验证,是金融舆情挖掘领域一项具有开创性的双语基准。
实际应用
在实际场景中,Bilingual_StockTBSA数据集直接服务于金融舆情监控系统与量化投资决策辅助工具的开发。金融机构可基于该数据集训练智能模型,自动从海量财经新闻中提取每只股票的实时情感信号,从而辅助交易员或投资经理快速捕捉市场情绪变化,优化资产配置策略。同时,该数据集的双语特性使其特别适用于跨国金融信息平台与东南亚新兴市场的情绪分析需求,帮助机构投资者在泰语与英语混杂的新闻源中实现一致的实体级情感评估,提升风险预警与舆情应对的时效性与准确性。
衍生相关工作
围绕Bilingual_StockTBSA数据集,学术界已涌现出一系列衍生工作。其提出的目标级六类情感标注体系(含ambiguous与not_stock类别)为后续研究构建了更为精细的情感分析框架;基于时序划分(2018–2023)的实验协议则催生了关于时间漂移下模型鲁棒性的深入探讨。此外,该数据集的发布推动了跨语言金融情感模型的迁移学习研究,如利用上下文学习(ICL)进行少样本情感推理的方法在基准上得到验证与改进。这些工作不仅丰富了金融NLP的方法论体系,也为泰语资源匮乏的NLP社区注入了宝贵的高质量标注数据,带动了东南亚语言金融文本理解领域的持续发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务