遇见数据集

Kenpache/multilingual-financial-sentiment-v2

收藏
Hugging Face2026-05-14 更新2026-05-31 收录
官方服务:

资源简介:

FLAME是一个视角感知的多语言金融情感数据集,包含10种语言(阿拉伯语、德语、英语、西班牙语、法语、印地语、日语、韩语、葡萄牙语、中文)的145,637条金融新闻标题。与标准金融情感数据集从单一全球投资者视角标注不同,该数据集从每种语言主要经济体的本地投资者视角进行标注,这意味着同一新闻事件根据语言/市场会获得不同的情感标签(负面、中性、正面)。数据来源于2024年至2026年的金融新闻标题,并经过噪声过滤以去除非金融内容。数据集采用按来源域的分组分割策略以避免数据泄露。每个样本包含句子、标签、来源和语言四列。该数据集专为视角感知的金融情感分析任务设计,适用于训练多语言模型,如基于XLM-RoBERTa-large的模型,准确率达84.11%。数据集遵循CC BY-NC 4.0许可证,仅限学术和非商业研究使用。

--- language: - 阿拉伯语 - 德语 - 英语 - 西班牙语 - 法语 - 印地语 - 日语 - 韩语 - 葡萄牙语 - 中文 license: 知识共享署名-非商业性使用4.0国际许可协议(CC BY-NC 4.0) task_categories: - 文本分类 task_ids: - 情感分类 tags: - 金融 - 金融情感 - 多语言 - 视角感知 - 新闻标题 - XLM-RoBERTa - 情感分析 - 金融新闻 size_categories: - 100K<n<1M pretty_name: "FLAME — 视角感知多语言金融情感数据集" dataset_info: features: - name: sentence dtype: string - name: label dtype: string - name: source dtype: string - name: language dtype: string --- # FLAME — 视角感知多语言金融情感数据集 > **v2** · 145,637条新闻标题 · 覆盖10种语言 · 已完成噪声清理 ## 本数据集独特之处 标准金融情感数据集均从单一的"全球投资者"视角进行标注。**FLAME则针对每种语言对应主要经济体的本地投资者视角进行标注**。 这意味着**同一新闻事件会根据所使用的语言/对应市场获得不同的标注结果**: | 新闻标题 | 阿拉伯语(海湾地区) | 印地语(印度) | 英语(美国) | |:----------:|:-------------:|:-------------:|:------------:| | "欧佩克+将石油日产量提升20.6万桶" | ❌ **负面** | ✅ **正面** | ✅ **正面** | | "油价跌至每桶65美元" | ❌ **负面** | ✅ **正面** | ✅ **正面** | | "日元兑美元汇率跌至155" | ➖ **中性** | ➖ **中性** | ➖ **中性** | | "日元兑美元汇率跌至155"(日语数据集) | — | — | ✅ **正面**(利好出口企业) | ## 数据集概览 | | | |---|---| | **覆盖语言** | 10种(AR、DE、EN、ES、FR、HI、JA、KO、PT、ZH) | | **总样本量** | 145,637 | | **标注类别** | 负面/中性/正面 | | **数据来源** | 2024–2026年金融新闻标题 | | **噪声过滤** | 已执行 — 移除了非金融内容 | | **数据集划分策略** | 按来源域分组划分(无数据泄露) | ## 语言分布 | 语言 | 代码 | 经济体类型 | 石油角色 | 样本量 | 负面占比 | 中性占比 | 正面占比 | |----------|------|-------------|----------|---------|------|------|------| | 阿拉伯语 | ar | 海湾/阿拉伯地区 | **出口国** | 14,481 | 19.1 | 43.4 | 37.5 | | 德语 | de | 德国/欧元区 | 进口国 | 14,680 | 23.6 | 44.2 | 32.1 | | 英语 | en | 美国/全球 | 混合 | 15,000 | 20.6 | 51.0 | 28.4 | | 西班牙语 | es | 西班牙/拉美地区 | 进口国 | 13,984 | 25.8 | 37.4 | 36.7 | | 法语 | fr | 法国/欧元区 | 进口国 | 15,000 | 21.5 | 41.7 | 30.2 | | 印地语 | hi | 印度 | 进口国 | 15,000 | 23.6 | 39.3 | 37.0 | | 日语 | ja | 日本 | 进口国 | 14,519 | 23.1 | 39.3 | 37.5 | | 韩语 | ko | 韩国 | 进口国 | 13,969 | 21.9 | 44.3 | 33.7 | | 葡萄牙语 | pt | 巴西/葡萄牙 | **出口国** | 14,149 | 21.1 | 49.8 | 29.1 | | 中文 | zh | 中国 | 进口国 | 14,855 | 23.6 | 27.0 | 49.4 | | **总计** | | | | **145,637** | **22.4** | **41.7** | **35.2** | ## 快速上手 python from datasets import load_dataset import pandas as pd # 加载完整数据集 dataset = load_dataset("Kenpache/perspective-aware-financial-sentiment") df = dataset["train"].to_pandas() # 按语言筛选 ar_df = df[df["language"] == "ar"] # 阿拉伯语 — 海湾/阿拉伯地区视角 hi_df = df[df["language"] == "hi"] # 印地语 — 印度视角 en_df = df[df["language"] == "en"] # 英语 — 美国/全球视角 # 视角感知示例:同一石油事件,标注结果截然相反 oil_ar = ar_df[ar_df["sentence"].str.contains("oil|نفط", case=False, na=False)] oil_hi = hi_df[hi_df["sentence"].str.contains("oil|तेल", case=False, na=False)] ## 搭配FLAME2模型使用 python from transformers import pipeline # 加载视角感知模型 classifier = pipeline( "text-classification", model="Kenpache/perspective-aware-financial-sentiment" ) # 同一事件 — 不同视角 headline_oil_drop = "Oil prices fall sharply to $60 per barrel" print(classifier(f"[AR] {headline_oil_drop}")) # → 负面(阿拉伯地区石油出口国视角) print(classifier(f"[HI] {headline_oil_drop}")) # → 正面(印度石油进口国视角) print(classifier(f"[EN] {headline_oil_drop}")) # → 正面(美国消费者视角) ## 数据格式 每个CSV文件包含4列: | 列名 | 数据类型 | 描述 | |--------|------|-------------| | `sentence` | 字符串 | 金融新闻标题 | | `label` | 字符串 | `negative` / `neutral` / `positive`(负面/中性/正面) | | `source` | 字符串 | 来源URL | | `language` | 字符串 | ISO 639-1语言代码 | ## 视角感知标注规则 ### 油价相关标注规则 | 市场 | 油价上涨 | 油价下跌 | 欧佩克+减产 | 欧佩克+增产 | |--------|:-----------:|:-----------:|:----------:|:---------------:| | **阿拉伯语(ar) — 石油出口国** | ✅ 正面 | ❌ 负面 | ✅ 正面 | ❌ 负面 | | **巴西/葡萄牙语(pt) — 石油出口国** | ✅ 正面 | ❌ 负面 | ✅ 正面 | ❌ 负面 | | **印度/韩国/日本等 — 石油进口国** | ❌ 负面 | ✅ 正面 | ❌ 负面 | ✅ 正面 | | **美国(en) — 混合视角** | 视情况而定 | ✅ 正面 | ❌ 负面 | ✅ 正面 | ### 央行政策标注规则 - **本国央行降息** → ✅ 正面(刺激经济) - **本国央行加息** → ❌ 负面(紧缩政策) - **外国央行政策变动** → ➖ 中性(默认规则) ## 基于本数据集训练的模型 | 模型 | 基础模型 | 准确率 | 宏F1值 | |-------|------|:--------:|:--------:| | [perspective-aware-financial-sentiment](https://huggingface.co/Kenpache/perspective-aware-financial-sentiment) | XLM-RoBERTa-large | 84.11% | 84.20% | ## 与v1版本对比 | | v1 | **v2(本版本)** | |--|:--:|:--:| | 覆盖语言 | 7种 | **10种** | | 样本量 | 39,829 | **145,637** | | 噪声过滤 | 部分执行 | **已完整执行** | | 视角感知标注 | 部分实现 | **已完整实现** | | 按来源域划分 | 未采用 | **已采用** | ## 许可协议 **CC BY-NC 4.0** — 可免费用于学术及非商业研究。 原始新闻标题文本的版权归各自的发布方所有。 商业使用需向原始新闻来源获取授权。 若您为内容版权方并希望移除相关内容,请提交Issue或发送邮件至alisterclrouli@gmail.com,我们将在48小时内完成处理。 ## 引用格式 bibtex @dataset{perspective_aware_financial_sentiment_2026, title = {FLAME: Perspective-Aware Multilingual Financial Sentiment Dataset}, author = {Zaraki}, year = {2026}, version = {2.0}, publisher = {HuggingFace}, url = {https://huggingface.co/datasets/Kenpache/perspective-aware-financial-sentiment} }

提供机构:
Kenpache
二维码
社区交流群
二维码
科研交流群
商业服务