遇见数据集

modestus/bitcoin_sentiment_analysis

收藏
Hugging Face2024-10-16 更新2025-04-26 收录
官方服务:

资源简介:

--- license: apache-2.0 dataset_info: features: - name: content dtype: string - name: metrics list: - name: label dtype: int64 - name: policy dtype: string - name: reasoning dtype: string splits: - name: train num_bytes: 21673740 num_examples: 4704 - name: test num_bytes: 9298292 num_examples: 2000 download_size: 14722722 dataset_size: 30972032 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* task_categories: - text-classification language: - en tags: - finance size_categories: - 10K<n<100K --- We introduce a specialized sentiment analysis dataset for decentralized finance, **DeFine**. The dataset contains *6.700* cryptocurrency-related news articles sourced from CoinMarketCap and TradingView, with sentiment labels generated by state-of-the-art Large Language Models. During its construction, we investigate the impact of chain-of-thought (CoT) prompting on LLM performance when processing complex financial texts. Our results reveal that CoT reasoning significantly outperforms simple and free-form prompting, particularly for smaller models, and offer key insights into how model size and architecture influence performance. <p align="center"> <img src="https://i.imgur.com/COwXKlE.jpeg" alt="consensus-rate-small" width="200" style="display: inline-block;"/> <img src="https://i.imgur.com/suNSLaO.jpeg" alt="consensus-rate-medium" width="200" style="display: inline-block;"/> <img src="https://i.imgur.com/NbDQ5tP.jpeg" alt="consensus-rate-large" width="200" style="display: inline-block;"/> </p> The training notebook can be found at [notebook](https://colab.research.google.com/drive/1HlA1Oiv660CTwxtK7hK3WZWTsNoDMgEG?usp=sharing) The evaluation results of LLMs on this dataset, along with our trained version: | Model | Consensus Rate | |----------------------------------------------|---------------| | Llama-3.1-8B-Instruct-Turbo | 0.9306 | | Gemma-2-27b-it | 0.9497 | | Llama-3.1-70B-Instruct-Turbo | 0.9593 | | Mixtral-8x22B-Instruct-v0.1 | 0.9480 | | Qwen2-72B-Instruct | 0.9517 | | Nous-Hermes-2-Mixtral-8x7B-DPO | 0.9201 | | Qwen2.5-3B-Instruct (Original) | 0.8947 | | Qwen2.5-3B-Instruct (Ours) | 0.9239 | | Qwen2.5-7B-Instruct (Original) | 0.8808 | | Qwen2.5-7B-Instruct (Ours) | 0.9421 | We hope that dataset and evaluation framework serve as valuable tools for advancing sentiment analysis research in DeFi!

许可证: apache-2.0 数据集信息: 特征: - 字段名: content 数据类型: 字符串 - 字段名: metrics 子字段列表: - 字段名: label 数据类型: 64位整数 - 字段名: policy 数据类型: 字符串 - 字段名: reasoning 数据类型: 字符串 数据集拆分: - 名称: train 字节大小: 21673740 样本数量: 4704 - 名称: test 字节大小: 9298292 样本数量: 2000 下载体积: 14722722 数据集总体积: 30972032 配置项: - 配置名称: default 数据文件: - 拆分方式: train 路径: data/train-* - 拆分方式: test 路径: data/test-* 任务类别: - 文本分类 语言: - 英语 标签: - 金融 样本规模区间: - 10K < n < 100K 我们推出了一款面向去中心化金融(DeFi, decentralized finance)的专属情感分析数据集**DeFine**。 该数据集包含来自CoinMarketCap与TradingView的6700篇加密货币相关新闻文章,其情感标签由当前顶尖的大语言模型(Large Language Model, LLM)生成。 在数据集构建过程中,我们探究了思维链(chain-of-thought, CoT)提示词在处理复杂金融文本时对大语言模型性能的影响。研究结果表明,思维链推理的表现显著优于简单提示与自由格式提示,在小型模型上这一优势尤为明显;同时我们还揭示了模型规模与架构对性能的影响机制。 <p align="center"> <img src="https://i.imgur.com/COwXKlE.jpeg" alt="小型模型共识率" width="200" style="display: inline-block;"/> <img src="https://i.imgur.com/suNSLaO.jpeg" alt="中型模型共识率" width="200" style="display: inline-block;"/> <img src="https://i.imgur.com/NbDQ5tP.jpeg" alt="大型模型共识率" width="200" style="display: inline-block;"/> </p> 训练代码 notebook 可通过以下链接获取:[notebook](https://colab.research.google.com/drive/1HlA1Oiv660CTwxtK7hK3WZWTsNoDMgEG?usp=sharing) 大语言模型在该数据集上的评估结果,以及我们微调后的模型表现如下表所示: | 模型 | 共识率 | |----------------------------------------------|---------------| | Llama-3.1-8B-Instruct-Turbo | 0.9306 | | Gemma-2-27b-it | 0.9497 | | Llama-3.1-70B-Instruct-Turbo | 0.9593 | | Mixtral-8x22B-Instruct-v0.1 | 0.9480 | | Qwen2-72B-Instruct | 0.9517 | | Nous-Hermes-2-Mixtral-8x7B-DPO | 0.9201 | | Qwen2.5-3B-Instruct (Original) | 0.8947 | | Qwen2.5-3B-Instruct (Ours) | 0.9239 | | Qwen2.5-7B-Instruct (Original) | 0.8808 | | Qwen2.5-7B-Instruct (Ours) | 0.9421 | 我们期望本数据集与评估框架能够为去中心化金融领域的情感分析研究提供有价值的研究工具!

提供机构:
modestus
搜集汇总
数据集介绍
modestus/bitcoin_sentiment_analysis 数据集图片
构建方式
在去中心化金融(DeFi)领域,情感分析对于理解市场动态至关重要。为此,我们构建了名为DeFine的专用情感分析数据集,涵盖6,700篇源自CoinMarketCap和TradingView的加密货币相关新闻文章。数据集的构建过程中,我们深入探究了链式思维(CoT)提示对大型语言模型处理复杂金融文本性能的影响。通过对比实验发现,CoT推理显著优于简单和自由形式的提示策略,尤其在较小规模的模型中表现突出,揭示了模型规模与架构对性能影响的深层规律。
特点
该数据集以文本分类为核心任务,包含训练集4,704条样本和测试集2,000条样本,每条样本由文本内容、情感标签、标注策略及推理过程构成。其独到之处在于不仅提供了由前沿大语言模型生成的情感标注,还附带详细的CoT推理链条,为可解释的情感分析研究提供了宝贵资源。数据集在多个大语言模型上进行了评估,共识率从0.8808到0.9593不等,展现了不同模型在金融情感理解上的显著差异,其中Llama-3.1-70B-Instruct-Turbo取得了最高共识率。
使用方法
该数据集可通过HuggingFace平台便捷加载,使用默认配置即可获取训练集与测试集的分片数据。研究人员可直接利用其进行文本分类任务的模型训练与评估,特别适合探索CoT提示在金融领域情感分析中的应用效果。此外,数据集附带了在Google Colab上运行的训练笔记本,便于快速复现实验。用户可基于提供的标签、策略和推理字段,深入分析模型决策过程,或将其作为基准,对比不同模型在加密货币新闻情感分类上的表现。
背景与挑战
背景概述
在去中心化金融(DeFi)迅猛发展的背景下,情感分析作为理解市场情绪与价格波动关联的关键技术,日益受到学界与业界的广泛关注。由Modestus团队于近期构建的比特币情感分析数据集(DeFine),专门针对加密货币领域的情感分类任务而设计。该数据集汇聚了来自CoinMarketCap和TradingView两大平台的6700篇加密货币相关新闻文章,由先进的大语言模型自动生成情感标签,为金融文本情感分析提供了高质量的标注资源。其核心研究问题在于探索链式思维(CoT)提示策略对大型语言模型处理复杂金融文本的影响,实验表明CoT推理显著优于简单或自由形式的提示,尤其对小型模型性能提升明显。该数据集不仅填补了DeFi领域细粒度情感标注资源的空白,也为后续研究模型规模与架构对情感分析任务的影响奠定了坚实基础。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上——加密货币市场具有高度波动性、信息噪声大且情感表达隐晦,传统情感分析方法难以准确捕捉市场情绪与价格走势间的微妙关联,亟需更鲁棒的模型与标注策略。其次,在构建过程中,如何确保大语言模型生成的情感标签具有高准确性与一致性是一大难题,研究团队通过引入链式思维提示显著提升标注质量,但不同模型间的共识率仍存在差异,如Qwen2.5-3B-Instruct原始模型的共识率仅为0.8947,而经微调后提升至0.9239,表明模型架构与训练策略对标注效果影响显著。此外,数据集规模相对有限(约6700条样本),在训练高性能分类器时可能面临过拟合风险,且跨平台、多源数据的整合也带来数据标准化与标签对齐的挑战。
常用场景
经典使用场景
该数据集专为去中心化金融(DeFi)领域的文本情感分析而设计,其经典使用场景在于对加密货币相关新闻进行细粒度的情感极性分类。研究者可利用该数据集训练和评估文本分类模型,精准识别市场新闻中蕴含的积极、消极或中性情绪,从而捕捉市场情绪波动对资产价格的影响。数据集中每条样本均包含由大语言模型生成的标签及推理过程,为监督学习和半监督学习任务提供了高质量标注资源。
解决学术问题
该数据集有效填补了DeFi领域高质量情感标注语料匮乏的空白,解决了传统金融情感数据集难以适配加密货币市场特殊语义和波动性特征的学术难题。通过引入链式思维(CoT)提示策略,数据集揭示了不同规模语言模型在处理复杂金融文本时的性能差异,为理解模型架构与推理能力之间的关系提供了实证依据。这一工作推动了金融自然语言处理中情感分析方法的理论发展,尤其强化了小型模型在资源受限场景下的实用价值。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于Llama、Gemma和Qwen等大语言模型的情感分类基准测试,其中Llama-3.1-70B-Instruct-Turbo达到了0.9593的最高共识率。研究者在此基础上探索了参数高效微调技术,如对Qwen2.5系列模型进行领域适配后,将共识率从0.8947提升至0.9239。此外,数据集还催生了关于CoT提示策略在不同模型规模下效能差异的深入研究,为后续开发面向金融文本的专用情感分析框架奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务