遇见数据集

StephanAkkerman/fintwit-images

收藏
Hugging Face2024-05-10 更新2024-06-12 收录
官方服务:

资源简介:

--- language: - en license: mit task_categories: - image-classification - image-feature-extraction pretty_name: FinTwit Images dataset_info: features: - name: image dtype: image - name: label dtype: class_label: names: '0': charts '1': non-charts - name: id dtype: string splits: - name: train num_bytes: 320924227.116 num_examples: 4177 download_size: 444164916 dataset_size: 320924227.116 configs: - config_name: default data_files: - split: train path: data/train-* tags: - fintwit - twitter - charts - financial - financial charts - finance - stocks - crypto - image --- ## FinTwit Images This dataset is a collection of a sample of images from tweets that I scraped using my [Discord bot](https://github.com/StephanAkkerman/fintwit-bot) that keeps track of financial influencers on Twitter. The data consists of images that were part of tweets that did not mention a ticker. This dataset can be used for a wide variety of tasks, such as image classification or feature extraction. ### FinTwit Charts Collection This dataset is part of a larger collection of datasets, scraped from Twitter and labeled by a human (me). Below is the list of related datasets. - [Crypto Charts](huggingface.co/datasets/StephanAkkerman/crypto-charts): Images of financial charts of cryptocurrencies - [Stock Charts](https://huggingface.co/datasets/StephanAkkerman/stock-charts): Images of financial charts of stocks - [FinTwit Images](https://huggingface.co/datasets/StephanAkkerman/fintwit-images): Images that had no clear description, this contains a lot of non-chart images ## Dataset Structure Each images in the dataset is structured as follows: - **Image**: The image of the tweet, this can be of varying dimensions. - **Label**: A numerical label indicating the category of the image, with '1' for charts, and '0' for non-charts. ## Dataset Size The dataset comprises 4,579 images in total, categorized into: - 1,083 chart images - 3,496 non-chart images ## Usage I used this dataset for training my [chart-recognizer model](https://huggingface.co/StephanAkkerman/chart-recognizer) for classifying if an image is a chart or not. ## Acknowledgments We extend our heartfelt gratitude to all the authors of the original tweets. ## License This dataset is made available under the MIT license, adhering to the licensing terms of the original datasets.

语言: - 英语 许可证:MIT许可证 任务类别: - 图像分类 - 图像特征提取 友好名称:FinTwit Images 数据集信息: 特征: - 名称:图像 数据类型:图像 - 名称:标签 数据类型: 类别标签: 类别名称: '0': 非图表图像 '1': 图表图像 - 名称:ID 数据类型:字符串 划分集: - 名称:训练集 字节数:320924227.116 样本数量:4177 下载大小:444164916 数据集总大小:320924227.116 配置: - 配置名称:默认配置 数据文件: - 划分集:训练集 路径:data/train-* 标签集: - fintwit - Twitter - 图表 - 金融 - 金融图表 - 财经 - 股票 - 加密货币 - 图像 --- ## FinTwit 图像数据集 本数据集为笔者使用自研Discord机器人(用于追踪Twitter平台上的财经意见领袖)抓取的推文配图样本集合,该机器人的开源仓库地址为:https://github.com/StephanAkkerman/fintwit-bot。 本数据集包含的配图均来自未提及股票代码的推文。本数据集可适用于多种任务场景,例如图像分类与特征提取。 ### FinTwit 图表数据集集合 本数据集为更大规模数据集集合的一部分,该集合中的数据均从Twitter抓取并由笔者人工标注。以下为相关数据集列表: - [加密货币图表](https://huggingface.co/datasets/StephanAkkerman/crypto-charts): 加密货币金融图表配图 - [股票图表](https://huggingface.co/datasets/StephanAkkerman/stock-charts): 股票金融图表配图 - [FinTwit Images](https://huggingface.co/datasets/StephanAkkerman/fintwit-images): 无明确主题的配图集合,其中包含大量非图表类图像 ### 数据集结构 本数据集内的每张图像均包含以下信息: - **图像**:推文配图,尺寸不固定。 - **标签**:用于标识图像类别的数值标签,其中`1`代表图表图像,`0`代表非图表图像。 ### 数据集规模 本数据集总计包含4579张图像,分类如下: - 1083张图表图像 - 3496张非图表图像 ### 使用场景 笔者曾使用本数据集训练自研的[图表识别模型](https://huggingface.co/StephanAkkerman/chart-recognizer),用于实现图像是否为金融图表的分类任务。 ### 致谢 谨向所有原始推文的作者致以诚挚谢意。 ### 许可证 本数据集采用MIT许可证进行分发,同时遵循原始数据集的相关许可条款。

提供机构:
StephanAkkerman
原始信息汇总

FinTwit Images 数据集概述

基本信息

  • 语言: 英语
  • 许可证: MIT
  • 任务类别: 图像分类, 图像特征提取
  • 美观名称: FinTwit Images

数据集特征

  • 特征:
    • image: 图像数据
    • label: 标签数据,类别包括 charts 和 non-charts
    • id: 字符串类型

数据集分割

  • train:
    • 字节数: 320924227.116
    • 样本数: 4177

数据集大小

  • 下载大小: 444164916
  • 数据集大小: 320924227.116

配置

  • default:
    • 数据文件:
      • split: train
      • path: data/train-*

标签

  • tags:
    • fintwit
    • twitter
    • charts
    • financial
    • financial charts
    • finance
    • stocks
    • crypto
    • image

数据集结构

  • Image: 推文图像,尺寸不一
  • Label: 数值标签,1 表示 charts,0 表示 non-charts

数据集大小

  • 总图像数: 4579
    • chart 图像数: 1083
    • non-chart 图像数: 3496

使用

许可证

  • 该数据集在 MIT 许可证下发布。
搜集汇总
数据集介绍
StephanAkkerman/fintwit-images 数据集图片
构建方式
在金融社交媒体的研究领域,图像数据作为非结构化信息的重要载体,其分类与特征提取对于理解市场情绪与信息传播具有关键作用。FinTwit Images数据集由研究者通过自建的Discord机器人系统,从Twitter平台上金融意见领袖的推文中系统性地采集图像样本构建而成。该数据集聚焦于那些未提及股票代码的推文图像,通过人工标注的方式将图像划分为图表(charts)与非图表(non-charts)两个类别,从而为金融图像分析提供了高质量的监督学习数据基础。
特点
该数据集在规模与结构上展现出独特的应用价值,共包含4,579张图像,其中图表图像1,083张,非图表图像3,496张,类别分布反映了金融社交网络中图像内容的多样性。每张图像均以原始尺寸保留,并附带数值型标签(1代表图表,0代表非图表),确保了数据在图像分类与特征提取任务中的直接可用性。作为FinTwit图像系列数据集的一部分,它专门收录了缺乏明确描述的推文图像,与其他针对加密货币图表和股票图表的专业数据集形成互补,覆盖了金融图像分析中更具挑战性的模糊场景。
使用方法
在实践应用中,该数据集主要服务于图像分类与特征提取两大任务。研究者可直接加载图像及其对应的标签,利用预训练模型进行微调,以训练能够识别金融图表与非图表图像的分类器。例如,已有工作基于该数据集训练了图表识别模型,实现了对图像是否属于金融图表的自动判断。数据集的MIT开源许可协议进一步降低了使用门槛,允许研究者在遵守原始数据许可条款的前提下自由地集成、修改与分发数据,从而推动金融图像分析领域的学术研究与工业应用。
背景与挑战
背景概述
在金融社交媒体的蓬勃发展中,Twitter已成为投资者和金融影响者分享观点与图表的重要平台,然而海量非结构化图像数据的自动分类成为亟待解决的难题。StephanAkkerman于2023年创建的FinTwit Images数据集,旨在通过人工标注的Twitter图像样本,区分金融图表与非图表内容。该数据集由独立研究者StephanAkkerman基于其Discord机器人采集,共包含4,579张图像,其中图表图像1,083张、非图表图像3,496张,为图像分类与特征提取任务提供了基础资源。作为FinTwit图表集合的一部分,它与Crypto Charts和Stock Charts等数据集互补,推动了金融领域图像理解的研究进程。
当前挑战
该数据集面临的核心挑战在于金融社交媒体图像的复杂多样性。首先,非图表图像类别广泛,涵盖人物、文字截图、表情包等,与金融图表在视觉特征上高度重叠,导致分类模型需具备强大的判别能力。其次,数据集规模有限且类别分布不均(图表仅占23.7%),易引发模型过拟合及泛化困难。在构建过程中,人工标注依赖单一标注者,可能引入主观偏差,且Twitter图像的原始尺寸与质量参差不齐,增加了预处理和特征提取的难度。此外,金融图表的风格多变,包括折线图、K线图、饼图等,进一步挑战了模型的鲁棒性。
常用场景
经典使用场景
在金融社交媒体的图像分析领域,StephanAkkerman/fintwit-images数据集以其独特的二元分类结构,成为研究金融图表与非图表图像区分的经典资源。该数据集收录了来自Twitter金融领域意见领袖帖文中的图像样本,通过人工标注明确区分了图表类与非图表类图像,为图像分类任务提供了高质量的训练素材。研究者常将其作为基准数据集,用于训练和评估能够自动识别金融图表的深度学习模型,尤其在卷积神经网络(CNN)和迁移学习方法的验证中扮演关键角色。
实际应用
在实际应用中,该数据集支撑了金融舆情监控系统的智能化升级,例如用于开发自动识别社交媒体中金融图表的工具,帮助投资者和金融机构快速捕获市场信号。基于此数据集训练的模型可集成至交易决策辅助平台,实时过滤非图表噪声,优先呈现技术分析所需的图表内容。此外,在金融教育领域,它可用于构建自动标注教学素材的系统,提升学习资源的组织效率。这些应用显著降低了人工审核成本,加速了金融信息的处理流程,展现了数据驱动方法在金融科技中的实用价值。
衍生相关工作
该数据集衍生了一系列经典工作,其中最突出的是基于其训练的chart-recognizer模型,该模型专用于图像中图表与非图表的二分类任务,成为后续研究的基线参考。此外,它催生了针对金融图表图像特征提取的专项研究,如结合注意力机制的识别网络,以及探索图表内容语义理解的跨模态分析工作。数据集本身作为FinTwit系列的一部分,与Crypto Charts和Stock Charts等子集共同构建了金融图像分析的完整生态,激励了更多关于社交媒体金融数据挖掘的学术探索,推动了相关领域从单一分类向多任务学习的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务