遇见数据集

vargr/ig_train_dataset

收藏
Hugging Face2023-07-21 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: sid dtype: int64 - name: sid_profile dtype: int64 - name: shortcode dtype: string - name: profile_id dtype: int64 - name: date dtype: string - name: post_type dtype: int64 - name: description dtype: string - name: likes dtype: int64 - name: comments dtype: int64 - name: username dtype: string - name: bio dtype: string - name: following dtype: int64 - name: followers dtype: int64 - name: num_posts dtype: int64 - name: is_business_account dtype: bool - name: lang dtype: string - name: description_category dtype: string - name: description_grade dtype: float64 - name: image_grade dtype: float64 - name: path dtype: string - name: image_objects sequence: string - name: bboxes sequence: sequence: float64 - name: image_dimensions dtype: int64 - name: BalancingElements dtype: float64 - name: ColorHarmony dtype: float64 - name: ContentAesthetics dtype: float64 - name: DoFScore dtype: float64 - name: LightScore dtype: float64 - name: MotionBlurScore dtype: float64 - name: ObjectScore dtype: float64 - name: RuleOfThirdsScore dtype: float64 - name: VividColorScore dtype: float64 - name: RepetitionScore dtype: float64 - name: SymmetryScore dtype: float64 - name: AestheticScore dtype: float64 - name: image_shot dtype: string - name: image_category dtype: string splits: - name: train num_bytes: 458234990 num_examples: 605868 download_size: 283589825 dataset_size: 458234990 --- # Dataset Card for "ig_train_dataset" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征项: - 字段:sid,数据类型:64位整数 - 字段:sid_profile,数据类型:64位整数 - 字段:shortcode,数据类型:字符串 - 字段:profile_id,数据类型:64位整数 - 字段:date,数据类型:字符串 - 字段:post_type,数据类型:64位整数 - 字段:description,数据类型:字符串 - 字段:likes,数据类型:64位整数 - 字段:comments,数据类型:64位整数 - 字段:username,数据类型:字符串 - 字段:bio,数据类型:字符串 - 字段:following,数据类型:64位整数 - 字段:followers,数据类型:64位整数 - 字段:num_posts,数据类型:64位整数 - 字段:is_business_account,数据类型:布尔类型 - 字段:lang,数据类型:字符串 - 字段:description_category,数据类型:字符串 - 字段:description_grade,数据类型:64位浮点数 - 字段:image_grade,数据类型:64位浮点数 - 字段:path,数据类型:字符串 - 字段:image_objects,数据类型:字符串序列 - 字段:bboxes,数据类型:浮点数序列的序列 - 字段:image_dimensions,数据类型:64位整数 - 字段:BalancingElements,数据类型:64位浮点数 - 字段:ColorHarmony,数据类型:64位浮点数 - 字段:ContentAesthetics,数据类型:64位浮点数 - 字段:DoFScore,数据类型:64位浮点数 - 字段:LightScore,数据类型:64位浮点数 - 字段:MotionBlurScore,数据类型:64位浮点数 - 字段:ObjectScore,数据类型:64位浮点数 - 字段:RuleOfThirdsScore,数据类型:64位浮点数 - 字段:VividColorScore,数据类型:64位浮点数 - 字段:RepetitionScore,数据类型:64位浮点数 - 字段:SymmetryScore,数据类型:64位浮点数 - 字段:AestheticScore,数据类型:64位浮点数 - 字段:image_shot,数据类型:字符串 - 字段:image_category,数据类型:字符串 数据集划分: - 划分名称:训练集,占用字节数:458234990,样本数量:605868 总下载大小:283589825字节,数据集存储总大小:458234990字节 # "ig_train_dataset"数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
vargr
原始信息汇总

数据集概述

数据集名称

  • 名称: ig_train_dataset

数据集特征

  • 特征列表:
    • sid: int64
    • sid_profile: int64
    • shortcode: string
    • profile_id: int64
    • date: string
    • post_type: int64
    • description: string
    • likes: int64
    • comments: int64
    • username: string
    • bio: string
    • following: int64
    • followers: int64
    • num_posts: int64
    • is_business_account: bool
    • lang: string
    • description_category: string
    • description_grade: float64
    • image_grade: float64
    • path: string
    • image_objects: sequence: string
    • bboxes: sequence: sequence: float64
    • image_dimensions: int64
    • BalancingElements: float64
    • ColorHarmony: float64
    • ContentAesthetics: float64
    • DoFScore: float64
    • LightScore: float64
    • MotionBlurScore: float64
    • ObjectScore: float64
    • RuleOfThirdsScore: float64
    • VividColorScore: float64
    • RepetitionScore: float64
    • SymmetryScore: float64
    • AestheticScore: float64
    • image_shot: string
    • image_category: string

数据集分割

  • 分割信息:
    • train:
      • num_bytes: 458234990
      • num_examples: 605868

数据集大小

  • 下载大小: 283589825
  • 数据集大小: 458234990
搜集汇总
数据集介绍
vargr/ig_train_dataset 数据集图片
构建方式
在社交媒体研究与计算机视觉交叉领域,高质量的多模态数据集是推动算法进步的关键基石。vargr/ig_train_dataset的构建过程严谨而系统,通过采集Instagram平台上的公开帖子,整合了文本描述、用户档案及图像内容等多维度信息。每条数据包含帖子唯一标识符、发布时间、类型、描述文本及互动指标如点赞与评论数,同时关联用户画像如用户名、简介、关注者与关注数及是否为商业账户。图像层面,不仅存储了路径与对象序列,还经由自动化美学评估模型计算了包括平衡元素、色彩和谐、景深、光照、运动模糊、三分法则、生动色彩、重复模式、对称性及整体美学分数在内的十项视觉指标,并标注了拍摄类型与内容类别。最终形成包含605,868条训练样本的结构化数据集,为分析社交媒体内容特征与用户行为提供了坚实的数据基础。
特点
该数据集最显著的特点在于其深度整合了文本语义、用户社交属性与图像美学三大维度,构建了前所未有的多模态分析桥梁。文本方面,description字段及其对应的description_category与description_grade,使得内容主题与质量可被量化评估。用户行为数据如likes、comments、followers与following,揭示了社交互动模式。图像美学评分体系涵盖从构图规则的RuleOfThirdsScore到色彩表现的VividColorScore等十二项细粒度指标,实现了对视觉吸引力从局部到整体的客观度量。此外,image_objects与bboxes提供了目标检测的标注基础,而image_shot与image_category则补充了拍摄场景与内容类型的分类信息。这种多层次的丰富特征,使得该数据集不仅适用于推荐系统与内容排名研究,更能支撑跨模态学习与社交媒体心理学分析。
使用方法
使用vargr/ig_train_dataset时,研究者可直接通过HuggingFace Datasets库加载训练集,利用其提供的结构化特征开展多样化实验。对于内容分析任务,可提取description文本结合description_category进行主题建模或情感分析;用户行为预测可基于likes、comments等指标构建回归或分类模型。图像美学研究中,AestheticScore及相关子分数可作为监督信号训练视觉质量评估网络,或与image_objects协同探索对象布局对美感的影响。数据集的图像路径字段path需配合本地存储访问,而image_dimensions可用于预处理缩放。值得注意的是,bboxes与image_objects序列字段为多模态对齐提供了天然标注,适合训练视觉定位或描述生成模型。研究者应依据具体任务选择特征子集,并注意数据集的社交平台特定偏差,确保结论的泛化性。
背景与挑战
背景概述
在社交媒体与计算机视觉交叉研究领域,Instagram作为全球极具影响力的视觉内容平台,其海量用户生成内容为理解图像美学、用户行为及内容传播机制提供了宝贵数据源。vargr/ig_train_dataset数据集由研究团队于近年来构建,旨在系统性地探索社交媒体图像的美学评估与多模态特征关联。该数据集汇聚了超过60万条Instagram帖子,每条记录不仅包含用户信息、互动指标(如点赞、评论数)及文本描述,还融入了丰富的图像属性,包括目标检测结果、美学评分(如色彩和谐度、构图平衡性)及拍摄场景分类。这一综合性设计使其成为研究图像质量自动评价、社交媒体内容分析及视觉语义理解等领域的基石性资源,推动了从传统图像分类向细粒度美学感知的范式演进。
当前挑战
该数据集所解决的领域问题集中于社交媒体图像的多维美学量化与内容理解,核心挑战在于如何从海量非结构化数据中提取具有泛化性的美学特征。具体而言,构建过程中面临三大难点:其一,美学评分的主观性,需通过多维度指标(如景深、运动模糊、构图规则)实现客观化建模;其二,跨模态数据对齐,需将文本描述、用户行为与视觉特征进行语义关联,以捕捉内容与反馈间的隐含规律;其三,大规模数据标注的规模化难题,涉及目标检测边界框的精确标注及美学标签的标准化,要求兼顾效率与一致性。此外,数据集的时效性亦构成潜在挑战,Instagram平台的算法演化与用户审美趋势的变迁可能导致模型在动态环境中的性能衰减。
常用场景
经典使用场景
在社交媒体计算与视觉美学交叉研究的浪潮中,vargr/ig_train_dataset 以其丰富的多模态特征脱颖而出,成为探究Instagram内容传播规律与视觉质量评估的经典数据基座。该数据集收录了逾60万条帖子样本,每条记录不仅包含点赞数、评论数等社交互动指标,还囊括了图像美学评分、构图元素分数(如三分法、对称性、色彩和谐度)以及图像类别与拍摄场景标签。研究者常借助这一资源,构建预测模型以揭示用户参与度与视觉美学特征之间的深层关联,或训练多任务学习框架,同时完成内容质量分级与社交影响力推断。其结构化设计为量化分析网络内容生态提供了可靠范本。
衍生相关工作
基于vargr/ig_train_dataset,学术界涌现出一系列具有影响力的衍生工作。在视觉质量评估方向,研究者以此为基础提出了融合社交上下文的多模态美学预测模型,显著提升了传统单一图像评分方法的泛化能力。在用户行为分析领域,衍生工作包括构建基于视觉特征与文本描述联合嵌入的互动预测框架,揭示了帖子类型与用户参与度之间的非线性关系。此外,该数据集催生了针对商业账号内容策略的对比研究,相关论文提出了账号影响力分层模型,将视觉美学、发布频率与粉丝增长动力学相结合。这些工作不仅深化了人们对社交媒体视觉传播机制的理解,也为后续的数据驱动型社交网络研究奠定了方法论基础。
数据集最近研究
最新研究方向
在社交媒体内容分析的前沿领域,vargr/ig_train_dataset的发布为视觉美学与用户行为建模的交叉研究提供了关键数据支撑。该数据集囊括了超过60万条Instagram帖子,不仅包含传统的用户互动指标(如点赞、评论数)与账户属性(如粉丝量、商业账号标识),更创新性地整合了多维图像美学评分体系,涵盖平衡性、色彩和谐度、景深、运动模糊等十余项量化指标。这一设计紧密呼应了当前计算美学与社交网络分析的热点融合趋势——研究者得以探究内容视觉质量如何驱动用户参与度,以及不同审美特征在跨语言、跨文化语境下的传播效能。尤其值得关注的是,数据集中对图像内物体边界框与分类标签的标注,为细粒度视觉语义挖掘开辟了道路,有望推动基于审美偏好的个性化推荐算法与品牌营销策略的革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务