visualcomments/yt-personalities
收藏官方服务:
资源简介:
在特质理论中,Big Five人格特质(有时称为五因素人格模型或OCEAN或CANOE模型)是用于研究人格的五种特征:1. **开放性**(创新/好奇 vs. 一致/谨慎);2. **尽责性**(高效/有条理 vs. 奢侈/粗心);3. **外向性**(外向/精力充沛 vs. 孤独/内向);4. **宜人性**(友好/富有同情心 vs. 批判/判断);5. **神经质**(敏感/紧张 vs. 坚韧/自信)。我们提供了一个关于他们日常生活的YouTubers列表,并根据Big Five人格特质进行分类。
The dataset, named Youtubers by Big Five Personality Traits, includes a list of YouTubers categorized according to the Big Five personality traits (Openness, Conscientiousness, Extraversion, Agreeableness, and Neuroticism). These YouTubers primarily make videos about their daily lives. The dataset is generated using large language models (such as GPT-4o, Claude-3.5-Sonnet, and LLaMA-3.2-90b) and the final categorization is determined by the consistency of results across these models.
提供机构:
visualcomments搜集汇总
数据集介绍

构建方式
该数据集基于人格心理学中的大五人格理论(开放性、尽责性、外向性、宜人性、神经质)构建,旨在将YouTube上记录日常生活的创作者按性格特质进行分类。研究团队借助大型语言模型——GPT-4o、Claude-3.5-Sonnet和LLaMA-3.2-90b——分别生成对应五类特质的YouTuber名单,并通过多数投票机制筛选出至少两个模型一致认可的人物,以此确保标签的可靠性与一致性。
特点
数据集涵盖八大性格子类别,例如“高效有序”与“粗心大意”分别对应尽责性的两极,共收录数十位知名YouTuber,如Mark Rober、Emma Chamberlain等。其独特之处在于融合了前沿AI模型的多源共识,而非依赖单一来源或人工主观判断,从而在人格标注上实现了较高的客观性。此外,数据集的分布可视化分析揭示了各性格组别内创作者的文本转录数量差异,为后续研究提供了丰富的统计基础。
使用方法
用户可直接加载数据集中的YouTuber名单及其对应的人格类别,用于多模态人格分析、社交媒体行为研究或推荐系统开发。使用时需注意遵循GPL-3.0开源许可协议。研究人员可进一步提取这些创作者的视频转录文本,结合情感计算或自然语言处理技术,验证大五人格特质与语言模式之间的关联。数据集也可作为基准测试,评估不同语言模型在人格分类任务上的一致性表现。
背景与挑战
背景概述
视觉个性计算领域近年来逐渐成为多模态机器学习的研究热点,其核心在于通过视觉线索自动推断个体的人格特质,为人机交互、个性化推荐及社交媒体分析提供理论支撑。在此背景下,visualcomments/yt-personalities数据集应运而生,由研究团队于2024年基于大语言模型(GPT-4o、Claude-3.5-Sonnet、LLaMA-3.2-90b)的共识机制创建,旨在构建一个以YouTube日常生活类视频博主为样本、按大五人格特质(开放性、尽责性、外向性、宜人性、神经质)分类的多模态数据集。该数据集通过跨模型投票筛选出具有代表性的人物,为将抽象人格理论与可观察的视觉行为建立映射提供了基准资源,推动了人格识别研究从文本向视觉模态的拓展。
当前挑战
当前数据集面临多重挑战。首先,在领域问题层面,大五人格的视觉化表征存在天然歧义性,例如同一博主在不同视频中可能展现不同特质,而数据集仅基于静态标签分类,难以捕捉人格的动态性与情境依赖性。其次,构建过程中,依赖大语言模型生成候选人名单的共识机制虽提升了效率,却可能引入模型偏见,导致样本代表性不足,如外向性与宜人性类别样本较少,而神经质类别则过度集中于特定群体。此外,视频转录文本的分布不均,部分博主拥有大量内容而其他博主资源稀缺,加剧了数据不平衡,影响下游模型训练的泛化能力。最后,人格标注缺乏人类专家验证,仅凭模型间一致性作为标准,可能偏离真实人格评估的复杂性。
常用场景
经典使用场景
在人格心理学与计算社会科学的交叉领域中,visualcomments/yt-personalities数据集提供了一种将大五人格理论映射至真实视频创作者群体的创新范式。研究者可借助该数据集,系统性地分析不同人格特质(如开放性、尽责性、外向性等)在YouTube博主视频内容中的语言模式、视觉风格与叙事策略差异,从而构建基于多模态特征的人格预测模型。该数据集通过大语言模型交叉验证生成标签,确保了人格分类的可靠性,为探究数字媒介中人格表达的量化规律奠定了坚实基础。
解决学术问题
该数据集有效填补了人格计算研究中缺乏大规模、真实社交媒介人格标注数据的空白。传统人格研究多依赖于受控环境下的自我报告问卷,难以捕捉自然情境下的人格表达。而本数据集通过整合GPT-4o、Claude-3.5-Sonnet与LLaMA-3.2-90b的共识性判断,解决了跨模型一致性验证的学术难题,为自动化人格标注提供了可复现的方法论框架。其意义在于推动了人格心理学与自然语言处理、计算机视觉的深度融合,使得研究者能够从非结构化视频数据中挖掘人格特质的可计算特征,进而验证大五人格理论在数字生态中的适用性。
衍生相关工作
该数据集已衍生出多项开创性研究工作。基于此数据集,研究者可开展人格特质与视频多模态特征的关联分析,例如探索外向性博主在视频中更频繁使用高能量面部表情与快节奏剪辑的规律。此外,该数据集为构建人格感知的视觉-语言预训练模型提供了标注基准,推动了如CLIP、VideoBERT等模型在人格理解任务上的微调与评估。在社交媒体分析领域,相关工作聚焦于利用该数据集验证大语言模型的人格推断能力,如比较GPT-4与人类评分者在博主人格分类上的一致性。这些衍生工作不仅拓展了人格计算的理论边界,也为跨学科研究(如计算传播学与数字人文)提供了可量化的数据基础设施。
以上内容由遇见数据集搜集并总结生成



