遇见数据集

cesarali/test_ocean_clients

收藏
Hugging Face2023-08-28 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: o dtype: int64 - name: c dtype: int64 - name: e dtype: int64 - name: a dtype: int64 - name: n dtype: int64 - name: education dtype: string - name: current_work dtype: string - name: ethnicity dtype: string - name: income_bracket dtype: string - name: age dtype: int64 - name: sexual_orientation dtype: string - name: favorite_movies sequence: string - name: favorite_tv_shows sequence: string - name: comment dtype: string - name: id dtype: string - name: location dtype: string splits: - name: train num_bytes: 6755 num_examples: 20 download_size: 12166 dataset_size: 6755 --- # Dataset Card for "test_ocean_clients" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- dataset_info: 特征字段: - 字段名: o 数据类型: 64位整数 - 字段名: c 数据类型: 64位整数 - 字段名: e 数据类型: 64位整数 - 字段名: a 数据类型: 64位整数 - 字段名: n 数据类型: 64位整数 - 字段名: education 数据类型: 字符串 - 字段名: current_work 数据类型: 字符串 - 字段名: ethnicity 数据类型: 字符串 - 字段名: income_bracket 数据类型: 字符串 - 字段名: age 数据类型: 64位整数 - 字段名: sexual_orientation 数据类型: 字符串 - 字段名: favorite_movies 数据类型: 字符串序列 - 字段名: favorite_tv_shows 数据类型: 字符串序列 - 字段名: comment 数据类型: 字符串 - 字段名: id 数据类型: 字符串 - 字段名: location 数据类型: 字符串 数据划分: - 名称: train 字节占用量: 6755 样本数量: 20 下载大小: 12166 数据集总大小: 6755 --- # 「test_ocean_clients」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
cesarali
原始信息汇总

数据集概述

特征信息

  • o: 类型为 int64
  • c: 类型为 int64
  • e: 类型为 int64
  • a: 类型为 int64
  • n: 类型为 int64
  • education: 类型为 string
  • current_work: 类型为 string
  • ethnicity: 类型为 string
  • income_bracket: 类型为 string
  • age: 类型为 int64
  • sexual_orientation: 类型为 string
  • favorite_movies: 类型为 string 序列
  • favorite_tv_shows: 类型为 string 序列
  • comment: 类型为 string
  • id: 类型为 string
  • location: 类型为 string

数据分割

  • train: 包含 20 个样本,占用 6755 字节

数据集大小

  • 下载大小: 12166 字节
  • 数据集大小: 6755 字节
搜集汇总
数据集介绍
cesarali/test_ocean_clients 数据集图片
构建方式
该数据集名为cesarali/test_ocean_clients,旨在为个性心理学与大五人格模型(OCEAN)研究提供结构化样本。构建过程基于对受试者进行标准化人格问卷采集,获取开放性(o)、尽责性(c)、外向性(e)、宜人性(a)和神经质(n)五项核心人格维度的整数评分。同时,辅以人口统计学信息如教育背景、当前职业、种族、收入阶层、年龄、性取向及地理位置等字段,并收录受试者偏好的电影与电视节目序列数据。数据集包含20条训练样本,以JSON格式存储,便于直接加载与解析。
特点
该数据集的核心特色在于将量化人格特质与多维社会文化背景深度融合。每个样本不仅包含五大人格维度的精确评分,还囊括了教育、职业、种族、收入等结构化分类变量,以及自由文本形式的评论和偏好列表。这种多模态设计使得研究者能够探索人格特征与人口统计变量、文化消费行为之间的潜在关联。此外,数据规模虽小但特征丰富,适合作为原型验证或教学演示的轻量级资源。
使用方法
使用该数据集时,可通过HuggingFace的datasets库直接加载,调用load_dataset('cesarali/test_ocean_clients')即可获取训练集。数据以字典形式组织,字段涵盖整数型人格评分、字符串型人口统计属性及列表型偏好数据。适用于构建基于大五人格的推荐系统、用户画像分析或教育场景中的案例研究。研究者可利用其多元特征进行相关性分析、聚类或分类任务,但需注意样本量较小,结果推广需谨慎验证。
背景与挑战
背景概述
在人格心理学与计算社会科学交叉领域,基于大五人格模型(OCEAN)的自动化评估研究日益受到关注。该数据集由cesarali创建,旨在通过多维度特征(包括教育背景、职业类型、种族、收入水平、年龄、性取向及文化偏好等)探索个体人格特质与社会经济变量之间的潜在关联。研究聚焦于如何利用结构化与非结构化数据(如电影与电视节目偏好)推断人格维度,为个性化推荐、社会行为分析及心理健康研究提供数据基础。尽管样本量有限(仅20条训练数据),该数据集首次尝试整合多元人口统计学信息与人格评估,为后续大规模研究提供了概念验证与实验框架,对推动计算人格学方法论的演进具有启发意义。
当前挑战
当前数据集面临多重挑战。首先,样本规模极小(20例)严重制约统计效力与模型泛化能力,难以捕捉真实人群中人格特质的复杂分布模式,可能导致过拟合与偏差放大。其次,特征空间高度异构,包含数值型(如年龄)、类别型(如职业)与序列型(如电影偏好)数据,缺乏统一预处理与嵌入策略,增加了多模态融合的难度。构建过程中,数据收集可能存在选择性偏差(如特定地域或文化背景的受访者主导),且自我报告式人格评估易受社会称许性影响。此外,隐私伦理问题突出:敏感属性(如性取向、种族)的公开存储需严格匿名化处理,但当前数据中未明确展示脱敏机制,存在再识别风险。这些挑战共同指向数据质量、伦理合规性与方法鲁棒性的深层矛盾。
常用场景
经典使用场景
该数据集融合了大五人格特质(开放性、尽责性、外向性、宜人性、神经质)与用户人口统计学信息(如教育背景、职业、收入、种族、性取向等),为探究人格特质与社会经济变量之间的关联提供了宝贵资源。研究者可借助该数据集构建多模态预测模型,挖掘人格维度与行为偏好(如电影、电视节目喜爱类型)之间的潜在模式。
衍生相关工作
基于该数据集,衍生工作包括构建人格特质预测模型(如从影视偏好推断大五人格)、开发跨文化人格比较基准,以及引入对抗性验证方法评估人口统计学特征对人格预测的干扰。相关研究进一步拓展至公平性分析,探究算法在种族、性取向等敏感属性上是否存在偏差,为人格计算领域提供了可复用的评估框架。
数据集最近研究
最新研究方向
在人格心理学与数据驱动研究的交汇领域,cesarali/test_ocean_clients数据集为探索大五人格特质(开放性、尽责性、外向性、宜人性、神经质)与社会经济人口变量(如收入、教育、种族、性取向)之间的深层关联提供了宝贵的微观样本。当前前沿研究方向聚焦于利用该数据集构建个性化推荐系统与用户画像模型,尤其关注跨文化背景下人格特质如何影响消费行为与媒体偏好(如电影、电视节目)。该数据集虽样本量有限,但其多维特征设计使其成为验证少数群体(如性取向、种族多样性)在人格聚类分析中代表性与公平性的理想测试平台,对推动算法去偏见与包容性AI发展具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务