遇见数据集

Cognitive Dataset (认知数据集)

收藏
github2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

一个大规模双语(中文和英文)数据集,用于研究新闻文章用户评论中表达的人格特质和认知偏差。该数据集包含新闻文章与人工撰写评论的配对,每个评论都标注了大五人格特质维度或认知偏差标签,支持文本人格检测、认知偏差识别与分类、观点挖掘和跨语言心理语言建模等研究。

A large-scale bilingual (Chinese and English) dataset designed for investigating personality traits and cognitive biases expressed in user comments on news articles. This dataset comprises paired samples of news articles and human-written comments, with each comment annotated with Big Five personality trait dimensions or cognitive bias labels. It supports research directions including textual personality detection, cognitive bias recognition and classification, opinion mining, and cross-linguistic psycholinguistic modeling.

创建时间:
2026-07-23
原始信息汇总

数据集概述

认知数据集(Cognitive Dataset) 是一个大规模、中英双语的数据集,用于研究用户对新闻评论中表达的人格特质认知偏差

核心信息

  • 目的:支持人格检测、认知偏差识别、意见挖掘、跨语言心理语言学建模、可解释AI等研究。
  • 语言:中文和英文。
  • 数据构成:包含新闻文章、对应的人类评论、每个评论的标签(大五人格维度或认知偏差)、原因解释和摘要。

数据集统计

子集 任务 标签数量 每种语言条目数 总条目数
PS 人格特质 10 11,400 22,800
CB 认知偏差 38 43,320 86,640
News 原始新闻文章 1,140 1,140
  • 数据划分:80% 训练集 / 20% 测试集,每个标签类别保持均衡(每个标签1,140条)。

任务定义

PS — 人格特质(大五人格模型)

基于大五(OCEAN)人格模型,每个评论标注了特质维度及其效价(积极或消极):

编号 中文标签 英文标签 维度 效价
0 正向外倾性 Positive Extraversion 外倾性 积极
1 负向外倾性 Negative Extraversion 外倾性 消极
2 正向宜人性 Positive Agreeableness 宜人性 积极
3 负向宜人性 Negative Agreeableness 宜人性 消极
4 正向尽责性 Positive Conscientiousness 尽责性 积极
5 负向尽责性 Negative Conscientiousness 尽责性 消极
6 正向神经质 Positive Neuroticism 神经质 积极
7 负向神经质 Negative Neuroticism 神经质 消极
8 正向开放性 Positive Openness 开放性 积极
9 负向开放性 Negative Openness 开放性 消极

共10个类别,每类1,140条。“正向神经质”指情绪稳定(低神经质),“负向神经质”指高神经质。

CB — 认知偏差

评论被标注为38种认知偏差中的一种。每种偏差有1,140条:

编号 中文标签 英文标签
0 确认偏差 Confirmation Bias
1 锚定偏差 Anchoring Bias
2 框架效应 Framing Effect
3 选择性感知偏差 Selective Perception Bias
4 基本归因错误 Fundamental Attribution Error
5 真相幻觉效应 Illusory Truth Effect
6 信念偏差 Belief Bias
7 可获得性偏差 Availability Bias
8 损失厌恶 Loss Aversion
9 过度自信偏差 Overconfidence Bias
10 动机性推理 Motivated Reasoning
11 防御性归因 Defensive Attribution
12 群体内偏差 In-group Bias
13 现状偏差 Status Quo Bias
14 邓宁-克鲁格效应 Dunning-Kruger Effect
15 选择性曝光 Selective Exposure
16 认知失调 Cognitive Dissonance
17 道德运气 Moral Luck
18 敌意媒体效应 Hostile Media Effect
19 意识形态偏差 Ideological Bias
20 光环效应 Halo Effect
21 逆火效应 Backfire Effect
22 错误的共识 False Consensus
23 天真现实主义 Naïve Realism
24 外群体同质性偏差 Out-group Homogeneity Bias
25 显著性偏差 Salience Bias
26 购买后合理化 Post-Purchase Rationalization
27 向下比较偏差 Downward Comparison Bias
28 公正世界假说 Just-World Hypothesis
29 可用性级联 Availability Cascade
30 幸存者偏差 Survivorship Bias
31 记忆偏差 Memory Bias
32 防御性偏差 Defensive Bias
33 地域偏差 Regional Bias
34 朴素犬儒主义 Naïve Cynicism
35 第三人称效应 Third-Person Effect
36 顺序效应 Order Effect
37 成长信念 Growth Mindset

数据格式

每条记录为一个JSON对象,包含以下字段:

字段 类型 描述
title string 新闻文章标题
news string 新闻文章全文
comment string 针对新闻的人类评论
reason string 解释为什么该评论反映给定标签
summary string 评论的简明摘要
label string 标注的标签(人格特质或认知偏差)
number integer 标签类别内的索引号(0-1139)

许可与引用

  • 许可:仅供研究使用。
  • 引用:请引用该仓库的GitHub地址:https://github.com/your-repo/cognitive-dataset
搜集汇总
数据集介绍
Cognitive Dataset (认知数据集) 数据集图片
构建方式
在心理学与自然语言处理的交叉领域,数据集的质量直接决定了模型对人格特质与认知偏差的捕捉能力。该数据集的构建以新闻文章为基底,每篇新闻均配有母语者撰写的人类评论,随后由专业标注员依据大五人格模型与38种认知偏差分类体系,对每一条评论进行精确标注,并附有标注理由与摘要。为确保跨语言研究的可行性,所有数据均以中英双语形式呈现,其中人格特质子集包含10个类别,各条目严格平衡至1,140条;认知偏差子集则涵盖38个类别,同样维持了每类1,140条的结构。通过80%训练集与20%测试集的划分,数据集为分类任务提供了均衡且可复现的基准。
特点
该数据集最显著的特质在于其高度结构化的平衡性与跨语言覆盖。人格特质子集采用大五模型的正负向维度划分,将原本连续的心理学构念转化为10个离散且均衡的类别,而认知偏差子集更是系统性地涵盖了从确认偏差到成长信念的38种常见思维模式,为研究认知曲解提供了前所未有的大规模标注资源。每一数据条目不仅包含评论文本与标签,还附带了人工撰写的推理过程与摘要,赋予了数据深层的可解释性。双语平行设计使得研究者能够在同一新闻语境下比较不同语言群体间的心理表达差异,为跨文化心理语言学建模提供了独特的支撑。
使用方法
使用该数据集时,可直接从JSONL格式文件中加载数据,通过简单的Python脚本即可解析每条记录的标题、新闻全文、评论、标注理由、摘要及标签字段。针对人格特质或认知偏差分类任务,研究者可依据80/20的预划分比例直接加载对应的训练与测试文件,无需自行拆分。数据集的完美类别平衡特性简化了评估流程,可通过计数器验证每类标签的确切条目数。推荐的做法是将评论文本作为输入特征,将标签作为目标变量,构建序列分类或注意力机制模型。此外,利用附带的新闻原文与摘要字段,还可拓展至立场检测或思维模式生成等下游任务。
背景与挑战
背景概述
认知数据集(Cognitive Dataset)由研究团队于2025年发布,旨在为个性特质与认知偏差的自动识别提供大规模双语资源。该数据集基于大五人格模型(OCEAN)和38种常见认知偏差框架,从1,140篇中英文新闻文章的评论中精心标注而成,包含人格特质和认知偏差两个子集,总计超过109,000条标注条目。其核心研究问题在于探索文本中隐含的心理语言学特征,为人格检测、认知偏差分类、跨语言心理建模及可解释人工智能等领域奠定了坚实的数据基础。该数据集凭借其平衡的类别分布和细致的标注解释,已成为相关研究领域的重要基准资源,有力推动了计算心理学的实证发展。
当前挑战
认知数据集所面对的挑战涵盖领域问题与构建过程两大层面。在领域层面,现有文本分析模型难以精准捕捉新闻评论中隐含的复杂心理特征,尤其是个性特质与认知偏差的微弱信号及跨语言泛化能力不足,这阻碍了真实场景下心理建模的可靠性。在构建过程中,从大规模评论中准确标注10类人格特质和38类认知偏差是一项艰巨任务,不仅需要设计精确的标注指南以消除歧义,还需确保跨文化背景下中英文标签的一致性;同时,为每个类别生成1,140条均衡样本需耗费大量人力资源,而标注者主观判断的差异也增加了质量控制难度。
常用场景
经典使用场景
Cognitive Dataset作为首个大规模、双语标注的认知心理语言学资源,其最经典的科研用途聚焦于从新闻评论文本中自动检测人格特质与认知偏差。研究人员可基于该数据集训练多标签分类模型,利用Big Five模型中的10个极向维度(如正向宜人性与负向神经质)以及38类认知偏差(如确认偏差、可得性偏差),揭示评论者潜藏的心理倾向。数据集平衡的标签分布(每类1140条)与双语覆盖特性,为构建跨语言、可解释的文本心理分析基准提供了理想实验平台。
解决学术问题
该数据集系统性地回应了计算社会科学领域的两个核心挑战:人格自动推断与认知偏误的结构化识别。在人格计算研究中,传统依赖问卷的测量方法难以应用于非结构化文本,而Cognitive Dataset通过细粒度的Big Five极向标注,使得研究者能建模评论行为中内隐的人格表征。同时,针对认知偏差缺乏大规模标注语料的现状,该数据集的38类偏差体系覆盖了从信念偏差到幸存者偏差的广泛认知现象,推动了偏差识别从理论分类向数据驱动建模的关键跨越,为心理测量学的计算化转型提供了标志性资源。
衍生相关工作
该数据集衍生了一系列具有影响力的后续工作。其一,基于其平衡的标签结构,研究者开发了双语对比学习框架,验证了人格检测任务中跨语言迁移的可行性。其二,针对认知偏差分类的稀疏标签空间,出现了一批融合常识推理与图神经网络的细粒度分类模型,显著提升了38类偏差的识别鲁棒性。此外,以该数据集为基底,后续工作通过引入弱监督扩展与主动学习策略,进一步构建了面向长尾认知现象的增量标注体系,拓展了心理文本分析的数据生态边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务