遇见数据集

IMPACTeen

收藏
arXiv2026-06-16 更新2026-06-17 收录
数据链接:
官方服务:

资源简介:

IMPACTeen是由弗罗茨瓦夫理工大学创建的青少年社会影响力文本数据集,专注于描绘青少年在人际、媒体和数字环境中的社会影响场景。该数据集包含1,021个文本,涵盖对话和叙述形式,总计5,100条人工标注记录,数据源通过受控的大语言模型生成并结合人工两阶段编辑验证以确保真实性。其构建过程基于SITT分类法选取20种社会影响技术,通过维度约束生成上下文向量并人工优化。该数据集旨在支持社会影响力检测、标注者分歧分析、跨语言建模以及大语言模型的训练与评估,为解决青少年群体社会影响机理的跨学科研究提供关键资源。

IMPACTeen is a teenage social impact text dataset developed by Wrocław University of Science and Technology, focusing on depicting social impact scenarios involving adolescents in interpersonal, media, and digital environments. This dataset includes 1,021 texts in both conversational and narrative formats, totaling 5,100 manually annotated records. Its data sources were generated via controlled large language models (LLMs) and validated through two-stage manual editing to ensure authenticity. The construction pipeline selects 20 social influence techniques based on the SITT taxonomy, generates context vectors via dimensional constraints, and optimizes them manually. This dataset aims to support social impact detection, annotator disagreement analysis, cross-lingual modeling, as well as the training and evaluation of large language models (LLMs), providing a critical resource for interdisciplinary research investigating the mechanisms of social influence among adolescents.

创建时间:
2026-06-16
原始信息汇总

数据集概述:IMPACTeen

英文全称:IMPACTeen: Intentions, Manipulation, Persuasion, Annotations, and Consequences in Teen Communication Dataset

核心主题:这是一个聚焦于青少年语境下文本社交影响场景的数据集,涵盖意图、操纵、说服、标注及后果。

数据规模与构成

  • 包含 1,021 段文本
  • 包含 5,100 条个人标注记录
  • 为社交影响技术提供 黄金标签

标注视角:每段文本均从五个不同视角进行标注:

  1. 青少年
  2. 父母
  3. 心理学家
  4. 传播学专家
  5. 教师

构建方法

  • 通过受约束的大型语言模型(LLM)生成。
  • 随后经过两步人工编辑和验证阶段,以确保青少年语境下的真实性。

标注维度:多维度标注覆盖了以下方面:

  • 影响力存在与否
  • 影响技术
  • 意图
  • 后果
  • 抵抗性
  • 反应
  • 标注置信度

适用研究方向

  • 社交影响检测
  • 标注者分歧研究
  • 跨语言建模
  • 语言模型的训练与评估

语言:原始数据集以波兰语创建,并附带对应的英文版本

所属学科:计算机科学 > 计算与语言(cs.CL);人工智能(cs.AI)

搜集汇总
数据集介绍
IMPACTeen 数据集图片
构建方式
IMPACTeen数据集的构建遵循了一条精心设计的管道流程。首先,基于SITT分类体系,筛选出20种在青少年交流中最为显著的社会影响力技术作为理论基础。随后,研究者定义了一组涵盖主题语境、人际关系类型、交流环境、影响目标等关键维度,并针对各维度间的互斥与共现关系设计了约束规则。利用这组规则生成了330个经过专家审核的语境向量,每个向量被用于驱动DeepSeek-V3模型生成三个独立的文本样例。此外,部分文本被改编为叙事体场景,另有40个文本被重写为不含社会影响力的负面样本。经过质量控制的文本最终由25名来自青少年、家长、心理学家、沟通专家和教师这五个群体的标注者进行人工编辑与验证,以确保文本真实反映青少年交流生态,最终形成了包含1021篇文本的语料库。
特点
该数据集的核心特色在于其多维度、多视角的精细标注体系。每个文本均从五个截然不同的利益相关者视角——青少年、家长、心理学家、沟通专家和教师——进行了独立标注,这为研究社会影响力感知的主观性提供了宝贵资源。标注涵盖了社会影响力的存在与否、具体技巧、意图清晰度、可能后果、后果严重性、顺从结果、抵抗程度、反应以及标注者置信度等十个维度,既有定量的李克特量表评分,也包含丰富的自由文本描述。此外,数据集设计了重复标注机制,部分文本在标注过程的首尾被同一标注者重新评估,从而支持分析标注者能力的动态演变。最终通过多数投票与专家裁断相结合的方式生成了社会影响力技巧的黄金标签,为后续模型训练与评估提供了可靠基准。
使用方法
IMPACTeen数据集以平行语料形式提供波兰语和英语两个版本,所有文件均通过唯一标识符对齐。主要数据文件包含完整的标注记录,每条记录对应一个文本与一位标注者的配对,并附有标注者所属群体的信息。研究者可加载标注文件中的多标签技巧列与序数量表进行社会影响力检测或主观性分析;自由文本字段则适合进行定性或语言学层面的深度挖掘。数据集还单独提供了黄金标签文件与重复标注对比文件,前者包含10折划分信息便于交叉验证,后者支持标注稳定性与标注者能力发展的时序研究。此外,配套的生成语境文件记录了每篇文本的构造参数,允许用户追溯文本生成时的控制条件。
背景与挑战
背景概述
在青少年沟通与社会影响的研究领域,现有数据集多聚焦于成人间的说服与操纵,鲜有针对青少年群体的专门资源。由波兰弗罗茨瓦夫理工大学Aleksander Szczęsny等人于2026年创建的IMPACTeen数据集,填补了这一关键空白。该数据集收录了1,021篇涵盖人际、媒体及数字场景的青少年社会影响文本,并创新性地引入五类标注者视角——青少年、家长、心理学家、传播专家及教师,形成5,100条多维标注记录。通过受控大语言模型生成、人工编辑验证及专家审校的多阶段流水线,数据集确保了青少年语境的真实性。其双语特性(波兰语与英语)与丰富的标注维度(影响力识别、意图剖析、后果评估等)为探究社会影响检测、标注者主观性差异及跨语言建模提供了独特资源,对理解青少年交际中的社会影响机制具有重要学术价值。
当前挑战
该数据集所解决的领域核心挑战在于青少年社会影响的复杂性与多义性。相较于成人场景,青少年沟通中的影响形式更为隐晦(如同伴压力、群体规范暗示),且同一文本可能混杂多种影响技术,对识别模型构成严峻考验。构建过程中亦面临诸多技术难点:如何通过约束性生成与人工校验在合成文本中复现青少年真实的语言风格(包括网络用语、情绪化表达与逻辑跳跃),如何维持20种社会影响技术在330个上下文向量间的均衡分布,以及如何协调五类标注者因认知差异导致的标注分歧——例如青少年与家长对同一操纵意图的感知可能截然不同。为应对这些挑战,研究团队设计了专家仲裁机制解决标注冲突,并通过重复标注实验追踪标注者能力演进,从而保障了数据集在主观性研究中的稳健性。
常用场景
经典使用场景
在青少年社会影响力研究这一交叉学科领域中,IMPACTeen数据集被广泛用于识别与检测文本中蕴含的多元社会影响技巧。研究者可借助其多维度注释体系(涵盖影响存在性、技巧类型、意图清晰度、抵抗程度及后果严重性等),训练并评估各类自然语言处理模型在青少年沟通情境下的社会影响力检测能力。该数据集尤其支持对微妙操控与公开说服的区分性建模,为探索同龄人压力、亲子关系及权威影响等典型场景中的语言模式提供了丰富且经过严格校验的实验材料。
实际应用
IMPACTeen的实际应用价值体现在多个社会关键领域:在教育领域,它辅助开发面向青少年的批判性思维训练工具,帮助识别网络与校园中的隐形操控话语;在心理健康领域,其注释成果可赋能智能监测系统,自动捕捉可能引发焦虑、自卑等负面后果的说服性对话,为早期心理干预提供语言层面的预警信号;在公共关系与数字素养教育中,它支持创建面向家长与教师的沟通指南,揭示权威式、情感挟持式等影响策略的运作机制,从而提升成年人对青少年复杂社交环境的风险感知能力。
衍生相关工作
IMPACTeen的发布催生了多项创新性研究:其一,基于其多标签技巧分类体系,学者们进一步拓展了SITT社会影响技巧分类法(Social Influence Technique Taxonomy),深化了对青少年独有影响策略的语义刻画;其二,其重复注释数据被用于探究标注过程中的能力习得效应,形成了关于注释者训练如何提升社会影响识别敏感度的实证研究;其三,围绕其跨语言版本,涌现出针对波兰语与英语差异的迁移学习与多语言模型微调工作;此外,该数据集还被用作生成对抗网络与提示工程对比实验的基准资源,推动了受控文本生成技术的伦理评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务