遇见数据集

PFED5+

收藏
arXiv2026-06-25 更新2026-06-29 收录
官方服务:

资源简介:

PFED5+是一个专门用于面部表情质量评估(FEQA)的扩展数据集,由布里斯托大学和兰卡斯特大学的研究团队联合构建。该数据集在原始PFED5的基础上,新增了专家指导的、临床审查过的视频片段级运动描述文本注释,共计包含2,811个视频片段,数据来源于帕金森病患者的特定面部动作任务。其创建过程采用了系统化的标注框架,将每个视频按时间结构划分为动作前、中、后三个阶段,并由专家定义临床相关面部区域进行精细观察和结构化描述,再经GPT-4o进行文本流畅性优化并最终由临床专家双重验证。该数据集主要应用于医疗健康领域,旨在支持生成式可解释性研究,通过联合预测临床严重程度评分并生成结构化证据报告,以解决传统FEQA方法仅输出分数而缺乏可审计运动证据的问题,从而增强神经运动障碍评估的透明度和临床实用性。

PFED5+ is an extended dataset specifically designed for Facial Expression Quality Assessment (FEQA), jointly constructed by research teams from the University of Bristol and Lancaster University. Building upon the original PFED5 dataset, it adds expert-guided, clinically reviewed video clip-level textual annotations of motion descriptions, totaling 2,811 video clips sourced from targeted facial movement tasks performed by patients with Parkinson’s disease. Its development adopted a systematic annotation framework: each video is divided into three temporal stages—pre-action, action, and post-action—with experts defining clinically relevant facial regions for fine-grained observation and structured description. The annotations then underwent text fluency optimization via GPT-4o, followed by final double validation by clinical experts. This dataset is primarily applied in the healthcare domain, aiming to support generative explainability research. It addresses the key limitation of traditional FEQA methods, which only output scores without providing auditable motor evidence, by jointly predicting clinical severity scores and generating structured evidence reports, thereby enhancing the transparency and clinical utility of neuromotor disorder assessment.

创建时间:
2026-06-25
原始信息汇总

TraMP-LLaMA 数据集概述

基本信息

  • 项目名称:TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment
  • 论文地址arXiv版本
  • 核心任务:提出统一的多模态框架TraMP-LLaMA,能够从面部运动线索中联合预测严重程度评分并生成结构化的文本报告。

数据集:PFED5+

  • 来源扩展:在PFED5数据集基础上,添加了专家指导的文本运动描述,构建了增强版PFED5+数据集。
  • 视频帧和MDS-UPDRS标签获取:需通过QAFE-Net仓库申请访问权限。
  • 运动描述标签:提供链接(当前为空)。

引用信息

  • 若在研究中使用了本工作,建议引用相关论文,包括TraMP-LLaMA论文、Trajectory-guided Motion Perception论文以及QAFE-Net论文。

致谢

搜集汇总
数据集介绍
PFED5+ 数据集图片
构建方式
PFED5+数据集是在PFED5的基础上扩展构建的。原始PFED5提供了帕金森病患者的MDS-UPDRS面部表情严重程度评分,但缺乏支持评分的可视运动证据文本描述。为弥补这一不足,研究者在临床专家指导下设计了一套系统化的标注框架:首先将每个视频片段按时间结构划分为动作前、动作中和动作后三个阶段,并为每个阶段定义临床相关的面部区域(如眉毛、脸颊、嘴巴)作为观察槽位;然后由标注专家逐区域记录运动状态,包括有无运动、运动方向及左右不对称性等细粒度信息;最后通过模板自动组装为结构化文本描述,并利用GPT-4o进行流畅性优化,所有结果经临床专家双重校验以确保事实准确性。该流程共标注了2,811个视频片段。
特点
PFED5+的核心特点在于其结合了定量评分与定性证据的多模态标注体系。每个视频片段不仅保留了原始的MDS-UPDRS严重程度评分,还配备了专家引导的、阶段性、区域化的面部运动文本描述。这些描述严格遵循观察性标注原则,避免推断性情感术语,仅记录可视运动证据,并通过显式标注“无运动”状态防止遗漏被误读为阴性证据。对于无法观察的面部区域,使用固定占位符明确标记缺失阶段。数据集覆盖微笑、皱眉、眯眼、咬牙和静坐休息五种临床诱发动作,其中前四种采用三阶段模板,静坐任务采用单阶段模板,确保了不同动作类型标注结构的一致性。
使用方法
PFED5+主要用于训练和评估联合评分与报告生成的多模态框架,如TraMP-LLaMA。使用时,将视频片段及其对应的面部地标轨迹作为输入,模型需同时输出严重程度评分和结构化运动证据报告。评分分支采用MSE损失优化,报告分支则利用标注的文本描述进行指令微调,通过自回归方式生成阶段性报告。为缓解任务干扰,建议采用解耦训练策略,阻止文本生成梯度反向传播至运动编码器和融合模块。评估时可分别使用Spearman相关系数衡量评分性能,以及BERTScore、ROUGE-L、BLEU-4和CIDEr等指标评估报告质量。
背景与挑战
背景概述
PFED5+数据集由英国布里斯托大学、兰卡斯特大学等机构的研究人员于2026年构建,旨在解决面部表情质量评估(FEQA)中可解释性不足的难题。现有FEQA方法仅输出严重程度评分,无法揭示支持预测的面部运动证据,尤其限制了帕金森病评估中模型输出的可审查性。该数据集在原有PFED5基础上,由临床专家为每个视频片段添加了结构化文本运动描述,涵盖微笑、皱眉、眯眼、咬牙及静坐五项临床动作,共计2811个片段。PFED5+的发布推动了可解释性FEQA研究,为联合严重程度评分与证据报告生成提供了标准化基准。
当前挑战
PFED5+所解决的领域问题在于传统FEQA方法仅输出单一评分,缺乏对支撑评分可观察运动证据的显式描述,导致临床评估不透明且难以审计。构建过程中面临多重挑战:一是需要设计精确的时空运动描述模板,将前动作、动作中、后动作三个阶段的区域级运动状态转化为结构化文本,确保临床语义保真度;二是需避免标注中的标签泄露,要求文本描述严格基于可观察运动而非严重程度标签;三是面临细粒度面部运动注释的高昂成本,需在专家指导下定义面部区域观察清单,并通过GPT-4o后处理与临床专家校验保障注释质量一致性。
常用场景
经典使用场景
PFED5+ 数据集的核心应用场景在于视频驱动的面部表情质量评估(FEQA),尤其适用于帕金森病等神经退行性疾病中面部运动障碍的定量分析。该数据集扩展了原始 PFED5 的临床评分体系,引入了专家指导的结构化文本描述,使得模型能够同时预测 MDS-UPDRS 严重程度评分并生成基于证据的面部运动报告。这一独特设计使得 PFED5+ 成为连接视觉临床评估与可解释自然语言输出的关键桥梁,广泛应用于联合训练下的多动作面部表情严重性回归与结构化报告生成任务。
衍生相关工作
PFED5+ 的出现衍生了一系列重要的学术工作。其中 TraMP-LLaMA 作为最具代表性的工作,提出了一种解耦指令调优的多模态框架,通过结合 RGB 外观与地标轨迹线索,在 PFED5+ 上实现了严重性评分与结构化报告生成的联合优化。该工作引入的梯度阻断策略有效缓解了回归与语言生成之间的任务干扰,为多任务视觉语言模型在医疗评估中的应用奠定了方法论基础。此外,PFED5+ 还促进了视频语言模型在细粒度面部运动理解方向的探索,催生了更关注运动证据而非场景语义的临床专用视觉语言评估方法。
数据集最近研究
最新研究方向
在面部表情质量评估(FEQA)领域,前沿研究方向正从单一的严重程度评分迈向兼具可解释性与临床实用性的多模态生成式框架。PFED5+数据集的提出标志着该领域的范式转变,其核心突破在于将专家引导的结构化面部运动文本描述与MDS-UPDRS临床评分相融合,为构建可审计、可追溯的评估模型提供了关键数据支撑。基于该数据集,研究者开发了TraMP-LLaMA框架,通过解耦指令调优策略协同优化严重程度回归与结构化报告生成,将路径点轨迹与RGB外观特征统一编码为视觉-语言证据,在帕金森病运动障碍评估中展现出卓越性能。这一研究路径不仅推动了神经退行性疾病早期诊断的自动化进程,更通过生成可解释的临床证据报告,为人机协作的医疗决策范式构建了可信赖的桥梁,对推动可解释人工智能在精准医疗中的应用具有深远意义。
相关研究论文
  • 1
    TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment布里斯托大学·计算机科学学院; 布里斯托大学·转化健康科学学院; 兰卡斯特大学·计算与通信学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务