遇见数据集

SignQA-2026

收藏
github2026-08-20 更新2026-08-22 收录
官方服务:

资源简介:

SignQA-2026是一个多语言手语问答基准数据集,包含144,550个问答对,覆盖28,910个视频,基于PHOENIX-2014T和CSL-Daily构建,包含五种问题类别,用于评估手语理解。

SignQA-2026 is a multilingual sign language question answering benchmark dataset. It comprises 144,550 question-answer pairs covering 28,910 videos, is constructed based on PHOENIX-2014T and CSL-Daily, and includes five question categories for sign language understanding evaluation.

创建时间:
2026-08-20
原始信息汇总

数据集总体概述

本项目提出了手语问答(Sign Language Question Answering, SLQA)任务,并发布了名为SignQA-2026的多语言基准数据集及强基线模型SLQAM。任务目标为:给定一段手语视频和自然语言问题,模型需生成相应答案。该框架统一评估了细粒度视觉检索、时间与结构推理、手语词汇(gloss)识别及句子级语义理解能力。

基准数据集内容

SignQA-2026基于PHOENIX-2014T(德语)和CSL-Daily(中文)的词注与翻译标注构建,共包含144,550个问答对,覆盖28,910个视频,支持德语和中文两种语言。

基准子集 语言 训练集 开发集 测试集 总计
PHOENIX-2014T-QA 德语 35,480 2,595 3,210 41,285
CSL-Daily-QA 中文 92,000 5,385 5,880 103,265
总计 - 127,480 7,980 9,090 144,550

问答涵盖五种互补的问题类型,由低层次序列推理至高层次语言理解:

  1. M1(位置推理):识别指定位置的词注。
  2. M2(结构推理):推理相邻符号和子序列。
  3. M3(视觉搜索):定位目标词注或识别非手部标记。
  4. M4(词注识别):恢复完整词注序列。
  5. M5(翻译理解):理解目标口语语义。

数据获取与使用

  • 注释数据可在Hugging Face获取:hulala/SignQA-2026
  • 注意:该版本仅包含问答注释和视频标识符,不重新分发源视频。需自行获取PHOENIX-2014T和CSL-Daily原始资源,并遵循其原有访问和许可条款。
  • 每条注释包含:源video_id、数据划分、数据集、模块、问题模板ID、问题、答案及语言。

基线模型(SLQAM)

**SLQAM(Sign2Answer)**作为基线系统,包含三大核心组件:

  1. 视觉骨干网络:提取帧级手语表示。
  2. 问题条件调制时间下采样(QCMTD):筛选与问题相关的时间信息。
  3. 语言模型:生成答案。

训练采用三阶段领域内知识迁移流程:连续手语识别(CSLR)预训练 → 手语翻译(SLT)训练 → SLQA微调,逐步转移视觉感知、时间对齐和语言生成能力。

主要实验结果

在测试集上,SLQAM整体表现优于通用视频-语言模型及级联基线(Sign2Text2Answer),具体指标(ROUGE-L、BLEURT、CIDEr)如下(数值越高越好):

模型 PHOENIX ROUGE-L PHOENIX BLEURT PHOENIX CIDEr CSL-Daily ROUGE-L CSL-Daily BLEURT CSL-Daily CIDEr
VideoLLaMA3-2B 44.69 37.45 1.252 60.51 38.24 1.735
Qwen3-VL-2B-Instruct 47.70 42.02 1.410 60.24 38.32 1.699
InternVL3-2B 50.93 45.45 1.736 64.27 44.31 2.277
Sign2Text2Answer 53.54 54.54 2.343 70.75 54.04 3.754
SLQAM(Sign2Answer) 54.16 56.21 2.768 73.52 60.23 4.193

开源状态与使用说明

  • 论文及预印本:arXiv(https://arxiv.org/abs/2607.27826)
  • 项目主页:https://github.com/gswycf/SignLanguageQA
  • 数据加载示例(Python): python from datasets import load_dataset

中文基准

csl_daily = load_dataset("hulala/SignQA-2026", "csl-daily-qa")

德语基准

phoenix14t = load_dataset("hulala/SignQA-2026", "phoenix14t-qa")

  • 当前以发布论文、注释和项目页面;训练与评估代码、预训练检查点及详细预处理说明将持续更新。
搜集汇总
数据集介绍
SignQA-2026 数据集图片
构建方式
SignQA-2026数据集的构建基于两个广泛使用的手语语料库PHOENIX-2014T和CSL-Daily,利用其丰富的注释信息,系统性地生成了涵盖五种互补问题类型的问答对。这五种类型包括位置推理、结构推理、视觉搜索、手势识别和翻译理解,旨在全面评估模型在手语理解中的多维度能力。数据集共包含144,550个问答对,覆盖28,910个视频,并在训练、验证和测试集上进行了合理划分,确保评估的可靠性与可比性。
特点
SignQA-2026的显著特点在于其开创性地提出了手语问答任务,突破了传统手语理解任务仅进行固定映射的局限。通过自然语言问题驱动模型对手语视频的细粒度理解,该数据集涵盖了从低级序列推理到高级语义理解的多个层次。其多语言设计(德语和中文)及大规模数据规模,为手语理解研究提供了丰富的评测资源。此外,数据集的答案生成不依赖于额外的证据,直接基于视频内容,更具挑战性和实用性。
使用方法
使用SignQA-2026数据集时,研究者可通过Hugging Face平台加载预构建的问答对,每个注释包含视频ID、分割标签、所属模块和问题模板ID等信息。数据集适用于训练和评估手语问答模型,论文中提出的SLQAM基线模型展示了有效的使用方式,包括问题条件下的时间下采样和领域知识迁移策略。研究者可直接加载数据进行微调,或遵循论文的预处理步骤进行定制化处理,以适应不同的模型架构和应用场景。
背景与挑战
背景概述
手语作为听障群体的主要沟通媒介,其自动化理解长期受制于固定映射任务的桎梏。传统研究聚焦于视频到孤立标签、手语词序列或口语译文的转换,虽在各自领域取得进展,却难以支撑对同一手语视频的多样化、开放式语义探究。为突破这一局限,南京大学的研究团队于2026年提出手语问答(SLQA)这一全新任务,由史伟淦、王立琛等学者领衔,旨在通过自然语言问题驱动对手语视频进行细粒度理解。SLQA任务综合评估视觉检索、时序与结构推理、手语词识别及句子级语义解析,开创了手语理解研究的新范式。基于此,团队构建了SignQA-2026基准数据集,包含144,550个问答对,覆盖德、中两语种,并提出了强基线模型SLQAM,通过问题条件时序下采样与领域知识迁移,显著提升了性能,为手语智能交互奠定了坚实基础。
当前挑战
SignQA-2026所面临的挑战多重且深远。首先,在领域层面,其核心任务SLQA要求模型在统一框架内兼顾多种认知能力,从位置推理、结构分析到视觉检索、手语词识别乃至翻译理解,这种多层次语义协同超越了既有任务(如图像分类或视频描述)的简单映射,对模型的时序敏感性与跨模态对齐提出了严苛要求。其次,在数据集构建过程中,由于手语的语言特异性与地域变体,从PHOENIX-2014T和CSL-Daily中提炼问答对需精密设计五类问题模板,确保覆盖低层序列到高层语义的完整维度,且需平衡多语言、多领域的分布差异,工作繁复。此外,现有通用视频-语言模型在SignQA上表现欠佳,暴露出手语时空特性与具身语义的建模鸿沟,而高质量手语数据的稀缺与真实场景的噪声更增添了评测与部署的难度。
常用场景
经典使用场景
SignQA-2026数据集的核心应用场景在于驱动手语问答(SLQA)这一全新任务的科研探索。该任务突破了传统手语理解中从视频到固定标签(如词类、手语词汇序列或口语翻译)的单一映射限制,要求模型依据输入的手语视频和自然语言问题,生成精准的答案。此数据集覆盖了从低层级序列推理到高层级语言理解的五类互补性问题,包括位置推理、结构推理、视觉搜索、手语词汇识别和翻译理解,为细粒度视觉检索、时序与结构推理以及句子级语义理解提供了一个统一且严谨的评测框架。
解决学术问题
该数据集精准回应了手语理解研究中长期存在的核心挑战:传统任务无法灵活应对多变的问题,且难以全面评估模型对手语视频的深层理解能力。SignQA-2026通过提供大规模、多语言(中德双语)的问答对,解决了评估维度碎片化的问题,使得研究者能够在同一个框架下系统度量模型的视觉感知、时序推理、词汇识别与跨模态语义理解能力。其构建过程依托于PHOENIX-2014T和CSL-Daily的丰富注释,确保了数据质量与领域代表性,为手语问答这一新兴方向树立了可靠的基准,有力推动了该领域学术研究的规范化和深入发展。
衍生相关工作
围绕SignQA-2026,已衍生出一系列极具启发性的后续工作。一方面,所提出的SLQAM基线模型开创了问题条件调制的时间下采样(QCMTD)策略,并为手语理解引入了从连续手语识别预训练、手语翻译训练到QA微调的三阶段知识迁移范式,为后续模型设计提供了坚实基础。另一方面,该数据集激发了跨模态理解、高效视频表征学习以及大型视觉语言模型在手语领域的适配研究。此外,数据集的发布也催生了更精细的评测指标和多任务联合学习研究,并促进了手语问答与图像问答、视频问答等领域的交叉融合,推动了对非口语语言智能理解体系的整体探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务