SignQA-2026
收藏资源简介:
SignQA-2026是一个多语言手语问答基准数据集,包含144,550个问答对,覆盖28,910个视频,基于PHOENIX-2014T和CSL-Daily构建,包含五种问题类别,用于评估手语理解。
SignQA-2026 is a multilingual sign language question answering benchmark dataset. It comprises 144,550 question-answer pairs covering 28,910 videos, is constructed based on PHOENIX-2014T and CSL-Daily, and includes five question categories for sign language understanding evaluation.
数据集总体概述
本项目提出了手语问答(Sign Language Question Answering, SLQA)任务,并发布了名为SignQA-2026的多语言基准数据集及强基线模型SLQAM。任务目标为:给定一段手语视频和自然语言问题,模型需生成相应答案。该框架统一评估了细粒度视觉检索、时间与结构推理、手语词汇(gloss)识别及句子级语义理解能力。
基准数据集内容
SignQA-2026基于PHOENIX-2014T(德语)和CSL-Daily(中文)的词注与翻译标注构建,共包含144,550个问答对,覆盖28,910个视频,支持德语和中文两种语言。
| 基准子集 | 语言 | 训练集 | 开发集 | 测试集 | 总计 |
|---|---|---|---|---|---|
| PHOENIX-2014T-QA | 德语 | 35,480 | 2,595 | 3,210 | 41,285 |
| CSL-Daily-QA | 中文 | 92,000 | 5,385 | 5,880 | 103,265 |
| 总计 | - | 127,480 | 7,980 | 9,090 | 144,550 |
问答涵盖五种互补的问题类型,由低层次序列推理至高层次语言理解:
- M1(位置推理):识别指定位置的词注。
- M2(结构推理):推理相邻符号和子序列。
- M3(视觉搜索):定位目标词注或识别非手部标记。
- M4(词注识别):恢复完整词注序列。
- M5(翻译理解):理解目标口语语义。
数据获取与使用
- 注释数据可在Hugging Face获取:hulala/SignQA-2026。
- 注意:该版本仅包含问答注释和视频标识符,不重新分发源视频。需自行获取PHOENIX-2014T和CSL-Daily原始资源,并遵循其原有访问和许可条款。
- 每条注释包含:源
video_id、数据划分、数据集、模块、问题模板ID、问题、答案及语言。
基线模型(SLQAM)
**SLQAM(Sign2Answer)**作为基线系统,包含三大核心组件:
- 视觉骨干网络:提取帧级手语表示。
- 问题条件调制时间下采样(QCMTD):筛选与问题相关的时间信息。
- 语言模型:生成答案。
训练采用三阶段领域内知识迁移流程:连续手语识别(CSLR)预训练 → 手语翻译(SLT)训练 → SLQA微调,逐步转移视觉感知、时间对齐和语言生成能力。
主要实验结果
在测试集上,SLQAM整体表现优于通用视频-语言模型及级联基线(Sign2Text2Answer),具体指标(ROUGE-L、BLEURT、CIDEr)如下(数值越高越好):
| 模型 | PHOENIX ROUGE-L | PHOENIX BLEURT | PHOENIX CIDEr | CSL-Daily ROUGE-L | CSL-Daily BLEURT | CSL-Daily CIDEr |
|---|---|---|---|---|---|---|
| VideoLLaMA3-2B | 44.69 | 37.45 | 1.252 | 60.51 | 38.24 | 1.735 |
| Qwen3-VL-2B-Instruct | 47.70 | 42.02 | 1.410 | 60.24 | 38.32 | 1.699 |
| InternVL3-2B | 50.93 | 45.45 | 1.736 | 64.27 | 44.31 | 2.277 |
| Sign2Text2Answer | 53.54 | 54.54 | 2.343 | 70.75 | 54.04 | 3.754 |
| SLQAM(Sign2Answer) | 54.16 | 56.21 | 2.768 | 73.52 | 60.23 | 4.193 |
开源状态与使用说明
- 论文及预印本:arXiv(https://arxiv.org/abs/2607.27826)
- 项目主页:https://github.com/gswycf/SignLanguageQA
- 数据加载示例(Python): python from datasets import load_dataset
中文基准
csl_daily = load_dataset("hulala/SignQA-2026", "csl-daily-qa")
德语基准
phoenix14t = load_dataset("hulala/SignQA-2026", "phoenix14t-qa")
- 当前以发布论文、注释和项目页面;训练与评估代码、预训练检查点及详细预处理说明将持续更新。




