SignThought
收藏资源简介:
SignThought是一个新构建的大规模无注释手语翻译数据集,由香港理工大学和四川大学的研究团队开发。该数据集具有更强的上下文依赖性和更真实的语义表达,旨在解决传统手语翻译系统中将手语视频片段直接映射到口语单词的局限性。数据集通过收集手语视频和对应的口语翻译句子构建,为研究跨模态推理任务提供了重要资源,可应用于手语翻译、辅助技术等领域。
SignThought is a newly constructed large-scale unannotated sign language translation dataset developed by research teams from The Hong Kong Polytechnic University and Sichuan University. This dataset exhibits stronger contextual dependency and more authentic semantic expressions, aiming to address the limitations of traditional sign language translation systems that directly map sign language video clips to spoken words. The dataset is constructed by collecting sign language videos and their corresponding spoken translation sentences, providing a crucial resource for research on cross-modal reasoning tasks, and can be applied in fields such as sign language translation and assistive technologies.
数据集概述
数据集基本信息
- 数据集名称:SignThought
- 关联研究:Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation (ACL 2026)
- 核心目标:提出一种新的无注释手语翻译范式,通过潜在思想抽象、计划-基础解耦和可追溯证据对齐机制,解决手语中动态“生产性形式”的翻译难题。
数据集内容与特征
- 视觉特征:使用预提取的1024维视觉特征,特征提取器基于开源的Inception网络,移除了依赖于注释的监督,并仅使用配对的手语视频-句子数据进行句子级对比目标训练。
- 涵盖数据集:
- PHOENIX2014T
- CSL-Daily
数据获取与准备
-
特征下载地址:
- PHOENIX2014T: https://connectpolyu-my.sharepoint.com/:f:/g/personal/25014758r_connect_polyu_hk/IgAnU8PHNGn6Q4jCLm6Yb5UKAfZzqYeZVYgwXWpL_jKey2E?e=YZbi5R
- CSL-Daily: https://connectpolyu-my.sharepoint.com/:f:/g/personal/25014758r_connect_polyu_hk/IgAnU8PHNGn6Q4jCLm6Yb5UKAfZzqYeZVYgwXWpL_jKey2E?e=YZbi5R
-
文件目录结构:
data/ ├── PHOENIX2014T/ │ ├── phoenix14t.train │ ├── phoenix14t.dev │ └── phoenix14t.test └── csl/ ├── csl.train ├── csl.dev └── csl.test
模型训练与推理
- 训练命令:
- PHOENIX2014T:
CUDA_VISIBLE_DEVICES=0 python -m main train configs/sign_phoenix.yaml - CSL-Daily:
CUDA_VISIBLE_DEVICES=0 python -m main train configs/sign_csl.yaml
- PHOENIX2014T:
- 推理命令:
- PHOENIX2014T:
CUDA_VISIBLE_DEVICES=0 python -m main test configs/sign_phoenix.yaml --ckpt experiment_results/phoenix14t_auto/best.ckpt - CSL-Daily:
CUDA_VISIBLE_DEVICES=0 python -m main test configs/sign_csl.yaml --ckpt experiment_results/csl_auto/best.ckpt
- PHOENIX2014T:
关键配置参数
| 参数 | 默认值 | 描述 |
|---|---|---|
thinking.K |
8 | 潜在思想槽的数量 |
thinking.num_layers |
2 | 思考层数 |
thinking.num_segments |
8 | 软分段标记M的数量 |
training.batch_size |
32 | 批次大小 |
training.learning_rate |
1e-3 | 初始学习率 |
training.lambda_mono |
0.1 | 单调性正则化权重 |
training.lambda_cont |
0.2 | 连续性正则化权重 |
引用
bibtex @misc{jiang2026thinklatentthoughtsnew, title={Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation}, author={Yiyang Jiang and Li Zhang and Xiao-Yong Wei and Li Qing}, year={2026}, eprint={2604.15301}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2604.15301}, }



