遇见数据集

SLU-2K

收藏
arXiv2026-06-02 更新2026-06-04 收录
数据链接:
官方服务:

资源简介:

SLU-2K是由摩德纳和雷焦艾米利亚大学等研究机构构建的语义评估基准数据集,旨在通过问答形式系统评估手语翻译系统的语义理解能力。该数据集包含2,350个封闭式视频问答对,基于广泛使用的PHOENIX-2014T和CSL-Daily数据集构建,涵盖动作、位置、数字、对象、人物、时间和天气条件等七类语义类别,通过自动化流水线生成并经过多阶段过滤以确保质量。数据集主要应用于手语理解领域,旨在解决传统翻译评估中语义保真度不足的问题,为开发更精准的辅助技术提供语义层面的评估工具。

SLU-2K is a semantic evaluation benchmark dataset constructed by the University of Modena and Reggio Emilia and other research institutions. It aims to systematically evaluate the semantic understanding capability of sign language translation systems through question-answering formats. This dataset contains 2,350 closed-ended video question-answering pairs, and is constructed based on two widely used datasets, PHOENIX-2014T and CSL-Daily. It covers seven semantic categories including actions, locations, numbers, objects, persons, time and weather conditions. Generated via an automated pipeline, it has undergone multi-stage filtering to ensure data quality. Primarily applied in the field of sign language understanding, this dataset is designed to solve the problem of insufficient semantic fidelity in traditional translation evaluation, providing a semantic-level evaluation tool for the development of more precise assistive technologies.

创建时间:
2026-06-02
原始信息汇总

SLU-2K 数据集概述

基本信息

  • 数据集名称:SLU-2K
  • 数据集类型:基于问题的语义评估基准
  • 应用领域:手语翻译(Sign Language Translation, SLT)的语义评估

主要功能

  • 用于手语翻译模型的语义理解能力测试
  • 通过问答形式评估翻译结果的语义准确性

包含内容

  • PHOENIX-2014T 基准测试:针对德语手语数据集的语义评估
  • CSL-Daily 基准测试:针对中文手语数据集的语义评估
  • 自动生成管道:可用于为其他手语翻译数据集生成语义问答基准测试
搜集汇总
数据集介绍
SLU-2K 数据集图片
构建方式
在手语翻译领域,传统的评估指标如BLEU和ROUGE侧重于词汇重叠,难以衡量语义保真度。为弥补这一缺陷,SLU-2K数据集应运而生,其构建基于PHOENIX-2014T和CSL-Daily两个广泛使用的基准数据集。构建过程采用全自动流水线:首先利用可靠的指令跟随大语言模型DeepSeek-Chat-V3.2,依据参考句子生成类别感知的多选题,包含一个正确答案和四个干扰项。随后,经过多阶段筛选:先后进行无句子上下文场景的弱项测试、干扰项重生成与二次弱项测试、跨模型验证(使用GPT-5.1),以及带句子上下文的非歧义性测试。最终,仅保留那些在无原始句子时难以回答、但结合原文可明确作答的高质量题目,形成包含2350个视频-问答对的基准数据集。
特点
SLU-2K数据集的核心特点在于它将手语翻译的评估从表面词汇重叠转向深层语义理解。数据集覆盖7个语义类别:动作、地点、数字、物体、人物、时间和天气状况,其中类别划分因数据集而异(PHOENIX侧重天气相关,CSL-Daily涵盖更广)。每道题都经过严格筛选,确保仅能通过理解源句语义来作答,而非依赖常识或频率偏差,从而精准暴露模型在关键语义信息(如数字、地点)上的缺陷。实验表明,该数据集能揭示BLEU相近的模型在语义准确性上的显著差异,例如MMSTL在PHOENIX上整体准确率达75.24%,而SpaMo为68.54%,尤其在数字类别差距高达10.71个百分点。
使用方法
SLU-2K的使用方法直观且系统化。给定一段手语视频,手语翻译模型首先生成自然语言译文。随后,将该译文与基准集中对应的多选题一同输入大语言模型(如DeepSeek-Chat-V3.2),由后者根据译文内容选择答案。最终,预测答案与参考答案比对,计算整体及各语义类别的准确率。该协议需与BLEU等传统指标互补使用,以全面评估模型的翻译质量——既衡量流利度,又检验语义保真度。代码、提示词和基准文件均已开源,便于研究者复现实验并追踪不同架构、训练策略下的语义理解进展。
背景与挑战
背景概述
在手语翻译(Sign Language Translation, SLT)领域,长期以来评估标准主要依赖于BLEU和ROUGE等基于词法重叠的指标。然而,这些指标虽能衡量表面的词汇相似性,却无法有效捕捉译文的语义保真度——一段翻译可能在词法上流畅,却错误地改变了关键数字、地点或时间信息。针对这一根本性缺陷,Zeno Testa及其团队于2026年提出了SLU-2K数据集,该研究由意大利摩德纳与雷焦艾米利亚大学主导,联合卡塔尼亚大学、格拉纳达大学等机构共同完成。核心研究问题在于:如何从语义理解(Sign Language Understanding, SLU)的角度,而非仅从翻译流利度出发,系统性地评估手语翻译系统的质量?SLU-2K数据集基于PHOENIX-2014T和CSL-Daily两个广泛使用的数据集,通过自动化的问答生成流水线,构建了2350个闭式视频问答对,涵盖动作、地点、数字、物体、人物、时间和天气等七类关键语义范畴。该基准的推出直接挑战了传统评估体系的可靠性,揭示了现有模型在语义正确性上的显著短板,为手语翻译领域确立了一种更忠实于含义传递的评估范式。
当前挑战
SLU-2K数据集所应对的核心挑战源于传统词法重叠指标(如BLEU、ROUGE)在评估语义保真度方面的天然局限。这些指标无法区分“流畅但不准确”的翻译,例如在地点替换、数字变更或时间扭曲等情形下仍可能获得高分,这严重阻碍了手语翻译在辅助技术(如智能眼镜)中的实际部署。构建过程中亦面临多重技术难题:首先,自动生成高质量且具有诊断意义的语义问答对极为复杂,需确保问题无法仅凭常识或语言先验即可作答;其次,设计并实现了多阶段过滤流水线,包括脆弱性测试、干扰项再生、跨模型校验及非歧义性验证,以剔除弱或歧义问题——最初生成的4037个问题中,最终仅保留了2350个合格样本;此外,在不同语言复杂度的数据集(如句式简单的PHOENIX与语义丰富的CSL-Daily)之间,语义评估的难度差异巨大,模型在数字和地点等精确事实类别的准确率可低至25.30%,凸显了精确语义信息的保留仍是当前手语翻译系统的关键瓶颈。
常用场景
经典使用场景
在手语翻译研究领域,传统评估依赖BLEU、ROUGE等词重叠指标,虽能衡量词汇相似性,却难以捕捉翻译是否忠实传达源手语序列的语义内涵。SLU-2K数据集正是为此而生,它通过构建封闭式问答对,将评估焦点从表面流畅性转向深层语义理解。该数据集包含2350个视频-问题-答案三元组,覆盖动作、地点、数字、物体、人物、时间及天气七类语义范畴,为系统评估手语翻译模型在关键语义要素上的保留能力提供了标准化工具。研究者可借此精准诊断模型在各类语义维度上的表现短板,而非仅依赖模糊的总体分数。
解决学术问题
SLU-2K直指当前手语翻译评估中的核心痼疾:BLEU与ROUGE等指标无法区分译文在事实细节上的正误,导致系统可能生成流畅却信息失真的翻译。该数据集揭示了现有顶尖系统(如MMSTL和SpaMo)在数值、地点等精确语义类别上的显著差距——例如在PHOENIX数据集上,MMSTL的语义准确率达75.2%,而SpaMo仅68.5%,但二者传统指标却高度接近。这一发现证实了语义理解与词汇流畅性不可混为一谈,促使学界重新审视评估范式,推动从“翻译质量”到“语义保真度”的范式转换,为建立更可靠的评测体系奠定基础。
衍生相关工作
SLU-2K的提出已催生出若干具有启发性的研究方向。其自动化生成流水线——包括弱问题筛选、干扰项重生成、跨模型验证及非歧义性测试等环节——为构建高质量语义评测集提供了可复现的模板,激励后续工作在不同语言对及更广泛语义类别上拓展类似基准。此外,该数据集对多模态大语言模型的近乎随机表现评估,揭示了当前具身智能系统在手语理解上的根本性缺陷,直接推动了将手语理解能力系统整合进多模态模型的研究浪潮。更关键的是,其揭示的数字、地名等精确信息的脆弱性,促使研究者探索基于事实约束的解码策略与专项训练机制,以实现翻译流畅性与语义正确性的真正统一。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务