登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Unmatched test scores in five noise sources at all SNRs.
Unmatched test scores in five noise sources at all SNRs.
收藏
NIAID Data Ecosystem
2026-05-01 收录
鲁棒性测试
语音识别评估
数据链接:
https://figshare.com/articles/dataset/Unmatched_test_scores_in_five_noise_sources_at_all_SNRs_/22804038
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
The results are averaged over all testing utterances.
应用场景:
创建时间:
2023-05-11
相关数据集
AutoElicit-Bench
计算机安全
鲁棒性测试
AutoElicit-Bench 是一个包含117条人工验证的扰动指令的基准数据集,用于评估计算机使用代理(CUAs)在面临意外行为时的鲁棒性。这些扰动指令通过AutoElicit框架从Claude 4.5 Haiku(50条)和Claude 4.5 Opus(67条)模型中成功诱发,均基于OSWorld任务进行最小化修改,旨在触发非恶意意图下的不安全行为。数据集包含以下字段:任务ID(task_
Hugging Face
2026-02-10 更新
25
0
PPTC-R
自然语言处理
鲁棒性测试
PPTC-R数据集由北京大学和微软亚洲研究院共同创建,旨在评估大型语言模型在完成复杂PPT任务时的鲁棒性。数据集包含279个多轮对话会话,每个会话涉及创建新幻灯片和编辑现有PPT模板任务。通过模拟用户指令在句子、语义和多语言层面的对抗性扰动,以及软件版本变化对API可用性的影响,数据集设计了多种鲁棒性测试场景。该数据集的应用领域主要集中在提高语言模型在实际用户场景中的任务完成性能,特别是在面对多重
arXiv
2024-03-06 更新
15
0
Results of speech recognition and speech and language development outcome.
语音识别评估
语言发展评估
Results of speech recognition and speech and language development outcome.
NIAID Data Ecosystem
6
0
2023基于室内图像与文本目标、图像与描述文本的词级扰动稳定性测试(C2C-R)数据集
指代表达式
鲁棒性测试
该数据集在2023年提出,是一个由多场景多类别图片和以指代目标为中心的指代表达文本组成的指代表达理解鲁棒性测试数据集。该数据集共包含223个图像,总共338个鲁棒性测试样例。其中,鲁棒性样例被分为文本变化而指代目标变化(Change2Change, C2C)和文本变化而指代目标不变(Change2Remain, C2R)两部分。具体来说,对于原有的这338个指代表达理解任务的数据样例,我们对指代表
国家基础学科公共科学数据中心
18
0
eval-parakeet-tdt-0.6b-v3-multimed-hard-20260408-1930
语音识别评估
实体识别
该数据集包含 Whisper 模型在特定评估数据集上的评测结果,主要用于语音转文本(speech-to-text)任务的性能评估。数据集包含音频样本(如源数据集提供)、参考转录文本、模型预测文本、词错误率(WER)和字符错误率(CER)等字段。特别地,数据集还包含实体标注信息(如解剖学、生物标志物、条件、药物、组织和程序等类别)及相应的实体字符错误率(Entity CER)。整体实体字符错误率为2
Hugging Face
2026-04-09 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广