HEAR Dataset
收藏资源简介:
HEAR是一个全面的声学侧信道攻击(ASCA)语料库,旨在评估击键推断算法在三个关键轴上的表现:键盘泛化、噪声适应和用户偏见。数据集包含53名参与者、37个笔记本电脑键盘、3个真实环境(安静、中等噪声、高噪声)和3种捕获模态(外部麦克风、设备麦克风、VoIP流式捕获),采用连续文本键入和多记录器同步技术。
HEAR is a comprehensive acoustic side channel attack (ASCA) corpus designed to evaluate keystroke inference algorithms across three key axes: keyboard generalization, noise adaptation, and user bias. The dataset includes 53 participants, 37 laptop keyboards, three real-world environments (quiet, moderate noise, high noise), and three capture modalities (external microphone, built-in device microphone, VoIP streaming capture), utilizing continuous text typing and multi-recorder synchronization techniques.
数据集概述:HEAR
HEAR 是一个旨在推动声学侧信道攻击(ASCA)研究的大规模、高真实度数据集,为评估键盘按键推断算法而设计。该数据集是 AsiaCCS 26 论文《DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition》的官方基准数据集。
- 核心目标:解决以往ASCA数据集在用户、环境和设备多样性上的不足,专门用于评估算法在以下三个关键维度上的表现:
- 键盘泛化能力:跨不同设备的鲁棒性。
- 噪声适应能力:在不同环境噪声下的韧性。
- 用户偏差:不同打字风格带来的差异。
数据集关键特性
- 参与者:共 53 人,涵盖不同性别、用手习惯和打字行为。
- 键盘设备:包含 37 种不同的笔记本电脑键盘,涵盖笔记本内置的剪刀脚键盘、外接薄膜键盘和机械键盘。
- 采集环境:三种真实环境,包括安静(图书馆)、中等噪音(办公室)和高噪音(咖啡馆/户外)。
- 录音方式:三种采集模态。
- 外部麦克风录制。
- 设备内置麦克风录制(无网络噪声)。
- VoIP 网络流媒体录制(模拟真实远程会议场景)。
- 文本内容:连续文本打字任务,要求输入完整的句子,比孤立按键更难解析。
- 同步技术:具备多录音设备的时间偏移估计功能,支持多通道、跨设备的声学侧信道分析。
关联框架:DECKER
该数据集是 DECKER 框架的基准。DECKER 是一个四阶段域不变按键推断框架,包括:
- 键盘签名归一化 (KSN):在波形域降低设备特征。
- 域对抗解耦:抑制键盘身份信息。
- 监督跨键盘对比对齐:确保不同设备上相同按键的特征一致性。
- 声学风格随机化 (ASR):合成未见过的键盘响应。




