遇见数据集

HEAR Dataset

收藏
github2026-07-21 更新2026-07-23 收录
官方服务:

资源简介:

HEAR是一个全面的声学侧信道攻击(ASCA)语料库,旨在评估击键推断算法在三个关键轴上的表现:键盘泛化、噪声适应和用户偏见。数据集包含53名参与者、37个笔记本电脑键盘、3个真实环境(安静、中等噪声、高噪声)和3种捕获模态(外部麦克风、设备麦克风、VoIP流式捕获),采用连续文本键入和多记录器同步技术。

HEAR is a comprehensive acoustic side channel attack (ASCA) corpus designed to evaluate keystroke inference algorithms across three key axes: keyboard generalization, noise adaptation, and user bias. The dataset includes 53 participants, 37 laptop keyboards, three real-world environments (quiet, moderate noise, high noise), and three capture modalities (external microphone, built-in device microphone, VoIP streaming capture), utilizing continuous text typing and multi-recorder synchronization techniques.

创建时间:
2026-07-21
原始信息汇总

数据集概述:HEAR

HEAR 是一个旨在推动声学侧信道攻击(ASCA)研究的大规模、高真实度数据集,为评估键盘按键推断算法而设计。该数据集是 AsiaCCS 26 论文《DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition》的官方基准数据集。

  • 核心目标:解决以往ASCA数据集在用户、环境和设备多样性上的不足,专门用于评估算法在以下三个关键维度上的表现:
    1. 键盘泛化能力:跨不同设备的鲁棒性。
    2. 噪声适应能力:在不同环境噪声下的韧性。
    3. 用户偏差:不同打字风格带来的差异。

数据集关键特性

  • 参与者:共 53 人,涵盖不同性别、用手习惯和打字行为。
  • 键盘设备:包含 37 种不同的笔记本电脑键盘,涵盖笔记本内置的剪刀脚键盘、外接薄膜键盘和机械键盘。
  • 采集环境:三种真实环境,包括安静(图书馆)、中等噪音(办公室)和高噪音(咖啡馆/户外)。
  • 录音方式:三种采集模态。
    1. 外部麦克风录制。
    2. 设备内置麦克风录制(无网络噪声)。
    3. VoIP 网络流媒体录制(模拟真实远程会议场景)。
  • 文本内容:连续文本打字任务,要求输入完整的句子,比孤立按键更难解析。
  • 同步技术:具备多录音设备的时间偏移估计功能,支持多通道、跨设备的声学侧信道分析。

关联框架:DECKER

该数据集是 DECKER 框架的基准。DECKER 是一个四阶段域不变按键推断框架,包括:

  1. 键盘签名归一化 (KSN):在波形域降低设备特征。
  2. 域对抗解耦:抑制键盘身份信息。
  3. 监督跨键盘对比对齐:确保不同设备上相同按键的特征一致性。
  4. 声学风格随机化 (ASR):合成未见过的键盘响应。
搜集汇总
数据集介绍
HEAR Dataset 数据集图片
构建方式
HEAR数据集面向声学侧信道攻击(ASCA)研究,旨在突破现有数据集在用户、环境与设备多样性上的局限。数据采集自53名参与者,涵盖不同性别、用手习惯及打字风格,使用37种笔记本电脑键盘,包括内置剪刀脚、外接薄膜与机械键盘。录音在三种真实场景中进行——安静图书馆、中等噪声办公室与高噪声咖啡馆/户外,并通过三种模态捕获:外接麦克风、设备内置麦克风(无网络噪声)以及VoIP网络流媒体(模拟远程会议环境)。参与者录入连续文本而非孤立按键,极大提升了数据复杂度。同步采用多录音机偏移估计,支持多通道与跨设备分析。最终构建了包含超万条样本的全面语料库。
使用方法
研究者可通过官方渠道获取HEAR数据集,将其用于ASCA算法的训练与评估。建议的典型流程为先基于数据集训练基模型,以跨用户、跨键盘与跨环境等划分创建测试集,评测模型的泛化能力。数据集的同步录音机制允许利用多通道信息,支持研究者对比不同麦克风模态下的性能。文本级标签可用于训练序列模型或结合语言模型(如LLM)进行后处理纠错,提升句子层面的恢复精度。此外,DECKER框架已开源,用户可直接使用Keyboard Signature Normalization、域对抗解耦等组件复现或扩展其实验。推荐在论文中引用亚洲计算机与通信安全会议(AsiaCCS '26)的官方文献。
背景与挑战
背景概述
在网络安全领域,声学侧信道攻击(ASCA)通过解析击键声响泄露敏感信息,对笔记本电脑安全构成严重威胁。然而,早期研究受限于数据集在用户多样性、设备覆盖与场景丰富度上的不足,难以全面评估攻击的泛化能力。为突破这一瓶颈,由Bikrant Bikram Pratap Maurya、Nitin Choudhury、Daksh Agarwal与Arun Balaji Buduru等人于2026年在AsiaCCS '26会议上提出的HEAR数据集,收录了53名参与者、37种不同键盘及三种真实环境下的声学记录,涵盖外部麦克风、设备麦克风与VoIP流媒体三种采集模式,首次系统性地支持跨用户、跨键盘与跨环境的基准评测,推动了ASCA研究迈向更现实、更鲁棒的分析框架。
当前挑战
HEAR数据集所解决的领域核心挑战包括三个方面:其一,如何实现跨键盘泛化——不同键盘的声学特征差异显著,导致攻击模型在新设备上性能骤降;其二,如何适应环境噪声——安静图书馆、办公区与咖啡馆等场景的背景噪音动态多变,严重干扰击键声学特征提取;其三,如何消除用户偏差——不同个体在打字力度、节奏与姿势上的差异形成了独特的声学指纹,加大了隐私推断的难度。在构建过程中,团队需同步处理三种采集模式下时间戳的多源对齐问题,并确保连续文本录入能在自然无约束条件下被忠实记录,这对录制设备同步与数据标注精度提出了极高要求。
常用场景
经典使用场景
在声学侧信道攻击(ASCA)研究领域,HEAR数据集被广泛用作评估键盘按键推断算法鲁棒性的基准平台。研究者通过该数据集,系统性地测试模型在跨键盘泛化、环境噪声适应及用户打字风格偏差等三个关键维度上的表现。数据集精心采集了53名参与者在37种不同笔记本电脑键盘上的连续文本键入音频,涵盖静音图书馆、中等噪度办公室及高噪咖啡馆/户外三种真实场景,并通过外置麦克风、设备内置麦克风及VoIP流媒体三种捕获模态同步记录。这一设计使研究人员能够模拟从物理邻近攻击到远程窃听的完整威胁图谱,为开发更贴近现实威胁环境的防御与攻击技术提供了标准化的实验框架。
解决学术问题
HEAR数据集系统性破解了长期以来困扰ASCA学术研究的三大瓶颈:多键盘域适配、环境噪声鲁棒性与用户风格偏差消除。传统数据集因规模有限,仅支持同键盘或同用户受控实验,难以揭示跨设备泛化的本质难题。HEAR通过引入37种键盘的声学签名差异、三种噪声水平的环境调控以及53人多样化的打字节奏与力度数据,构建了首个可同时评估“键盘泛化-噪声适应-用户去偏”三维能力的学术基准。该数据集直接催生了DECKER框架等域不变特征学习方法,并实证了声学攻击在跨域场景下仍具现实威胁性,为密码学、隐私保护与信号处理领域的研究者提供了严谨的实验范式与可复现的评测标准。
实际应用
在实际安全领域,HEAR数据集能够支撑构建针对笔记本电脑键盘的通用声学侧信道攻击系统,尤其在实时远程会议、公共办公区及开放式校园等真实场景中,攻击者利用常见录音设备即可实现敏感信息(如密码、私密对话)的隐秘窃取。该数据集通过VoIP流媒体捕获模态模拟了广泛使用的网络通话环境,使得对Skype、Zoom等平台中按键声的远程推断研究成为可能。此外,跨键盘泛化能力的突破直接赋能执法部门在设备型号未知的犯罪取证场景中进行按键复原,同时也倒逼键盘制造商重新设计抑噪结构或开发主动声学屏蔽技术,推动消费电子产品安全设计的范式革新。
数据集最近研究
最新研究方向
HEAR数据集作为目前规模最大、最具现实意义的声学侧信道攻击语料库,正引领键盘敲击推断研究从实验室理想环境向跨设备、跨用户、跨场景的泛化挑战迈进。该数据集包含53名参与者在37种笔记本电脑键盘上的录音,涵盖安静图书馆、嘈杂办公室及户外咖啡馆三种真实噪音环境,并同时支持外接麦克风、设备内置麦克风及VoIP流媒体三种捕获模态。依托HEAR,研究者提出了DECKER框架,通过键盘签名归一化、领域对抗解耦、跨键盘对比对齐及声学风格随机化四阶段策略,显著提升了跨键盘与跨用户场景下的键击识别准确率。尤为值得关注的是,结合大语言模型后处理层的句子级推断攻击验证了ASCA在现实通信场景中的持续性安全威胁,为隐私防御研究提供了关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务