遇见数据集

BASH-Lab/OpenSQA

收藏
Hugging Face2025-09-22 更新2025-10-25 收录
官方服务:

资源简介:

OpenSQA是一个开源的传感器感知问题回答或指令调整数据集,包含人类活动IMU数据解释。该数据集包括35,960个IMU-标题对组成的SensorCap资源和199,701个为因果和解释性推理设计的问题-答案对。它还包括一个优化的调整拆分(Tune-OpenSQA),用于科学准确性、叙述清晰度和诊断洞察力。数据集分为v1和v2版本,分别包含每个IMU读数的10个较小的问题-答案对和5个较大的问题-答案对。

OpenSQA is an open-source sensor-aware question-answering or instruction-tuning dataset covering IMU data interpretations for human activities. The dataset includes 35,960 IMU-caption pairs in SensorCap and 199,701 question-answer pairs designed for causal and explanatory reasoning. It also features a curated tuning split (Tune-OpenSQA) optimized for scientific accuracy, narrative clarity, and diagnostic insight. The dataset is split into v1 and v2 versions, with 10 relatively smaller QA pairs and 5 relatively larger QA pairs per IMU reading, respectively.

提供机构:
BASH-Lab
搜集汇总
数据集介绍
BASH-Lab/OpenSQA 数据集图片
构建方式
OpenSQA数据集源于对可穿戴传感器数据深层语义理解的需求,旨在弥补传统IMU活动识别系统缺乏因果解释能力的不足。其构建依托于SensorCap数据集中的35,960个IMU-文本描述对,通过为每条IMU读数生成问答对的方式实现:v1版本每条IMU样本对应10个较小规模的问答对,v2版本则对应5个较大规模的问答对,最终汇聚成包含199,701个问答对的资源库。所有IMU数据以10Hz采样率呈现,并保留小数点后六位精度。此外,数据集还特别提炼出Tune-OpenSQA子集,专为优化科学准确性、叙事清晰度与诊断洞察力而设计。
特点
OpenSQA的核心特点在于其面向传感器数据的因果推理与解释性问答能力,突破了传统数据集仅关注活动分类的局限。该数据集覆盖丰富的人类活动场景,问答对不仅涵盖动作识别,更深入探讨其背后的生理机制与情境意义,赋予模型生成可解释、上下文丰富响应的能力。基于此训练的LLaSA模型(7B和13B参数)在基准测试与真实世界任务中均展现出超越GPT-3.5和GPT-4o-mini等商业大语言模型的性能,充分验证了领域监督与模型对齐策略在传感器推理任务中的有效性。
使用方法
研究人员可直接通过Hugging Face平台加载OpenSQA数据集,用于训练或微调传感器感知的语言模型。典型使用流程包括:将原始IMU时间序列数据(10Hz采样,六位小数精度)与对应的问答对结合,构建传感器-文本联合输入。数据集支持两种版本(v1与v2)的选择,可根据任务复杂度调整问答对密度。推荐结合LLaSA框架进行模型训练,利用Tune-OpenSQA子集优化科学推理能力。评估时,可参考论文中提供的基准测试协议,对比模型在活动解释、因果分析等任务上的表现。
背景与挑战
背景概述
随着可穿戴设备的普及,基于惯性测量单元(IMU)数据的人体活动识别技术已取得显著进展,然而现有模型大多局限于分类任务,缺乏对活动背后因果机制与上下文意义的解释能力。为弥合这一鸿沟,BASH Lab(伍斯特理工学院)于2024年推出了OpenSQA数据集,该数据集由Sheikh Asif Imran等研究人员构建,包含199,701个面向因果与解释性推理的问答对,旨在推动传感器感知语言模型的发展。OpenSQA不仅为IMU数据解读提供了高质量的监督信号,还催生了LLaSA系列模型,其在传感器推理任务上超越了GPT-3.5与GPT-4o-mini等商业大语言模型,彰显了领域监督与模型对齐在可解释传感器分析中的关键价值。
当前挑战
OpenSQA所应对的核心挑战在于,传统IMU活动识别模型无法提供可解释的语义输出,难以回答关于活动成因、上下文含义及诊断性洞察的开放性问题。构建过程中,研究人员需将原始IMU时序数据(10Hz采样,六位小数精度)高效转化为高质量的问答对,这涉及多模态对齐、科学准确性保障及叙述清晰度优化。此外,数据集需兼顾规模与质量,从SensorCap的35,960条IMU-描述对中衍生出近20万问答对,并精心设计Tune-OpenSQA子集以平衡科学严谨性与诊断洞察力,最终实现紧凑型传感器语言模型在资源受限设备上的实用部署。
常用场景
经典使用场景
OpenSQA数据集的核心应用在于构建与评估传感器感知的问答系统,尤其聚焦于对人体活动惯性测量单元(IMU)数据的因果与解释性推理。该数据集包含近20万对问答样本,覆盖了从日常行为识别到异常运动检测的广泛场景,为研究人员提供了一个标准化的基准平台,用以训练和测试能够对原始IMU时序信号进行自然语言理解与生成的语言模型。其经典用法是将IMU数据作为输入,引导模型回答诸如“用户正在做什么动作”或“为何该动作被识别为跌倒”等开放性问题,从而推动可解释人工智能在可穿戴计算领域的发展。
解决学术问题
在学术研究中,OpenSQA旨在解决传统可穿戴系统虽能识别活动但无法解释其潜在原因或上下文意义的根本性缺陷。现有方法多依赖于黑箱分类模型,缺乏对传感器数据背后因果机制的透明推理能力。OpenSQA通过提供大量带有人工标注的问答对,使研究者得以探索如何将结构化时序信号与自然语言推理相结合,从而推动传感器数据解释从简单的模式匹配向深层次的语义理解转型。这一资源显著促进了多模态学习、因果推理以及人机交互等交叉领域的研究进展,并为评估模型在科学准确性、叙述清晰性与诊断洞察力方面的表现提供了量化依据。
衍生相关工作
基于OpenSQA数据集,研究者已衍生出若干具有影响力的经典工作。其中最具代表性的是LLaSA(Large Language and Sensor Assistant)系列模型,该工作通过将IMU数据编码为语言模型可理解的嵌入表示,在7B和13B参数量级上实现了超越GPT-3.5与GPT-4o-mini的传感器推理性能。此外,SensorCap数据集的提出为IMU-文本配对提供了基础资源,而OpenSQA则在此基础上进一步丰富了问答对,催生了诸如传感器驱动的因果链推理、跨模态对齐预训练以及可穿戴设备上的轻量化推理框架等研究方向。这些工作共同构建了从数据采集、模型训练到实际部署的完整技术栈,深刻影响了可穿戴人工智能的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务