遇见数据集

WearableQA

收藏
arXiv2026-09-05 更新2026-09-08 收录
官方服务:

资源简介:

WearableQA是由Meta、韩国科学技术院和高丽大学联合构建的基准数据集,旨在评估AI系统对真实用户长期可穿戴数据的推理能力。该数据集包含4084道10选1选择题,基于200名真实用户长达500天的日常可穿戴时间序列、血液生物标志物及人口统计学信息。通过双源框架,结合文献生理发现与统计验证群体模式,确保问题可靠且具有区分度。其应用领域涵盖健康监测与个性化医疗,旨在解决现有基准缺乏真实世界可穿戴推理能力的评估问题。

WearableQA is a benchmark dataset jointly constructed by Meta, Korea Advanced Institute of Science and Technology (KAIST) and Korea University, designed to evaluate the reasoning capabilities of AI systems when processing long-term wearable data from real users. This dataset contains 4084 10-option multiple-choice questions, which are built upon 500-day daily wearable time-series data, blood biomarkers and demographic information collected from 200 real users. It adopts a dual-source framework that integrates physiological findings from scholarly literature and statistically validated population patterns to ensure the questions are both reliable and discriminative. Its application fields cover health monitoring and personalized medicine, aiming to address the gap that existing benchmarks lack evaluations of real-world wearable reasoning abilities.

创建时间:
2026-09-05
原始信息汇总

WearableQA是一个用于评估模型在真实世界可穿戴数据上进行健康推理能力的基准测试,包含4,084道十选一多选题,数据源自200名真实用户的长期健康记录。

数据来源

  • 真实用户数据:包含可穿戴设备时间序列、血液生物标志物和人口统计学信息,每位用户拥有长达约500天的每日测量记录。
  • 真实数据特性:保留了真实的设备噪声、缺失天数和个体间差异,区别于合成或理想化信号构建的基准。

问题类型与分类

问题按两个互补轴组织,涵盖16种问题类型:

分类轴 类别 题目数量
推理组 数据推理 / 健康推理 2,724 / 1,360
信号复杂度 单信号 / 跨信号 1,682 / 2,402
依据来源 群体统计 / 文献依据 3,154 / 930

每题要求模型对单个用户的纵向记录进行推理,包括对原始测量值的计算(如相关性、异常计数、恢复时间、趋势形状)或生理学解释(如风险评估、鉴别诊断、预后预测)。每个推理组内的正确答案选项A–J均匀分布,随机基线为10%。

数据内容

每个用户最多包含16种每日指标,如:

  • 步数、静息心率、心率变异性、最大摄氧量
  • 睡眠时长、睡眠效率、深度睡眠百分比、REM百分比、就寝时间标准差
  • 活跃卡路里、基础代谢卡路里、平均压力水平
  • 运动次数、运动时长、运动METs、运动平均心率

仓库文件

文件 大小 内容
WearableQA.jsonl 306 MB 预渲染基准,每行一道题,提示已格式化为文本,可直接用于评估
WearableQA_raw.json 39 MB 结构化源数据,包含问题及完整逐用户时间序列,可自定义渲染
render_raw.py 10 KB 渲染器,可将结构化源数据转换为.jsonl格式,支持四种序列化方式

提示结构

每道题的完整提示包含以下部分(内容适用时包含):

  • 指令说明
  • 用户画像:年龄、性别、BMI、种族
  • 传感器数据:最多约500天的日常指标
  • 血液生物标志物面板:17种可用生物标志物
  • 群体参考:5项指标的十分位数/四分位数/中位数
  • 问题陈述
  • 选项A–J

提示文本规模较大:中位约86k字符,最大约124k字符。部分问题会刻意省略时间序列或群体参考,以考察特定推理能力。

使用方式

  • Hugging Face Hub:可直接通过load_dataset("facebook/WearableQA", split="test")加载,也提供其他传感器序列化版本和结构化配置。
  • 本地仓库:需安装Git LFS后克隆,或运行render_raw.py从原始数据重建渲染文件。该脚本仅需Python 3,无第三方依赖。

评估标准

仅当模型选择的选项字母与answer字段完全匹配时计为正确;无法解析出选项字母的响应视为错误。

许可

数据使用CC BY-NC 4.0许可,并附加限制条款:禁止重新识别或尝试重新识别数据主体;禁止用于临床、诊断或治疗决策;禁止以歧视性、有害性或对健康结果具有误导性的方式使用;数据按"原样"提供,仅供研究和基准测试使用。

搜集汇总
数据集介绍
构建方式
WearableQA基准的构建源于对真实用户长期可穿戴数据的深度挖掘,整合了200名真实用户的纵向可穿戴时序数据、17项血液生物标志物及人口统计学信息,每位用户覆盖长达500天的日常测量记录。为确保问题的科学可靠性与规模生成,构建过程采用了双重基础框架:一方面基于同行评审的医学文献,将验证过的生理学发现转化为可计算的推理任务;另一方面通过大群体数据挖掘,借助统计验证识别出真实数据中稳健的生理模式。每一问题均通过确定性的计算方法在个体用户数据上实例化答案,并辅以严格的质量审计与反馈循环,确保标注的准确性和与真实数据的契合度。最终形成了包含4,084个十选一选择题的基准,全面覆盖16种细粒度问题类型。
特点
WearableQA的核心特征在于其真实性、诊断性与全面性。它保留了真实世界可穿戴数据固有的设备噪声与个体间差异,为评估大语言模型在真实健康场景下的推理能力提供了基准。基准采用2×2诊断分类法,从数据推理与健康推理、单信号与跨信号推理两个互补维度系统解构模型能力,使研究者能精确定位模型失败源于数据计算、生理解释还是多信号整合。数据集还提供了群体参考百分位数和血液生物标志物,支持多层次上下文推理,有效防范了模型依赖先验知识的捷径,确保了评估的公正性和挑战性。
使用方法
使用WearableQA时,每个问题需向模型呈现用户的纵向可穿戴数据、人口统计学信息、血液生物标志物及群体参考统计量,要求模型从十个选项中选出唯一正确答案。默认推荐采用链式思考(CoT)提示方式,引导模型先逐步推理再作答,而直接作答模式亦被支持。评测通过精确匹配预测字母与确定性标准答案来计算准确率。为规避位置偏差,答案位置在基准中均衡分布;输入时序数据可采用多种文本或可视化表示,其中CSV格式表现较优。无时序输入时模型性能将大幅下降,这突出了基准对真实可穿戴数据推理的依赖,使之成为评估和诊断LLM健康推理能力的有效工具。
背景与挑战
背景概述
随着可穿戴传感技术的迅猛发展,持续监测个体生理与行为信号已成为现实,这为个性化健康管理和精准医疗提供了前所未有的机遇。然而,现有基准测试大多依赖合成或模拟信号,难以评估人工智能系统在真实用户长期可穿戴数据上的推理能力。为此,Meta、KAIST及高丽大学的研究人员于2026年联合推出了WearableQA基准,旨在填补这一空白。该基准基于200名真实用户长达500天的纵向可穿戴记录、血液生物标志物及人口统计学信息,构建了4,084道10选1的多项选择题,系统评估大语言模型在数据推理与健康推理、单一信号与跨信号推理等多个维度的表现。WearableQA的推出,为可穿戴健康数据的智能分析与应用提供了坚实的评估基石,推动了该领域向更真实、更复杂场景的迈进。
当前挑战
WearableQA基准面临多重挑战。领域层面,真实可穿戴数据包含设备噪声与个体间差异,模型需从嘈杂的纵向生理测量中准确提取趋势、异常及关联,并对其进行生理学解读,这远超一般健康知识回忆的范畴,极具挑战性。构建过程中,如何确保试题能够反映真实数据中出现的生理模式,同时使答案可被确定性标注,是一大难题。为此,研究团队采用文献与人群双基座框架,结合统计验证,并辅以严格的质量控制与审计流程。实验显示,即使是顶尖模型,其准确率也仅为72.9%,多数模型低于60%,凸显了该任务的高难度与现有模型的局限性。
常用场景
经典使用场景
WearableQA基准测试的核心应用场景在于评估大语言模型对真实用户纵向可穿戴数据的推理能力。该数据集包含200名真实用户长达500天的日常测量记录,涵盖心率、睡眠、活动等多维度生理信号,并融合血液生物标志物与人口统计学信息。其设计精巧地构建了4084道十选一多项选择题,按照推理类型(数据推理与健康推理)和信号复杂度(单信号与跨信号)两个轴心划分出16种问题类型。这一布局使得WearableQA能够细致剖析模型在计算趋势、识别异常、解读生理意义以及整合多源信号时的表现差异,为可穿戴健康领域的AI推理研究提供了严苛且逼真的测试平台。
解决学术问题
WearableQA直面现有健康推理基准测试的三大核心缺陷:过度依赖合成或模拟信号而脱离真实世界数据、忽视纵向时序推理与个体差异、以及未能整合多模态健康信息。该数据集通过采用双重锚定框架,结合文献支撑的生理学发现与统计验证的人群模式,确保了问题的科学严谨性和临床意义。其重要意义在于精准揭示了当前大语言模型在数据推理上的普遍短板,尤其是从嘈杂的真实测量中直接推导答案的困难,以及跨信号整合推理的长期挑战。WearableQA的贡献在于为评估和推动模型在个性化健康理解、纵向时序分析及多源信息融合等关键能力上提供了诊断性强且极具现实意义的基准,填补了该领域缺乏真实世界可穿戴数据评估工具的空白。
衍生相关工作
WearableQA的发布催生了多个前沿研究方向与衍生工作。其一,启发了一系列针对可穿戴时间序列推理的专项研究,例如结合外部工具或Python代码执行来增强模型的数据处理能力,实验表明代理式方法能显著提升准确率。其二,推动了多模态健康数据融合技术的发展,鼓励研究者探索如何将图像、表格文本与生理信号有效结合以改善模型的跨信号理解。其三,WearableQA的构建方法论,尤其是双重锚定与统计验证框架,被借鉴用于开发其他领域的健康推理基准,如基于心电图或连续血糖监测数据的问答数据集。此外,该数据集还促进了对模型依赖先验知识而非真实数据分析的深入探究,衍生出关于定义性与经验性信号对比较的新评估范式。这些衍生产物共同推动了可穿戴健康AI向更稳健、更可靠方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务