WearableQA
收藏资源简介:
WearableQA是由Meta、韩国科学技术院和高丽大学联合构建的基准数据集,旨在评估AI系统对真实用户长期可穿戴数据的推理能力。该数据集包含4084道10选1选择题,基于200名真实用户长达500天的日常可穿戴时间序列、血液生物标志物及人口统计学信息。通过双源框架,结合文献生理发现与统计验证群体模式,确保问题可靠且具有区分度。其应用领域涵盖健康监测与个性化医疗,旨在解决现有基准缺乏真实世界可穿戴推理能力的评估问题。
WearableQA is a benchmark dataset jointly constructed by Meta, Korea Advanced Institute of Science and Technology (KAIST) and Korea University, designed to evaluate the reasoning capabilities of AI systems when processing long-term wearable data from real users. This dataset contains 4084 10-option multiple-choice questions, which are built upon 500-day daily wearable time-series data, blood biomarkers and demographic information collected from 200 real users. It adopts a dual-source framework that integrates physiological findings from scholarly literature and statistically validated population patterns to ensure the questions are both reliable and discriminative. Its application fields cover health monitoring and personalized medicine, aiming to address the gap that existing benchmarks lack evaluations of real-world wearable reasoning abilities.
WearableQA是一个用于评估模型在真实世界可穿戴数据上进行健康推理能力的基准测试,包含4,084道十选一多选题,数据源自200名真实用户的长期健康记录。
数据来源
- 真实用户数据:包含可穿戴设备时间序列、血液生物标志物和人口统计学信息,每位用户拥有长达约500天的每日测量记录。
- 真实数据特性:保留了真实的设备噪声、缺失天数和个体间差异,区别于合成或理想化信号构建的基准。
问题类型与分类
问题按两个互补轴组织,涵盖16种问题类型:
| 分类轴 | 类别 | 题目数量 |
|---|---|---|
| 推理组 | 数据推理 / 健康推理 | 2,724 / 1,360 |
| 信号复杂度 | 单信号 / 跨信号 | 1,682 / 2,402 |
| 依据来源 | 群体统计 / 文献依据 | 3,154 / 930 |
每题要求模型对单个用户的纵向记录进行推理,包括对原始测量值的计算(如相关性、异常计数、恢复时间、趋势形状)或生理学解释(如风险评估、鉴别诊断、预后预测)。每个推理组内的正确答案选项A–J均匀分布,随机基线为10%。
数据内容
每个用户最多包含16种每日指标,如:
- 步数、静息心率、心率变异性、最大摄氧量
- 睡眠时长、睡眠效率、深度睡眠百分比、REM百分比、就寝时间标准差
- 活跃卡路里、基础代谢卡路里、平均压力水平
- 运动次数、运动时长、运动METs、运动平均心率
仓库文件
| 文件 | 大小 | 内容 |
|---|---|---|
WearableQA.jsonl |
306 MB | 预渲染基准,每行一道题,提示已格式化为文本,可直接用于评估 |
WearableQA_raw.json |
39 MB | 结构化源数据,包含问题及完整逐用户时间序列,可自定义渲染 |
render_raw.py |
10 KB | 渲染器,可将结构化源数据转换为.jsonl格式,支持四种序列化方式 |
提示结构
每道题的完整提示包含以下部分(内容适用时包含):
- 指令说明
- 用户画像:年龄、性别、BMI、种族
- 传感器数据:最多约500天的日常指标
- 血液生物标志物面板:17种可用生物标志物
- 群体参考:5项指标的十分位数/四分位数/中位数
- 问题陈述
- 选项A–J
提示文本规模较大:中位约86k字符,最大约124k字符。部分问题会刻意省略时间序列或群体参考,以考察特定推理能力。
使用方式
- Hugging Face Hub:可直接通过
load_dataset("facebook/WearableQA", split="test")加载,也提供其他传感器序列化版本和结构化配置。 - 本地仓库:需安装Git LFS后克隆,或运行
render_raw.py从原始数据重建渲染文件。该脚本仅需Python 3,无第三方依赖。
评估标准
仅当模型选择的选项字母与answer字段完全匹配时计为正确;无法解析出选项字母的响应视为错误。
许可
数据使用CC BY-NC 4.0许可,并附加限制条款:禁止重新识别或尝试重新识别数据主体;禁止用于临床、诊断或治疗决策;禁止以歧视性、有害性或对健康结果具有误导性的方式使用;数据按"原样"提供,仅供研究和基准测试使用。



