遇见数据集

WearableQA

收藏
github2026-09-09 更新2026-09-11 收录
官方服务:

资源简介:

WearableQA是一个基准数据集,包含4084个十选项多项选择题,这些题目基于200个真实用户的穿戴时间序列、血液生物标志物和人口统计信息构建。每个用户有长达约500天的每日测量数据。与基于合成或理想化信号的基准不同,它保留了真实的穿戴数据分布——包括设备噪声、缺失天数和个体间变异性。

WearableQA is a benchmark dataset containing 4,084 ten-option multiple-choice questions, which are constructed based on wearable time series, blood biomarkers and demographic information from 200 real users. Each user has daily measurement data spanning up to approximately 500 days. Unlike benchmarks built on synthetic or idealized signals, it preserves the real-world distribution of wearable data, including device noise, missing days and inter-individual variability.

创建时间:
2026-09-04
原始信息汇总

WearableQA 数据集概述

一、数据集基本信息

  • 名称:WearableQA
  • 性质:基于真实世界可穿戴数据进行健康推理的基准(Benchmark)
  • 规模:4,084 道十选一多项选择题
  • 数据来源:来自 200 名真实用户的可穿戴时间序列、血液生物标志物和人口统计学数据
  • 数据跨度:每位用户拥有最多约 500 天的每日测量数据
  • 数据特点:保留了真实可穿戴数据的分布特征,包括设备噪声、缺失日期和个体间差异
  • 许可证:Creative Commons Attribution-Non Commercial 4.0 International (CC BY-NC 4.0)
  • 论文:arXiv 编号 2609.05405

二、任务设计

每道题要求模型对单个用户的纵向记录进行推理,具体包括:

  • 对原始测量值进行计算
  • 对测量值进行生理学解释
  • 或同时包含以上两者

三、问题分类体系

16 种问题类型沿两个互补维度组织:

  • 数据推理 vs. 健康推理:对纵向测量进行计算(相关性、偏移计数、恢复时间、趋势形态) vs. 对测量进行生理学解释(风险评估、鉴别诊断、预后预测)
  • 单信号推理 vs. 跨信号推理:单一指标内的推理 vs. 多个指标的整合

划分统计

维度 划分 数量
推理组 data / health 2,724 / 1,360
信号复杂度 single / cross 1,682 / 2,402
依据来源 population / literature 3,154 / 930

每个推理组内,真值答案在选项 A–J 上均匀平衡,随机基线为 10%。

四、仓库内容

仓库包含三个文件、两种格式:

文件 大小 说明
WearableQA.jsonl 306 MB 预渲染基准,每行一个问题,提示已展平为文本,用于评估
WearableQA_raw.json 39 MB 结构化源文件,包含问题及完整的按用户时间序列,可自行渲染
render_raw.py 10 KB 渲染器,将结构化源渲染为 .jsonl,支持四种序列化格式

1. WearableQA.jsonl(预渲染基准)

包含 4,084 行,每行一个 JSON 对象。字段说明:

字段 含义
id 唯一问题 id(<source>_<user>_<end-date>
question 完整提示:指令、用户画像、传感器历史、血液面板、队列百分位、问题题干、选项
choices 十个选项,键为 AJ
answer 真值选项字母
category 16 种问题类型之一
reasoning_group datahealth
signal singlecross
grounding population(源自队列统计)或 literature(源自已发表关系)
representation 该文件渲染所用的传感器序列化方式(发布文件中为 row

问题字符串构成部分

  • (instruction)
  • === USER PROFILE ===(年龄、性别、BMI、族裔)
  • === SENSOR DATA (row: one line per day) ===(最多约 500 天的每日指标)
  • === BLOOD BIOMARKER PANEL ===(17 项生物标志物,如有)
  • === COHORT REFERENCE (population percentiles) ===(5 项指标的 p10/p25/p50/p75/p90)
  • === QUESTION ===(问题题干)
  • === OPTIONS ===(A–J)

不适用时会省略相应部分。提示体积较大:中位数约 86k 字符,最大约 124k。

每位用户最多出现 16 项每日指标:步数、静息心率、HRV、VO2 max、睡眠时长、睡眠效率、深睡百分比、REM 百分比、就寝时间标准差、活动卡路里、BMR 卡路里、平均压力水平、运动次数、运动小时数、运动 METs、运动平均心率。

2. WearableQA_raw.json(结构化源)

结构包含:

  • descriptionn_mcqs(4084)、n_unique_users(200)
  • gt_balancing:每个推理组内均匀 A–J
  • cohort_reference:5 项指标的百分位
  • user_histories:200 名用户的完整记录
  • mcqs:4,084 个问题

mcqs 条目字段:iduser_idstemoptionsgt_letterquestion_typereasoning_groupsignalgroundingcontext(demographics 与 blood_panel)、end_datewindow_size(全程为 28)、full_dropped_metricsno_cohort

3. render_raw.py(渲染器)

从结构化源重建 .jsonl。无参数运行时逐字节复现发布的 WearableQA.jsonl(md5 为 82bb783e147db78501d35ffab4a5392f)。

命令示例: bash python3 render_raw.py python3 render_raw.py --format markdown --out WearableQA_markdown.jsonl python3 render_raw.py --format csv --out WearableQA_csv.jsonl python3 render_raw.py --format col --out WearableQA_col.jsonl

参数:

标志 默认值 含义
--data WearableQA_raw.json 结构化源文件
--format row rowcolcsvmarkdown
--out WearableQA.jsonl 输出路径

=== SENSOR DATA === 块随格式变化。渲染器仅需 Python 3,无第三方依赖。

输出体积:csv 约 132 MB,row 306 MB,col 330 MB。

五、数据获取方式

数据集文件使用 Git LFS 存储,克隆前需先安装 LFS。

bash git lfs install git clone https://github.com/facebookresearch/WearableQA.git cd WearableQA

已克隆但未使用 LFS 时可执行 git lfs pull。若仅需结构化源文件:

bash GIT_LFS_SKIP_SMUDGE=1 git clone https://github.com/facebookresearch/WearableQA.git cd WearableQA git lfs pull --include="WearableQA_raw.json" python3 render_raw.py

六、快速开始

数据集同时发布于 Hugging Face Hub:

python from datasets import load_dataset

ds = load_dataset("facebook/WearableQA", split="test")

ds[0]["question"] ds[0]["choices"] ds[0]["answer"]

Hub 副本还包含其他三种传感器序列化配置和 structured 配置:

python load_dataset("facebook/WearableQA", "markdown", split="test") load_dataset("facebook/WearableQA", "structured", split="test")

从仓库文件使用:

python import json

with open("WearableQA.jsonl") as f: questions = [json.loads(line) for line in f]

print(len(questions))

q = questions[0] prompt = q["question"] gold = q["answer"]

health = [q for q in questions if q["reasoning_group"] == "health"] cross = [q for q in questions if q["signal"] == "cross"]

评分方式:仅当模型选择的字母与 answer 匹配时记为正确;无解析字母的响应计为错误。

七、许可证附加条款

数据采用 CC BY-NC 4.0 许可,并附加以下条款:

  • (i) 禁止重新识别或尝试重新识别;
  • (ii) 禁止用于临床、诊断或治疗决策;
  • (iii) 禁止以对健康相关结果具有歧视性、有害或误导性的方式使用;
  • (iv) 数据集按“原样”提供,不附带任何明示或暗示的保证,仅供研究和基准测试使用。
搜集汇总
数据集介绍
WearableQA 数据集图片
构建方式
WearableQA的构建依托于二百名真实用户的可穿戴设备时序记录、血液生物标志物与人口统计学信息,每位用户拥有长达约五百日的逐日测量数据。研究者在保留设备噪声、数据缺失与个体间变异的前提下,从这些纵向档案中提炼出四千零八十四道十选一多项选择题,每题均要求模型围绕单一用户的完整记录展开推理。题目设计沿数据运算与健康解读两条互补轴线展开,并兼顾单信号与跨信号两种复杂度,答案在A至J间均匀分布,形成了随机基线为百分之十的评测基准。
使用方法
研究者可通过Hugging Face Hub以load_dataset接口直接载入预渲染数据,获取已扁平化为单一字符串的完整提示、十项选项与标准答案,亦可选择markdown或structured等配置以改变序列化方式或获取原始数值。在本地使用时,既可读取预渲染的jsonl文件逐行解析,亦可借助render_raw.py从结构化源文件重建任意格式的提示,仅需Python 3环境而无需第三方依赖。评测时仅当模型所选字母与标准答案一致方计为正确,无法解析出字母的响应按错误处理,用户还可依据reasoning_group或signal字段对特定子集进行切片评估。
背景与挑战
背景概述
可穿戴设备在健康监测中的普及催生了对真实世界纵向生理数据进行推理的迫切需求,但既有基准多依赖合成或理想化信号,难以反映设备噪声、数据缺失与个体差异并存的现实情境。WearableQA由Meta等机构的研究者于2026年提出,基于200名真实用户累计约500天的可穿戴时序、血液生物标志物与人口统计学信息,构建了4,084道十选一选择题,覆盖数据计算与健康解读、单信号与跨信号、群体与文献溯源等16类任务。该基准首次将真实可穿戴数据的复杂性与临床推理深度相结合,为评估大语言模型在个人健康纵向推理中的能力提供了严谨且具有生态效度的测试平台。
当前挑战
该基准所应对的核心领域难题在于:如何在保留真实可穿戴数据固有噪声、缺失与异质性的前提下,要求模型完成从原始测量计算到生理学解释的多层次推理,并跨越单信号与多信号整合的认知边界。构建过程中的主要挑战包括:对200名用户长达500天的稀疏时序数据进行清洗、对齐与窗口切片,确保问题可回答且答案唯一;在群体统计与已发表文献之间建立可靠的溯源依据,以平衡数据驱动与知识驱动两类问题;在A至J十个选项间均匀分配真值以消除位置偏差,同时控制渲染格式对模型表现的显著影响,使基准在不同序列化方式下保持稳健可比。
常用场景
经典使用场景
在可穿戴健康计算与生理时间序列推理的交叉领域,WearableQA构筑了一个以真实用户长期记录为基石的评测场域。该数据集最经典的使用场景在于要求模型围绕单一受试者长达数百日的连续测量序列展开多层次推理:既包括对原始数据执行相关性计算、异常偏移计数、恢复时长估算与趋势形态识别等数值运算,亦涵盖对上述指标进行生理学阐释,如风险评估、鉴别诊断与预后预测。十六类问题沿数据与健康推理、单信号与跨信号推理两轴展开,迫使模型在真实设备噪声、缺失记录与个体差异并存的条件下完成从测量到医学含义的贯通式推断,从而系统检验其长程健康推理能力。
解决学术问题
该数据集直面健康推理研究中长期存在的生态效度匮乏问题。过往基准多依托合成或理想化信号,难以复现真实可穿戴设备所固有的噪声结构、数据缺失模式与个体间异质性,致使模型性能评估与临床实际情境脱节。WearableQA以二百名真实用户的纵向记录为素材,并纳入血液生物标志物与人口统计学信息,使模型必须在信息不完整、分布不均衡的条件下进行推断。此举为健康状态预测、跨信号整合与文献知识 grounding 等议题提供了更具外部效度的测试平台,推动了评测范式从理想化信号向真实世界证据的迁移,对可穿戴健康信息学的可复现研究具有方法学意义。
实际应用
在实际应用层面,WearableQA为可穿戴设备生态中的智能健康助手、远程患者监护与个性化健康管理提供了验证基座。模型需从步数、静息心率、心率变异性、睡眠结构、最大摄氧量等日常指标中抽取临床相关信号,并融合血液面板与人群百分位参照,生成对用户健康轨迹的解读。这一过程直接对应消费级健康应用中的趋势预警、运动处方调整与慢病风险分层等任务。数据集刻意设置的指标缺失与队列参照缺失条件,亦模拟了真实部署中传感器脱落、检查项目不全等情形,使所得评测结果对产品级健康推理系统的鲁棒性具有直接的参考价值。
数据集最近研究
最新研究方向
围绕可穿戴设备真实时序数据展开的健康推理评测,正成为连接大语言模型与个体化健康管理的关键议题。WearableQA以200名真实用户、多至约500天的日常测量为基底,融合血液生物标志物与人口学信息,构建了涵盖数据计算与生理诠释双重视角的4084道十选一题目,其16类题型系统地区分了单信号与跨信号推理路径。该基准的最新研究动向聚焦于长上下文建模、稀疏缺失数据的鲁棒推理以及工具调用式数值计算,并揭示文本序列化方式对模型准确率的显著影响。这一工作为可解释的健康AI评估提供了贴近现实分布的标尺,对推动模型从合成信号走向真实个体化健康决策具有重要的方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务