TouchThinker-1M
收藏资源简介:
TouchThinker-1M是一个百万级、多源触觉推理数据集,涵盖415个对象、8个场景和7种传感器类型,通过整合异构视觉-触觉源到统一的触觉推理格式构建。它标准化了触觉视频,统一了跨数据集的属性注释,并将触觉观察组织成语义一致的问题-答案监督。除了传统的基于模板的触觉问答,该数据集引入了两种补充格式:思维链触觉推理和开放式触觉问答,鼓励模型基于触觉证据进行响应,并将物理观察与常识结论联系起来。
TouchThinker-1M is a million-scale multi-source tactile reasoning dataset encompassing 415 objects, 8 scenarios, and 7 sensor types. It is constructed by integrating heterogeneous visual-tactile sources into a unified tactile reasoning framework. The dataset standardizes tactile videos, unifies cross-dataset attribute annotations, and structures tactile observations into semantically consistent question-answer supervision. In addition to traditional template-based tactile question answering, it introduces two supplementary formats: Chain-of-Thought (CoT) tactile reasoning and open-ended tactile question answering, which encourage models to generate responses based on tactile evidence and connect physical observations with common-sense conclusions.
数据集概述:TouchThinker
TouchThinker 是一个面向开放世界的触觉常识推理框架,旨在通过大规模数据和动作感知表示,将触觉推理从受限场景扩展到现实开放世界。该工作由多个机构的学者共同完成,相关论文可在 arXiv 查阅,数据集同时托管在 Hugging Face 和 Google Drive。
核心数据资源:TouchThinker-1M
- 规模与范围:百万级多源触觉推理数据集,覆盖 415 个物体、8 类场景 和 7 种传感器类型,为开放世界泛化提供数据基础。
- 数据构建方式:融合多种异构视觉-触觉数据源,统一为标准化触觉推理格式。具体包括:
- 标准化触觉视频。
- 统一不同数据集中的属性标注。
- 将触觉观测组织为语义一致的问答监督。
- 问答格式多样性:
- 传统模板式触觉问答。
- 链式思维触觉推理:引导模型基于触觉证据进行逐步推理。
- 开放式触觉问答:鼓励模型将物理观测与常识结论连接。
评估基准:TouchThinker-Bench
用于开放世界评估,测试任务包括:
- 触觉属性理解。
- 触觉常识推理。
- 未见物体泛化能力。
- 未见传感器泛化能力。
任务设置更贴近现实场景,具有更高的多样性和真实性。
模型框架:TouchThinker
采用 动作感知的触觉-语言推理框架,针对触觉信号的冗余性和动作特定性设计:
- 问题引导的触觉标记融合:将触觉观测与任务语义对齐。
- 动作感知高斯时序 MoE 机制:
- 识别与查询相关的触觉片段。
- 聚合有意义的触觉证据(例如:按压对应硬度、滑动对应摩擦、旋转对应纹理)。
- 两阶段训练流程:
- 触觉-文本对齐:利用属性问答数据,将触觉表示与语言模型嵌入空间对齐。
- 端到端监督微调:使用更复杂的指令数据(包含推理问答、链式思维问答、开放式问答)提升触觉常识推理能力。




