遇见数据集

TouchThinker-1M

收藏
github2026-06-11 更新2026-06-16 收录
官方服务:

资源简介:

TouchThinker-1M是一个百万级、多源触觉推理数据集,涵盖415个对象、8个场景和7种传感器类型,通过整合异构视觉-触觉源到统一的触觉推理格式构建。它标准化了触觉视频,统一了跨数据集的属性注释,并将触觉观察组织成语义一致的问题-答案监督。除了传统的基于模板的触觉问答,该数据集引入了两种补充格式:思维链触觉推理和开放式触觉问答,鼓励模型基于触觉证据进行响应,并将物理观察与常识结论联系起来。

TouchThinker-1M is a million-scale multi-source tactile reasoning dataset encompassing 415 objects, 8 scenarios, and 7 sensor types. It is constructed by integrating heterogeneous visual-tactile sources into a unified tactile reasoning framework. The dataset standardizes tactile videos, unifies cross-dataset attribute annotations, and structures tactile observations into semantically consistent question-answer supervision. In addition to traditional template-based tactile question answering, it introduces two supplementary formats: Chain-of-Thought (CoT) tactile reasoning and open-ended tactile question answering, which encourage models to generate responses based on tactile evidence and connect physical observations with common-sense conclusions.

创建时间:
2026-06-10
原始信息汇总

数据集概述:TouchThinker

TouchThinker 是一个面向开放世界的触觉常识推理框架,旨在通过大规模数据和动作感知表示,将触觉推理从受限场景扩展到现实开放世界。该工作由多个机构的学者共同完成,相关论文可在 arXiv 查阅,数据集同时托管在 Hugging Face 和 Google Drive。


核心数据资源:TouchThinker-1M

  • 规模与范围:百万级多源触觉推理数据集,覆盖 415 个物体8 类场景7 种传感器类型,为开放世界泛化提供数据基础。
  • 数据构建方式:融合多种异构视觉-触觉数据源,统一为标准化触觉推理格式。具体包括:
    • 标准化触觉视频。
    • 统一不同数据集中的属性标注。
    • 将触觉观测组织为语义一致的问答监督。
  • 问答格式多样性
    • 传统模板式触觉问答。
    • 链式思维触觉推理:引导模型基于触觉证据进行逐步推理。
    • 开放式触觉问答:鼓励模型将物理观测与常识结论连接。

评估基准:TouchThinker-Bench

用于开放世界评估,测试任务包括:

  • 触觉属性理解。
  • 触觉常识推理。
  • 未见物体泛化能力。
  • 未见传感器泛化能力。

任务设置更贴近现实场景,具有更高的多样性和真实性。


模型框架:TouchThinker

采用 动作感知的触觉-语言推理框架,针对触觉信号的冗余性和动作特定性设计:

  • 问题引导的触觉标记融合:将触觉观测与任务语义对齐。
  • 动作感知高斯时序 MoE 机制
    • 识别与查询相关的触觉片段。
    • 聚合有意义的触觉证据(例如:按压对应硬度、滑动对应摩擦、旋转对应纹理)。
  • 两阶段训练流程
    1. 触觉-文本对齐:利用属性问答数据,将触觉表示与语言模型嵌入空间对齐。
    2. 端到端监督微调:使用更复杂的指令数据(包含推理问答、链式思维问答、开放式问答)提升触觉常识推理能力。
搜集汇总
数据集介绍
TouchThinker-1M 数据集图片
构建方式
触觉感知作为具身智能体理解物理世界的关键模态,长期以来受限于数据规模不足与格式碎片化。TouchThinker-1M数据集的构建旨在突破这一瓶颈,通过整合来自7种传感器类型、覆盖415个日常物体和8种真实场景的异构视觉-触觉数据源,构建了首个百万级多源触觉推理数据集。在数据标准化过程中,研究团队将不同来源的触觉视频进行格式统一,并系统化地标注物体属性,最终将触觉观测组织为语义一致的问答监督形式。除了传统的基于模板的触觉问答,数据集还引入了链式思维触觉推理和开放式触觉问答两种补充格式,促使模型将推理过程锚定于触觉证据,建立物理观测与常识结论之间的关联。
特点
TouchThinker-1M数据集的核心特点在于其规模庞大、来源多样且格式丰富,为开放世界的触觉常识推理奠定了坚实的数据基础。该数据集整合了7种传感器类型,覆盖415个物体和8种场景,突破了以往触觉数据集在格式和规模上的局限。在数据格式设计上,除传统的模板化触觉问答外,创新性地引入了链式思维推理和开放式问答两种格式,能够有效引导模型在触觉证据基础上进行多步骤推理,并将物理观测与常识知识有机连接。此外,基于该数据集构建的TouchThinker-Bench基准测试,从触觉属性理解、触觉常识推理、未见物体泛化和未见传感器泛化四个维度进行开放世界评估,提供了更为真实多样的评测环境。
使用方法
使用TouchThinker-1M数据集进行模型训练时,研究者需遵循两阶段训练流程。第一阶段为触觉-文本对齐阶段,利用属性问答数据将触觉表示映射到语言模型的嵌入空间中,实现跨模态表征的对齐。第二阶段为端到端监督微调阶段,通过复杂的指令数据(包括推理问答、链式思维问答和开放式问答)提升模型的触觉常识推理能力。为高效处理触觉信号冗余和动作特异性的问题,TouchThinker模型采用动作感知机制,通过问题引导的触觉令牌融合和动作感知高斯时间混合专家模块,自动识别与查询相关的触觉片段(如在硬度判断时聚焦按压动作、在摩擦感知时聚焦滑动动作),从而聚合有意义的触觉证据进行高效推理。
背景与挑战
背景概述
触觉感知是具身智能体理解物理世界的关键模态之一。尽管近期研究已尝试将触觉信号融入语言系统以实现触觉常识推理,但现有数据集在格式与规模上存在显著局限,且触觉信号本身具有冗余性和动作特异性,限制了系统在开放世界中的泛化能力。为此,由多机构研究人员于2025年提出的TouchThinker-1M数据集,旨在从数据和表示两个维度推动触觉常识推理迈向开放世界。该数据集覆盖415个物体、8种场景及7类传感器,整合多源视觉-触觉数据,构建了百万级规模的统一触觉推理语料库,为开放世界触觉理解奠定了坚实的数据基础。TouchThinker-1M的出现填补了大规模、多模态触觉推理数据集的空白,对机器人与多模态学习领域产生了深远影响。
当前挑战
TouchThinker-1M所解决的领域核心挑战在于:触觉常识推理系统长期受限于数据规模不足与触觉信号的有效表示问题。具体而言,现有触觉推理数据集格式单一、规模有限,难以支撑开放世界的泛化需求;同时,触觉信号具有高冗余性与动作特异性(如按压、滑动等不同动作产生不同感知模式),导致传统特征提取方法难以高效捕获与任务语义对齐的关键触觉证据。在数据集构建过程中,面临异构视觉-触觉源数据的统一格式化、跨数据集属性标注的一致性对齐、以及触觉观测到语义问答对的逻辑映射等挑战。此外,如何设计多模态训练策略,使模型能够在感知冗余中聚焦于与查询相关的触觉片段(如硬度、摩擦力、纹理等),亦是构建该大规模推理系统时需攻克的关键难点。
常用场景
经典使用场景
TouchThinker-1M数据集为触觉常识推理研究提供了大规模、多源异构的触觉-语言对齐数据,覆盖415种物体、8类场景及7种传感器类型。其最经典的使用场景在于构建和评估触觉大语言模型,通过将触觉视频信号与自然语言指令对齐,使模型能够基于触觉信息进行物体属性理解、交互动作推理以及开放世界场景下的常识判断。该数据集支持链式思维推理与开放式问答两种高级格式,为从简单属性识别到复杂多模态推理的渐进式学习奠定了数据基础。
实际应用
在实际应用中,TouchThinker-1M可赋能具身智能体在复杂物理环境中执行精细操作任务。例如,服务机器人通过触觉传感器识别物体硬度、纹理和摩擦系数,从而自适应调整抓取力度与握持姿态;智能制造领域的机械臂可依据触觉反馈判断工件表面缺陷或装配松紧度。此外,该数据集支持跨传感器类型的知识迁移,降低了真实场景中部署触觉智能系统的数据采集成本,在医疗康复、虚拟现实交互以及人形机器人灵巧操作等场景具有广阔的应用前景。
衍生相关工作
TouchThinker-1M的发布催生了多项具有代表性的衍生工作。在触觉基础模型方面,基于该数据集训练的动作感知高斯时序混合专家模型已成为触觉语言理解的新基线;在基准测试方面,TouchThinker-Bench为评估触觉属性感知、常识推理及开集泛化提供了标准化评测平台。后续研究围绕该数据集拓展了触觉链式思维推理范式,探索了触觉与视觉、语言模态的深度融合机制。此外,跨传感器迁移学习和触觉数据高效压缩等研究方向也受益于该数据集的规模优势与统一标注体系,推动了触觉智能从专用模型向通用推理框架的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务