资讯中心

“foundation model” 热潮终于是轮到触觉了?

📅 2026/9/28 4:47:53
“foundation model” 热潮终于是轮到触觉了?
“foundation model” 热潮终于轮到触觉了——不是跟风是被‘逼’的目录01 传感器能换数据不能跟着“清零”02 数据能留下模型也开始不想每个任务都从头学03 会“摸懂”还不够触觉开始真正改变动作04 再往前一步机器人开始预测“下一次会摸到什么”05 为什么偏偏是现在06 但触觉离“视觉的今天”其实还很远07 换掉的不是传感器而是问题本身如果把机器人触觉的发展拉长到几十年一个最直观的变化是机器人终于越来越“摸得清楚”了。早期的力传感器告诉机器人“有没有受力”柔性电子皮肤开始把接触铺到更大的表面GelSight、DIGIT 这类视觉触觉传感器则进一步把硅胶表面的细微形变直接变成图像。很长一段时间里触觉研究最基础的问题都可以概括成一句话怎么把一次接触变成足够丰富、足够稳定、足够精细的信号。当然这个问题今天依然没有结束。但若把视线收窄到 2024—2026 这三年会发现研究重心正在“后移”不再只问“怎么把触觉测出来”而是问“拿到触觉之后机器人到底该学到什么”。于是问题变成了“换一块传感器模型还能不能用不同任务能否不再反复采标注、重训而是共享一套通用触觉表示触觉进入 VLA 后能否让“摸到什么”直接改变“下一步怎么做”更进一步机器人能否在接触发生前就预测下一步动作之后我应该“摸到”什么当我们把这些问题放在一起看会发现已经不再是“再训一个模型”能解决的了。它们要的是一套通用、可迁移、能进入策略和预测的触觉能力。而这也恰好触及了 foundation model 在视觉和语言领域试图回答的核心问题之一。所以“foundation model”热潮终于轮到触觉了与其说“跟风”不如说触觉自己走到了一个相似的关口。因为我们把 2024 到 2026 这三年的一批工作放在一起仔细研究后发现了一条很清楚的变化路径触觉从传感器到表示从表示到策略再从策略走向了对未来接触的预测。01 传感器能换数据不能跟着“清零”触觉研究有一个长期存在、但可能很少被注意到的问题同一套算法换一块传感器可能就不好用了。原因并不难理解。触觉传感器和普通相机很不一样。尤其对视觉触觉传感器来说硅胶的软硬、表面纹理、内部照明、marker 的位置甚至使用一段时间之后的磨损都可能改变最终看到的信号。于是模型学到的可能不只是“这个接触代表什么”还顺手记住了“我现在用的是这一块具体的传感器。”在实验室里传感器坏了重新标定再采一遍数据也还能继续做实验。但一旦机器人真的要长期运行它就会变得很现实。皮肤会磨损手指会更换机器人也不可能永远使用同一块触觉模块。如果每换一次皮肤都要重新采数据、重新训练策略那么触觉再灵敏也很难像相机一样变成一个可以规模化部署的基础部件。2024 年的 AnySkin是这一阶段很有代表性的一项工作。它关注的重点并不是“把分辨率再提高多少”而是三个很工程、却非常关键的问题能不能方便替换能不能装到不同机器人上以及换了一块 skin 以后过去的数据和策略还能不能继续用▲图1 | 触觉走向长期使用后第一个问题不是“能不能测”而是“换了还能不能用”。AnySkin 将感知表面做成可替换部件并适配 Franka、Dobb-E stick、LEAP Hand 等不同末端。对机器人学习更重要的是硬件实例变化后已经采集的数据和训练好的策略仍有机会继续复用。只有数据不再随着一块皮肤的磨损而一起“报废”触觉才可能真正积累出规模。这种思路意味着触觉研究第一次很明确地碰到了一个视觉领域早就经历过的问题硬件可以换模型最好别跟着从头来。而当“数据能不能留下来”开始成为问题以后下一步几乎是顺理成章的。既然数据终于有机会被复用那我们还要不要继续为每一个触觉任务单独训练一个模型02 数据能留下模型也开始不想每个任务都从头学过去很长一段时间触觉学习的方式都非常直接。想检测滑移就收一批 slip 数据训练一个 detector想估计接触力就收一批带力标签的数据训练 force estimator想识别材质再换一个 texture classifier想做插入再重新采插入任务的数据训练一套 policy。每个任务都能做但每多一个任务就几乎要重新来一遍。更麻烦的是不同传感器还长得不一样。DIGIT、GelSight、GelSight Mini 的成像方式、marker、视场都有差异。在某一类传感器上学到的特征换到另一类设备上不一定还能直接复用。这让触觉在很长一段时间里呈现出一种“碎片化”状态传感器是碎的任务是碎的模型也是碎的。而视觉领域已经走过另一条路。今天很少有人会为了每一个新视觉任务都从随机初始化开始训练一个完整 encoder。更常见的做法是先用海量数据学一个通用 representation再用少量下游数据解决检测、分割、深度估计等具体问题。触觉能不能也这么做2024 年的Sparsh很系统地把这个问题摆到了台前。它没有先挑“滑移检测”或“力估计”作为唯一目标而是整合了超过 46 万张用于自监督预训练的触觉图像用 MAE、DINO、I-JEPA 等方法先学习通用触觉表示再把同一套表示拿去解决六类不同问题。▲图2 | 当触觉数据开始能够积累问题就从“每个任务训一个模型”转向“能不能先学一个通用底座”。Sparsh 左侧覆盖 DIGIT、GelSight、GelSight Mini 等不同传感器右侧则把力估计、滑移、姿态、抓取稳定性、材料识别和机器人操作放进同一套表示里。真正的变化不是多做了几个任务而是研究者开始寻找一种能够跨传感器、跨任务复用的“接触知识”。此外研究还专门构建了 TacBench把力估计、slip detection、姿态估计、抓取稳定性、纺织物识别和机器人操作放到同一套评估中。在标注数据有限的设置下自监督预训练表示整体明显优于从头训练的 task-specific、sensor-specific 模型。据实验数据在 TacBench 的有限标注设置下SSL 预训练平均比对应的端到端训练高 95.1%。但这个数字本身并不是这项工作的重点。更重要的是触觉开始拥有了一个过去主要属于视觉和语言的问题有没有一种 representation 本身就理解“接触”这件事这和“识别当前有没有滑”已经不是同一个尺度的问题了。前者解决一个任务后者想建立一个以后可以被不同任务反复调用的“触觉底座”。到这里触觉已经第一次有了点“基础模型”的味道。但 representation 再通用如果最后只是停在“识别滑移”“估计力”这些感知任务上它仍然没有真正进入机器人最核心的闭环。于是问题继续往后移动如果模型已经学会“理解触觉”这些理解什么时候才会真正变成机器人的行为03 会“摸懂”还不够触觉开始真正改变动作这是 2025 年之后非常明显的一次变化。过去的 tactile model 很多时候仍然像一个外围感知模块。它可以告诉机器人“现在正在滑”、“当前接触力偏大”、“物体可能比较软”这些信息当然有用。但机器人最终真正要解决的问题不是“判断对不对”而是知道这些以后下一步动作怎么改这正好碰上了 VLA 的快速发展。可真正进入接触之后视觉和语言往往只能把机器人送到“差不多正确的位置”。最后几毫米怎么办力度多大是否打滑是否卡住这些信息仍然藏在物理接触里。于是一批工作开始尝试把触觉从外围模块真正接入机器人 policy其中Tactile-VLA 是一个很直观的代表。它关心的已经不是让模型单独预测某个力值而是让语言里的物理语义真正落到执行上。▲图3 | 触觉进入 VLA 之后角色从“状态检测器”变成了动作决策的一部分。左侧把“轻一点 / 重一点”这样的语言要求落实成不同作用力中间利用物体重量、脆弱程度等常识调整抓取右侧则在擦拭失败后根据接触反馈改变动作。也就是说模型不再只是知道“现在力太小”而要进一步决定“下一步应该多压多少”。这件事看上去只是“VLA 多了一个模态”。实际上它把触觉推到了一个更难的问题上模型到底应该从触觉里学什么因为视觉-触觉传感器首先输出的是一张图如果沿用视觉基础模型的思路很自然会把 tactile image 当作另一种视觉输入或者让它和 RGB 图像在 latent space 里做对齐。可机器人真正关心的并不是这两张图片长得像不像。机器人更关心的是这块硅胶为什么这样变形这意味着多大的力、剪切方向在哪里、接触是不是已经接近打滑于是到 2026 年研究开始进一步从“触觉进入 VLA”推进到“触觉应该被什么物理量约束”。TaF-VLA就提出了一个很有代表性的变化与其只做 tactile-vision alignment不如直接做 tactile-force alignment。▲图4 | 当触觉真正进入决策后新的问题变成“这套表示到底理解了什么”。TaF-VLA 不再只把触觉图像当成另一种视觉纹理而是先同步采集视觉触觉、六轴力/力矩和矩阵压力让 tactile representation 直接对齐真实 interaction force再接入 VLA。这里的关键转向是从“图像像不像”走向“这次形变究竟对应什么物理作用”。这项工作建立了超过千万级同步 tactile-force frame 的数据并收集超过一万条真实操作 episode覆盖 20 多类 force-aware manipulation task。从这里开始“通用触觉表示”内部也出现了一种很有意思的分工。有的工作更强调 semantic alignment让触觉和视觉、语言拥有统一语义另一些则更关心 physical grounding希望表示里真正留下力、滑移、形变和接触动态。这两条路线不一定互相排斥相反它们共同说明了一件事触觉正在从一种传感器输出变成基础模型内部的一种物理表示。但只做到这里机器人依然主要是在“读现在”动作发生了触觉变化了模型再做调整。而过去一年里更明显的新变化是研究者开始追问下一件事机器人能不能提前知道下一步应该摸到什么04 再往前一步机器人开始预测“下一次会摸到什么”传统触觉的工作方式本质上是反馈式的。机器人先动 → 接触发生 → 传感器看到形变、压力或者滑移 → 控制器再调整动作。这套逻辑没有问题也非常重要。但它天然发生在“事情已经发生之后”。如果机器人在插头真正推入接口之前就能预测正确接触应该如何演化知道接下来几百毫秒的压力和剪切应该是什么样——那么当真实触觉突然偏离预测时机器人就可以立刻意识到动作正在偏离预期。这时触觉就不再只是 observation而是开始成为 prediction target。2026 年的 OmniVTA 是这条路线中非常典型的一项工作。背后首先是数据规模的变化。配套数据集 OmniViTac 包含超过 2.1 万条 visuo-tactile-action trajectory覆盖 86 个任务、100 多种物体和六类接触模式。但真正值得注意的是模型结构它已经不只是“当前视觉 当前触觉 → 下一步动作”而是引入 visuo-tactile world model对短期未来的视觉与接触状态进行建模再把这种预测交给慢速 policy 生成较长的动作段与此同时另一条 60 Hz 的触觉回路持续读取真实接触对偏差进行快速纠正。▲图5 | 触觉走进 world model 后机器人不再只等“碰到了再反应”。OmniVTA 左侧的慢速策略先预测未来视觉和触觉再生成一段主体动作右侧 60 Hz 的快速回路持续读取真实触觉对“实际摸到的”和“预计应该摸到的”之间的偏差进行修正。触觉由此同时成为未来预测目标和实时反馈信号。这时候世界模型真正的作用是让机器人知道如果当前动作是对的接触状态应该往哪里发展。这也让触觉能够覆盖比插孔对准更复杂的过程。▲图6 | 擦拭、削皮、切割、装配、抓取和调整看起来是六种任务本质上都要求机器人持续维持和修正接触。它们说明触觉研究的对象正在从“某一帧有没有接触”扩展为“几秒钟内接触状态如何随动作演化”。当研究对象变成一段动态过程预测未来触觉也就从附加能力变成了控制本身的一部分。几个月后的TouchWorld 又把这种“预测 反应”的分工进一步拆得更明确。它把高层视觉语言规划、触觉世界模型、正常动作生成和高频触觉修正放在不同时间尺度上。▲图7 | TouchWorld 把“预测未来”和“实时反应”进一步拆到不同时间尺度1 Hz 的高层负责子任务与未来 tactile subgoal10 Hz 的策略据此生成主体动作30 Hz 的触觉 refinement 则处理接触后的快速偏差。这里最值得注意的是同一种触觉同时承担两种职责它既是“未来应该达到什么状态”的目标也是判断“现在有没有偏离”的反馈。如果说前几年触觉更多是在帮助机器人回答“我现在碰到了什么”那么到了这里问题已经明显变成如果我接下来这么做我应该碰到什么从“识别现在”到“预测未来”看起来只是多预测了几帧触觉实际却改变了触觉在机器人系统里的位置。它不再只是动作执行后的反馈而开始成为动作执行前就存在的一种物理预期。这一步才真正让触觉开始进入机器人的内部世界模型。05 为什么偏偏是现在为什么这些变化偏偏集中发生在最近三年如果只看论文名字很容易把它简单理解成“foundation model 热潮终于也轮到触觉了。”但事情也没有这么简单它背后其实是几个条件同时成熟。第一触觉硬件终于变得更容易获得。GelSight Mini、DIGIT、AnySkin以及大量新的视觉触觉、磁性触觉和电子皮肤让触觉不再只能依赖少数昂贵、难集成的实验平台。第二视觉触觉把“接触”变成了现代模型熟悉的数据形态。传统力传感器可能只有几个通道。一张 tactile image 却可以同时包含接触区域、几何、剪切、形变、纹理等复杂线索。对于 ViT、Transformer、diffusion model 和今天的 VLA 来说这意味着触觉终于可以直接借用视觉领域已经非常成熟的工具链。第三也是最重要的机器人学习本身换了目标。过去很多机器人策略只需要解决一个固定任务。在这种情况下一个任务训练一个 tactile model虽然麻烦但并非不能接受。今天大家想做的却是 generalist policy、VLA、world model。模型一旦要跨物体、跨任务、跨场景运行“每个任务重新做一套触觉”就会立刻成为瓶颈。于是前面那些原本分散的问题开始连成一条链“传感器能不能更换决定数据能不能积累数据能不能积累决定能不能预训练有了可迁移表示触觉才有机会进入统一 policy进入 policy 以后机器人又会自然需要预测未来接触并用真实反馈做闭环纠偏。在 2026 年 8 月的一篇新的视觉触觉综述中已经不再把 hardware、perception、policy、dataset 和 foundation model 当成彼此割裂的几个方向而是把它们放在一条完整的 sensing-and-learning pipeline 里。▲图8 | 《Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation》如果把过去三年的变化压缩成一张地图就是从底部的 raw tactile image / event stream 一路向上走先学习信号表示再理解力与接触动力学、几何和属性随后进入多模态融合与任务策略最终来到 generalizable tactile learning / foundation policies。传感器并没有变得不重要只是“把接触测出来”从终点变成了整条触觉智能链条的起点。06 但触觉离“视觉的今天”其实还很远这些条件解释了为什么触觉能够在最近几年一路从传感器走到 foundation policy 和 world model。但“开始走到这里”和“已经成熟”是两件完全不同的事。如果因此得出一个结论触觉 foundation model 的时代已经来了——或许还为时尚早。首先是数据。一张互联网图片几乎是免费的一段高质量触觉数据却意味着机器人真的要伸出手、接触物体、控制力度还要保证传感器没有损坏、机器人没有把东西碰飞。如果还需要同步六轴力、压力分布、机器人动作和语言描述采集成本会继续上升。第二个问题是传感器异构。相机型号虽然很多但最终大多还是 RGB 图像。触觉却不是。有的是视觉触觉图像有的是磁场有的是 taxel有的是六维力矩还有的是覆盖整只手的电子皮肤。不同传感器看到的“触觉世界”甚至很难说天然存在于同一个坐标系。这也是为什么过去三年“cross-sensor”“semantic alignment”“force alignment”会频繁出现。它们都在从不同角度追问同一个问题触觉究竟有没有一种足够稳定的公共语言第三个问题是时间尺度。语言可以慢慢理解视觉可以几 Hz 到几十 Hz 更新但 slip、碰撞和接触破坏可能在几十毫秒里发生。这意味着未来成熟的触觉机器人很可能不是一个“大模型”把所有模态一次性吞进去然后统一频率输出动作。它更可能是一个分层系统慢的部分理解任务和环境中间层预测接触会怎样发展快的部分像反射一样根据最新触觉把动作拉回正确轨道。07 换掉的不是传感器而是问题本身如果一定要把过去三年触觉的变化压缩成一句话我想大概是怎么把一次接触可靠地变成信号 → 怎么把这些信号变成可以复用、迁移、决策和预测的知识。“最开始的问题是换一块皮肤以后数据和策略能不能留下来再往后是不是可以不为每个任务重新训练而是先学出一套通用 representation然后触觉开始进入 VLA真正影响动作接下来触觉表示又开始从“像不像视觉”转向“有没有真实的物理 grounding”到了最近机器人甚至开始预测未来触觉把“下一刻应该摸到什么”变成内部世界模型的一部分。所以这三年的变化并不是触觉传感器突然不重要了。恰恰是因为机器人越来越能“摸到”研究者才终于有机会把问题继续往后推让机器人拥有触觉 → 让机器人理解触觉 → 让机器人利用触觉去预测并改变未来。触觉真正开始进入的已经不只是机器人的手而是机器人的模型。但触觉进入模型不等于模型就会正确使用触觉 ➡️ 下一篇我们就来拆开这个反直觉的问题为什么给机器人加上触觉反而可能更差依次回答四个问题什么时候该听触觉的、触觉应该以什么形式进入模型、模型里谁真正需要触觉以及触觉究竟应该有多大的话语权……Ref1. AnySkin: Plug-and-play Skin Sensing for Robotic Touch, 2024 / ICRA 2025.2. Sparsh: Self-supervised Touch Representations for Vision-Based Tactile Sensing, CoRL 2024.3. Tactile-VLA: Unlocking Vision-Language-Action Models Physical Knowledge for Tactile Generalization, 2025.4. OmniVTLA: Vision-Tactile-Language-Action Model with Semantic-Aligned Tactile Sensing, 2025.5. ForceVLA: Enhancing VLA Models with a Force-Aware MoE for Contact-Rich Manipulation, NeurIPS 2025.6. TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation, 2026.7. TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation, 2026.8. ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation, 2026.9. Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation, 2026.

看完文章,想为自己的企业也做一次专业网站诊断?

尧图顾问免费为您评估现有网站,并给出建站/改版建议与报价方案。

免费获取方案