出轨的女人
机器人终于学会了“用手感受”:马里兰大学等机构联合研发的触觉残差学习系统,让视觉机器人从“看着做”进化到“摸着做”_我的网站

一 | 这项由马里兰大学(University of Maryland, College Park)与佐治亚理工学院(Georgia Institute of Technology)联合完成的研究,于2026年7月4日以预印本形式发布,论文编号为arXiv:2607.03723,研究方向归属于计算机科学的机器人学领域。 虽然离真正过年还有一段时间,但各个城市、商场都已经开始布置下一年的生肖吉祥物。感兴趣的读者可以通过该编号在arXiv平台查阅完整论文。 **一、机器人为什么老是"差那么一点点"** 现实生活中,有一类任务看似简单,实则极难完成——比如把充电器插进插孔、拧开瓶盖、或者把一根棍子插进一个刚好比它大一点点的孔里。人类做这些事情时,眼睛固然会提供大致的方向感,但真正决定成败的往往是手指尖传来的那一点点细微感觉:插进去了没有?有没有卡住?是不是需要稍微转个角度? 对于机器人来说,视觉系统就像是一双很好用的眼睛,可以看清楚东西在哪里、大概朝什么方向移动。在往年看来仪式感十足的步骤,最近对于很多人来说却是一场噩梦,因为我们即将迎来——蛇年。但是,当机器人的夹爪真正触碰到物体的那一刻,纯粹的视觉信息就有些力不从心了。接触力是多大?接触的几何形状是什么样的?需要往哪个方向微调?这些关键信息,摄像头根本没有办法直接测量到。我知道看到这里,很多怕蛇人已经想要立刻关掉页面、防止眼睛中毒了。正因如此,那些需要精密接触的任务——也就是研究者们所说的"接触丰富型操作"——对机器人来说一直是个大难题。 马里兰大学和佐治亚理工学院的研究团队决定从人类学习的经验里寻找解法。

二 | 但别担心,本文已经通过了编辑部极度怕蛇人叶橙子的权威检验,保证文中不会出现真蛇,稍微可能引发不适的图都做了滑动效果。前两天关晓彤参加微博之夜的直播,可以说生动地展示了一位对蛇有着生理性恐惧的年轻人,是如何被蛇年逼疯的。

三 | 在交换新年礼物的欢节,关晓彤抽到了一个Jellycat的蛇玩偶。已经在娱乐圈摸爬滚打了23年的国民闺女,在镜头前经历了全面的表情失控。

四 | 皱起的眉头、偷偷翘起的手指,暗示着她作为95后小花的最后一丝体面。一个人学打羽毛球,可以通过看视频来了解动作要领和战术套路;但真正打好球,必须通过大量实际练习,用手腕去感受每次击球的力度和角度。因为节目是直播,关晓彤不好意思直接表现出嫌弃。就这么手足无措地拎着蛇cue流程,看也不敢看、碰又不敢碰。屏幕对面的多少怕蛇人,立刻感同身受。“蛇年对于我来说就是一场大劫,无时无刻不在担心出门转角遇到蛇。”月初短视频平台上曾流传一种说法,说十二生肖里本来没有蛇。我深刻怀疑这完全是怕蛇人的阴谋,就为了不想最近在街头巷尾被蛇元素吓一跳。去年遍布各大商场的丑龙装饰,最多只是对人类审美的荼毒。

五 | 视觉提供的是"大方向",触觉和本体感觉提供的是"最后一公里"的精确调整。基于这个类比,这个团队提出了一套名为**OMNITACTUNE**的系统,让机器人先靠视觉学会任务的大致流程,然后通过"用手摸索"来精修那最难的接触阶段。

六 | **二、视觉大数据与触觉小数据之间的鸿沟** 要理解这项研究的意义,先得了解当前机器人学习领域的一个根本矛盾。 近年来,视觉数据变得越来越丰富。但蛇装饰——无论它们是搞笑还是唯美——对怕蛇人来说,都意味着直击灵魂的震颤。对于怕蛇人来说,最近的生活就像是误入规则怪谈。

七 | 规则一,绝不能踏进宜家半步。

八 | 研究者们可以用人类操作的视频、远程操控的机器人录像,甚至海量的互联网图片来训练机器人的"眼睛"。不然就会看到成箱的逼真蟒蛇玩偶,摆在大厅最显眼的位置。

九 | 这些数据量庞大,种类繁多,让机器人在"看"这件事上变得越来越厉害。事实上,建议最近在进入大型超市的时候,也尽量把眼睛闭上或者看向天花板。然而,触觉数据就完全是另一回事了——采集触觉数据需要专用的触觉传感器,每种传感器产生的数据格式不同,一个任务收集到的数据换到另一个任务又得重新来过,更别说换一台机器人了。

十 | 因为很容易在一堆醒狮、对联之类的红火年货中,转角遇到自己命定的博格特。目前触觉数据集的规模,与视觉数据集相比,差了不止一个数量级。@zzzzzzzzzzzzzzzz规则二,买东西尽量网购。如果非要到线下逛街,只去那些懒得搞生肖装饰的老式百货商店。很多时髦点的商场去年靠着大型龙装饰火成网红打卡地,今年也想如法炮制。只不过在普通人眼中还算精致的蛇雕塑,对怕蛇人来说宛如耶梦加得重生、噩梦成真。 这就造成了一个现实困境:视觉策略可以靠大数据训练得很好,但在接触阶段频频失败;而引入触觉反馈虽然能解决接触问题,却又因为数据匮乏而难以泛化。

十一 | @小优游玩记前两天全网都在嘲笑昆明某商场的蛇年装饰。画着腮红的蛇脸上露出一种如痴如醉的表情,被吐槽是“鬼迷日眼”“仿佛吃了菌子”。但怕蛇的昆明人已经无心加入这场玩梗了,只需瞟一眼那抽象的尖牙和红色信子,心里就暗暗发誓最近绝对不路过这个路口。 研究团队的核心洞察在于:我们不需要把触觉数据也扩展到视觉数据那个量级。触觉和视觉在操作任务中扮演的角色本就不同——视觉负责全局规划,触觉负责局部修正。

十二 | 既然如此,何不让视觉策略承担宏观引导的角色,然后只让一个小巧的触觉"修正模块"来处理接触阶段的细微调整?这就是OMNITACTUNE的核心思路:**把触觉学习当成对已有视觉策略的"残差修正"**,而不是从头重新学一套新策略。 所谓"残差修正",可以理解为这样一个场景:你已经有一位经验丰富的厨师(视觉策略)负责整体烹饪流程,但在最后收汁的关键时刻,需要一位专门负责火候感知的助手(触觉残差策略)来做最后的精细调整。

十三 | 南京德基广场的蛇雕塑是马卡龙色的,还配这忽闪忽闪的长睫毛和蝴蝶结尾巴。助手不需要重新学整道菜的做法,只需要在关键节点上补充主厨感知不到的信息。 **三、两阶段流程:先"看着练",再"摸着改"** OMNITACTUNE的整个工作流程分为两个主要阶段,可以用运动员学习新动作的过程来理解。 第一阶段叫做"热身启动"(Warm-start)。@Cawaii圈圈“内啥,我我承认它很漂亮,但还是让它走开吧”。

十四 | 规则三,最近看到品牌出的什么“新年联名”“新年特供”,一定要提高警惕。因为很可能这个“联名”,指得就是跟蛇联名。

十五 | 在这个阶段,机器人完全按照已有的视觉策略来行动,不做任何改变,但同时打开触觉传感器,默默记录下每一次交互中触觉传感器感受到的信息。很多人热衷于收藏各种品牌的生肖珍藏款产品,十二生肖已经集齐七八个。这就像一位新来的助手跟着主厨观摩学习,虽然还没有动手操作,但已经在积累对这个厨房、这道菜的感知经验。 这个阶段的目的不是立刻改善表现,而是做三件准备工作:填充"经验池"(也就是回放缓冲区),让之后的学习有素材可用;训练一个能判断"当前触觉信息对应什么结果"的评价网络(称为"评论家"或Critic);以及针对当前任务微调预训练的触觉编码器,让它能够更好地理解这个任务特有的接触模式。收集事业卒于新款包装上的蛇做得太逼真。

十六 | 为什么这三件事缺一不可呢?如果直接跳过热身就开始学习,评价网络因为没有数据而无从判断好坏,触觉编码器因为没有针对当前任务微调而产生"表征偏移"(简单说就是:它提取出来的触觉特征跟任务实际需要的特征对不上),整个学习过程会极不稳定。@异乡异客沪上阿姨看似考虑了怕蛇人的需求,蛇年推出的新品是“蛇果奶绿”。结果偏偏设计了一个“蛇皮杯”,甚至贴心做出了鳞片的花纹和纹理触感。@悄悄发个动态有人称赞“质感摸上去仿佛在摸一款上好的皮包”,但对于怕蛇人来说,这只能算是一款鸡皮疙瘩生成器。研究团队将这个缺乏热身的对照方法称为PLD*,实验结果证明它的学习曲线确实更曲折、最终表现也更差。“打开袋子直接被吓到心跳加速,遮起来!立刻遮起来!”@菲菲不少网友说,怕蛇的人蛇年是真省钱了,啥限定都买不下手。 热身阶段还有一个巧妙的数据增强技巧:利用一个叫做ControlTac的触觉图像生成工具,对每一段真实收集到的接触轨迹,额外合成两段虚拟的触觉轨迹,模拟不同的接触力和接触位置。但自己不买,不代表别人不会买。最近上班跟同事谈工作的时候都要小心翼翼。这相当于厨师助手观摩了一次真实操作之后,在脑海中又演练了两次"如果力道更轻一点"或"如果角度稍微偏一点"会是什么感觉,从而大大扩充了学习素材。

十七 | 第二阶段叫做"在线残差强化学习"(Online Residual RL)。生怕对方换了新的屏保或者手机壳,定睛一看上面画条蛇。这时,机器人开始真正地边做边学。

十八 | @卢靖珊大学生发现隔壁寝室贴了福字,本来还在感慨同学真有仪式感。结果仔细一看头皮发麻,还不敢跟别人说怕显得自己矫情。每一步行动的最终动作,是视觉策略给出的基础动作加上触觉残差策略给出的修正量,就像主厨的手法加上助手在关键时刻的轻轻一推。

十九 | @猫仔起床惹至于永远能跟上每一股潮流的美甲行业,最近更像是真·“捅了蛇窝”。“闺蜜给我看她新做的蛇年美甲时,我的表情就跟关晓彤一样一样的。

| 触觉残差策略通过反复与真实环境交互、根据任务是否成功来不断优化自己的修正能力,这正是强化学习的核心思想。 为了安全起见,修正量被严格限制在一个较小的范围内,并且通过一个逐渐放大的调度器来控制:一开始修正幅度很小(0到5%),随着学习进行逐步增大(最高到15%)。这确保了早期探索不会因为修正过猛而损坏设备或破坏任务。 此外,研究团队还引入了一个"接触门控"机制:只有当触觉传感器检测到实际接触时(通过传感器标记点的位移量来判断),触觉特征才会被输入到残差策略中。”@Twin-小双眼看着临近新年,网红们也开始蹭起了生肖的热度。对于怕蛇人来说,这相当于进一步增大了生活中蛇元素的密度。在没有接触的时候,机器人完全跟随视觉策略,不做任何触觉修正。

| 这防止了机器人在还没接触物体时就"过度依赖"触觉信号而做出错误动作。

| **四、让机器人知道"做得好不好":多感官奖励设计** 强化学习的一个核心问题是:机器人怎么知道自己做得好还是不好?在真实世界中,这个问题比在模拟环境中难得多——不能每步都人工标注,但奖励信号又必须足够密集,才能让学习高效进行。 OMNITACTUNE设计了一套综合视觉和触觉信号的多感官奖励系统。社交平台热搜上刷到“蛇年妆容”,还以为最多是教你如何画细长眼线、精致鼻影。整体奖励由四个部分组成,不同阶段侧重不同。 在机器人还没抓住物体之前,"接近奖励"引导末端执行器靠近物体的初始三维中心位置,距离越近奖励越高。这相当于给机器人一个路标:先朝着目标走过去。 抓住物体之后,主要的引导来自"流奖励"。这里的"流"指的是物体关键点的运动轨迹——研究团队用视觉方法在演示视频中追踪物体上的一组关键点,生成一条预测的运动轨迹,然后用机器人实际操作中物体运动轨迹与这个预测轨迹的吻合程度来给分。具体而言,预测轨迹被稀疏化为若干个"子目标",机器人每到达一个子目标,奖励就增加一级,并切换到下一个子目标。这让奖励信号变得既稠密又有方向性。

| 触觉信号贡献两类奖励。结果点开一看,美妆博主头上的蛇形头饰比这些年在古装剧里的见过的还多。一是"抓握奖励":触觉传感器接触面积内的深度值超过阈值,说明抓握稳固,给予正向奖励。二是"安全惩罚":如果触觉传感器检测到的标记点位移超过安全阈值,说明接触力过大,立即终止当前轮次并给予大幅负奖励,机器人自动复位。@六金yE想要给家里增添节日气氛,点开”新年必学剪窗花视频”,结果剪出来一个美杜莎的头——不是,你这蛇吐信子的细节就非得要吗!@唛大叔或许是因为复制起来太过容易,蛇形元素会在任何地方出现。

| 这四部分奖励通过加权归一化组合成一个介于0到1之间的综合分数,当任务完成时额外给予1分的"成功奖励"。看个美食教程,也有可能遭遇突然惊吓。只见大厨手起刀落,几下飞快的操作之后,一根普普通通的黄瓜就立刻变得可疑了起来。@长沙夜宵锋哥看这翠绿的颜色、柔软的“身段”,以及头部点缀得那颗小芝麻……“不好!是蛇!我终于明白家里的猫看到黄瓜为什么会瞬间弹跳起飞了!”在十二生肖的形象中,怕老鼠、怕鸡、怕羊、怕狗的人并不在少数。

| 这样的设计让机器人在每一步都能获得有意义的反馈,而不是在黑暗中等待偶尔成功的瞬间。但大家怕的基本上都是真动物,艺术加工过的不算。很多人在垃圾箱后发现真老鼠会失声尖叫,在迪士尼见到米奇人偶却会疯狂拍照。但怕蛇的人不一样——怕得真情实感、怕得各有千秋。 **五、视觉策略从哪里来:多种"眼睛"的训练方式** OMNITACTUNE设计为"策略无关"(Policy-Agnostic),意思是它不限定必须和哪一种视觉策略配合,任何已有的视觉策略都可以作为基础。秦岚在综艺里被要求摸蛇。

| 研究团队实际测试了四种不同来源和架构的视觉策略。有人怕三角形的蛇头,以及它竖起来的瞳孔,让人联想到童年神剧里阴森森的蛇精反派。

| 有人怕冰凉的鳞片,看一眼就想起小时候在乡下老家玩耍,被蛇爬过脚面时滑腻腻的触感。也有人讨厌看到蛇在草地上快速蜿蜒爬行的样子,感觉下一秒就会窜到自己身上。 其中最有特色的是"基于流的策略"(Flow Policy)。再严重一点的,甚至连连看到蛇这个字都会感到浑身难受。说实在的,作为一个不怕蛇的人,我在判断身边怕蛇人的心理阈值时,经常会出现纰漏。比如前两天我给叶橙子转发了一张搞笑动漫风的蛇表情包,本以为已经够无害了,她却直接从工位上蹦了起来。而从各个商场、商家出的蛇年吉祥物设计来看,也可以看出商家们已经很努力在削减蛇年对怕蛇人的伤害——因为摸不准尺度在哪儿,那就干脆进行天马行空的艺术创作,尽量让蛇们少一点蛇样。研究团队从人类操作的视频出发,先用DINOv2(一种视觉特征提取工具)和SAM(一种图像分割工具)在视频帧中定位目标物体,然后用CoTracker3追踪物体上32个关键点在整段视频中的运动轨迹。

| 接下来,用一个微调过的生成模型,给定当前观察帧,预测整个任务接下来的关键点运动轨迹——这就是所谓的"对象流"。把这条生成的流稀疏化为若干子目标,策略就知道下一步应该让物体朝哪个方向运动。去年过年,上海豫园灯会在一众网红打卡地中大出风头。这个设计的妙处在于:人类和机器人的手臂形态各异,但两者都在操作同一个物体,物体的运动轨迹是跨越了"embodiment gap"(身体差异鸿沟)的通用语言。对象流正是这样一种语言。

| 除了这种从人类视频学习的策略,研究团队还测试了通过远程操控机器人收集数据训练的ACT(动作分块变换器)和Diffusion Policy(扩散策略),以及基于大规模预训练的视觉-语言-动作模型π0.5。这四种策略代表了当前机器人学习领域最主流的几个技术路线,覆盖范围相当广泛。当时他们做的龙灯是这样的:胡须、鳞片细致可见,整个姿态栩栩如生。但今年的蛇灯,是这个风格——“我们是做不出来像的吗?我们是怕太像了吓着你!”湖南株洲百货去年的龙装饰,被当地网友吐槽毫无霸气可言。 值得一提的是,研究团队发现从人类视频学到的基础策略,通常比从远程操控数据学到的策略具有更平滑的运动轨迹。眯缝眼、呲牙傻乐,圆滚滚的身体“不像龙倒像条蛇”。@株洲百货但看了今年的装饰就明白,株洲百货只是单纯热爱给动物变形。看这有棱有角的身形,看这莫名其妙的圆形花纹,谁说贪食蛇就不能算蛇。他们用两个专业指标(SPARC和LDLJ,都是衡量轨迹平滑程度的数学工具)进行了量化对比,发现人类演示的平滑度远高于远程操控演示,并且这个差距在策略学习之后会进一步放大。

| 为了在“让人能看出是蛇”和“又不能太像蛇”两个需求之间找到平衡,设计师们可以说是绞尽脑汁。已知龙和蛇的身形很像,为什么很多人怕蛇却不怕龙?答:或许是因为蛇头可怕,遮起来就行了。于是今年,很多商场里的蛇生肖装饰都被加上了头套。@易只烊重庆街头的这条蛇,不仅有着圆滚滚的脸蛋,甚至还带上了财神的帽子。

| 原因很直观:人类在操作时手部自然地产生平滑运动,而操控机器人时无法直接感受接触力,导致在关键接触阶段频繁出现抖动和不稳定的修正动作。用年轻人大家对金钱的渴望,压抑蛇形象本身带来的的负面情绪,这波堪称是实用主义的胜利。(bushi@Hi 沙坪坝为了把可怕程度降到最低,不少蛇年吉祥物的设计思路,都在往可爱的方向打造。这些不平滑的动作被策略学习放大之后,会让接触阶段的行为更加混乱,从而使触觉残差修正更难进行。比如山东菏泽某商场里这只,除了细长的身子还能看出点蛇样来,已经拿掉了绝大部分蛇的特征。@心动曹州鳞片换成了毛茸茸质感,竖直瞳孔换成了大眼珠子,就连配色都是嫩嫩的马卡龙色系。为了让蛇不像蛇,有时候设计师们也会用力过猛。比如一不小心,在蛇的身体上按了个忧郁青蛙的头。

| **六、四个"精细操作"任务上的实验:从一塌糊涂到近乎完美** 研究团队在真实机器人上进行了全面验证,使用的平台是搭载GelSight Mini触觉传感器的xArm7机械臂,配合一台第三视角的Intel RealSense D435深度摄像头。看花纹明明是写实风,但偏偏睁着两只搞笑大眼睛对你say“嘶”。 四个测试任务各有各的挑战性,但都属于接触丰富型操作。

| **插棒入孔**是第一个任务:机器人需要抓起一根圆柱形棒子,将其插入不同位置的目标孔中。这个任务要求空间泛化能力(孔的位置每次不同)、稳定抓握以及毫米级的接触对齐。让你不知道是该笑还是该扭头就跑。视觉基础策略在这个任务上的成功率只有40%,经过40到50分钟的OMNITACTUNE训练后,成功率提升至100%。

| @momo去年在年轻人中间爆火的IP“小狗蛇点点”,最近成了很多网红品牌争相想要联名的对象。 **充电器插入**是难度最高的任务之一:机器人要把一个充电器插头插入手机充电口。

| 充电器金属插片宽约7毫米,厚约1.5毫米,对应的插槽宽仅约2毫米,留给误差的空间极其微小。因为很难再找到另一条让人觉得很可爱的蛇。“第一个想到把狗跟蛇结合起来的人,真是天才!”@多吃螃蟹“变可爱”的思路虽然削减了蛇的可怕,但过于萌的外观毕竟不适合高端品牌。视觉基础策略的成功率只有10%,训练40分钟后成功率达到100%。于是另一个路线横空出世,那就是抽象派。 **拧瓶盖**是一个工具使用任务:机器人拿着开瓶器去打开瓶子盖子。

| 某个高端商场没有常规地在中庭摆放大型蛇雕塑,而是在电梯扶手,营造一种大蛇盘绕的效果。这个任务要求在动态变化的接触过程中保持精确的工具姿态,稍有偏差就会从瓶盖上滑落。

| 视觉基础策略成功率仅5%,训练50分钟后达到90%。但秒就秒在它若隐若现。说是蛇、是龙,甚至是鲤鱼都行,甚至连模拟鳞片的花纹,仔细一看都更像是珠宝切割过的切面。 **开盒子**同样是工具使用任务:机器人用杠杆式开瓶器撬开一个小铁盒。这个任务的特殊挑战在于可以着力的边缘厚度只有约1.3毫米,必须极精准地对准后才能产生有效的杠杆力。

| 视觉基础策略成功率为5%,训练80分钟后成功率达到85%。

| Prada的蛇年宣传片甚至根本没有蛇本人出现,而是把人群的剪影排成了蜿蜒的蛇形。结果被吐槽像节假日大家在景区排队上厕所。

| 与此同时,研究团队还对比了三种对照方法。刚排到马龙。

| 奢侈品牌BV的蛇年新品,则是一个绿色的单肩包,用编制工艺稍稍模拟一下蛇的鳞片质感。PLD*是把现有的PLD强化学习框架引入触觉的版本,但跳过了触觉编码器和评论家网络的热身优化;PLD(仅视觉)是只用视觉反馈进行残差学习、不接入触觉的版本;ViTAL是从零开始学习视觉-触觉策略、没有热身阶段的版本。在包带一段再缝个小小的红布条,就算应上蛇年的这个景了。

| 四个任务上,OMNITACTUNE的最终成功率比这三个对照方法高出40%以上,印证了每个设计选择的必要性。 **七、与其他视觉-触觉学习方法的正面对比** 除了与相同框架的对照方法比较,研究团队还将OMNITACTUNE与当前几种主流的视觉-触觉模仿学习方法进行了正面较量,测试场景集中在插棒入孔任务上。其中一个例外,是辣条品牌卫龙。 对比方法包括:带触觉融合的ACT(把触觉特征拼接到视觉特征后一起输入网络)、Reactive Diffusion Policy即RDP(一种先进的慢-快双通道视觉-触觉扩散策略),以及带触觉令牌的π0.5微调版。

| 这些方法在学习时都额外收集了包含触觉信息的远程操控演示数据,演示数量从50条增加到90条,总时间成本与OMNITACTUNE的在线训练阶段相当,以确保公平对比。 结果显示,所有基于模仿学习的视觉-触觉方法,成功率均低于OMNITACTUNE。

| 带触觉融合的ACT达到60%,RDP达到65%,带触觉令牌的π0.5达到45%,而OMNITACTUNE达到100%。

| 虽然本身的定位是平民零食,但在设计上也凑了“抽象派”的热闹。

| 而它所谓的“蛇年设计元素”是什么呢?请看PPT。没错,只要想象力够丰富,蛇皮袋也可以是蛇。

| 相比于龙年的大张旗鼓、创意满满,可以看出对待“蛇”这个生肖吉祥物,所有设计师们都很收敛。相差20%到30%的差距,说明了一个核心结论:对于接触丰富型的精密操作,通过反复试错在线学习触觉修正,比收集更多的人工演示数据更有效率。这与人类学习的直觉一致——要学会穿针引线,真的需要自己动手练,光靠看别人做示范是不够的。火不火还在其次,总之尽量先别吓到人。

| **八、兼容多种触觉感知方式** 现实中触觉传感器的种类繁多,不同传感器产生的数据形式各异。前两天疯狂动物城发布新春海报,对联里打出了“灵蛇纳福”的字样。但堂堂新角色、灵蛇本蛇,只能委屈地躲在海报的一侧,再加上身形过于细长,不认真看可能都不会注意到。为了验证OMNITACTUNE不依赖于特定的触觉感知方式,研究团队在插棒入孔和充电器插入两个任务上,对比了四种不同的触觉表示方法。也不排除设计师自己本来就是一个怕蛇人士。

| AnyTouch2是一种通用光学触觉表示学习模型,能够处理动态触觉感知;Sparsh是一种基于视觉的触觉自监督学习表示;T3是一种跨传感器跨任务的可迁移触觉变换器;还有一种更简单的低维触觉标记(Tactile Markers),直接使用触觉传感器中物理标记点的二维位移作为输入,配合一个两层的全连接网络来编码。自从进入了春节倒计时,网上经常有从事设计工作的网友在哀嚎:“找有关蛇的素材时从来不忘加上‘手绘’‘可爱’之类的关键词,但随时担心会出来一个写实风,已经想直接跳过蛇年过马年了。 实验结果显示,四种触觉表示在经过OMNITACTUNE训练后都实现了显著的性能提升。AnyTouch2和低维标记方法在两个任务上都达到了相当的最终性能(约100%和100%对应插棒入孔,约100%和100%对应充电器插入),说明即使是简单的标记位移也足以提供有效的接触反馈。T3和Sparsh在充电器插入任务上表现略逊(约90%和80%),研究者推测这是因为这两个模型的预训练数据主要来自静态操作场景,对于充电器插入这类涉及动态探索的任务,其预训练特征与实际需求存在一定偏差。

| 这个结论对实际应用有重要意义:OMNITACTUNE不绑定昂贵的高端触觉传感器,廉价的标记位移传感器同样可以驱动有效的触觉残差学习。 **九、消融实验:逐一验证每个设计选择的必要性** 研究团队对系统的几个关键设计进行了消融实验,系统地验证每个组件的必要性。 奖励设计的消融实验显示,去掉接近奖励、流奖励或触觉奖励中的任何一项,学习速度都会明显减慢,最终成功率也会下降。”如果说还能有什么战胜人们对蛇的恐惧,恐怕只有金钱的力量。比如我为了写这篇文章广泛询问了身边怕蛇的朋友,到底什么样的蛇年吉祥物才能不让他们感到害怕。其中去掉流奖励(即仅依靠稀疏的成功信号)的影响最大,验证了密集的基于物体运动的中间奖励对于高效强化学习的关键作用。 残差策略设计的消融实验则比较了基于轨迹级关键点引导与基于逐步关键点引导的差别。逐步关键点引导会对机器人每一步的动作方向过度限制,导致即使是ACT这样本身就会产生多样化动作的策略也难以与之协调,最终表现反而更差。轨迹级的稀疏子目标引导则既保持了任务方向性,又给了残差策略足够的自由度去处理局部接触细节。最后发现达成一致的答案有两个。此外,去掉接触门控机制(让触觉特征在所有阶段都影响动作)也会使表现下降,说明"只在真正接触时才使用触觉"是一个重要的设计原则。 热身阶段的消融实验验证了三件事的重要性:热身期间对触觉编码器和评论家网络的联合优化、ControlTac触觉数据增强,以及评论家损失与重建正则化损失的共同作用。任何一项缺失,学习过程都会变得更不稳定,最终成功率也更低。一是宝格丽。二是金店里卖的各种蛇元素首饰。

| 动作空间设计的消融实验证明了残差幅度调度器的价值:去掉调度器(一开始就允许较大的修正幅度)会导致学习不稳定;而设置过大的残差幅度上限(0.5而非0.15)虽然比完全无限制好,但最终性能仍不如精心调校的0到0.15的逐步增大方案。这或许也为怕蛇的朋友们,提供了一个度过蛇年春节的好点子。 **十、局限性与未来展望** 研究团队对OMNITACTUNE的局限性保持了清醒的认识。“既然已经躲不开这到处都是的‘蛇装饰’了,我决定最近多去金店逛逛。”说不定亮闪闪的金子看多了,就把蛇也连带着看顺眼了呢?#头条深一度#。

| 系统仍然继承了真实世界强化学习的通病:每次任务失败后需要人工重置环境,长时间反复接触操作会造成触觉传感器的磨损。

| 特别是GelSight Mini这类基于视觉的触觉传感器,其柔性接触面在频繁接触中容易产生损耗。如何实现更自动化的环境重置、降低硬件磨损,是未来工作需要解决的实际问题。 研究团队提出的改进方向包括:引入世界模型(World Model)来生成物理上更可信的视觉-触觉仿真轨迹,用于预训练和在线策略改进,从而减少真实环境交互的次数;以及将系统扩展到更多机器人平台和更多种类的触觉传感器上。

| 归根结底,OMNITACTUNE给出的是一个关于"如何用触觉补充视觉"的可行路径:不需要从头收集海量触觉数据,也不需要重新训练视觉策略,只需要在已有视觉策略的基础上,用40到80分钟的真实机器人交互,就能让机器人在那些"最后一公里"的精密接触任务上从几乎完全失败变成近乎完美。这或许意味着:为机器人添加触觉感知能力,真的可以比我们想象的更轻便,更快捷。

| --- Q&A Q1:OMNITACTUNE和普通的视觉-触觉融合学习有什么区别? A:普通的视觉-触觉融合学习需要同时收集大量包含触觉信息的示范数据,从头训练整个策略,数据成本高、泛化难。OMNITACTUNE则不同,它把已经训练好的视觉策略完全冻结,只训练一个轻量级的"触觉修正模块",通过真实机器人在线练习来学习局部接触修正。这样既保留了视觉策略的泛化能力,又不需要重新收集海量视觉-触觉配对数据,40到80分钟内即可完成适配。 Q2:OMNITACTUNE需要什么样的触觉传感器才能用? A:OMNITACTUNE对触觉传感器类型没有强制要求。研究团队实际测试了AnyTouch2、Sparsh、T3三种预训练触觉图像编码器,以及直接用传感器标记点位移作为低维输入的简单方案,四种方式都能正常工作。实验结果显示,简单的低维标记位移方案甚至达到了与高端预训练编码器相当的性能,说明无需昂贵传感器也能有效使用该系统。 Q3:OMNITACTUNE训练完成后,机器人插棒入孔这类任务的成功率能到多少? A:在研究团队的实验中,视觉基础策略在插棒入孔任务上的初始成功率只有40%,经过约50分钟的OMNITACTUNE在线训练后,成功率提升至100%。充电器插入任务从10%提升至100%,拧瓶盖从5%提升至90%,开盒子从5%提升至85%,平均成功率达到93.75%,比对比方法高出超过40个百分点。
Current article:http://wqndc.minshixuanhabing.bond/news/20260826_9741.html
Published on:18:09:32








