arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华等做了4000条视触觉演示,让机器人分清软面包和硬物体

arXiv 2608.18701 cs · cs.RO

机器人把面包放到目标位置,并不代表任务真的成功:抓得太松会滑落,抓得太紧会把软物体压坏,外部相机有时看不出两者差别。拓境智能、清华大学、卡内基梅隆大学等机构提出SoftVTBench,收集4000条视触觉演示,专门评估可变形物体操作中的形变控制。

数据包含四个诊断套件,每套10项任务和1000条演示,共40项任务;资产超过50种,其中有10种体积可变形物体,每个软物体都配一个网格、纹理和质量相同但几乎不变形的硬质“双胞胎”。

视觉相同的软硬物体迫使策略使用触觉

若软物体和硬物体外观完全不同,模型可以靠颜色或形状猜测抓力。SoftVTBench让两者共享外观与质量,只改变顺应性。策略只有接触后读取指尖标记点的位移,才能判断物体是否正在被压缩或滑动。

SoftVTBench任务、资产与多模态数据

项目总览:四个诊断套件、软硬配对资产,以及视觉、触觉、本体感知、语言和动作流。

四个套件分别考察物体属性和空间关系,并把软体与硬体条件交叉。数据同步记录RGB、触觉图像、机器人状态、语言指令和动作;用于评价的真实形变状态与策略可见输入分开保存,避免模型偷看答案。

任务完成率与形变合规率分别计分

传统成功率只检查物体是否到达目标。SoftVTBench另外定义形变约束,判断抓取和运输过程中是否超过每个物体的安全容差,再把任务成功与形变合规组合成DSR指标。

数据构建和评估流程

项目流程图:先制作软硬配对物体并校准约束,再生成任务、采集多模态轨迹并进行自动与人工质检。

这能区分两种表面相同的结果:机器人都把物体放对了位置,一次抓取始终在容差内,另一次在运输前已经过度挤压。若只看终点,两条轨迹都会被标为成功。

十种触觉图像显示相机遗漏的接触变化

指尖触觉传感器内部标记点随接触发生位移,不同几何、软硬程度和接触面积会形成不同剪切场。十种Object-Soft物体在抓取瞬间呈现可区分的接触斑块,外部RGB画面则可能几乎一样。

十种物体的触觉标记位移

项目触觉图:十种软物体在抓取时形成不同接触斑块和标记位移,提供外部相机缺失的受力线索。

基准还控制光照、质量和刚度变化,划分训练、分布内与分布外测试。每个测试点运行100个回合,并用按任务分层的bootstrap区间表示不确定性。它评估的是指定模拟与传感配置下的闭环策略,不等同于任意真实软物体泛化。

同样到达终点,触觉能看出谁把物体压坏了

成功轨迹中的安全抓取与过度形变

项目定性图:两条轨迹都完成放置,蓝色保持在形变容差内,橙色在抓取和运输阶段持续超限。

这类标签适合训练机器人在完成任务之外控制接触力,例如烘焙食品分拣、衣物整理、包装和柔性零件装配。医疗或食品生产等高风险用途仍需要真实材料、卫生和硬件失效条件下的独立测试。

下一步要跨传感器、跨真实材料复现

SoftVTBench提供了可诊断起点,后续应把同一任务迁移到不同触觉传感器、夹爪尺寸和真实软体材料,分别报告任务成功、滑落、永久变形和传感器漂移。若策略只记住某种标记点纹理,换硬件后会迅速失效。

四套任务中的每套都含10个任务和1000条演示,合计40个任务、4000条演示,并覆盖10种可形变物体。这个规模足以比较策略是否利用触觉,但还不能代表食品、衣物、线缆等真实材料的全部黏弹性变化。

后续复现还应拆开报告视觉、触觉和两者融合的结果,并测试光照变化、触觉表面磨损以及物体含水量变化。否则,模型可能把固定传感器纹理当成物体软硬度的捷径。

数据集最直接的产品价值,是把“拿到了”与“拿好且没损坏”拆成两个目标。机器人进入家庭和生产线后,后者往往比终点位置更接近真实验收标准。

参考资料

https://arxiv.org/abs/2608.18701

https://softvtbench.github.io/

https://github.com/TuojingAI/SoftVTBench