arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-17 至 2026-07-17 共收录 52 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 12 篇

2607.14609 2026-07-17 cs.RO 新提交 86%

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation

用于接触丰富的机器人操作的表示对齐触觉基础

Ruilin Chen, Jingkai Jia, Tong Yang, Xinyu Zhou, Qiao Sun, Jiangwei Zhong, Shizeng Zhang, Nuo Chen, Bailin He, Wei Li, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Lenovo CTO Organization(联想首席技术官组织) Nanyang Technological University(南洋理工大学) TeleAl, China Telecom(中国电信天翼人工智能公司)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO

AI总结 研究接触丰富的机器人操作中,针对VLA策略不同表示作用下触觉监督应用位置不明的问题,通过线性探针分析找到可预测未来触觉状态的中间动作专家特征,引入LTP,实验证明表示对齐的触觉基础效果更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14730 2026-07-17 cs.RO 新提交 83%

Hybrid Rigid-Soft Robotic Gripper with Shape Adaptation, Uniform Force Distribution, and Self-Locking Capabilities

具有形状适应、均匀力分布和自锁能力的混合刚性-柔性机器人抓手

Xi Chen, Yun Wang, Lichao Yang, Haitao Li, Ya Xiong

机构 * Intelligent Equipment Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京市农林科学院智能装备研究中心) College of Engineering, China Agricultural University(中国农业大学工学院) College of Engineering, Shanxi Agricultural University(山西农业大学工学院)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 研究针对传统机器人抓手难题,提出集成低成本气动执行器与3D打印双棘轮棘爪机构的混合刚性-柔性抓手,能实现形状适应、均匀力分布和无能源自锁,实验验证其负载、力分布及能耗等性能优越,为农业任务提供高效方案。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14280 2026-07-17 cs.RO cs.LG 新提交 73%

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

DiMaS:用于引导视觉-语言-动作模型的分布匹配

Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

机构 * ISIR, Sorbonne Université(法国国家信息与自动化研究所,索邦大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究针对基于流匹配的视觉-语言-动作模型细粒度行为控制不足的问题,提出DiMaS分布匹配引导策略,能有效控制行为,研究其泛化性并分析原因,推动了视觉运动设置下的分布匹配设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14579 2026-07-17 cs.HC cs.CV 新提交 70%

Skeleton: Visual Authoring of Non-visual Data Experiences

Skeleton:非视觉数据体验的可视化创作

Frank Elavsky, Chieri Nnadozie, Lucas Nadolskis, Patrick Carrington, Dominik Moritz

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.CV

AI总结 研究非视觉数据体验可视化创作问题,提出Skeleton直接操作创作环境,含Inspector、Dimensions API等技术,经对8名从业者实地研究评估,其使导航结构可见,改变从业者可访问设计方式。

Comments 9 pages core, 2 pages acknowledgements + references, 4 pages appendices. Accepted at IEEE VIS 2026, to appear in November 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14341 2026-07-17 cs.RO cs.AI 新提交 62%

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

超越视觉抓取:从检测到执行的复杂抓取基准测试

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zurich University of Applied Science(苏黎世应用科学大学) Indian Institute of Science(印度科学研究所) University of Information Technology(信息技术大学) The University of Tokyo(东京大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对现有抓取基准未涵盖复杂多步推理和语义理解任务的问题,提出GCA-Bench基准,实现多种基线方法并进行实证研究,给出新评估指标等,为开发更强大通用的抓取策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14271 2026-07-17 cs.LG cs.AI 新提交 62%

Local Additive Feature Attribution: A Mathematical Taxonomy and Reporting Checklist

局部加法特征归因:一种数学分类法和报告清单

Rebecca Afriyie Sarpong, Daniel Commey

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究围绕五个规范选择组织多种局部加法特征归因方法,通过公理矩阵比较,将常见失败模式与假设关联,为使用局部加法归因的研究提出十项报告清单,强调归因结果依数学假设而定且假设应报告

Comments 35 pages, 7 figures, and 19 tables. Ancillary files include the axiom matrix, reporting checklist, related-survey scoring, and review-corpus summary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14842 2026-07-17 cs.RO 新提交 57%

KineFuse: Kinematic-Aware Haptic Fusion for In-Hand Occluded-Object Pose Tracking

KineFuse:用于手中遮挡物体姿态跟踪的运动感知触觉融合

Chanyoung Ahn, Jaesung Lee, Sungwoo Park, Donghyun Hwang

机构 * Center for Humanoid Research, KIST(韩国科学技术院人形机器人研究中心) Korea University(韩国大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究如何利用多手指手上的稀疏触觉信号补充预训练视觉姿态跟踪器以应对遮挡,提出运动感知手指级编码器,经多级别评估对比,验证其能提升跟踪成功率,在下游任务表现更好并提供真实世界演示。

Comments 8 pages, 10 figures. Accepted for presentation at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14578 2026-07-17 cs.RO 新提交 57%

Beyond Implicit Force: Evaluating Explicit Force-Torque Proxies in Action Chunking with Transformers

超越隐式力:在使用Transformer的动作分块中评估显式力-扭矩代理

King Hang Wong, Lingqiao Liu, Feras Dayoub

机构 * Australian Institute for Machine Learning (AIML), Adelaide University(澳大利亚机器学习研究所(AIML),阿德莱德大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究在动作分块中ACT的力感知是否依赖遥操作隐式线索,引入以观察为中心的变体,评估简单关节扭矩代理。去除隐式线索致力关键阶段失败,扭矩增强策略可恢复接触行为并改进基础策略,证明隐式线索是力感知可恢复来源。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14487 2026-07-17 cs.RO 新提交 57%

MIDAS Hand: Modular low-Impedance Direct-drive Anthropomorphic Sensing Hand

MIDAS手:模块化低阻抗直接驱动拟人传感手

Alvin Zhu, Mingzhang Zhu, Beom Jun Kim, Quanyou Wang, Jose Victor S. H. Ramos, Dennis Hong

机构 * UCLA(加州大学洛杉矶分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 针对灵巧操作受手部硬件限制的问题,提出低成本开源的MIDAS手,有16个自由度,直接驱动且回驱扭矩低,集成触觉传感,发布完整堆栈,经多种测试分析,为触觉灵巧操作和人机数据收集提供平衡可重复平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14275 2026-07-17 cs.AI cs.MA 新提交 57%

AI Agents Do Not Fail Alone:The Context Fails First

人工智能智能体并非独自失败:上下文首先失败

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14819 2026-07-17 quant-ph 新提交 50%

Quantum Remote Implementation of Hybrid Operations on Hyperstates Using Hyperentangled States

利用超纠缠态对超态进行混合操作的量子远程实现

Satish Kumar, Anirban Pathak

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究利用超纠缠态实现量子远程控制,提出同时利用两比特超纠缠态的偏振和空间自由度的QRIO协议,通过线性光学元件等构建协议,分析测量误差影响并评估成功概率,结果显示该方案对混合量子通信等有应用潜力。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14365 2026-07-17 astro-ph.IM 新提交 50%

Using Muon Rings for the Calibration of the Cherenkov Telescope Array: An Analytical Solution for the Dual-Mirror Telescope Using Vector Geometry

利用μ子环校准切伦科夫望远镜阵列:基于矢量几何的双镜望远镜解析解

Markus Gaug, Víctor Giráldez-Segalàs, Fiona Redmen

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究利用矢量几何形式推导双镜望远镜中μ子产生切伦科夫光的解析解,通过与已知解及极限情况对比验证,分析了相关效应,结果可直接用于切伦科夫望远镜阵列天文台基于μ子的校准。

Comments This is the second article of the series "Using Muon Rings for the Calibration of the Cherenkov Telescope Array", following https://iopscience.iop.org/article/10.3847/1538-4365/ab2123

Journal ref The Astrophysical Journal Supplement Series 285 (2026) 22

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 10 篇

2607.14853 2026-07-17 cs.RO cs.MA cs.SY eess.SY 新提交 83%

Modeling and Validation of Quality of Control for Edge-Offloaded Collaborative Navigation

边缘卸载协同导航的控制质量建模与验证

Neelabhro Roy, Mikael Hammarling, Victor Nan Fernandez-Ayala, Gourav Prateek Sharma, Mani H. Dhullipalla, Dimos V. Dimarogonas, James Gross

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 针对复杂环境中协同控制受网络问题挑战,本文扩展控制质量框架到实际机器人模型,建模网络影响、探索控制参数影响并实验验证,得出最优操作模式,还比较了ROS~2中QoS策略的QoC性能。

Comments Accpeted in IEEE VTC-Fall 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15036 2026-07-17 cs.RO 新提交 79%

Learning Agile Navigation in Crowded Environments for Quadruped Robots

学习四足机器人在拥挤环境中的敏捷导航

Shuyu Wu, Zeyu Liu, Tianbao Zhang, Fanxing Li, Fangyu Sun, Mingkang Xiong, Wei Xi, Wenxian Yu, Danping Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Midea Group(美的集团)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对四足机器人在拥挤环境中导航难题,提出结合VO几何安全与端到端学习敏捷性的VOP-Nav系统,利用LiDAR数据隐式编码约束并预测安全速度区,VO预测兼具推理输入与训练奖励双重作用,实验验证其高效性与稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14586 2026-07-17 cs.RO 新提交 79%

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航

Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。

Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14424 2026-07-17 cs.RO cs.AI cs.LG 新提交 69%

ConFlow: Constraints-Guided Learning with Flow Matching for Motion Generation

ConFlow:基于流匹配的约束引导学习用于运动生成

Nutan Chen, Jianxiang Feng, Marvin Alles, Botond Cseke

机构 * LS Wiiri Robot Innovation Center(LS维里机器人创新中心) Technical University of Munich(慕尼黑工业大学) Volkswagen Group(大众集团)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG;robot learning(comments)

AI总结 研究针对机器人运动生成中约束与数据不匹配问题,提出ConFlow框架,将约束信息纳入训练目标,用条件高斯过程解决设计规范,用不可行演示作负监督,实验表明其能降低碰撞率、提高轨迹质量,弥合训练与推理差距。

Comments RSS 2026 Workshop on Diffusion for Robot Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14228 2026-07-17 cs.CV cs.AI 新提交 62%

SeeSE3: Emergence of 3D Space in Vision Features

SeeSE3:视觉特征中3D空间的出现

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14968 2026-07-17 cs.CV 新提交 57%

Stitch-Inferencer: Enhance Endoscopic Video Segmentation and Tracking via Panoramic Reconstruction

Stitch-Inferencer:通过全景重建增强内窥镜视频分割和跟踪

Shunsuke Kikuchi, Atsushi Kouno, Hiroki Matsuzaki

机构 * Jmees Inc(Jmees公司)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 针对内窥镜视频理解中视野受限和遮挡问题,提出Stitch-Inferencer框架,用全景画布取代隐式特征记忆,跨帧拼接观察以扩大视野,让现有模型利用长程上下文,实验证明其能在保持实时性的同时提升分割和跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14899 2026-07-17 cs.RO 新提交 57%

OASIS-Map: Object-Level Change Detection in Multi-Session Mapping using Semantic Correspondence Matching

OASIS-Map:基于语义对应匹配的多会话映射中的对象级变化检测

Haedam Oh, Yifu Tao, Nived Chebrolu, Maurice Fallon

机构 * Indian Institute of Technology Bombay(印度孟买理工学院)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 研究多会话映射中对象级变化检测问题,提出OASIS-Map系统,通过建立语义对应维护一致对象级地图,在三个真实场景演示,取得停车场汽车替换场景变化检测F1值0.783等成果。

Comments 8 pages, 6 figures, website: https://dynamic.robots.ox.ac.uk/projects/oasis-map/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14507 2026-07-17 cs.RO 新提交 57%

DRIFT: Drift and Aggregation for Motion Planning

DRIFT:用于运动规划的漂移与聚合

Yining Xing, Zhiyuan Liu, Zehong Ke, Wenhao Yu, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能网联汽车与交通国家重点实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究针对端到端轨迹规划器问题,提出DRIFT固定深度规划器,结合轨迹潜在空间漂移与提议聚合,基于视觉编码器特征生成提议,经聚合头预测最终轨迹,在导航测试中有良好表现,证明该方法为多假设运动规划提供高效设计。

Comments 8 pages, 3 figures, 4 tables. Under review at IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15135 2026-07-17 cs.SE 新提交 50%

Navigating the Socio-Technical Complexity Challenge in Quantum Software Ecosystems

应对量子软件生态系统中的社会技术复杂性挑战

Ronja Heikkinen, Santiago Núñez-Corrales, Vlad Stirbu

专题命中 具身导航 :navigation(abstract)

AI总结 本文针对量子计算环境选择面临的挑战,运用设计科学研究方法,通过社会技术视角构建评估框架,引入引力阱及其属性、社会技术需求等结构,经示例案例演示评估,推动了量子生态系统理论及实践指导发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14808 2026-07-17 math.NA cs.NA 新提交 50%

An unfitted boundary algebraic equation method with static-dynamic reduction for evolving implicit geometries

一种用于演化隐式几何的具有静态-动态约简的非拟合边界代数方程方法

Yizhen Huang, Qing Xia

专题命中 具身导航 :navigation(abstract)

AI总结 研究在移动界面模拟等中对演化边界区域重复椭圆求解效率低的问题,核心方法是为非拟合晶格格林函数方法开发静态-动态边界约简,主要贡献是实现并验证针对多种变化障碍物的更新策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 4 篇

2607.14180 2026-07-17 cs.LG cs.AI 新提交 81%

RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences

RENEW:迈向从偏好中学习世界模型并修复模型利用问题

Logan Mondal Bhamidipaty, Mykel Kochenderfer, Subramanian Ramamoorthy

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对世界模型在数据覆盖薄弱时易受模型利用问题,提出从人类反馈中学习动力学(DLHF),但朴素DLHF样本效率低,于是引入RENEW利用认知不确定性聚焦微调,经实验评估,RENEW提高样本效率等,为解决离线模型强化学习利用问题提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14187 2026-07-17 cs.AI cs.RO 新提交 62%

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型

Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI

AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14550 2026-07-17 cs.MA 新提交 50%

World-Model-Aware Responsibility Allocation in Heterogeneous Logistics Systems

异构物流系统中世界模型感知责任分配

Artan Markaj, Niklas Jobs, Felix Gehlhoff

专题命中 具身推理 :world model(abstract)

AI总结 研究异构物流系统中自主与非自主设备混合时的责任分配问题,提出世界模型感知责任框架WMARF,依模型质量和自动化水平动态分权限并分类死锁,通过模拟验证其有效性及随自主性提高仍有效的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14103 2026-07-17 cs.CL cs.MA 新提交 50%

Latent Communication Between Language Model Agents: Channels, Alignment, and the Limits of Text

语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性

Markus Wenzel

机构 * Constructor University(康斯坦丁大学)

专题命中 具身推理 :world model(abstract)

AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 5 篇

2607.15275 2026-07-17 cs.RO cs.AI cs.LG 新提交 75%

RoboTTT: Context Scaling for Robot Policies

RoboTTT:机器人策略的上下文扩展

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA(英伟达公司) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人基础模型 :manipulation(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。

Comments Project website: http://research.nvidia.com/labs/gear/robottt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14698 2026-07-17 cs.RO 新提交 70%

Lights, Camera, Malfunction: When Illumination Robustness Leaves VLA Models Blind to Color

灯光、相机、故障:当光照鲁棒性使视觉语言动作模型对颜色视而不见时

Marino Watanabe, Takami Sato, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究VLA模型在现实环境中对光照干扰的脆弱性,提出FLARE攻击框架和ChromaGuard对抗训练方法,通过实验验证ChromaGuard能有效提升模型在颜色相关任务中的成功率,保障模型在复杂环境下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交 67%

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14236 2026-07-17 cs.RO cs.AI cs.LG 新提交 67%

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化

Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Noematrix Ltd.(诺玛矩阵有限公司)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。

Comments Project page: https://lift-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏