arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-28 至 2026-05-28 共收录 92 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 16 篇

2605.27582 2026-05-28 cs.RO cs.CV 81%

Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation

Uni-LaViRA:面向统一具身导航的语言-视觉-机器人动作翻译

Hongyu Ding, Sizhuo Zhang, Ziming Xu, Jinwen Guo, Hongxiu Liu, Xingzhi Cheng, Zixuan Chen, Haifei Qi, Duo Wang, Hao Xu, Jieqi Shi, Yifan Zhang, Jing Huo, Jian Cheng, Yang Gao, Jiebo Luo

机构 * Nanjing University(南京大学) Beihang University(北京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) BMW (Nanjing) Information Technology Co., Ltd.(宝马(南京)信息技术有限公司) University of Rochester(罗切斯特大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 提出Uni-LaViRA统一智能体架构,通过语言-视觉-机器人动作翻译结构,结合待办列表记忆和二次机会回溯机制,在零训练下实现四类导航任务和四种真实机器人的零样本泛化,性能匹配或超越近期训练式导航基础模型。

Comments Project page: https://xetroubadour.github.io/Uni-LaViRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25770 2026-05-28 cs.RO 79%

Implicit Null-space Manifold Generation for Redundant Robotic Systems

冗余机器人系统的隐式零空间流形生成

Taiki Ishigaki, Teresa Vidal-Calleja, Ko Ayusawa, Eiichi Yoshida

机构 * Tokyo University of Science, Japan(日本东京科学大学) University of Technology Sydney, Australia(澳大利亚悉尼技术大学) National Institute of Advanced Industrial Science and Technology, Japan(日本国家先进工业科学与技术研究院)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO

AI总结 针对冗余机器人系统,提出一种基于雅可比引导探索的隐式标量场方法,通过零水平集表示解流形,实现解空间几何结构的有效估计与连续任务建模。

Comments Corrected author names in references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27464 2026-05-28 cs.CV cs.AI 73%

Beyond Motion Primitives: Behavioral Activity Recognition from Head-Mounted IMU

超越运动基元:基于头戴式IMU的行为活动识别

Chung-Ta Huang, Leopold Das, Jeffrey Zhou, Faizaan Siddique, Julia Seungjoo Baek, Serena Liu, Andrew Rusli, Todd Y. Zhou, Freddy Yu, Sinclair Hansen, Ziling Hu, Arnav Sharma, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛人工智能与机器人实验室,哈佛大学)

专题命中 具身导航 :robotics(abstract,abstract_cn);分类 cs.AI、cs.CV

AI总结 提出HiT-HAR层次模型,利用头戴式IMU数据实现行为级活动识别,超越传统运动基元,在五类动作和八类场景识别中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27909 2026-05-28 cs.RO 72%

S-Cheetah: A Novel Quadrupedal Robot with a 3-DOF Active Spine Learning Agile Locomotion

S-Cheetah:一种具有3自由度主动脊柱学习敏捷运动的新型四足机器人

Zimu Li, Weibang Bai

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 具身导航 :robotics(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出一种具有3自由度仿生主动脊柱的四足机器人S-Cheetah,并设计强化学习框架使其实现高速奔跑、原地转向及空中自翻等敏捷运动。

Comments Project website: https://himmy-robotics.github.io/scheetah

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13177 2026-05-28 cs.RO 72%

ROOM: A Physics-Based Continuum Robot Simulator for Photorealistic Medical Datasets Generation

ROOM: 基于物理的连续体机器人模拟器,用于生成逼真的医学数据集

Salvatore Esposito, Matías Mattamala, Daniel Rebain, Francis Xiatian Zhang, Kevin Dhaliwal, Mohsen Khadem, Subramanian Ramamoorthy

机构 * University of Edinburgh, UK(爱丁堡大学,英国) University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大)

专题命中 具身导航 :robotics(abstract,journal_ref);navigation(abstract);分类 cs.RO

AI总结 提出ROOM模拟框架,利用患者CT扫描生成多模态支气管镜训练数据,验证其在姿态估计和深度估计任务中的有效性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28172 2026-05-28 cs.RO 61%

Provably Guaranteed Polytopic Uncertainty Quantification for SLAM

具有可证明保证的多面体不确定性量化用于SLAM

Guangyang Zeng, Yulong Gao, Yuan Shen, Lingpeng Chen, Haoying Li, Guodong Shi, Junfeng Wu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳)) Department of Electrical and Electronic Engineering, Imperial College London(电子与电气工程系,帝国理工学院伦敦分校) School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(航空航天、机械与机电工程学院,悉尼大学)

专题命中 具身导航 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出基于多面体表示的不确定性量化算法,通过前向映射、后向位姿跟踪和位姿复合三个模块,为3D-3D路标SLAM提供可证明的确定性保证,并结合共形预测提高实用性。

Comments 16 pages, 10 figures; accepted by Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28607 2026-05-28 cs.AI cs.CL 57%

Adaptive Multimodal Agents-Based Framework for Automatic Workflow Execution

基于自适应多智能体框架的自动工作流执行

Susanna Cifani, Mario Luca Bernardi, Marta Cimitile

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Department of Engineering University of Sannio(萨尼奥大学工程系) Faculty of Jurisprudence Unitelma Sapienza University(法理学院萨皮恩扎大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 提出一种多模态多智能体框架,通过离线构建拓扑知识库和在线自适应检索增强生成与闭环协作验证,实现自动工作流执行。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses. Accepted for publication at the 2026 IEEE International Conference on Evolving and Adaptive Intelligent Systems (EAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28454 2026-05-28 cs.AI 57%

GONDOR to the Rescue: Satisficing Planning with Low Memory

GONDOR 救援:低内存下的满意规划

Yonatan Vernik, Alexander Tuisov, Alexander Shleyfman

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系) Independent Researcher(独立研究员)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 提出 GONDOR 算法,通过周期压缩搜索树并保留稀疏锚点状态,在严格内存限制下扩展 GBFS,实现低内存预算下的满意规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28254 2026-05-28 cs.RO cs.SY eess.SY math.DS 57%

Natural Locomotion: Principle and Method

自然运动:原理与方法

Mirado Mortel, Luc Jaulin, Lionel Lapierre, Simon Rohou

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出自然运动作为系统与环境约束或相互作用介导的运动交换原理,通过构建自然运动流形(NLM)并采用闭/开构造方法,在理想非完整无滑移系统上验证了该原理。

Comments Preprint. 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28046 2026-05-28 cs.AI cs.CL 57%

MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents

MemCog: 从记忆即工具到记忆即认知的对话代理

Zihan Li, Xingyu Fan, Feifei Li, Wenhui Que

机构 * WeChat, Tencent Inc.(腾讯公司)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 提出MemCog系统,通过可导航记忆存储、跨维度导航接口和主动推理协议,将记忆访问融入推理过程,在被动问答和主动记忆触发基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20480 2026-05-28 cs.RO 57%

Degradation-Aware Cooperative Multi-Modal GNSS-Denied Localization Leveraging LiDAR-Based Robot Detections

基于激光雷达机器人检测的退化感知协同多模态GNSS拒止定位

Václav Pritzl, Xianjia Yu, Tomi Westerlund, Petr Štěpán, Martin Saska

机构 * Multi-robot Systems Group, Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克技术大学电气工程学院控制学系多机器人系统组) Turku Intelligent Embedded and Robotic Systems (TIERS) Lab, University of Turku(图尔库大学智能嵌入式与机器人系统实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出一种因子图框架下的自适应多模态多机器人协同定位方法,融合异步VIO、LIO和3D机器人间检测,通过插值因子和Wasserstein距离加权处理传感器退化,显著提升定位精度。

Comments Preprint version. This work has been submitted to Elsevier for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07299 2026-05-28 stat.AP 56%

Cauchy-Gaussian Overbound for Heavy-tailed GNSS Measurement Errors

重尾GNSS测量误差的柯西-高斯过界

Zhengdao Li, Penggao Yan, Weisong Wen, Li-Ta Hsu

专题命中 具身导航 :navigation(abstract,comments)

AI总结 针对重尾GNSS测量误差,提出结合柯西分布核心与高斯分布尾部的过界方法,通过卷积保持过界性质,在位置域将垂直保护水平降低15%-47%。

Comments Published in NAVIGATION: Journal of the Institute of Navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24352 2026-05-28 cs.NI cs.SY eess.SY 50%

Data-Driven Adaptive Resource Allocation for Reliable Low-Latency Uplink Communications in Rural Cellular 5G Multi-Connectivity

数据驱动的自适应资源分配:面向农村蜂窝5G多连接的可靠低延迟上行通信

Carlos S. Alvarez-Merino, Alejandro Ramirez-Arroyo, Rasmus Suhr Mogensen, Morten V. Pedersen, Miguel Villanueva-Fernández, Emil J. Khatib, Sergio Fortes, Raquel Barco, Preben E. Mogensen

专题命中 具身导航 :navigation(abstract)

AI总结 针对农村5G上行通信中资源受限和功率控制导致的延迟与可靠性问题,提出基于测量数据的主锚自适应故障切换(PAAF)框架,通过选择性冗余激活实现低开销的可靠通信。

Journal ref IEEE Open Journal of the Communications Society; 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07161 2026-05-28 math.HO 50%

Blues for Alice: The Interplay of Neo-Riemannian and Cadential Viewpoints

Blues for Alice: 新里曼与终止式观点的相互作用

Octavio A. Agustín-Aquino

专题命中 具身导航 :navigation(abstract)

AI总结 通过PLRQ群推广Mazzola的终止集合理论至四音和声,揭示终止集合之间的棱镜结构,并分析Charlie Parker和Ray Noble的作品展示比波普中的和声导航。

Comments Second major revision

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 7 篇

2605.28816 2026-05-28 cs.CV 83%

Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

Gamma-World: 超越双玩家的生成式多智能体世界建模

Fangfu Liu, Kai He, Tianchang Shen, Tianshi Cao, Sanja Fidler, Yueqi Duan, Jun Gao, Igor Gilitschenski, Zian Wang, Xuanchi Ren

机构 * NVIDIA Tsinghua University(清华大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.CV

AI总结 提出一种生成式多智能体世界模型,通过Simplex Rotary Agent Encoding实现智能体置换等价性,并采用Sparse Hub Attention降低跨智能体注意力成本,支持多玩家交互视频生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/gamma-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28317 2026-05-28 cs.LG cs.AI cs.NA math.NA physics.comp-ph 81%

Hybrid Neural World Models

混合神经世界模型

Pranav Lakshmanan, Paras Chopra

机构 * Lossfunk

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出混合神经世界模型,通过单网络连续视界条件训练直接预测未来状态,并利用误差图隐式捕捉不连续性,实现高效且可靠的物理动力学模拟。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28810 2026-05-28 cs.LG cs.IR cs.SD 79%

Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization

情感音乐推荐:基于展开世界模型的离线偏好优化

Audrey Chan, Aaron Labbé, Jacob Lavoie, Jordan Bannister, Arsène Fansi Tchango, Guillaume Lajoie, Laurent Charlin

机构 * LUCID Inc. Toronto Canada LUCID Inc. Montr\' e al Canada Mila --- Qu\' e bec AI Institute Montr\' e al Canada LUCID Inc. Mila --- Qu\' e bec AI Institute

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 针对在线情感实验受伦理限制的问题,提出基于展开世界模型的情感音乐推荐系统AMRS,利用因果Transformer预测用户情感状态,并通过离线偏好优化提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28277 2026-05-28 cs.AI 79%

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

LLMs 是否从文本构建世界模型?多语言空间推理诊断

Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao

机构 * University of New South Wales(新南威尔士大学) Essential Energy University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 通过多语言诊断基准 MentalMap 评估大语言模型的空间推理能力,发现所有模型在视角推理上存在普遍的性能瓶颈(L3 推理悬崖),表明该限制源于纯文本工作记忆约束而非特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18137 2026-05-28 cs.CV 79%

Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving

小米自动驾驶世界模型:一个融合重建与生成的联合世界模型

Lijun Zhou, Hongcheng Luo, Zhenxin Zhu, Cheng Chi, Mingfei Tu, Kaixin Xiong, Lei Gong, Zhanqian Wu, Zehan Zhang, Fangzhen Li, Hao Li, Yingying Shen, Jiale He, Haohui Zhu, Shan Zhao, Kai Wang, Zhiwei Zhan, Yuechuan Pu, Kaiyuan Tan, Ruiling Yang, Xianqi Wang, Tianyi Yan, Jiawei Zhou, Lei Zhang, Jingyang Zhao, Xi Zhou, Chitian Sun, Chenming Wu, Jiong Deng, Hongwei Xie, Ming Lu, Kun Ma, Long Chen, Guang Chen, Hangjun Ye, Bing Wang, Haiyang Sun

机构 * Xiaomi(小米)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出一个统一技术系统,通过稀疏场景查询驱动的重建模块WorldRec和两阶段训练框架WorldGen,实现高保真3D场景表示与高质量因果视频生成,并联合优化以提升生成稳定性、跨帧一致性和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28111 2026-05-28 cs.LG 79%

Chreode: A Cell World Model for One-Step Temporal Dynamics and Perturbation Prediction

Chreode: 用于一步时间动态和扰动预测的细胞世界模型

Mufan Qiu, Genhui Zheng, Yinuo Xu, Ruichen Zhang, Ying Ding, Qi Long, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出Chreode,一种基于结构化残差转移算子的单步细胞世界模型,通过预训练和微调实现发育轨迹与扰动预测的统一,在多个基准上取得性能提升。

Comments 25 pages, 3 figures, 14 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28144 2026-05-28 cs.AI 57%

Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning

解构空间复杂性:用于LLM空间推理的层次分解

Yi Wang, Haojie Lu, Zhaofan Zhang, Li Chen, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身推理 :navigation(abstract);分类 cs.AI

AI总结 提出一种层次任务分解方法,结合MCTS引导的组相对策略优化(M-GRPO),通过改进中间状态选择和规划能力,显著提升LLM在导航、规划和策略游戏等空间任务中的表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 8 篇

2605.27817 2026-05-28 cs.RO cs.AI cs.CV cs.LG 84%

Turning Video Models into Generalist Robot Policies

将视频模型转化为通用机器人策略

Sizhe Lester Li, Evan Kim, Xingjian Bai, Tong Zhao, Tao Pang, Max Simchowitz, Vincent Sitzmann

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学) Amazon FAR(亚马逊公司)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);world model(abstract);robot foundation model(abstract)

AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。

Comments project page: https://vera.csail.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28726 2026-05-28 cs.RO cs.LG 62%

How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures

VLA如何以不同方式失败:黑盒动作监控揭示架构特定的失败特征

Krishnam Gupta

机构 * Independent Research(独立研究)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文通过黑盒动作监控发现,视觉-语言-动作(VLA)架构在电机指令层面以根本不同且可预测的方式失败,并证明架构匹配的监控器选择至关重要。

Comments Accepted at IEEE ICRA 2026 Workshop "From Data to Decisions: VLA Pipelines for Real Robots", Vienna, June 2026. Non-archival workshop. 5 pages, 2 figures, 22 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03668 2026-05-28 cs.RO cs.CV 62%

MVP-LAM: Learning Action-Centric Latent Action via Cross-Viewpoint Reconstruction

MVP-LAM:通过跨视角重建学习以动作为中心的潜在动作

Jung Min Lee, Dohyeok Lee, Seokhun Ju, Taehyun Cho, Jin Woo Koo, Li Zhao, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University, Seoul, South Korea(首尔国立大学,首尔,韩国) Konkuk University, Seoul, South Korea(韩国konkuk大学,首尔,韩国) Microsoft Research Asia, Beijing, China(微软亚洲研究院,北京,中国) HodooAI Labs, Seoul, South Korea(HodooAI实验室,首尔,韩国)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出MVP-LAM模型,利用多视角视频通过跨视角重建目标学习与真实动作高度相关的潜在动作,提升动作预测和下游操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21046 2026-05-28 cs.CV cs.RO 62%

CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification

CogVLA: 通过指令驱动路由与稀疏化实现认知对齐的视觉-语言-动作模型

Wei Li, Renshan Zhang, Rui Shao, Jie He, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出CogVLA框架,通过指令驱动路由和稀疏化机制,在LIBERO基准和真实机器人任务上以2.5倍训练成本降低和2.8倍推理延迟降低实现97.4%和70.0%的成功率。

Comments Accepted to NeurIPS 2025, Project Page: https://jiutian-vl.github.io/CogVLA-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28527 2026-05-28 cs.RO 57%

What Frozen VLAs Already Know About Success: A Probing Study of Value-Like Structure in Foundation Robot Policies

冻结的VLA已经知道关于成功的信息:对基础机器人策略中价值类结构的探测研究

Jiachen Zhang, Junnan Nie, Junyi Lao, Wei Cheng, Chenghao Liu, Jiaxin Jiang, Songfang Huang

机构 * Peking University(北京大学) China Agricultural University(中国农业大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 通过线性探测从冻结的VLA特征中预测蒙特卡洛结果目标,发现其编码了成功信息,并可用于测试时动作选择提升成功率。

Comments 14 pages, 1 figure, 11 tables. Equal contribution: Jiachen Zhang, Junnan Nie, and Junyi Lao. Corresponding author: Songfang Huang. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28083 2026-05-28 cs.CV 57%

VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking

VLA-Hijack: 通过视觉本体感觉劫持实现针对视觉-语言-动作模型的可迁移补丁攻击

Jiyuan Fu, Kaixun Jiang, Jingkai Jia, Zhaoyu Chen, Xueyao Chen, Lingyi Hong, Shuyong Gao, Chenzhi Tan, Dingkang Yang, Wenqiang Zhang

机构 * Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.CV

AI总结 提出VLA-Hijack框架,通过注意力引导的本体感觉抑制和多模态本体感觉注入攻击视觉自定位过程,实现跨架构黑盒迁移攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27461 2026-05-28 cs.RO 57%

A Factory-Floor Deployment Case Study of VLA Pipelines for Industrial Packaging Task: Workflow, Failures, and Lessons

工业包装任务的VLA流水线工厂部署案例研究:工作流、故障与经验教训

Brian Zhu, Philipp Schmitt, Philine Meister, Lukas Gensler, Momen Khalil, Emmanuele Poggi, Johannes Hechtl, Carsten Braunroth, Kai Wurm, Gokul Narayanan, Eugen Solowjow, Georg von Wichert, Andre Scholz, Felix Albrecht, Maxmillian Metzner

机构 * Siemens Corporation(西门子公司)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本研究通过在西门子工厂部署预训练Pi0.5策略执行工业包装任务,迭代微调并收集2535个现场数据片段,总结了VLA流水线部署中的常见故障模式与改进工作流的经验教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05378 2026-05-28 cs.CL cs.CV 57%

ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving

ICR-Drive:面向端到端语言驱动自动驾驶的指令反事实鲁棒性

Kaiser Hamid, Can Cui, Nade Liang

机构 * Texas Tech University(德克萨斯科技大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))

专题命中 机器人基础模型 :navigation(abstract);分类 cs.CV

AI总结 提出ICR-Drive框架,通过生成四类扰动指令(改写、歧义、噪声、误导)并基于CARLA仿真评估,揭示语言条件驾驶模型对指令变化的脆弱性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 872-880

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 6 篇

2605.08758 2026-05-28 cs.RO cs.AI math.OC 81%

Omni-scale Learning-based Sequential Decision Framework for Order Fulfillment of Tote-handling Robotic Systems

基于全尺度学习的料箱搬运机器人系统订单履行序贯决策框架

Jiaxin Liu, Peng Yang, Yuping Li, Xinyue Xie

机构 * Institution of Data and Information, Shenzhen International Graduate School, Tsinghua University, Nanshan District, Shenzhen 518055, China(数据与信息研究所,深圳国际研究生院,清华大学,南山区,深圳518055,中国)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 针对料箱搬运机器人系统的订单履行决策,提出一种结合结构化组合优化与多智能体强化学习的通用可扩展序贯决策框架OLSF-TRS,在小规模系统上平均最优性差距低于3.5%,在大规模场景中相比启发式基线减少8-12%的料箱移动,并保持实时响应。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏