arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-24 至 2026-03-24 共收录 135 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 32 篇

2603.20679 2026-03-24 cs.RO 77%

Enhancing Vision-Based Policies with Omni-View and Cross-Modality Knowledge Distillation for Mobile Robots

通过多视角与跨模态知识蒸馏增强基于视觉的策略用于移动机器人

Kai Li, Shiyu Zhao

机构 * College of Computer Science and Technology at Zhejiang University(浙江大学计算机科学与技术学院) School of Engineering at Westlake University(西湖大学工程学院)

专题命中 具身导航 :robotics(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出通过多视角和跨模态知识蒸馏提升移动机器人基于视觉的策略,解决场景迁移性差、计算资源有限和传感器成本高等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21523 2026-03-24 cs.RO cs.AI 73%

SafePilot: A Framework for Assuring LLM-enabled Cyber-Physical Systems

SafePilot: 一种确保基于大语言模型的嵌入式物理系统框架

Weizhe Xu, Mengyu Liu, Fanxin Kong

机构 * University of Notre Dame(诺克斯维尔大学) Washington State University(华盛顿州立大学)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SafePilot框架,通过层级神经符号方法确保基于大语言模型的嵌入式物理系统安全性,通过任务复杂度评估和分治策略,结合形式化验证提升任务规划可靠性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10744 2026-03-24 cs.AI cs.CV 73%

Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration

探索与长期记忆:一个基准和基于多模态LLM的强化学习框架用于具身探索

Sen Wang, Bangwei Liu, Zhenkun Gao, Lizhuang Ma, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身导航 :embodied agent(abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出LMEE框架,通过多模态LLM强化学习促进终身学习,构建LMEE-Bench基准评估具身探索过程与结果,采用MemoryExplorer方法提升记忆检索与主动探索能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10878 2026-03-24 cs.RO 70%

RL-Augmented MPC for Non-Gaited Legged and Hybrid Locomotion

强化学习增强的MPC用于非步态腿部和混合运动

Andrea Patrizi, Carlo Rizzardo, Arturo Laurenzi, Francesco Ruscelli, Luca Rossini, Nikos G. Tsagarakis

机构 * Humanoids and Human-Centred Mechatronics (HHCM) lab, Istituto Italiano di Tecnologia (IIT)(人机协同机电一体化实验室,意大利技术研究院)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种结合强化学习和模型预测控制的分层架构,通过模拟中学习无环步态实现接触时间的卸载,验证了在不同机器人平台上的有效性及非平坦地形的扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13733 2026-03-24 cs.RO cs.AI cs.LG 69%

Implicit Maximum Likelihood Estimation for Real-time Generative Model Predictive Control

隐式最大似然估计用于实时生成模型预测控制

Grayson Lee, Minh Bui, Shuzi Zhou, Yankai Li, Mo Chen, Ke Li

机构 * School of Computing Science, Simon Fraser University(计算科学系,西蒙弗雷泽大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 本文提出隐式最大似然估计(IMLE)作为生成模型的替代方法,实现快速推理和强模式覆盖,适用于实时MPC任务。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21987 2026-03-24 cs.CV cs.AI 62%

LRC-WeatherNet: LiDAR, RADAR, and Camera Fusion Network for Real-time Weather-type Classification in Autonomous Driving

LRC-WeatherNet:用于自动驾驶中实时天气类型分类的激光雷达、雷达和摄像头融合网络

Nour Alhuda Albashir, Lars Pernickel, Danial Hamoud, Idriss Gouigah, Eren Erdal Aksoy

机构 * Halmstad University, School of Information Technology, Center for Applied Intelligent Systems Research(哈姆斯塔德大学,信息科技学院,应用智能系统研究中心)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出LRC-WeatherNet,通过融合激光雷达、雷达和摄像头数据,实现在恶劣天气下的实时天气分类,优于单一传感器基线,且在MSU-4S数据集上表现优异。

Comments Accepted for publication at IEEE Intelligent Vehicles Symposium - IVS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21565 2026-03-24 cs.CV cs.AI 62%

Rethinking SAR ATR: A Target-Aware Frequency-Spatial Enhancement Framework with Noise-Resilient Knowledge Guidance

重新思考SAR ATR:一种具有噪声鲁棒知识引导的靶向频率-空间增强框架

Yansong Lin, Zihan Cheng, Jielei Wang, Guoming Lua, Zongyong Cui

机构 * the Institute of Intelligent Computing, University of Electronic Science and Technology of China (UESTC)(智能计算研究院,电子科技大学) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 ubiquitous 智能与可信服务重点实验室) the School of Information and Communication Engineering, University of Electronic Science and Technology of China (UESTC)(信息与通信工程学院,电子科技大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出FSCE框架,通过频率-空间浅特征自适应增强模块和教师-学生学习范式提升SAR目标识别的鲁棒性,实验表明DSAFNet-L在多个数据集上表现优异,DSAFNet-M在保持精度的同时降低模型复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21774 2026-03-24 cs.RO 61%

Memory-Efficient Boundary Map for Large-Scale Occupancy Grid Mapping

高效内存边界图用于大规模占用网格映射

Benxu Tang, Yunfan Ren, Yixi Cai, Fanze Kong, Wenyi Liu, Fangcheng Zhu, Longji Yin, Liuyu Shi, Fu Zhang

机构 * Mechatronics and Robotic Systems (MaRS) Laboratory, Department of Mechanical Engineering, The University of Hong Kong, Hong Kong SAR, China(机械电子与机器人系统实验室,机械工程系,香港大学,香港特别行政区,中国) Department of Robotics, Perception, and Learning, KTH Royal Institute of Technology, Stockholm, Sweden(机器人、感知与学习系,皇家理工学院,斯德哥尔摩,瑞典)

专题命中 具身导航 :robotic(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出一种高效内存边界图方法,通过仅维护映射体积的边界来减少内存消耗,并设计了新的数据结构支持高效查询。

Journal ref Benxu Tang, et al. The International Journal of Robotics Research, published online 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21943 2026-03-24 cs.CV 57%

GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Prediction

GeoFlow:通过迭代流预测实现实时细粒度跨视角地理定位

Ayesh Abu Lehyeh, Xiaohan Zhang, Ahmad Arrabi, Waqas Sultani, Chen Chen, Safwan Wshah

机构 * Vermont Artificial Intelligence Lab, Department of Computer Science, University of Vermont(佛蒙特人工智能实验室,计算机科学系,佛蒙特大学) Intelligent Machines Lab, Information Technology University(智能机器实验室,信息科技大学) Institute of Artificial Intelligence, University of Central Florida(人工智能研究所,佛罗里达中央大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出GeoFlow,通过迭代流预测实现实时细粒度跨视角地理定位,解决了高精度与实时性的平衡问题,实验显示其在KITTI和VIGOR数据集上达到实时29FPS且保持高精度。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20066 2026-03-24 cs.CV 57%

PAUL: Uncertainty-Guided Partition and Augmentation for Robust Cross-View Geo-Localization under Noisy Correspondence

PAUL:基于不确定性的分区与增强以实现在噪声对应下的鲁棒跨视图地理定位

Zheng Li, Xueyi Zhang, Yanming Guo, Yuxiang Xie, Ding Zhaoyun, Siqi Cai, Haizhou Li, Mingrui Lao

机构 * National University of Defense Technology(国防科技大学) Shenzhen Loop Area Institute(深圳河套学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出PAUL框架,通过不确定性感知的共增强和证据共训练,解决跨视图地理定位中的噪声对应问题,提升鲁棒性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02064 2026-03-24 q-bio.NC cs.AI 57%

REMI: Reconstructing Episodic Memory During Internally Driven Path Planning

REMI:在内部驱动路径规划中重建情景记忆

Zhaoze Wang, Genela Morris, Dori Derdikman, Pratik Chaudhari, Vijay Balasubramanian

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文提出了一种MEC-HC连接理论,解释了网格细胞和位置细胞如何通过相互作用支持空间编码和内部驱动路径规划,如通过线索导航到记忆中的地点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15453 2026-03-24 eess.SY cs.RO cs.SY 57%

Barrier-Riccati Synthesis for Nonlinear Safe Control with Expanded Region of Attraction

非线性安全控制的屏障-里茨合成:扩展吸引区域

Hassan Almubarak, Maitham F. AL-Sunni, Justin T. Dubbin, Nader Sadegh, John M. Dolan, Evangelos A. Theodorou

机构 * Control & Instrumentation Engineering Department, King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学控制与仪器工程系) Department of Electrical & Computer Engineering(电气与计算机工程系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Daniel Guggenheim School of Aerospace Engineering(丹尼尔·古根海姆航空航天工程学院) George W. Woodruff School of Mechanical Engineering(乔治·W·伍德鲁夫机械工程学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种基于里茨的非线性安全控制框架,结合屏障状态方法与状态依赖里茨方程方法,通过辅助状态嵌入安全约束,扩展吸引区域并保证渐近安全稳定。

Comments This work has been accepted for publication in the proceedings of the 2026 American Control Conference (ACC), New Orleans, Louisiana, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20443 2026-03-24 cs.RO 57%

TRGS-SLAM: IMU-Aided Gaussian Splatting SLAM for Blurry, Rolling Shutter, and Noisy Thermal Images

TRGS-SLAM:基于IMU的高斯点云SLAM用于模糊、滚动快门和噪声热图像

Spencer Carmichael, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出TRGS-SLAM,一种基于3DGS的热惯性SLAM系统,能处理热图像中的模糊、滚动快门和噪声问题,通过改进的3DGS渲染方法和创新技术实现高精度跟踪。

Comments Project page: https://umautobots.github.io/trgs_slam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20336 2026-03-24 cs.IR cs.AI cs.DB 57%

GEM: A Native Graph-based Index for Multi-Vector Retrieval

GEM:一种基于图的多向量检索索引

Yao Tian, Zhoujin Tian, Xi Zhao, Ruiyuan Zhang, Xiaofang Zhou

机构 * The Hong Kong University of \ Hong Kong Generative AI Research \& Development Center Hong Kong China The Hong Kong University of Science Hong Kong Generative AI Research \& Development Center

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 GEM提出一种针对多向量表示的原生索引框架,通过构建向量集的接近图,保留细粒度语义并实现高效导航,提升检索效率和准确性。

Comments This paper has been accepted by SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22133 2026-03-24 cs.CY 50%

Navigational Thinking as an Emerging Paradigm of Computer Science in the Age of Generative AI

导航思维作为生成AI时代计算机科学的一种新兴范式

Ilya Levin

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出导航思维是生成AI时代知识生产的新模式,通过高维流形几何导航实现意义生成,挑战传统符号化认知方式。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21514 2026-03-24 cs.DB 50%

I/O Optimizations for Graph-Based Disk-Resident Approximate Nearest Neighbor Search: A Design Space Exploration

基于磁盘的近似最近邻搜索的I/O优化:设计空间探索

Liang Li, Shufeng Gong, Yanan Yang, Yiduo Wang, Jie Wu

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出一个以I/O为导向的框架,通过内存布局、磁盘布局和搜索算法三个维度优化磁盘基于的近似最近邻搜索,提出页面级复杂度模型并验证其有效性,最终提出OctopusANN系统在I/O和吞吐量上优于现有系统。

Journal ref Liang Li, Shufeng Gong, Yanan Yang, Yiduo Wang, and Jie Wu. I/O Optimizations for Graph-Based Disk-Resident Approximate Nearest Neighbor Search: A Design Space Exploration. PVLDB, 19(7): 1484 - 1498,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20259 2026-03-24 eess.SY cs.SY math.PR 50%

Polynomial Updates for the Unscented Kalman Filter

多项式更新用于无迹卡尔曼滤波

Chiran Cherian, Simone Servadio

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出基于多项式近似的多项式无迹卡尔曼滤波,通过Conjugate Unscented Transformation提升状态估计精度和协方差一致性。

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 9 篇

2601.21998 2026-03-24 cs.CV cs.RO 86%

Causal World Modeling for Robot Control

机器人控制中的因果世界建模

Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

专题命中 具身推理 :world model(title,abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LingBot-VA框架,通过视频世界建模与视觉语言预训练结合,实现机器人学习的新基础。模型包含共享潜在空间、闭环回滚机制和异步推理流程,提升了长周期操作和数据效率。

Comments Project page: https://technology.robbyant.com/lingbot-va Code: https://github.com/robbyant/lingbot-va

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22286 2026-03-24 cs.CV cs.AI cs.CL cs.LG 82%

WorldCache: Content-Aware Caching for Accelerated Video World Models

WorldCache: 用于加速视频世界模型的内容感知缓存

Umair Nawaz, Ahmed Heakl, Ufaq Khan, Abdelrahman Shaker, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 WorldCache通过引入运动自适应阈值、显著性加权漂移估计和最优近似方法,实现动态场景下的高效特征重用,提升推理速度并保持高质量。

Comments 33 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13340 2026-03-24 cs.RO cs.AI cs.LG 82%

Latent Policy Steering with Embodiment-Agnostic Pretrained World Models

基于世界模型的潜在策略引导

Yiqi Wang, Mrinal Verghese, Jeff Schneider

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(机器人研究所、计算机科学学院、卡内基梅隆大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文通过预训练世界模型和优化价值函数,提升低数据场景下的视觉运动策略性能,采用光流作为动作表示,实现跨体素的策略优化,实验显示在机器人任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21546 2026-03-24 cs.LG cs.AI 82%

What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulators

世界模型在强化学习中学习了什么?在学习的环境模拟器中探测潜在表示

Xinyu Zhang

机构 * Anyscale

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过线性与非线性探针、因果干预和注意力分析,探讨了IRIS和DIAMOND两种架构的世界模型对游戏状态的内部表示,发现其具有近似线性的结构化表示。

Comments 5 pages, 3 figures, 1 table

Journal ref ICLR 2026 the 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV 81%

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21557 2026-03-24 cs.CV 79%

From Part to Whole: 3D Generative World Model with an Adaptive Structural Hierarchy

从部分到整体:具有自适应结构层次的3D生成世界模型

Bi'an Du, Daizong Liu, Pufan Li, Wei Hu

机构 * Wangxuan Institute of \ Technology, Peking University Beijing, China Institute for Math \& AI, Wuhan University Wuhan, China

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出了一种自适应部分-整体层次的3D生成世界模型,通过直接从图像令牌推断出软且组合性的掩码,自主发现潜在结构槽,实现跨类别的形状共享和去噪。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21340 2026-03-24 cs.AI cs.DC 79%

ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture

ARYA:一种受物理约束的可组合且确定性世界模型架构

Seth Dobrin, Lukasz Chmiel

机构 * ARYA Labs(ARYA实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21315 2026-03-24 cs.LG 79%

FluidWorld: Reaction-Diffusion Dynamics as a Predictive Substrate for World Models

FluidWorld: 反应-扩散动力学作为世界模型的预测性基质

Fabien Polly

机构 * Independent Researcher(独立研究者)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出FluidWorld,通过反应-扩散型偏微分方程实现世界模型预测,对比Transformer和ConvLSTM基线,展示PDE在参数效率和空间结构保留上的优势。

Comments 18 pages, 16 figures, 4 tables. Code available at https://github.com/infinition/FluidWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21017 2026-03-24 cs.RO 79%

Dreaming the Unseen: World Model-regularized Diffusion Policy for Out-of-Distribution Robustness

梦见未见:用于分布外鲁棒性的世界模型正则化扩散策略

Ziou Hu, Xiangtong Yao, Yuan Meng, Zhenshan Bing, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) the School of Science and Technology, Nanjing University (Suzhou Campus), China(南京大学苏州校区科学技术学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 本文提出Dream Diffusion Policy,通过整合世界模型提升扩散策略在分布外扰动下的鲁棒性,实验显示其在MetaWorld和现实场景中表现优异。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2603.22280 2026-03-24 cs.CV cs.RO 62%

DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models

DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型

Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong, Guanyi Zhao, Yingjie Cai, Jiantao Gao, Xu Yan, Bingbing Liu, Yingcong Chen, Liuqing Yang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01571 2026-03-24 cs.CV cs.RO 62%

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

PixelVLA:推进视觉-语言-动作模型中的像素级理解

Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong

机构 * University of Trento(特伦托大学) School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Australian National University(澳大利亚国立大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 PixelVLA通过引入多尺度像素感知编码器和视觉提示感知编码器,提升视觉-语言-动作模型的像素级理解和多模态提示能力,在三个基准和两个模型变体中提升了10.1%-28.7%的操控成功率。

Comments 17pages,7 figures, 5 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 8 篇

2603.20607 2026-03-24 cs.RO cs.LG 84%

Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models

面向视觉-语言-动作模型的实用世界模型强化学习

Zhilong Zhang, Haoxiang Ren, Yihao Sun, Yifei Sheng, Haonan Wang, Haoxin Lin, Zhichao Wu, Pierre-Luc Bacon, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 模仿学习与强化学习 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出VLA-MBPO框架,解决视觉-语言-动作模型在强化学习中的世界建模、多视角一致性及稀疏奖励下的误差累积问题,提升策略性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21134 2026-03-24 cs.RO cs.CV 81%

Anatomical Prior-Driven Framework for Autonomous Robotic Cardiac Ultrasound Standard View Acquisition

基于解剖先验的自主机器人心脏超声标准视图采集框架

Zhiyan Cao, Zhengxi Wu, Yiwei Wang, Pei-Hsuan Lin, Li Zhang, Zhen Xie, Huan Zhao, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) School of Biomedical Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)生物医学工程学院) Information Intelligence Lab, Department of Electrical Engineering, National Chung Hsing University(中原大学电子工程系信息智能实验室) Institute of Medical Equipment Science and Engineering, Huazhong University of Science and Technology(华中科技大学医学装备科学与工程研究院) Department of Ultrasound Medicine, Union Hospital, Tongji Medical College, Huazhong University of Science and Technology(华中科技大学同济医学院附属同济医院超声医学科) Institute of Systems Science (ISS), National University of Singapore (NUS)(新加坡国立大学系统科学研究所)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出结合心脏结构分割与自主探头调整的框架,通过解剖先验引导提升超声标准视图采集的自动化水平,实验表明其在分割精度和探头调整成功率上均有显著提升。

Comments Accepted for publication at the IEEE ICRA 2026. 8 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏