arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 534 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 534 篇

2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交 62%

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00832 2026-07-07 cs.CV cs.AI 新提交 62%

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences

Pano2World: 通过统一多视图序列进行端到端三维生成

Zhenjia Li, Jinrang Jia, Yifeng Shi

机构 * Ke Holdings Inc.(贝壳找房)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出Pano2World方法,利用全景扩散模型和视图感知注意力路由,从单张室内全景图直接生成可探索的三维高斯场景,解决多步管道误差累积和视频模型灵活性不足的问题。

Comments 10 pages, 3 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00065 2026-07-02 cs.RO cs.AI 新提交 62%

Optimal any-angle path planning in static and dynamic environments

静态与动态环境中的最优任意角度路径规划

Yiyuan Zou, Clark Borst

机构 * Faculty of Aerospace Engineering, Delft University of Technology(航空航天工程学院,代尔夫特理工大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出椭圆前向扩展和视野技术加速最优任意角度路径规划,开发Zeta*和Zeta*-SIPP算法,在静态和动态环境中保持最优性,速度提升20倍以上。

Comments 33 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31216 2026-07-01 cs.RO cs.AI 新提交 62%

Information-Aided DVL Calibration

信息辅助的DVL标定

Zeev Yampolsky, Itzik Klein

机构 * The Hatter Department of Marine Technologies Charney School of Marine Sciences, University of Haifa(海法大学查尼海洋科学学院哈特海洋技术系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 针对DVL在GNSS不可用环境下无法标定的问题,提出信息辅助标定方法,在GNSS可用环境下提升精度,在无GNSS环境下实现自标定,实验显示速度估计平均提升20%和35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26383 2026-06-26 cs.LG cs.AI cs.AR cs.MA cs.PF 新提交 62%

SOLAR: AI-Powered Speed-of-Light Performance Analysis

SOLAR: AI驱动的光速性能分析

Qijing Huang, Sana Damani, Zhifan Ye, Athinagoras Skiadopoulos, Siva Kumar Sastry Hari, Jason Clemons, Sahil Modi, Jingquan Wang, Aditya Kane, Edward C Lin, Humphrey Shi, Christos Kozyrakis

机构 * NVIDIA(英伟达)

专题命中 具身导航 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出SOLAR框架,自动从PyTorch和JAX代码推导理论最小执行时间(光速界限),通过LLM前端和确定性分析实现无违反界限的多保真度性能分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25366 2026-06-25 cs.RO cs.AI 新提交 62%

Reliability-Asymmetric Spacecraft Autonomy: Co-Designing a Capable Learned GNC Stack with a Verified, Adaptation-Aware Runtime Shield

非对称可靠性航天器自主性:协同设计有能力的学得制导导航控制系统与经过验证的、适应感知的运行时防护盾

Alireza Shojaei

机构 * Myers-Lawson School of Construction, Virginia Tech(弗吉尼亚理工大学迈尔斯-劳森建筑学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出AMPLE-GNC三层制导导航控制系统,结合学得组件与运行时防护盾,实现深空任务自主性的能力与可认证性;通过边缘指挥官、故障自适应控制器和适应感知恢复证书,在仿真中验证了高自主性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24712 2026-06-24 cs.RO cs.AI 新提交 62%

TACTFUL: Tactile-Driven Exploration For Object Localization and Identification in Confined Environments

TACTFUL: 受限环境中的触觉驱动探索用于物体定位与识别

Shivani Kamtikar, Chung Hee Kim, Camilla Tabasso, Tye Brady, Joshua Migdal, Taskin Padir

机构 * Amazon Fulfillment Technologies & Robotics(亚马逊履约技术与机器人) Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校西贝尔计算与数据科学学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出无视觉触觉探索框架TACTFUL,使多指机器人通过动态奖励策略平衡全局探索与局部表面细化,实现物体自主发现与识别,平均重建误差0.015米,成功率77%。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19920 2026-06-19 cs.RO cs.LG cs.MA 新提交 62%

Deep-Unfolded Coordination

深度展开协调

Hunter Kuperman, Minchan Jung, Rahul V. Ghosh, Alex Oshin, Evangelos A. Theodorou

机构 * Autonomous Control and Decision Systems Laboratory Georgia Institute of Technology United States(佐治亚理工学院自主控制与决策系统实验室)

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 提出Deep Coordinator框架,通过深度展开ADMM-DDP迭代学习动态调整超参数,实现非凸优化器求解时自适应惩罚参数,在车队和四旋翼仿真中速度提升6.18-9.44倍且可扩展至8倍规模。

Comments The second and third authors contributed equally (equal second authorship). 35 pages (10 pages main text), 17 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19476 2026-06-19 cs.LG cs.AI 新提交 62%

Can In-Context Learning Support Intrinsic Curiosity?

上下文学习能否支持内在好奇心?

Eric Elmoznino, Sangnie Bhardwaj, Johannes von Oswald, Rajai Nasser, Blaise Agüera y Arcas, João Sacramento, Rif A. Saurous, Guillaume Lajoie

机构 * Google – Paradigms of Intelligence Team(Google – 智能范式团队) Google DeepMind(谷歌DeepMind)

专题命中 具身导航 :world model(abstract);分类 cs.AI、cs.LG

AI总结 研究利用序列模型的上下文学习能力作为即时无更新世界模型,以消除传统内在好奇心方法中梯度下降的计算瓶颈,理论证明在非时间设置下可渐近收敛到真实学习进度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17376 2026-06-17 cs.RO cs.CV 新提交 62%

Contactless Respiratory Monitoring on Heterogeneous Mobile Robots: A Multimodal Edge-Computing Framework

异构移动机器人上的非接触式呼吸监测:一种多模态边缘计算框架

Milind Rampure, Shadman Sakib, Haley Patel, Zahid Hasan, Nirmalya Roy

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出一种适用于异构移动机器人的多模态非接触式呼吸率监测框架,通过自适应传感器选择、关键点引导的ROI提取和信号质量过滤,在多种平台和光照条件下实现鲁棒监测,无需平台特定调参。

Comments 8 pages, 6 figures. To appear in Proceedings of the 8th International Workshop on IoT Applications and Industry 5.0 (IoTI5 2026), co-located with IEEE DCOSS-IoT 2026, Reykjavik, Iceland, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16042 2026-06-16 cs.RO cs.AI 新提交 62%

Leveraging Deep Learning for Object and Position Recognition of Load Carriers for Autonomous Logistics Vehicles

利用深度学习实现自主物流车辆对载具的物体与位置识别

Christoph Legat, Tobias Miller, Marco Riess

机构 * Research Group on Cognitive Autonomy & Predictive Intelligence, Technical University of Applied Sciences, Augsburg, Germany(认知自主与预测智能研究组,奥格斯堡应用技术大学,德国) Grenzebach Maschinenbau GmbH, Asbach-Bäumenheim, Germany(Grenzebach Maschinenbau GmbH,德国阿斯巴赫-博伊门海姆)

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 提出基于深度学习的框架,通过卷积神经网络从RGBD数据中识别载具上的预定义地标并计算其位姿,实现自主物流车辆对载具的检测与定位,实验验证了工业环境下的可靠性。

Comments 6 pages, 6 figures, IFAC World Congress2026, \c{opyright} 2026 the authors. This work has been accepted to IFAC for publication under a Creative Commons Licence CC-BY-NC-ND

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14773 2026-06-16 cs.CV cs.AI 新提交 62%

Double-Helix Vision (DH-V2): A Geometry-Based Visual Sampler for Bandwidth-Constrained Perception

双螺旋视觉 (DH-V2):一种基于几何的带宽受限感知视觉采样器

Jinwen Wen

机构 * Independent Researcher(独立研究者)

专题命中 具身导航 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 提出双螺旋视觉(DH),一种基于黄金比例螺旋轨迹的几何采样器,将2D图像压缩为1D信号,实现1433倍压缩比,在CPU上0.52ms完成感知,CIFAR-10上准确率提升6.03%。

Comments 5 pages, 3 figures, 5 tables. Code and benchmarks: https://github.com/JackJ-C/double-helix-vision-tool

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09569 2026-06-09 cs.RO cs.CV 新提交 62%

Efficient Minimal Solvers for Relative Pose Estimation in Autonomous Driving Applications

自动驾驶应用中相对位姿估计的高效最小求解器

Tao Li, Liang Liu, Jianli Han, Weimin Lv

机构 * College of Aerospace Science and Engineering, Naval Aviation University(海军航空大学航空航天科学与工程学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出基于新平移参数化和一阶旋转近似的统一框架,设计三种最小求解器(利用IMU垂直方向、转向旋转轴方向、平面运动假设),减少点对应数量和代数复杂度,在RANSAC中加速假设生成,平衡速度与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07658 2026-06-09 cs.CV cs.LG 新提交 62%

What neurosurgeons need to see: synthetic intra-operative MRI from ultrasound for brain-shift compensation in brain tumour surgery

神经外科医生需要看到的:用于脑肿瘤手术中脑移位补偿的超声合成术中MRI

Santiago Cepeda, Olga Esteban-Sinovas, Ignacio Arrese, Rosario Sarabia

机构 * Department of Neurosurgery, Neurovascular Unit, Río Hortega University Hospital, Valladolid, Spain(西班牙巴利亚多利德里奥·奥尔特加大学医院神经外科神经血管科) Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC), Instituto de Investigación Biosanitaria de Valladolid (IBioVALL), Valladolid, Spain(西班牙巴利亚多利德生物医学研究与计算分析专业组(GEIBAC),巴利亚多利德生物健康研究所(IBioVALL))

专题命中 具身导航 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 提出一种端到端流水线,通过融合术前MRI、术中超声生成的合成MRI及锚定该合成图像的可变形配准,生成术前成像空间中的全脑MRI体积,以补偿脑移位,为神经导航提供类似MRI的术中视野更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11895 2026-08-13 cs.RO cs.MA 新提交 61%

Scalable Multi-Agent Maze Traversal with Local Communication

带局部通信的可扩展多智能体迷宫遍历

Julian Rau, Jahir Argote-Gerald, Grace McFassel, Genki Miyauchi, Paul Trodden, Roderich Groß

机构 * Technical University of Darmstadt(达姆施塔特工业大学) The University of Sheffield(谢菲尔德大学) University of Bristol(布里斯托尔大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 针对通信受限的未知迷宫环境,提出基于局部通信与主从机制的分布式多智能体遍历算法,其性能接近最优全知策略,且在多智能体场景下优于朴素基线。

Comments This manuscript has been accepted for publication in the proceedings of the World Symposium on the Algorithmic Foundations of Robotics (WAFR 2026), to be published by Springer in the Springer Proceedings in Advanced Robotics (SPAR) series

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29513 2026-08-03 cs.RO 新提交 61%

Homotopy-Aware Corridor Generation without Predefined Reference Paths

无预定义参考路径的同伦感知走廊生成

Haoze Dong, Minghan Li, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 具身导航 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 该研究提出一种无预定义参考路径的自适应多尺度凸集图框架,用于生成同伦感知安全走廊,经数值与硬件实验验证,其图构造高效、轨迹性能稳定,同伦感知轨迹更短且能应对未知障碍物。

Comments 8 pages, 8 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17898 2026-07-21 cs.RO 新提交 61%

Manifold-Guided Motion Planning for Tight Assemblies

用于紧密装配的流形引导运动规划

Dror Livnat, Michael M. Bilevich, Michal Kleinbort, Dan Halperin

机构 * Blavatnik School of Computer Science and Artificial Intelligence, Tel-Aviv University(特拉维夫大学布拉瓦尼克计算机科学与人工智能学院)

专题命中 具身导航 :robotics(abstract,comments);分类 cs.RO

AI总结 针对刚体装配运动规划因几何约束面临的挑战,提出临界流形引导的CMG-RRT规划器。它利用配置空间分层细分,将采样偏向临界流形邻域引导探索,经证明概率完备,在基准测试中成功率达100%,还解决了麋鹿拆解谜题。

Comments Appeared in the 17th World Symposium on the Algorithmic Foundations of Robotics (WAFR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17852 2026-07-21 cs.RO 新提交 61%

Lifelong Localization in Dynamic Indoor Environments Combining Odometry with Sparse Distance Sampling

结合里程计与稀疏距离采样的动态室内环境终身定位

Michael M. Bilevich, Tomer Buber, Dan Halperin

机构 * Blavatnik School of Computer Science and Artificial Intelligence, Tel-Aviv University(特拉维夫大学布拉瓦尼克计算机科学与人工智能学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 研究动态室内环境中机器人定位问题,提出结合里程计与稀疏距离采样的终身定位框架,能实时解决绑架机器人问题,在静态和动态环境中均收敛到真实姿态,少量距离样本即可实现与SLAM相当的定位,具多方面优势。

Comments Appeared in the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16341 2026-07-21 cs.RO 新提交 61%

S.E.A.G.R: A Socially and Emotionally Aware Greeting Robot Framework with Dual-Layer Cultural and Affective Modulation

S.E.A.G.R:一个具有双层文化和情感调制的社交和情感感知问候机器人框架

Sajjad Hussain, Ranveer Bhura, Amandip Dutta, Shwetangshu Biswas

机构 * University of Brighton(布莱顿大学) National Institute of Technology, Silchar(锡尔恰尔国立理工学院)

专题命中 具身导航 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 研究为不同文化背景和情感状态用户的人机交互设计SEAGR问候机器人框架,引入双层调制,结合多种技术在统一架构内实现,用低成本原型验证概念,当前缺用户研究验证,这是未来主要工作方向。

Comments 13 pages, 6 figures. Accepted for publication in the proceedings of the 18th International Conference on Social Robotics (ICSR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26928 2026-06-26 cs.RO cs.SI 新提交 61%

UAV-MapFusion: RTK-Aligned Uncertainty-Aware Coarse-to-Fine Multi-Session UAV Mapping

UAV-MapFusion: RTK对齐的不确定性感知粗到细多会话无人机建图

Feng Pan, Chunran Zheng, Bing Xue, Yukang Cui, Jiayu Wen, Zhiyu Chen, Wei Wang

机构 * College of Automation, Harbin Engineering University(哈尔滨工程大学自动化学院) Department of Mechanical Engineering, University of Hong Kong(香港大学机械工程系) College of Mechatronics and Control Engineering, Shenzhen University(深圳大学机电与控制工程学院)

专题命中 具身导航 :robotics(abstract,comments);分类 cs.RO

AI总结 提出一种不确定性感知的多会话点云地图合并与粗到细优化系统,通过RTK时空对齐和迭代平面因子优化,在抑制长距离漂移的同时保持局部几何精度。

Comments 8 pages, 5 figures, accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18948 2026-06-18 cs.RO 新提交 61%

C-ARC: Continuous-Adaptive Range Clustering for Non-Repetitive LiDAR Sensors

C-ARC: 面向非重复式LiDAR传感器的连续自适应范围聚类

Nick B. Schroeder, Jonathan Lichtenfeld, Oskar von Stryk

机构 * Technical University of Darmstadt(德累斯顿技术大学) Simulation, Systems Optimization and Robotics Group(仿真、系统优化与机器人组)

专题命中 具身导航 :robotics(abstract,comments);分类 cs.RO

AI总结 提出C-ARC框架,通过滑动窗口上的持久双图结构解耦高频点插入与按需聚类检索,并利用指数控制环自适应校准网格分辨率,实现非重复式LiDAR点云的实时聚类。

Comments Submitted to IEEE Robotics and Automation Letters. This work has been submitted to the IEEE for possible publication. 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15645 2026-06-16 cs.RO 新提交 61%

TO-SoFiT: Topology Optimization of Hydraulic Soft Fish Tail Design for programmable undulating locomotion

TO-SoFiT: 用于可编程波动运动的液压软鱼尾拓扑优化设计

A Padmaprabhan, Amal Shaji, Prabhat Kumar

机构 * Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)

专题命中 具身导航 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 提出一种拓扑优化方法自动设计液压软鱼尾,平衡变形效率、流固耦合、可制造性和刚度,实现可调波动幅度和多轴弯曲,优于传统矩形尾鳍。

Comments Accepted for publication at the Advances in Robotics (AIR), 2025, IIT Jodhpur

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13921 2026-08-17 cs.AI 新提交 57%

When Personal Memory Has No Single Answer: Evaluating LLM Agents under Irreducible Conflict

当个人记忆没有唯一答案时:评估大语言模型智能体在不可约冲突下的表现

Lu Yang, Shusheng Xu, Zhuoran Li, Tongkai Yang, Longbo Huang

机构 * Ant Group(蚂蚁集团)

专题命中 具身导航 :navigation(abstract_cn);分类 cs.AI

AI总结 该研究针对大语言模型智能体的记忆冲突问题,提出了基准TANGLE并评估其表现,发现现有方法存在缺陷,进而提出冲突感知行动策略CAAP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12866 2026-08-14 cs.RO 新提交 57%

AMR-Pose: An Active LED Marker-Based Relative Pose Estimation Framework With Probabilistic Switching PnP for Cooperative AUVs

AMR-Pose:一种用于协作自主水下航行器(AUV)的基于主动LED标记的相对位姿估计框架,结合概率切换PnP算法

Zeyu Sha, Xiaorui Wang, Mingyang Yang, Feitian Zhang

机构 * Peking University(北京大学)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出AMR-Pose框架,采用含红、蓝LED的标记模块,结合PSwPnP算法实现协作AUV的鲁棒相对位姿估计,经水池及闭环实验验证其准确性与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12835 2026-08-14 cs.RO 新提交 57%

AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN

AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象

Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10249 2026-08-12 cs.LG 新提交 57%

STCAD: Scalable Trajectory Clustering and Anomaly Detection on Terabyte-Scale AIS Data

STCAD:针对TB级AIS数据的可扩展轨迹聚类与异常检测

Bertram Hage, Alexander Schiøtz, Felix Thomsen, Christian Rand, Peder Heiselberg

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 该研究提出STCAD框架,通过自定义BERT模型与CURE层次聚类实现TB级AIS轨迹的无监督聚类,结合重构损失与聚类噪声分配检测异常,在国家级AIS数据集上验证了方法的有效性。

Comments Accepted at IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09484 2026-08-11 cs.RO 新提交 57%

Graph-Guided Safe Diffuser: Topological Graph Guidance for Safe Diffusion Planning

图引导的安全扩散器:用于安全扩散规划的拓扑图引导

Nakgyu Yang, KwangBin Lee, SooJean Han

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 该研究提出图引导的安全扩散器(G2SD)框架,用高层拓扑图规划器引导低层扩散模型,解决扩散规划器的流形破裂问题,在Maze2D导航等任务中大幅提升无碰撞目标到达率与任务性能。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09146 2026-08-11 cs.CV 新提交 57%

Multi-Submap Implicit Neural SLAM with Local-to-Global Loop Closure for Large-Scale Scene Reconstruction

面向大规模场景重建的结合局部到全局回环检测的多子图隐式神经SLAM

Tianchen Deng, Chongdi Wang, Nailin Wang, Lei Zhao, Ziqi Ma, Tianjun Zhang, Zhe Liu, Danwei Wang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Carnegie Mellon University(卡内基梅隆大学) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 具身导航 :robotic(abstract);分类 cs.CV

AI总结 本文提出一种带多子图架构与双层回环检测机制的神经SLAM系统,结合渐进式建图、光流跟踪、局部到全局回环及子图间在线蒸馏算法,在大规模场景重建性能上优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08949 2026-08-11 cs.CV 新提交 57%

EndoMD-SLAM: Endoscopic Gaussian Splatting SLAM under Optical Degradation with Memory and Static-Transient Decomposition

EndoMD-SLAM:光学退化下的内窥镜高斯溅射SLAM,具备记忆与静态-瞬态分解能力

Nuo Chen, Kangqi Ni, Lulin Liu, Joga Ivatury, Ying Ding, Farshid Alambeigi, Tianlong Chen, Zhiwen Fan

机构 * Texas A&M University(德克萨斯农工大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Minnesota(明尼苏达大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 EndoMD-SLAM是针对内窥镜光学退化问题的SLAM框架,通过记忆驱动门控、静态-瞬态分解等机制,在结肠镜检查基准上实现了轨迹误差降低91%、PSNR提升9.9 dB的效果。

Comments Project page: https://endomd-slam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08648 2026-08-11 cs.CV 新提交 57%

Agentic Visual Reasoning in Whole-Slide Pathology Images via Active Perception

基于主动感知的全切片病理图像智能体视觉推理

Jingyun Chen, Fengchun Liu, Linghan Cai, Songhan Jiang, Shenjin Huang, Hongpeng Wang, Lequan Yu, Yongbing Zhang

机构 * College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 该研究提出AdaptivePath主动感知框架,通过序列决策实现千兆像素病理切片的视觉推理,在病理VQA基准及TCGA六队列癌症亚型分类上取得最优性能,辅助病理学家诊断。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏