arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-19 至 2026-05-19 共收录 174 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 38 篇

2605.18295 2026-05-19 cs.RO 57%

Assessing Localization Technologies for Pedestrian Collision Avoidance

评估用于行人碰撞避让的定位技术

Joshua Varughese, Joseba Gorospe, Novel Certad, Cristina Olaverri-Monreal

机构 * Dept. Intelligent Transport Systems, Johannes Kepler University Linz(智能交通系统系,约翰内斯·开普勒大学林茨)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文评估了超宽频技术和蓝牙6.0在行人碰撞预警中的定位精度,并将其与全球导航卫星系统进行性能对比,发现这些技术在特定场景下可作为替代或补充方案,提升环境感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06809 2026-05-19 cs.CV 57%

VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance

VA-Adapter:将超声基础模型适应于超声心动图探头引导

Teng Wang, Haojun Jiang, Yuxuan Wang, Zhenguo Sun, Yujiao Deng, Shiji Song, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China(自动化系、BNRist、清华大学、北京、中国) School of Computer Science and Technology, Xidian University(计算机科学与技术学院、西安电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Chinese PLA General Hospital(中国人民解放军总医院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出VA-Adapter,通过将超声基础模型与理解个体三维结构的能力相结合,提高超声心动图探头引导的精度和效率,实验表明其在参数量较少的情况下表现优于现有模型。

Comments MICCAI2026 Early Accept Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07111 2026-05-19 cs.CL cs.AI 57%

Beyond LoRA vs. Full Fine-Tuning: Gradient-Guided Optimizer Routing for LLM Adaptation

超越LoRA与全微调:基于梯度的优化器路由用于大语言模型适应

Haozhan Tang, Xiuqi Zhu, Xinyin Zhang, Boxun Li, Virginia Smith, Kevin Kuo

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Infinigence AI

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文提出了一种混合LoRA和全微调(MoLF)框架,通过在优化器层面动态路由更新,实现两种训练模式之间的连续导航,从而提升大语言模型的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17264 2026-05-19 cs.RO 57%

Stretch-ICP: A Continuous-Trajectory Registration and Deskewing Algorithm in Scenarios of Aggressive Motions

Stretch-ICP: 一种在剧烈运动场景下的连续轨迹配准与校正算法

Simon-Pierre Deschênes, Veronica Vannini, Philippe Giguère, François Pomerleau

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出Stretch-ICP算法,通过改进SLAM的鲁棒性,以提高在剧烈运动下的激光雷达-惯性导航状态估计的鲁棒性和一致性,同时减少了线速度和角速度的估计误差。

Comments 29 pages, 16 figures, published in Sensors 2026, 26(8), 2567, special issue "New Challenges and Sensor Techniques in Robot Positioning"

Journal ref Sensors 2026, 26(8), 2567

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09344 2026-05-19 cs.RO cs.SY eess.SY 57%

C-ZUPT: Stationarity-Aided Aerial Hovering

C-ZUPT:基于站定性的空中悬停

Daniel Engelsman, Itzik Klein

机构 * Hatter Department of Marine Technologies, Charney School of Marine Sciences, University of Haifa(哈特尔海洋技术系,查内海洋科学学院,海法大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出C-ZUPT方法,通过定义不确定性阈值识别准静态平衡状态,为估计滤波器提供精确速度更新,从而减少惯性漂移和控制努力,提升导航稳定性与悬停能效。

Comments 14 Pages, 16 Figures, 9 Tables

Journal ref IEEE Transactions on Aerospace and Electronic Systems, volume 62, pages 4063-4077, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16588 2026-05-19 cs.RO cs.SY eess.SY 57%

Policy Library CBF: Finite-Horizon Safety at Runtime via Parallel Rollouts

策略库CBF:通过并行滚动预测实现有限时间范围内的运行时安全

Taekyung Kim, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Dimitra Panagou

机构 * Department of Robotics(机器人学系) Department of Aerospace Engineering(航空航天工程系) University of Michigan(密歇根大学) Toyota Motor North America, Research & Development(丰田美国北美洲研发部门)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出PL-CBF,通过并行有限时间滚动预测评估备用策略库,选择最安全模式并最小修改名义策略以确保安全,实验显示在保持毫秒级运行时间的同时提升了安全覆盖率。

Comments Project page: https://www.taekyung.me/plcbf

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16408 2026-05-19 cs.CV 57%

Visual Search Patterns in 3D Pancreatic Imaging: An Eye Tracking Study

三维胰腺成像中的视觉搜索模式:一项眼动研究

Anna Anikina, Leila Khaertdinova, Trine Balschmidt, Michael B Andersen, Christoph F Müller, Erik GS Brandt, Henrik S Thomsen, Claudia Mello-Thoms, Bulat Ibragimov

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Department of Radiology, Herlev Hospital(赫尔勒夫医院放射科) Department of Radiology, University of Iowa(爱荷华大学放射科)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本研究通过眼动追踪分析三维胰腺CT影像中放射科医生的视觉搜索行为,揭示其在空间和时间上的注视模式,为理解诊断策略提供新的视角。

Comments Accepted at SPIE - Medical Imaging Conference 2026

Journal ref Proc. SPIE 13928, Medical Imaging 2026: Image Perception, Observer Performance, and Technology Assessment, 1392814 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02171 2026-05-19 cs.DB 50%

QuIVer: Rethinking ANN Graph Topology via Training-Free Binary Quantization

QuIVer:通过无训练二进制量化重新思考ANN图拓扑

Wenxuan Xiao, Zhiyou Wang, Chengcheng Li

专题命中 具身导航 :navigation(abstract)

AI总结 本文研究了二进制量化能否定义图拓扑本身,并提出了QuIVer,一个无需训练的ANN图索引,在2位Sign-Magnitude二进制量化度量空间中完成边选择、多样性剪枝和束搜索导航,揭示了二进制量化拓扑在不同数据集上的适用边界,提出了可验证的工业向量搜索系统在压缩、吞吐量和通用数据兼容性之间的不可能三角。

Comments 16 pages, 3 figures, 14 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16850 2026-05-19 physics.soc-ph 50%

Editorial Trajectories in Wikipedia Reflect Underlying Hyperlink Structure

维基百科的编辑轨迹反映底层超链接结构

Yeonji Seo, Mi Jin Lee, Seung-Woo Son, Hang-Hyun Jo, Yohsuke Murase

专题命中 具身导航 :navigation(abstract)

AI总结 研究探讨了维基百科超链接结构如何影响编辑者在文章间的转移模式,通过分析编辑历史与超链接网络的关系,揭示了编辑行为与超链接结构之间的关联,识别出三种编辑类型:专家、一般用户和机器人。

Comments 18 pages, 10 figures (5 main and 5 SI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05790 2026-05-19 eess.SY cs.SY 50%

Underwater MEMS Gyrocompassing: A Virtual Testing Ground

水下MEMS陀螺仪定位:一个虚拟测试平台

Daniel Engelsman, Itzik Klein

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出一种基于学习的框架,通过分析惯性测量动态UUV特征,提升水下陀螺仪定位的鲁棒性,应对海洋环境干扰。

Comments 8 Pages, 7 figures, OCEANS 2024 Singapore

Journal ref OCEANS 2024 - Singapore, pages 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08571 2026-05-19 eess.SY cs.SY 50%

Parametric and State Estimation of Stationary MEMS-IMUs: A Tutorial

参数与状态估计在静态MEMS惯性测量单元中的应用:教程

Daniel Engelsman, Yair Stolero, Itzik Klein

专题命中 具身导航 :navigation(abstract)

AI总结 本文探讨了静态MEMS惯性测量单元的参数与状态估计方法,分析了误差与时间、传感器数量的关系,并通过实验验证了多传感器应用的潜力。

Journal ref IEEE Access, volume 12, pages 148592-148604, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 19 篇

2512.24497 2026-05-19 cs.AI cs.LG cs.RO stat.ML 88%

What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?

在联合嵌入预测世界模型中成功因素是什么?

Basile Terver, Tsung-Yen Yang, Jean Ponce, Adrien Bardes, Yann LeCun

机构 * Meta FAIR Inria Paris(巴黎理工院) Ecole normale supérieure / PSL(巴黎高等师范学院 / PSL) New York University(纽约大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 本文研究了在物理规划中使用联合嵌入预测世界模型(JEPA-WMs)的成功因素,通过分析模型架构、训练目标和规划算法对规划成功的影响,提出了一种在导航和操作任务中优于现有基线方法的模型。

Comments V2 of the article: - Added AdaLN-zero - Added table comparing JEPA-WMs with baselines with std translating per-seed variability only, no variability across epochs - Reordered figures in main body of the paper V3: added data scaling experiments, theoretical appendix section on autoregressive rollout, acceptance at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14757 2026-05-19 eess.SP 85%

ChannelAgent-Empowered Electromagnetic Space World Model: A Case Study on Agent-Driven Channel Generation for 6G AI-Native Air Interface

ChannelAgent-empowered Electromagnetic Space World Model: A Case Study on Agent-Driven Channel Generation for 6G AI-Native Air Interface

Mingyue Li, Li Yu, Yuxiang Zhang, Heng Wang, Jianhua Zhang, Ping Zhang, Guangyi Liu

专题命中 具身推理 :world model(title,title_cn)

AI总结 本文提出了一种基于ChannelAgent的电磁空间世界模型,用于6G AI原生空气接口中的智能体驱动信道生成,通过多模感知、ChannelAgent智能核心和反馈更新的闭环过程,实现任务感知决策和自主适应。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16395 2026-05-19 cs.RO cs.LG 84%

OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence

OrbiSim:作为具身智能的可微物理引擎的世界模型

Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science(人工智能摩尔电子实验室、人工智能学院、计算机科学学院)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 OrbiSim提出了一种新的机器人仿真范式,将世界模型重新定义为完全可微的物理引擎,通过统一的物理基础路径连接结构化场景资产、神经动力学和下游强化学习,提升预测精度和控制性能。

Comments Project page: https://jjleejj85.github.io/projects/orbisim

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18303 2026-05-19 cs.LG cs.AI cs.CV cs.RO 83%

PH-Dreamer: A Physics-Driven World Model via Port-Hamiltonian Generative Dynamics

PH-Dreamer: 通过端口-哈密顿生成动力学构建一个物理驱动的世界模型

Xueyu Luan, Chenwei Shi

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出了一种基于端口-哈密顿框架的物理驱动世界模型PH-Dreamer,通过三个协同机制改进了基于递归状态空间架构的世界模型,实现了更紧凑且物理结构化的表示,同时提高了内部模拟器的保真度,并减少了潜在相空间体积、能量消耗和平均加速度平方。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08167 2026-05-19 cs.RO cs.AI cs.CV cs.LG 82%

Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning

基于互联网规模知识的自监督行动预测具身推理

Milan Ganai, Katie Luo, Jonas Frey, Clark Barrett, Marco Pavone

机构 * Stanford(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 具身推理 :manipulation(abstract,abstract_cn);navigation(abstract);分类 cs.RO、cs.AI、cs.CV;robotics(comments)

AI总结 本文提出R&B-EnCoRe方法,通过自监督细化使模型从互联网知识中自推导具身推理策略,提升动作执行和导航性能,减少碰撞率。

Comments Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15960 2026-05-19 cs.AI cs.LG 81%

Imperfect World Models are Exploitable

不完美的世界模型是可利用的

Logan Mondal Bhamidipaty, Esmeralda S. Whitammer, David Abel, Mykel J. Kochenderfer, Subramanian Ramamoorthy

机构 * University of Edinburgh(爱丁堡大学) Stanford University(斯坦福大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的强化学习中模型利用的定义,指出世界模型如果暗示某种策略应严格优于另一种策略,而真实环境转移模型却暗示相反,那么该模型就是可利用的。研究通过发展奖励黑客和模型利用的一般理论,证明在大规模策略集上利用本质上是不可避免的,并揭示了安全规划在世界模型中的局限性。

Comments 17 pages, 3 figures, 2 tables; modified (fixed metadata)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23058 2026-05-19 cs.CV cs.RO 81%

GeoWorld: Geometric World Models

GeoWorld:几何世界模型

Zeyu Zhang, Danning Li, Ian Reid, Richard Hartley

机构 * ANU(澳大利亚国立大学) MBZUAI(穆斯林人工智能研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 GeoWorld通过超几何JEPA和几何强化学习解决传统能量预测模型在几何结构和长周期预测中的不足,实验显示在3-4步规划中性能提升3%-2%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16725 2026-05-19 cs.AI 79%

Baba in Wonderland: Online Self-Supervised Dynamics Discovery for Executable World Models

《白兔在奇幻世界:在线自监督动态发现用于可执行世界模型》

SeungWon Seo, DongHeun Han, SeongRae Noh, HyeongYeop Kang

机构 * Korea University(韩国大学) Kyung Hee University(庆熙大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 该研究探讨了在先验错配情况下,如何通过交互证据自监督学习可执行世界模型,引入了Alice系统,通过失败的候选更新作为结构信号,发现并改进动态,从而提升可执行世界模型的学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23180 2026-05-19 cs.CV 79%

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM: 基于3D高斯场景表示的统一场景理解和多模态生成驱动世界模型

Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MEGVII Technology(商汤科技) Mach Drive

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出基于3D高斯表示的统一驱动世界模型框架,实现3D场景理解和多模态生成,并通过语言引导采样策略和双条件生成模型提升生成效果,实验验证其在nuScenes和NuInteract数据集上的优越性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16547 2026-05-19 cs.LG 79%

World Model-Enabled Causal Digital Twins for Semantic Communications in Physical AI Systems

面向物理人工智能系统的语义通信世界模型增强因果数字孪生

Lingyi Wang, Tingyu Shui, Walid Saad, Pascal Adjakple

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学电子与计算机工程系 Bradley 部门) Research and Innovation Labs, InterDigital Communications Inc.(InterDigital Communications Inc. 研究与创新实验室)

专题命中 具身推理 :world model(title);navigation(abstract);分类 cs.LG

AI总结 本文提出基于世界模型的因果数字孪生框架,解决物理人工智能系统中语义通信的长期回报最大化问题,通过因果信息价值指标和策略训练提升导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17517 2026-05-19 cs.RO 70%

AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment

AffordVLA: 通过隐式特征对齐将 affordance 表示注入到视觉-语言-动作模型中

Weijie Kong, Zhian Su, Wei Yu, Huixu Dong

机构 * Grasp Lab, School of Mechanical Engineering of Zhejiang University(浙大机械工程学院抓取实验室)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出 AffordVLA 框架,通过隐式特征对齐将以操作为中心的 affordance 表示注入到视觉-语言-动作模型中,以提升动作准确性,实验表明其在仿真和现实中的表现优于现有方法。

Comments 13pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16848 2026-05-19 cs.CV cs.AI cs.CL cs.LG 67%

Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction

基于模式的思考:通过模式诱导突破视觉规划中的感知瓶颈

Yichang Jian, Boyuan Xiao, Zhenyuan Huang, Yifei Peng, Yao-Xiang Ding

机构 * State Key Lab of CAD& CG(CAD与CG国家重点实验室)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出通过模式诱导的方法,利用模式推理和模式诱导策略,使视觉语言模型在视觉规划任务中实现更高效和准确的感知与推理,解决传统模型在复杂输入下的感知瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02060 2026-05-19 cs.CV cs.RO 62%

CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects

CompassAD: 基于意图的多功能竞争物体3D affordance 地标

Jingliang Li, Jindou Jia, Tuo An, Chuhao Zhou, Xiangyu Chen, Shilin Shan, Boyu Ma, Bofan Lyu, Gen Li, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡)

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出了一种新的3D affordance设定,即意图驱动的可混淆地标,旨在预测多物体点云中正确物体的每点affordance掩码,基于隐含的自然语言意图。通过构建CompassAD基准,该研究展示了在具有隐含意图的多物体组合中的先进结果,并在机器人机械臂上验证了其在真实世界抓取中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17923 2026-05-19 cs.DC cs.AI cs.LG 62%

AdaptiveLoad: Towards Efficient Video Diffusion Transformer Training

AdaptiveLoad: 向高效视频扩散变换器训练迈进

Yucheng Guo, Yongjian Guo, Zhong Guan, Haoran Sun, Wen Huang, Wanting Xu, Jing Long, Shuai Di, Junwu Xiong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AdaptiveLoad框架,通过双约束自适应负载平衡系统和融合LayerNorm-Modulate CUDA内核,解决视频生成模型中大规模视频扩散变换器(如DiT和MMDiT)训练中的计算不平衡问题,实验显示其在Wan 2.1世界模型上提升了计算效率和训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16412 2026-05-19 cs.RO cs.CV 62%

SCAR: Self-Supervised Continuous Action Representation Learning

SCAR:自监督连续动作表示学习

Hongjia Liu, Fan Feng, Minghao Fu, Xinyue Wang, Haofei Lu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校) KTH Royal Institute of Technology(皇家理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SCAR框架,通过自监督学习统一动作表示,提升跨体素和任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18181 2026-05-19 cs.AI cs.CL 57%

Scalable Environments Drive Generalizable Agents

可扩展环境驱动可泛化的智能体

Jiayi Zhang, Fanqi Kong, Guibin Zhang, Maojia Song, Zhaoyang Yu, Jianhao Ruan, Jinyu Xiang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州)) DeepWisdom PKU(北京大学) NUS(新加坡国立大学) SUTD(新加坡科技设计大学) UdeM & Mila(蒙特利尔大学及Mila)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨了可泛化智能体需要通过可扩展环境来适应多样任务和未见环境的问题,提出环境扩展的核心挑战,并提出了统一的分类方法和可扩展环境的构建范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17682 2026-05-19 cs.CV 57%

GEM: Gaussian Evolution Model for Occupancy Forecasting and Motion Planning

GEM:用于占用预测和运动规划的高斯演化模型

Cheng Chen, Hao Huang, Saurabh Bagchi

机构 * Purdue University(普渡大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 该研究提出GEM模型,通过高斯演化模型实现高效的占用预测和运动规划,解决了传统方法在时间灵活性、场景演化和连续时间动态匹配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17478 2026-05-19 cs.CV 57%

Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory

Mamba-VGGT: 通过外部滑动窗口Mamba内存实现持久长序列视频几何 grounded 变换器

Tianchen Deng, Zhenxiang Xiong, Nailin Wang, Fangjinhua Wang, Jiuming Liu, Jianfei Yang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院) Cambridge University(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出Mamba-VGGT框架,通过引入滑动窗口Mamba内存模块,解决传统VGGT在长序列视频中几何遗忘和累积漂移问题,提升3D场景重建的精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17058 2026-05-19 cs.LG 57%

Learning Multi-Timescale Abstractions for Hierarchical Combinatorial Planning

学习多时间尺度抽象以进行分层组合规划

Vivienne Huiling Wang, Tinghuai Wang, Joni Pajarinen

机构 * Department of Electrical Engineering(电气工程系) Automation, Aalto University, Finland(自动化,艾尔沃斯大学,芬兰)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种基于模型的分层框架,用于解决序列随机组合决策问题,通过多时间尺度目标结构化潜在动态,实现高效的前瞻规划,并联合学习子目标条件预算策略以支持上下文感知的资源分配。

Comments 34 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏