arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-30 至 2026-07-30 共收录 89 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 11 篇

2606.10348 2026-07-30 cs.RO 版本更新 83%

Semantic Evidence Regulation via Relational Bias for Zero-Shot Object Navigation

通过关系归纳偏差重新思考具身导航

Weitao An, Chenghao Xu, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) School of Information Science and Engineering, Hohai University(河海大学信息科学与工程学院)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 提出DB-Nav框架,利用激活偏置和抑制偏置双关系偏置重塑搜索空间,通过关系激活-抑制探索图调节前沿探索,显著提升目标导航成功率和路径效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26914 2026-07-30 cs.RO cs.AI 新提交 81%

BioVLN: A Simulation Platform for Visual Language Navigation in Biomedical Laboratories

BioVLN:生物医学实验室视觉语言导航的仿真平台

Zhe Liu, Quan Lu, Zhaohui Du, Zhe Wang, Huanbo Jin, Jiaming Gu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

机构 * East China University of Science and Technology(华东理工大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对现有导航平台不适用于实验室仪器的问题,提出BioVLN仿真平台,通过分区域建模仪器实现更精准导航,实验验证其提升成功率并降低安全风险。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26295 2026-07-30 physics.bio-ph cond-mat.stat-mech q-bio.NC 新提交 78%

A behavior-environment information loop drives sensory navigation

行为-环境信息回路驱动感官导航

Kevin S. Chen, Matthew P. Leighton, Damon A. Clark, Thierry Emonet

专题命中 具身导航 :navigation(title,abstract)

AI总结 该研究提出基于传递熵的信息论框架,量化感官与行为的双向信息流,可预测生物与人工系统的导航效率,揭示了驱动导航的通用行为-环境反馈回路。

Comments 14 pages, 6 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26165 2026-07-30 cs.CV 新提交 70%

DVPSFormer: Efficient Online Depth-aware Video Panoptic Segmentation for Autonomous Driving

DVPSFormer:面向自动驾驶的高效在线深度感知视频全景分割

Yung-Hsu Yang, Luigi Piccinelli, Siyuan Li, Mattia Segu, Lei Ke, Martin Danelljan, Yuqian Fu, Zuria Bauer, Fisher Yu, Hermann Blum, Marc Pollefeys

机构 * ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University(保加利亚索菲亚大学INSAIT研究所) University of Bonn(波恩大学) Microsoft(微软公司)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 DVPSFormer是一种统一在线架构,通过ESD和OMV机制实现高效4D场景理解,在两个DVPS基准上达SOTA,为自动驾驶提供在线机器人感知的精简方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14222 2026-07-30 cs.RO cs.SY eess.SY math.OC 70%

Muscle Coactivation in the Sky: Geometry and Pareto Optimality of Energy vs. Aerodynamic Promptness and Multirotors as Variable Stiffness Actuators

天空中的肌肉协同:能量与气动响应的几何与帕累托最优性及多旋翼作为可变刚度执行器

Antonio Franchi

机构 * Robotics and Mechatronics Department, Electrical Engineering, Mathematics, and Computer Science (EEMCS) Faculty(代尔夫特理工大学机器人与机电系) Department of Computer, Control and Management Engineering(罗马萨皮恩扎大学计算机、控制与管理工程系)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 本文通过引入气动响应这一动态指标,研究多旋翼中能量消耗与气动响应的几何与帕累托最优性,揭示了协同与对抗执行模式对飞行性能的影响,并提出动态'飞行肌肉'控制方法。

Comments Accepted for IEEE ICUAS 2026

Journal ref 2026 International Conference on Unmanned Aircraft Systems (ICUAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21329 2026-07-30 physics.flu-dyn physics.bio-ph physics.comp-ph 版本更新 67%

Smart strategies to navigate turbulent odor plumes reorienting to local wind

智能策略用于在湍流气味团中导航:重新定向到局部风

Lorenzo Piro, Maurizio Carbone, Luca Biferale, Massimo Cencini, Robin A. Heinonen, Marco Rando, Agnese Seminara

专题命中 具身导航 :navigation(abstract);robotic(abstract)

AI总结 本文提出了一种基于风的强化学习框架,用于在湍流中导航,通过局部风方向估计和时间间隔来选择动作,展示了在不同风条件下策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27194 2026-07-30 cs.CV cs.RO 新提交 62%

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion

VidMap:利用时序结构实现基于视频的运动恢复结构

Zador Pataki, Paul-Edouard Sarlin, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Microsoft(微软)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 VidMap结合SLAM序列约束与SfM全局优化,利用宽基线匹配和深度先验,在多样挑战性数据集上,较最新SLAM和SfM更鲁棒准确,可实现任意长未标定视频的度量重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26770 2026-07-30 cs.RO 新提交 57%

Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic

Vision-TL-Action:基于视觉观测和时序逻辑的神经符号轨迹生成

Zezhi Liu, Zhiwei Zheng, Hanqian Luo, Deyun Qin, Shizhen Wu, Yongchun Fang

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出Vision-TL-Action模型,通过融合视觉与TL节点标记生成动作轨迹,在Panda、AntMaze任务中优于或接近基线,实现无需物体几何信息的视觉到TL目标的轨迹生成。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08574 2026-07-30 cs.RO 版本更新 57%

RVC-NMPC: Nonlinear Model Predictive Control with Reciprocal Velocity Constraints for Mutual Collision Avoidance in Agile UAV Flight

RVC-NMPC:基于互斥碰撞回避的非线性模型预测控制

Vit Kratky, Robert Penicka, Parakh M. Gupta, Ondrej Prochazka, Martin Saska

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种基于RVC-NMPC的非线性模型预测控制方法,通过高效计算和直接整合互斥速度约束,实现高频率的碰撞回避控制,适用于敏捷无人机飞行。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26846 2026-07-30 eess.SY cs.SY 新提交 50%

Network Verified NTN Positioning for 6G A Standards Oriented Survey of Hybrid TN NTN Localization

面向6G标准的网络验证NTN定位:混合TN NTN定位综述

Donglin Wang, Zexing Fang, Qiuheng Zhou, Hans D. Schotten

专题命中 具身导航 :navigation(abstract)

AI总结 该综述针对6G标准,梳理了无线定位从传统方案到混合TN NTN 3D网络可验证定位的演进,分析了3GPP标准、方法权衡等,为相关设计提供参考。

Comments 7 pages, 2 figures, IEEE CSCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26604 2026-07-30 cs.CL 新提交 50%

WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

WikiLoop:基于下游反馈联合学习构建与智能体原生Wiki导航

Haoliang Ming, Feifei Li, Wenhui Que

专题命中 具身导航 :navigation(abstract)

AI总结 WikiLoop是反馈耦合框架,以Qwen3.5-9B为主干,联合学习构建与导航智能体原生Wiki,在AuthTrace等数据集上提升答案正确性,整合两种角色能力且无需特定数据集训练。

Comments 13 pages, 2 figures, 12 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 12 篇

2601.15284 2026-07-30 cs.CV 版本更新 89%

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract,abstract_cn);navigation(abstract);robotic(abstract)

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26336 2026-07-30 cs.LG cs.MA cs.RO 新提交 86%

Learning Implicit Causal World Models from Multi-Agent Demonstrations

从多智能体演示中学习隐式因果世界模型

Jasorsi Ghosh

专题命中 具身推理 :world model(title,abstract);navigation(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 该研究针对多智能体系统中世界模型因相关性与因果机制混淆导致分布偏移下失效的问题,提出隐式因果世界模型,经评估在协调任务上表现出可解释因果表示且精度随干预强度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 82%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 具身推理 :world model(title,abstract)

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26754 2026-07-30 cs.CV 新提交 79%

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

StatePlay:用于机制一致性生成的状态感知游戏世界模型

Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出StatePlay,一种状态感知游戏世界模型,采用混合Transformer架构联合预测视觉内容与游戏状态,经实验验证可提升游戏生成的机制保真度。

Comments Project Page: https://jimntu.github.io/stateplay_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26752 2026-07-30 cs.LG 新提交 79%

CalTwin: Towards Calibrated, Shift-Robust Medical World Models via Fisher-Information Regularisation

CalTwin:基于Fisher信息正则化的校准、分布偏移鲁棒医学世界模型研究

Behraj Khan, Shabir Ahmad, Syed Ahmad Chan Bukhari, Tahir Qasim Syed

机构 * Institute of Business Administration Karachi(卡拉奇商业管理学院) Gachon University(嘉泉大学) St. John’s University(圣约翰大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本研究提出CalTwin方法,结合Fisher信息偏移惩罚与置信度失配惩罚,应用于GRU医学世界模型,在PhysioNet脓毒症挑战赛上显著降低了分布外隐状态预测误差,同时改善了置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26712 2026-07-30 cs.RO 新提交 79%

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

ActSWM:面向开放世界游戏长视界规划的动作敏感型世界模型

Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 针对开放世界游戏长视界规划的上下文崩塌问题,提出动作敏感型世界模型ActSWM,通过约束隐式回滚保留动作依赖差异,提升了任务成功率与动作恢复能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25337 2026-07-30 cs.CL cs.RO 版本更新 79%

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

时间距离联合嵌入预测架构:用于潜在世界模型预测控制的计划感知表示学习

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 研究提出时间距离联合嵌入预测架构(TD-JEPA),保留LeWM编码器-预测器主干,从无奖励轨迹挖掘有向时间成本。该方法缩小JEPA世界模型规划器训练-规划差距,在多个环境中表现优于LeWM及其他基线,通过挖掘成本提升成功率和分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24149 2026-07-30 cs.CL 版本更新 78%

Large Emotional World Model

大规模情感世界模型

Changhao Song, Yazhou Zhang, Hui Gao, Chang Yang, Peng Zhang

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 具身推理 :world model(title,abstract)

AI总结 本文提出大规模情感世界模型,通过构建情感-原因-方式数据集,整合情感因素以提升对情感驱动社会行为的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27036 2026-07-30 cs.CV cs.LG 新提交 73%

Mitigating Compounding Error via Video Representation Regularization

通过视频表示正则化缓解复合误差

Taiye Chen, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV、cs.LG

AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26903 2026-07-30 cs.AI cs.RO 新提交 73%

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

从被动视频到可编辑体验:具身智能的物理基础体验合成

Jia Luo

专题命中 具身推理 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27145 2026-07-30 cs.CV 新提交 70%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13104 2026-07-30 cs.CV cs.GR 版本更新 57%

Neural Radiance Fields for the Real World: A Survey

神经辐射场用于现实世界:综述

Wenhui Xiao, Remi Chierchia, Rodrigo Santa Cruz, Xuesong Li, David Ahmedt-Aristizabal, Olivier Salvado, Clinton Fookes, Leo Lebrat

机构 * Queensland University of Technology(昆士兰理工大学) Australian National University(澳大利亚国立大学)

专题命中 具身推理 :robotics(abstract);分类 cs.CV

AI总结 本文综述了神经辐射场在现实世界中的应用,总结了其在3D场景重建、计算机视觉和机器人技术中的影响,并探讨了当前研究的挑战与未来方向。

Comments Accepted to ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 6 篇

2606.18426 2026-07-30 cs.RO 版本更新 79%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27205 2026-07-30 cs.CV cs.RO 新提交 73%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at https://github.com/H-EmbodVis/TurboVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04171 2026-07-30 cs.RO cs.LG 版本更新 73%

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27138 2026-07-30 cs.RO cs.AI cs.CV 新提交 67%

DLAM: Distributional Latent Actions with Temporal Constraints

DLAM:带时间约束的分布隐式动作模型

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26807 2026-07-30 cs.RO 新提交 57%

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

基于运动学的路由、基于观测的执行:MoE增强视觉-语言智能体(VLA)中的运动学监督专家路由

Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本研究针对MoE增强VLA的专家路由问题,提出KinRT方法,通过运动学聚类监督路由器训练,在两个平台上验证其性能优于现有模型,相关代码与平台将开源。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交 57%

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2607.26417 2026-07-30 cs.LG 新提交 70%

SCOUT: Per-Context Reset Curricula for Sparse-Reward Reinforcement Learning

SCOUT:面向稀疏奖励强化学习的每上下文重置课程

Siddharth Aphale, Ayushman Singh

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);分类 cs.LG

AI总结 SCOUT是为每个上下文提供独立重置课程的在线控制器,在六类任务中解决了全局进度无法适配学习差异的问题,无需组标签即可提升稀疏奖励强化学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏