arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3021 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 553 篇

2606.14893 2026-06-16 cs.HC 新提交 50%

Automated Gaze-based Behavioral Segmentation and Temporal Representation for Bridge Inspection in Unconstrained 3D Environments

基于自动注视行为分割与时间表示的非约束三维环境桥梁检测

Daniel Jimenez Gil, Haosen Zhang, Zixin Wang, Mohamad Alipour

专题命中 具身导航 :navigation(abstract)

AI总结 提出自动分析框架,将非约束3D注视、头部运动、无人机导航和场景几何数据分割为全局扫描、局部检测和导航三种功能模式的时间序列,提取行为描述符,揭示检测策略差异及与性能的关系。

Comments 46 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13797 2026-06-15 astro-ph.EP astro-ph.IM physics.pop-ph 新提交 50%

Solar System Technosignatures

太阳系技术印记

T. Joseph W. Lazio

专题命中 具身导航 :robotic(abstract)

AI总结 本文利用行星探测和天文巡天数据,评估了太阳系中可能存在的技术印记(如星际探测器或表面遗迹)的探测极限,发现目前仅能给出极粗略的上限,且某些大型探测器或遗迹可能未被发现。

Comments 21 pages, 4 figures; based on invited presentation at IAU Symposium 404 "Advancing the Search for Technosignatures," https://www.iau.org/Iau/Science/Scientific-Meetings/IAUM2026/IAUS404.aspx

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13612 2026-06-12 cs.CR 新提交 50%

Beyond the IT Checklist: Engineering a Reasonable Standard of Care for Cyber Safety

超越IT检查清单:为网络安全设计合理的注意标准

Matthew E. Jablonski, Linton Wells, Kathryn B. Laskey, F. Brett Berlin

专题命中 具身导航 :navigation(abstract)

AI总结 本文通过分析292份关键基础设施政策文件,指出当前以IT合规为中心的网络安全方法不足以应对网络物理系统的安全风险,并提出基于危险特定可追溯性、结构化保证案例和网络弹性工程的现代化注意标准。

Comments 6 pages, 2 figures, Accepted for publication and presentation the Cyber Safety Summit, Washington, D.C., 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11442 2026-06-11 cs.SE cs.PL 新提交 50%

Web-Native Graphical EMF Model Editors

Web原生图形化EMF模型编辑器

Susanne Göbel, Ralf Lämmel

专题命中 具身导航 :navigation(abstract)

AI总结 提出纯Web框架EMFular,基于Ecore模型自动生成图形编辑器,支持EMF一致性操作与Angular扩展,实现低代码生成、高可定制与无后端部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11747 2026-06-11 physics.atom-ph 新提交 50%

Ambiguity-Free Inertial Measurement with Multi-Wavelength Atom Interferometry

多波长原子干涉仪的无模糊惯性测量

Wei-Chen Jia, Yue Xin, Ke Shen, Yan-Ying Feng

专题命中 具身导航 :navigation(abstract)

AI总结 通过多波长原子干涉合成包络实现无模糊惯性测量,实验演示了双轴旋转与加速度传感,并解决了传统原子干涉仪的相位模糊问题。

Comments 10 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10907 2026-06-10 cs.CY cs.IR 新提交 50%

From Prompt to Purchase: How AI Brand Recommendations Move Consumers on the Open Web

从提示到购买:AI品牌推荐如何在开放网络上推动消费者行为

Michael Iannelli, Alan Ai

专题命中 具身导航 :navigation(abstract)

AI总结 通过面板数据结合点击流和AI对话,发现AI推荐品牌后,用户搜索、访问品牌网站和零售商页面显著增加,且效应在控制预趋势后依然显著。

Comments 10 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10423 2026-06-10 cs.CL 新提交 50%

WebChallenger: A Reliable and Efficient Generalist Web Agent

WebChallenger: 一个可靠且高效的通用型Web智能体

Jayoo Hwang, Xiaowen Zhang, Vedant Padwal

机构 * ML Collective longsurf.ai Independent(独立研究者)

专题命中 具身导航 :navigation(abstract)

AI总结 提出WebChallenger框架,通过PageMem结构化页面表示、分治观察、轻量探索记忆和复合动作工作流,复现人类认知优势,使开源模型在多个Web导航基准上接近前沿专有系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09870 2026-06-10 cs.CR cs.DB cs.DC cs.MM cs.NI eess.IV 新提交 50%

Safecloud: A Distributed, Encrypted Storage Cloud for Streaming

Safecloud: 一种用于流媒体的分布式加密存储云

Gregory Magarshak

专题命中 具身导航 :navigation(abstract)

AI总结 提出Safecloud,一种分布式加密存储与流媒体网络,通过密钥分层、收敛内容寻址和并行树结构实现端到端加密、去重和高效流式访问,并引入基于腐败证明的经济激励机制。

Comments 7 pages, 2 tables. Reference implementation open-source. Companion to Intercloud (arXiv:2605.22830) and a forthcoming Safecloud 2.0 compute paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10513 2026-06-10 cond-mat.soft physics.bio-ph physics.flu-dyn 新提交 50%

Moving backward to go faster: Diatom-inspired sliding reveals efficient modes of locomotion

向后移动以更快:受硅藻启发的滑动揭示高效运动模式

Julien le Dreff, Blaise Delmotte

专题命中 具身导航 :robotic(abstract)

AI总结 研究受硅藻菌落启发,发现链内相邻细胞间的滑动产生内部剪切,驱动与经典波动游泳方向相反的推进,实现更高速度和能效,最佳性能出现在波长远大于链长时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07719 2026-06-09 eess.SP 新提交 50%

Hessian-matching Based Weighting for Attitude Determination Using Short-Range DoA Measurements with IMU Assistance

基于Hessian匹配的短距离DoA测量与IMU辅助姿态确定加权方法

Chenxin Tu, Hengchuan Zhang, Xiaowei Cui, Gang Liu, Mingquan Lu

专题命中 具身导航 :navigation(abstract)

AI总结 针对短距离场景下方向向量误差各向异性问题,提出基于Hessian匹配的标量加权策略,通过流形高斯-牛顿法求解协方差加权正交Procrustes问题,并引入IMU重力向量提升精度与鲁棒性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06880 2026-06-08 cs.IR 新提交 50%

Towards Retrieving Interaction Spaces for Agentic Search

面向智能体搜索的交互空间检索

Shengyao Zhuang, Yuansheng Ni, Hengxin Fun, Jimmy Lin, Xueguang Ma

专题命中 具身导航 :navigation(abstract)

AI总结 提出RISE方法,通过BM25构建有边界的交互空间,并预处理文档支持shell式导航,在BrowseComp-Plus上以约四分之一成本达到78%准确率,优于纯shell基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07331 2026-06-08 quant-ph cond-mat.dis-nn 新提交 50%

Performance analysis of classical adiabatic annealing on Ising machines

经典绝热退火在伊辛机上的性能分析

Jacob Lamers, Guy Verschaffelt, Guy Van der Sande

专题命中 具身导航 :navigation(abstract)

AI总结 本文通过连续方法分析经典绝热退火技术,提出混合经典绝热退火策略,并在MaxCut等问题上测试,发现其相比现有简单方法无显著优势。

Comments 14 pages, 10 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 343 篇

2607.13560 2026-07-16 q-bio.NC cs.AI 新提交 89%

Grounded world models in biological organisms and future embodied AI

生物有机体和未来具身人工智能中的基础世界模型

Giovanni Pezzulo, Davide Nuzzi, Marco D'Alessandro, Riccardo Proietti, Roberto Bottini, Paul Cisek

专题命中 具身推理 :embodied AI(title,abstract);world model(title,abstract);navigation(abstract);分类 cs.AI

AI总结 研究探讨生物有机体中基础世界模型,通过五个神经回路例子揭示当前具身人工智能缺失的特征,如内在动力学作用等,还讨论了生物系统原则对未来具身人工智能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09298 2026-08-11 cs.RO cs.AI 新提交 88%

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) EvoPhys AI(EvoPhys人工智能公司) Joy Future Academy, JD(京东探索研究院) The University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 具身推理 :world model(title,abstract);manipulation(title);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。

Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01603 2026-08-04 cs.RO 新提交 88%

AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation

AffordTrajDP:用于机器人操纵的动态 affordance 引导视觉运动策略学习

Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 针对静态 affordance 导致的机器人操纵轨迹漂移问题,提出 AffordTrajDP 动态框架,以物体为中心传播锚点 affordance 生成轨迹,在 ManiSkill3 上成功率达70.0%,现实实验验证其鲁棒性与组件有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24207 2026-07-28 cs.RO 新提交 88%

FloAff-Kitchen: Bridging Navigation and Manipulation via Canonical and Progressive Floor Affordance Learning

FloAff-Kitchen:通过规范和渐进式地面可供性学习连接导航与操作

Ping Zhong, Manling Teng, Tao Wu, Bolei Chen, Jiazhi Xia, Jianxin Wang

专题命中 具身推理 :manipulation(title,abstract);navigation(title,abstract);分类 cs.RO

AI总结 研究针对移动操作中FloAff预测难题,提出含规范表示学习和渐进式可供性先验学习的统一框架,引入CFAR和PFAL,建立FloAff-Kitchen基准,实验证明该方法优于基线,验证了组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04652 2026-07-07 cs.RO 新提交 88%

KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation

KAM-WM:基于潜在世界模型的机器人操作运动学可供性地图

Xinyu Shao, Keru Zhou, Guowei Huang, Yajun Gao, Tongtong Cao, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 具身推理 :manipulation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 研究如何从少量演示中学习操作,提出KAM-WM框架,从冻结的潜在视频世界模型提取粗粒度方向交互线索,转化为运动学可供性地图,结合其他信息控制机器人,在实验中取得较好成果。

Comments 16 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00457 2026-07-02 cs.AI 新提交 88%

Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments

面向演化环境中具身智能体的多尺度世界模型混合

Jinwoo Jang, Daniel J. Rho, Sihyung Yoon, Hyunsuk Cho, Honguk Woo

专题命中 具身推理 :embodied agent(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 提出MuSix框架,通过尺度感知的世界模型混合与演化,解决具身智能体在动态环境中的多尺度推理和知识适应问题,在EmbodiedBench和HAZARD上超越现有方法。

Comments Accepted at ECCV 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09876 2026-08-11 cs.RO cs.AI 新提交 88%

Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning

用于物理一致性开放世界运动规划的能量结构化潜在世界模型与神经时间场

Yapeng Liu, Yuanzhao Zhai, Bo Ding, Huaimin Wang, Lin Wang

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 针对开放世界运动规划的物理一致性挑战,提出能量结构化潜在世界模型ELWM,结合物理条件神经时间场PC-NTF,显著提升了运动预测精度与导航成功率,降低了碰撞率与残差。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09813 2026-06-09 cs.RO cs.CV 新提交 88%

iMaC: Translating Actions into Motion and Contact Images for Embodied World Models

iMaC: 将动作转化为运动与接触图像用于具身世界模型

Zhenyu Wu, Xiuwei Xu, Yukun Zhou, Yifan Li, Qiuping Deng, Xiaofeng Wang, Zheng Zhu, Bingyao Yu, Ziwei Wang, Jiwen Lu, Haibin Yan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) GigaAI Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);manipulation(abstract);robotic(abstract)

AI总结 提出iMac框架,将原始视觉图像作为动作表示,通过图像-动作编码器和动态预测器实现高保真未来状态预测和闭环控制,在预测精度、任务成功率和跨场景泛化上优于传统向量动作控制。

Comments Project page: https://imac-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18697 2026-06-23 cs.LG cs.CR cs.RO 新提交 87%

Stealthy World Model Manipulation via Data Poisoning

通过数据投毒进行隐蔽的世界模型操纵

Yibin Hu, Xiaolin Sun, Zizhan Zheng

机构 * Department of Computer Science(计算机科学系)

专题命中 具身推理 :world model(title,abstract);manipulation(title);分类 cs.RO、cs.LG

AI总结 提出SWAAP框架,通过两阶段数据投毒(双层级优化寻找有害目标模型+梯度匹配隐蔽实现)操纵学习到的世界模型,导致规划性能显著下降,且能规避多种防御检测。

Comments 41 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20653 2026-07-24 cs.RO cs.CV cs.LG 新提交 87%

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

PhysCoRe:用于材料感知可变形动力学的物理校正残差世界模型

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对可变形物体操作演变预测难题,提出PhysCoRe模型,结合可微MPM模拟器与两个前馈神经网络,通过MfM和RfD模块实现物理校正与残差学习,提升预测精度,其置信度分布为未来探索提供信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02403 2026-07-03 cs.RO cs.AI cs.CV 新提交 87%

ACID: Action Consistency via Inverse Dynamics for Planning with World Models

ACID: 通过逆动力学实现行动一致性以用于世界模型规划

Gawon Seo, Dongwon Kim, Suha Kwak

机构 * POSTECH KAIST(韩国科学技术院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出ACID框架,通过逆动力学模型引入循环行动一致性约束,改进基于世界模型的决策时规划,在多种任务中提升规划效果并降低计算成本。

Comments Project Page: [this https URL](https://gawon1224.github.io/ACID/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13678 2026-08-17 cs.RO cs.LG 新提交 86%

hint$^2$: Hierarchical World Models for Inference-Time Temporal Logic Guidance

hint$^2$:用于推理时态逻辑引导的分层世界模型

Moritz Zoellner, Anastasios Manganaris, Ahmed H. Qureshi, Rohan Paleja

机构 * Purdue University(普渡大学)

专题命中 具身推理 :world model(title,abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出hint$^2$,一种用分层世界模型引导策略满足LTL规范的方法,在CALVIN基准及真实UR5e机械臂实验中,其性能优于现有推理引导方法。

Comments Videos available on our project page: https://anonymous-hint2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05799 2026-08-07 cs.RO cs.CV 新提交 86%

XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?

XEWorld:基于动作的世界模型能否泛化至未见过的机器人 embodiment?

Yixiang Chen, Jiabing Yang, Yuan Xu, Qisen Ma, Keji He, Peiyan Li, Kai Wang, Ziheng He, Xiangnan Wu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对XEWorld测试平台,发现基于动作的世界模型因视觉与物理动力学解耦不足,难以跨机器人 embodiment 泛化,需架构创新突破瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26336 2026-07-30 cs.LG cs.MA cs.RO 新提交 86%

Learning Implicit Causal World Models from Multi-Agent Demonstrations

从多智能体演示中学习隐式因果世界模型

Jasorsi Ghosh

专题命中 具身推理 :world model(title,abstract);navigation(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 该研究针对多智能体系统中世界模型因相关性与因果机制混淆导致分布偏移下失效的问题,提出隐式因果世界模型,经评估在协调任务上表现出可解释因果表示且精度随干预强度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19343 2026-07-22 cs.CV cs.RO 新提交 86%

Masked Visual Actions for Unified World Modeling

用于统一世界建模的掩码视觉动作

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

机构 * Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学帕克分校) Harvard University(哈佛大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究如何将动作传达给视频模型用于机器人世界建模,提出掩码视觉动作这一像素空间控制接口,经微调后单个检查点在多场景和实施例中表现出色,在下游操作中能辅助策略评估、改进决策和支持逆建模。

Comments Project webpage: https://masked-visual-actions.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03964 2026-07-07 cs.RO cs.AI 新提交 86%

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03461 2026-07-07 cs.CV cs.LG 新提交 86%

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.CV、cs.LG

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00148 2026-07-02 cs.RO cs.CV 新提交 86%

3D Point World Models: Point Completion Enables More Accurate Dynamics Learning

3D点云世界模型:点云补全实现更准确的动力学学习

Skand Peri, Hung Nguyen, Chanho Kim, Li Fuxin, Stefan Lee

机构 * Oregon State University(俄勒冈州立大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出3D点云世界模型(3DPWM),通过先补全部分点云再学习动作条件动力学,实现长时程可靠推演和精确成本评估,支持多种机器人操作任务。

Comments 21 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏