arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3061 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 350 篇

2607.17599 2026-07-21 cs.CV 新提交 57%

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交 57%

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12894 2026-07-15 cs.CV 新提交 57%

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Hy-Embodied-VLM-1.0:高效的物理世界智能体

Ziyi Wang, Xumin Yu, Yongming Rao, Yonggen Ling, Yunheng Li, Oran Wang, Mingqi Gao, Yuchen Zhou, Yves Liang, Zuyan Liu, Yani Zhang, Rui Huang, Xiaoran Xu, Bowen Yuan, Yifu Yuan, Xu Tan, He Zhang, Yufei Huang, Shenghao Zhang, Hongsheng Wu, Han Hu, Zhengyou Zhang

机构 * Tencent Robotics X(腾讯Robotics X团队) Hy Vision Team(腾讯混元视觉团队) Futian Laboratory(福田实验室)

专题命中 具身推理 :embodied agent(abstract);分类 cs.CV

AI总结 研究旨在构建物理世界具身智能体,介绍Hy-Embodied-VLM-1.0模型。定义以行动为中心的能力分类法,开发数据管道。基于特定主干和编码器构建模型,用专家混合架构提升效率。在多基准测试中性能出色,较上一代有显著提升,在具身智能任务中也表现强大。

Comments Tech Report. Code and models are open-sourced at https://github.com/Tencent-Hunyuan/HY-Embodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11964 2026-07-15 cs.LG 新提交 57%

LIDAR-AD: A Decoder-Free Latent-Interaction Dreamer with Action-Residual Chains for Autonomous Driving

LIDAR-AD:一种用于自动驾驶的无解码器潜在交互梦想家与动作残差链

Yongzhi Liu, Yang Xiao, Zhong Cao, Zeng Kang, Sunan Zhang, Zhaozhi Dong, Guojun Yu, Weichao Zhuang

机构 * School of Mechanical Engineering, Southeast University(东南大学机械工程学院) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) Xheart Technology Co., Ltd.(芯驰科技有限公司)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 研究针对自动驾驶中多源观测冗余问题,提出LIDAR-AD,用减少冗余的潜在对齐取代观测重建,将车辆控制建模为残差动作更新,经实验验证其在模拟场景和现实布局下性能优异,能提升风险感知等能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 57%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07475 2026-07-09 cs.RO 新提交 57%

Agent-Exploitation Affordances: From Basic to Complex Representation Patterns

智能体-利用可供性:从基本到复杂的表示模式

Bastien Dussard, Aurélie Clodic, Guillaume Sarthou

机构 * LAAS-CNRS, Université de Toulouse, CNRS, Toulouse, France(LAAS-CNRS、图卢兹大学、CNRS、图卢兹、法国)

专题命中 具身推理 :robotics(abstract);分类 cs.RO

AI总结 研究社会机器人领域中智能体的合作可供性概念,提出易于处理的本体表示,通过组合基本模式描绘多样场景,展现此表示的有效性,助力人工智能体理解与环境交互及拓展行动可能。

Journal ref International Conference on Social Robotics (16th Edition), Oct 2024, Odense, Denmark. pp.443-455

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02846 2026-07-07 cs.AI 新提交 57%

Object-Centric Environment Modeling for Agentic Tasks

用于智能任务的以对象为中心的环境建模

Yiyang Li, Tianyi Ma, Zehong Wang, Yijun Ma, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究大语言模型智能体经验维护难题,提出以对象为中心的环境建模(OCM),将经验组织成可执行模型,含对象知识与过程知识,在线更新并验证,实验表明其能提升智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01767 2026-07-07 cs.AI 新提交 57%

Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts

修复放大器,而非症状:面向智能体轨迹的稳定世界模型修正

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 针对长流程规划中的图级错误,提出WM-SAR方法,通过子图放大反向定位因果子图进行修复,在有限token预算下优于传统扫描修复方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31399 2026-07-07 cs.AI 新提交 57%

World-Model Collapse as a Phase Transition

世界模型崩溃作为相变

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究长时域语言代理隐式世界模型中的相变现象,通过确定性任务族的大规模网格搜索揭示从解决平台到崩溃的相图,并证明世界状态保真度先于动作有效性失效。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02376 2026-07-03 cs.AI cs.MA 新提交 57%

Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems

面向安全关键实时自主系统的硬件强制语义协调

Uwe M. Borghoff, Paolo Bottoni, Remo Pareschi

机构 * Department of Computer Science University of the Bundeswehr Munich Neubiberg, Germany Department of Computer Science Sapienza University of Rome Rome, Italy STAKE Lab University of Molise Campobasso, Italy

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 针对异构组件并发运行下的协调问题,提出基于FPGA的硬件强制语义协调架构,将TB-CSPN协调机制映射到硬件原语,实现确定性协调和安全保障。

Comments 1 figure, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26410 2026-06-26 cs.CV 新提交 57%

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection

神经体素动力学:通过体素特征平流学习隐式3D物理

Zican Wang, Niloy Mitra

机构 * University College London(伦敦大学学院) Adobe Research(Adobe研究院)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出自监督框架,将视频预测瓶颈从2D提升到3D体素潜在空间,通过体素特征平流学习隐式3D物理,无需显式物理引擎,实现异构现象的统一模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23455 2026-06-23 cs.CV 新提交 57%

MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing

MeGAS: 用于热物理场景编辑的热力学动态高斯泼溅

Zesong Yang, Yuanhang Lei, Liyuan Cui, Yihang Chen, Jiaer Huang, Boming Zhao, Peter Yichen Chen, Hujun Bao, Zhaopeng Cui

机构 * State Key Laboratory of CAD\&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) University of British Columbia(不列颠哥伦比亚大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出MeGAS框架,将热力学相变动力学融入3D高斯泼溅,通过温度属性、热对流-扩散求解器和MPM动力学实现热物理现象的物理真实合成,并采用拓扑自适应渲染策略处理极端变形。

Comments Accepted by ECCV 2026. Project page: http://zju3dv.github.io/MeGAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22131 2026-06-23 cs.CV 新提交 57%

Feed-forward Motion In-betweening for Any 4D

任意4D的前馈运动插值

Hiroki Nishizawa, Hubert P. H. Shum, Yoshihiro Fukuhara, Hirokatsu Kataoka, Shigeo Morishima

机构 * Waseda University(早稻田大学) AIST(产业技术综合研究所) Durham University(杜伦大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出一种基于关键帧条件的前馈插值框架,利用网格VAE和MMDiT骨干的整流流模型,实现任意4D网格的快速运动插值,在DyMesh16和DyMesh32上表现优异。

Comments Video: https://youtu.be/jZAjPUtSq38?si=aXtDMDviFdfkjKUU

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20583 2026-06-23 cs.NI cs.AI 新提交 57%

Physical-AI: From Channel Awareness to Environmental Intelligence in 6G Wireless Networks

Physical-AI: 从信道感知到6G无线网络中的环境智能

Farooque Hassan Kumbhar, Kapal Dev, Sunder Ali Khowaja, Alexandros-Apostolos A. Boulogeorgos, Mehdi Bennis, Yuanwei Liu

机构 * Augmented Cognition Meta-communications ERC Research Center, Korea University, Korea(增强认知元通信ERC研究中心,韩国大学,韩国) Department of Computer Science, Munster Technological University (MTU)(计算机科学系,穆斯特技术大学(MTU)) School of Computing, Faculty of Engineering and Computing, Dublin City University, Ireland(计算学院,工程与计算学院,都柏林城市大学,爱尔兰) Department of Electrical and Computer Engineering of the Democritus University, Greece(德米特里大学电气与计算机工程系,希腊) Department of Electrical and Computer Engineering, The University of Hong Kong, Hong Kong(电气与计算机工程系,香港大学,香港) Department of Electronic Engineering, Kyung Hee University, Yongin-si, Gyeonggi-do 17104, South Korea(电子工程系, Kyung Hee大学, Yongin-si, Gyeonggi-do 17104, 韩国)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 提出Physical-AI架构,利用自监督时空无线电基础模型将分布式观测转化为共享环境表征,通过多推理头估计阻塞、用户分布等环境属性,并基于神经决策层实现主动控制,降低中断概率和阻塞响应延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19776 2026-06-19 cs.CV 新提交 57%

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

Occ-VLM: 面向室内场景理解的占用接地视觉语言模型

Jianing Li, Zhou Fang, Yijiang Liu, Li Du

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15162 2026-06-16 cs.CV 新提交 57%

GeoStream: Toward Precise Camera Controlled Streaming Video Generation

GeoStream:迈向精确相机控制的流式视频生成

Yizhou Zhao, Yifan Wang, Xiaoyuan Wang, Yushu Wu, Hao Zhang, Moayed Haji-Ali, Rameen Abdal, Ashkan Mirzaei, Yanyu Li, Willi Menapace, Laszlo Jeni, Sergey Tulyakov, Peter Wonka, Chaoyang Wang

机构 * CMU(卡内基梅隆大学) Northeastern University(东北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Rice University(莱斯大学) Snap Inc.(Snap公司) KAUST(阿卜杜拉国王科技大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出GeoStream框架,通过自刷新3D缓存和在线策略蒸馏,实现自回归流式视频生成中的精确度量级相机控制,解决了现有方法在视角移动时控制失效和分布偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13607 2026-06-16 cs.AI 新提交 57%

Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning

推理即模式匹配:人类与LLM日常推理中的共享机制

Zach Studdiford, Gary Lupyan

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究通过比较人类和25个LLM在日常因果推理中的错误模式,发现两者均表现出模式匹配而非抽象世界模型驱动的推理,并识别出LLM中驱动响应的注意力头可预测人类推理错误。

Comments 13 pages main text, 51 pages supplementary text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09134 2026-06-09 cs.RO cs.AI cs.CL cs.CV cs.GR 新提交 56%

From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs

从USD场景到知识图谱:基于LLM的零样本本体接地

Jiangtao Shuai, Zongxiong Chen, Manfred Hauswirth, Sonja Schimmler

机构 * Technical University of Berlin(柏林工业大学) Fraunhofer FOKUS(弗劳恩霍夫开放通信系统研究所)

专题命中 具身推理 :分类 cs.RO、cs.AI、cs.CV;robotics(comments)

AI总结 研究利用大语言模型(LLM)零样本地将3D场景对象自动映射到本体类别,无需训练,在厨房场景中达到90-96%准确率,并揭示语义线索是关键。

Comments Accepted to the IEEE ICRA 2026 International Joint Workshop on Ontologies, Semantic Maps and Autonomous Robotics Standardization (J-WOSMARS 2026), Vienna, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01747 2026-08-04 eess.SP 新提交 50%

Ten Years of Deep Learning for Wireless Communications: From Learned Blocks to Deployable Wireless Intelligence

十年深度学习在无线通信中的应用:从学习模块到可部署的无线智能

Hao Ye, Geoffrey Ye Li, Biing-Hwang Juang

专题命中 具身推理 :world model(abstract)

AI总结 本文梳理了十年间深度学习在无线通信领域从替代孤立模块到开发无线智能的三次转变,指出未来无线AI发展需结合物理基础、智能体能力与标准化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00883 2026-08-04 eess.SY cs.SY 新提交 50%

Critical Inertia Estimation for the Three U.S. Interconnections

美国三大互联电网的关键惯量估计

Jiaojiao Dong, Sneha Fariha, Rocio Uria Martinez, Wen Wang, Yilu Liu

专题命中 具身推理 :world model(abstract)

AI总结 该研究针对美国三大互联电网,通过全尺寸PSS/E和PowerWorld模型仿真,得出不同电网的关键惯量对应的IBRs渗透率,指出需用全动态仿真指导高可再生能源下的输电规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00876 2026-08-04 cs.HC 新提交 50%

Who's That Player?: Externalizing Query Interpretation in Spoken XR Sports Interaction

那个球员是谁?:在沉浸式体育交互中外部化查询解释

Chunggi Lee, Tica Lin, Yalong Yang, Hanspeter Pfister

专题命中 具身推理 :navigation(abstract)

AI总结 本研究针对XR体育观赛中语音查询歧义导致的误读问题,构建外部化查询解释的设计空间并开发XR足球系统,用户研究显示外部化可提升可检查性但存在可见性-行动差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21107 2026-07-24 hep-th 新提交 50%

One-point holographic correlator in the expanding universe

膨胀宇宙中的单点全息关联器

Souvik Paul, Gopinath Guin, Sunandan Gangopadhyay

专题命中 具身推理 :world model(abstract)

AI总结 研究膨胀宇宙中大量算符的随时间变化的热单点函数,采用Randall-Sundrum II膜世界模型结合p膜气体,运用测地线公式计算,通过以色列交界条件得膜位置,分析了不同物质主导宇宙中热单点函数的早晚行为。

Comments 34 Pages Latex, 8 Figures, Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14550 2026-07-17 cs.MA 新提交 50%

World-Model-Aware Responsibility Allocation in Heterogeneous Logistics Systems

异构物流系统中世界模型感知责任分配

Artan Markaj, Niklas Jobs, Felix Gehlhoff

专题命中 具身推理 :world model(abstract)

AI总结 研究异构物流系统中自主与非自主设备混合时的责任分配问题,提出世界模型感知责任框架WMARF,依模型质量和自动化水平动态分权限并分类死锁,通过模拟验证其有效性及随自主性提高仍有效的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14103 2026-07-17 cs.CL cs.MA 新提交 50%

Latent Communication Between Language Model Agents: Channels, Alignment, and the Limits of Text

语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性

Markus Wenzel

机构 * Constructor University(康斯坦丁大学)

专题命中 具身推理 :world model(abstract)

AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09836 2026-07-14 gr-qc astro-ph.HE astro-ph.SR 新提交 50%

Compact stars in a large-tension braneworld: mildly negative Weyl coupling consistent with NICER and gravitational-wave data

大张力膜世界中的致密星:与NICER和引力波数据一致的轻度负外尔耦合

Samuel Isidoro dos Santos Júnior, Rafael Camargo Rodrigues de Lima, Pedro Henrique Ribeiro da Silva Moraes

专题命中 具身推理 :world model(abstract)

AI总结 该研究利用多信使观测的贝叶斯推断,在唯象膜世界模型中约束致密星参数空间,结合多种观测进行分析,得出大张力膜世界中轻度负外尔耦合与现有数据一致,无需大幅偏离广义相对论的结论。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31561 2026-07-01 hep-th gr-qc hep-ph 新提交 50%

Kaluza-Klein Gravitons in a Higher Curvature Warped Geometry : A New Perspective

高曲率翘曲几何中的卡鲁扎-克莱因引力子:一个新视角

Abhirup Karmakar, Isika Mandal, Soumitra SenGupta

专题命中 具身推理 :world model(abstract)

AI总结 本文在五维f(R)引力翘曲膜世界中,通过欧几里得路径积分求解引力子涨落的薛定谔方程,得到高曲率修正对KK引力子谱和耦合的影响,发现质量上移、截面压低而衰变宽度增强。

Comments 31 pages, 6 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 175 篇

2607.06706 2026-07-09 cs.RO cs.AI cs.LG 新提交 91%

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述

Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn

机构 * Chef Robotics RovifyLab IT Application Research Center, Jeonbuk Regional Branch Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)

专题命中 机器人基础模型 :robotics(title,abstract);manipulation(title,abstract);navigation(abstract);world model(abstract)

AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。

Comments 56 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27251 2026-06-26 cs.RO cs.AI 新提交 88%

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

推进全模态具身智能体:从孤立技能到日常物理自主

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

专题命中 机器人基础模型 :embodied agent(title,abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13886 2026-06-15 cs.RO cs.CV cs.LG 新提交 88%

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation

PhysVLA:面向物理基础的VLA用于具身机器人操作

Namai Chandra, Shriram Damodaran, Lin Wang

机构 * IIT Madras(印度理工学院马德拉斯分校) Nanyang Technological University(南洋理工大学)

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.CV、cs.LG

AI总结 提出PhysVLA,一种即插即用的推理时框架,通过相位有限状态机和选择性欧拉-拉格朗日门,在不重新训练的情况下为任何冻结的VLA骨干注入物理约束,提升成功率、稳定性和轨迹效率。

Comments 9 pages, 5 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11618 2026-06-11 cs.IT math.IT 新提交 88%

Vision-Language-Action Models Meet World Models: Embodied Agentic AI for Low-Altitude Wireless Networks

视觉-语言-动作模型遇见世界模型:面向低空无线网络的具身智能体AI

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Cunhua Pan, Dong In Kim, Naofal Al-Dhahir

专题命中 机器人基础模型 :embodied agent(title,abstract);world model(title,abstract)

AI总结 提出具身智能体无人机框架,以VLA模型为核心实现端到端决策,引入世界模型建模环境动态,通过记忆与反射机制形成闭环优化,实现低空无线网络的鲁棒自主控制。

详情

展开后加载摘要…

URL PDF HTML 收藏