arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-26 至 2026-06-26 共收录 84 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 34 篇

2606.27099 2026-06-26 physics.optics physics.app-ph physics.comp-ph 新提交 50%

Neural Networks for Inverse Design of Cascaded-Mode Near-Field Landscapes

用于级联模式近场景观逆向设计的神经网络

Wannes Luts De Martelaere, Joeri Lenaerts, Vincent Ginis

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出使用人工神经网络解决多模波导中级联模式干涉的近场逆向设计问题,通过梯度优化重构目标近场分布,实现了纵向和横向场设计,展示了深度学习的有效性和可扩展性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27015 2026-06-26 physics.optics 新提交 50%

Temporal wave trapping from dynamical pump pulses

动态泵浦脉冲的时间波捕获

T. Torres, R. Terrier, J. Fatome, B. Kibler, G. Millot, G. P. Agrawal

专题命中 机器人操作 :manipulation(abstract)

AI总结 利用非线性光纤中高阶孤子脉冲的动态演化,理论并实验证明了时间波捕获机制,实现了单脉冲动态时间波导,为全光控制超快信号开辟新途径。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26548 2026-06-26 cond-mat.mtrl-sci physics.comp-ph 新提交 50%

Topological phase transition driven by in-plane spin rotation

面内自旋旋转驱动的拓扑相变

Xinyue Zhu, Yu Xie, Yifei Hao, Fei Gao, Yue Li, Junting Zhang

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出通过连续面内自旋旋转可逆切换拓扑态,基于磁点群对称性约束贝里曲率分布,在二维kagome铁磁陈绝缘体中实现60°旋转翻转陈数符号,并验证超低场超快操作。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24150 2026-06-26 eess.SP 版本更新 50%

Channel Estimation for Beyond Diagonal RIS Exploiting Core Tensor Sparsity

利用核心张量稀疏性的超对角可重构智能表面信道估计

Daniel Costa Araújo, André L. F. de Almeida

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对超对角可重构智能表面(BD-RIS)的信道估计难题,提出利用测量张量的稀疏Tucker分解和信道分量的Kronecker秩一结构的压缩感知框架,开发了STORM和STAR两种算法,实现联合稀疏支撑识别和Kronecker秩一分解,显著降低测量开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
quant-ph/0309126 2026-06-26 quant-ph 50%

Rabi Profile Framework: A Simple Analytical and Graphical Toolkit for Quantum Control

Rabi轮廓框架:一个简单的分析和图形工具包用于量子控制

Duje Bonacci

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出Rabi轮廓、Rabi谱和Rabi泄漏三者构成的量子控制工具,提供评估多能级量子系统相干态控制可行性与选择性的框架,无需数值模拟,并通过超导transmon量子比特设计展示其实用性。

Comments Accepted for publication in American Journal of Physics. 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.14753 2026-06-26 cond-mat.mes-hall cond-mat.mtrl-sci physics.optics 50%

Topological optical and phononic interface mode by simultaneous band inversion

通过同时带倒置产生拓扑光学和声学界面模式

O. Ortiz, P. Priya, A. Rodriguez, A. Lemaitre, M. Esmann, N. D. Lanzillotti-Kimura

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过GaAs/AlAs多层结构实现光和声的同时带倒置,产生共定位的界面模式,验证了其在光学反射率和相干声子生成中的应用,并提出工程规则。

Comments 11 pages, 5 figures, 34 references

Journal ref Optica 8, 598-605 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 11 篇

2603.06480 2026-06-26 cs.RO 版本更新 83%

History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation

基于历史条件的时空视觉令牌剪枝用于高效视觉-语言导航

Qitong Wang, Yijun Liang, Ming Li, Tianyi Zhou, Christopher Rasmussen

机构 * Department of Computer and Information Sciences at the University of Delaware(德克萨斯大学达勒姆分校计算机与信息科学系) University of Maryland’s Department of Computer Science(马里兰大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种无需训练的时空视觉令牌剪枝框架,通过空间令牌选择和时空压缩减少冗余计算,在保持导航精度的同时显著提升推理效率,并在真实机器人上验证了低延迟指令跟随导航。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16932 2026-06-26 cs.RO 版本更新 79%

BAT-Nav: Budget-Aware Arbitration and Termination for Long-Horizon Semantic Navigation

MORN: 为资源理性长周期导航的元认知目标-目标调节

Xi Lin, Kangyi Wu, Jiayi Li, Jiaqiao Tang, Qingrong He, Lin Zhao

机构 * LCSR Lab, Johns Hopkins University(约翰霍普金斯大学LCSR实验室) Xi’an Jiaotong University(西安交通大学) JD Explore Academy, Beijing, China(京东探索研究院,北京,中国)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出MORN,一种基于双过程理论的元认知导航架构,通过引入资源理性机制,解决传统导航系统在长周期任务中因缺乏全局资源意识导致的资源浪费问题,提升了目标完成率和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01461 2026-06-26 cs.CV 版本更新 79%

UltraStar: Semantic-Aware Star Graph Modeling for Echocardiography Navigation

UltraStar: 面向超声心动图导航的语义感知星图建模

Teng Wang, Haojun Jiang, Chenxi Li, Diwen Wang, Yihang Tang, Zhenguo Sun, Yujiao Deng, Shiji Song, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China(自动化系、BNRist、清华大学、北京、中国) School of Automation, Beijing Institute of Technology, Beijing, China(自动化学院、北京理工大学、北京、中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院、北京、中国) Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院、北京、中国)

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV

AI总结 提出UltraStar方法,通过星图将探头导航从路径回归重构为基于锚点的全局定位,并采用语义感知采样策略选择代表性关键帧,有效处理噪声轨迹,在131万样本数据集上优于基线方法。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26383 2026-06-26 cs.LG cs.AI cs.AR cs.MA cs.PF 新提交 62%

SOLAR: AI-Powered Speed-of-Light Performance Analysis

SOLAR: AI驱动的光速性能分析

Qijing Huang, Sana Damani, Zhifan Ye, Athinagoras Skiadopoulos, Siva Kumar Sastry Hari, Jason Clemons, Sahil Modi, Jingquan Wang, Aditya Kane, Edward C Lin, Humphrey Shi, Christos Kozyrakis

机构 * NVIDIA(英伟达)

专题命中 具身导航 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出SOLAR框架,自动从PyTorch和JAX代码推导理论最小执行时间(光速界限),通过LLM前端和确定性分析实现无违反界限的多保真度性能分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26928 2026-06-26 cs.RO cs.SI 新提交 61%

UAV-MapFusion: RTK-Aligned Uncertainty-Aware Coarse-to-Fine Multi-Session UAV Mapping

UAV-MapFusion: RTK对齐的不确定性感知粗到细多会话无人机建图

Feng Pan, Chunran Zheng, Bing Xue, Yukang Cui, Jiayu Wen, Zhiyu Chen, Wei Wang

机构 * College of Automation, Harbin Engineering University(哈尔滨工程大学自动化学院) Department of Mechanical Engineering, University of Hong Kong(香港大学机械工程系) College of Mechatronics and Control Engineering, Shenzhen University(深圳大学机电与控制工程学院)

专题命中 具身导航 :robotics(abstract,comments);分类 cs.RO

AI总结 提出一种不确定性感知的多会话点云地图合并与粗到细优化系统,通过RTK时空对齐和迭代平面因子优化,在抑制长距离漂移的同时保持局部几何精度。

Comments 8 pages, 5 figures, accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26647 2026-06-26 cs.CV 新提交 57%

LayersReg: A Layer-by-Layer Progressive Regressor for Reliable Intraoperative 3D/2D Registration

LayersReg:一种用于可靠术中3D/2D配准的逐层渐进回归器

Xiyuan Wang, Zhenchao Wang, Xinran Chen, Junkai Liu, Chuan Chen, Feng Yin

机构 * School of Biological Science and Medical Engineering(生物科学与医学工程学院) Southeast University(东南大学) School of Engineering, College of Engineering and Physical Sciences(工程学院,工程与物理科学学院) University of Birmingham(伯明翰大学) State Key Laboratory of Digital Medical Engineering(数字医学工程国家重点实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出LayersReg,一种逐层渐进回归范式,通过特征空间搜索像素流趋势迭代收敛到正确空间位姿,在X射线/CT配准和切片定位任务上达到高精度,满足术中实时需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26168 2026-06-26 cs.LG q-bio.QM 新提交 57%

Implementation of reinforcement learning in chemical reaction networks: application to phototaxis as curiosity-driven exploration

强化学习在化学反应网络中的实现:以好奇心驱动的探索为例的趋光性

Ruyi Tang, Grégoire Sergeant-Perthuis, David Colliaux

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 将趋光性建模为部分可观测马尔可夫决策过程,通过化学反应网络常微分方程实现内部状态更新,利用逆强化学习从实验轨迹推断行为目标,揭示游动-翻滚交替作为信息获取策略。

Comments This paper is accepted as talk at ALIFE 2026 (Waterloo, Canada)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08639 2026-06-26 cs.CY cs.AI cs.DL 版本更新 57%

The Journal of Prompt-Engineered (Moral) Philosophy Or: Why AI-Assisted Ethics Research Requires Process Transparency

提示工程(道德)哲学杂志或:为何AI辅助伦理研究需要过程透明

Michele Loi

机构 * University of Milan(米兰大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文探讨了AI辅助伦理研究中过程透明的必要性,提出透明义务应基于主体完整性,通过五个透明元素构建文档充分性框架,以实现未来规范性判断的可能。

Comments 21 pages Transparency material documenting LLM usage available at: https://github.com/MicheleLoi/JPEP.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06080 2026-06-26 cs.CV cs.CY cs.HC 版本更新 57%

AIDEN: Design and Pilot Study of an AI Assistant for the Visually Impaired

AIDEN:面向视障人士的AI助手设计与初步研究

Luis Marquez-Carpintero, Francisco Gomez-Donoso, Zuria Bauer, Bessie Dominguez-Dager, Alvaro Belmonte-Baeza, Mónica Pina-Navarro, Francisco Morillas-Espejo, Felix Escalona, Miguel Cazorla

机构 * Institute for Computer Research, University of Alicante(计算机研究所,阿利坎特大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出AIDEN系统,结合YOLO实时目标检测、LLaVA场景描述与OCR,以及基于盖革计数器隐喻的连续触觉引导,避免听觉过载并保护隐私,实验表明用户满意度高。

Journal ref IEEE Access 14 (2026) 80406-80420

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17916 2026-06-26 cs.CV 版本更新 57%

EndoUFM: Utilizing Foundation Models for Monocular depth estimation of endoscopic images

EndoUFM:利用基础模型进行内窥镜图像的单目深度估计

Xinning Yao, Bo Liu, Bojian Li, Jingjing Wang, Jinghua Yue, Fugen Zhou

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27080 2026-06-26 cs.SE 新提交 50%

ATGBuilder: Feature-Assisted Graph Learning for Activity Transition Graph Construction with Seed Supervision

ATGBuilder: 基于特征辅助图学习的活动转换图构建与种子监督

Chenhui Cui, Zixiang Xian, Danyu Li, Tao Li, Rubing Huang, Dave Towey, Shikai Guo, Jiakun Liu

专题命中 具身导航 :navigation(abstract)

AI总结 提出ATGBuilder,利用大语言模型总结UI布局元数据,并将控件触发信息建模为边属性,通过辅助重构目标进行图学习,在种子监督下构建高质量活动转换图,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 12 篇

2606.26425 2026-06-26 cs.RO 新提交 86%

A System for Fast, Resilient, and Adaptable Loco-Manipulation Behaviors on Humanoid Robots

一种用于人形机器人快速、鲁棒且可适应的移动操作行为的系统

Duncan William Calvert

专题命中 具身推理 :manipulation(title,abstract);robotics(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种机器人本地、运行时可编辑的行为编写与运行系统,结合Coactive Design原则、对象中心Affordance模板、行为树逻辑和运行时场景感知,支持双臂行走、并发动作分层,已部署于多种人形机器人,实现20多种任务变体,可在数分钟或数小时内创建新行为。

Comments PhD dissertation, University of West Florida, Department of Intelligent Systems and Robotics, June 2026. 331 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26694 2026-06-26 cs.CV 新提交 83%

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.CV

AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。

Comments Project page: https://yizhiqianbi.github.io/physeditworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27326 2026-06-26 cs.LG cs.CV cs.RO 新提交 82%

Hallucination in World Models is Predictable and Preventable

世界模型中的幻觉是可预测且可预防的

Nicklas Hansen, Xiaolong Wang

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文发现世界模型中的幻觉源于状态-动作空间的低覆盖区域,提出三种可预测幻觉的信号,并开发覆盖感知采样和好奇心奖励方法,仅需50条真实轨迹即可微调模型适应新环境。

Comments Interactive paper, live demo, code, dataset, and models: https://www.nicklashansen.com/mmbench2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27277 2026-06-26 cs.AI cs.CV 新提交 81%

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

EO-WM: 一种用于概率性地球观测预测的物理信息世界模型

Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Wuhan University(武汉大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。

Comments 28 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26969 2026-06-26 cs.AI cs.CL cs.CV 新提交 81%

Einstein World Models

爱因斯坦世界模型

Munachiso Samuel Nwadike, Zangir Iklassov, Ali Mekky, Zayd M. Kawakibi Zuhri, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) RIKEN AIP, Japan(日本理化学研究所革新智能综合研究中心) Tohoku University(东北大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出爱因斯坦世界模型(EWM),通过将视觉时间展开嵌入推理轨迹,使LLM能利用视觉化反事实事件增强复杂推理能力。

Comments 12 pages (9 without references), 2 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26922 2026-06-26 cs.RO cs.AI 新提交 81%

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling

风险感知的选择性多模态驾驶员监控与驾驶员状态世界建模

Daosheng Qiu, Haozhuang Chi, Hao Su, Shu Long, Xinyue Miao, Yongle Dong, Wei Zhang

机构 * Hubei University(湖北大学) Nanyang Technological University(南洋理工大学) Osaka University(大阪大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出成本感知的选择性推理框架,结合轻量级RGB-生理学生网络和门控机制,在低延迟下减少不安全决策,实现可部署的多模态驾驶员监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27014 2026-06-26 cs.LG 新提交 79%

A Generalization Theory for JEPA-Based World Models

基于JEPA的世界模型的泛化理论

Jingyi Cui, Qi Zhang, Hongwei Wen, Yisen Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) University of Sydney(悉尼大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26713 2026-06-26 cs.AI 新提交 79%

LithoDreamer: A Physics-Informed World Model for Multi-Stage Computational Lithography

LithoDreamer: 一种用于多阶段计算光刻的物理信息世界模型

Yuqi Jiang, Yumeng Liu, Zimu Li, Jinyuan Deng, Qian Jin, Yucheng Cui, Yu Li, Xunzhao Yin, Qi Sun, Cheng Zhuo

机构 * Zhejiang University(浙江大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 提出首个物理信息世界模型LithoDreamer,将光刻流程建模为决策驱动的多步演化系统,通过对比变分优化实现可解释干预,在正向演化和逆向规划中达到最优性能。

Comments Correspondence to: Qi Sun <qisunchn \at zju \dot edu \dot cn>

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Jul. 6-11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03371 2026-06-26 cs.CL 版本更新 78%

See, Infer, Intervene: Proactive World Modeling for Goal-Oriented Social Intelligence

观察、推断、干预:面向目标导向社交智能的主动世界建模

Honghui Zhang, Chenmeinian Guo, Yichen Yu, Guanyu Liu, Yujia Zhang, Yongming Qin, Chongguo Song, Mengyue Yang, Lei Yu, Tianyu Shi

机构 * Mita Technology(Mita技术公司) University of Bristol(布里斯托大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学)

专题命中 具身推理 :world model(title,abstract)

AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。

Comments 16 pages, 3 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27364 2026-06-26 cs.CV 新提交 70%

PhysiFormer: Learning to Simulate Mechanics in World Space

PhysiFormer: 在世界空间中学习模拟力学

Yiming Chen, Yushi Lan, Andrea Vedaldi

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV

AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。

Comments Project page: https://yimingc9.github.io/physiformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26217 2026-06-26 cs.LG cs.CV cs.RO 新提交 67%

Fast LeWorldModel

快速LeWorldModel

Yuntian Gao, Xiangyu Xu

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26410 2026-06-26 cs.CV 新提交 57%

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection

神经体素动力学:通过体素特征平流学习隐式3D物理

Zican Wang, Niloy Mitra

机构 * University College London(伦敦大学学院) Adobe Research(Adobe研究院)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 提出自监督框架,将视频预测瓶颈从2D提升到3D体素潜在空间,通过体素特征平流学习隐式3D物理,无需显式物理引擎,实现异构现象的统一模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 2 篇

2606.27251 2026-06-26 cs.RO cs.AI 新提交 88%

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

推进全模态具身智能体:从孤立技能到日常物理自主

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

专题命中 机器人基础模型 :embodied agent(title,abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏