arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-25 至 2026-03-25 共收录 52 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 13 篇

2602.12288 2026-03-25 eess.SY cs.AI cs.RO cs.SY 88%

Energy-Aware Reinforcement Learning for Robotic Manipulation of Articulated Components in Infrastructure Operation and Maintenance

面向智能基础设施运维的节能强化学习机器人操作

Xiaowen Tao, Yinuo Wang, Haitao Ding, Yuanyang Qi, Ziyu Song

机构 * National Key Laboratory of Automotive Chassis Integration and Bionics(汽车底盘集成与仿生国家重点实验室) Jilin University(吉林大学) School of Computer Science and Statistics(计算机科学与统计学学院) Trinity College Dublin(都柏林大学) Department of Civil Engineering(土木工程系)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种节能强化学习框架,通过紧凑几何表示和约束马尔可夫决策过程实现异构机械部件的高效操作,实验显示能耗降低16%-30%且成功率高。

Comments 18 pages, 5 figures, 7 tables. This version supersedes all previous preprint versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23227 2026-03-25 cs.RO 83%

Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation

基于球面谐波的高效混合SE(3)-等变视觉运动流策略用于机器人操作

Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Dexmal

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出E3Flow框架,通过球面谐波表示实现高效且稳定的多模态等变学习,提升机器人操作的性能、效率和数据效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22760 2026-03-25 cs.RO 83%

SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation

SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作

Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li, Junxi Li, Jianwen Xie, Hao Su, Zhuowen Tu

机构 * UC San Diego(南加洲大学) Lambda, Inc(Lambda公司)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13670 2026-03-25 cs.RO 83%

NL2SpaTiaL: Generating Geometric Spatio-Temporal Logic Specifications from Natural Language for Manipulation Tasks

NL2SpaTiaL: 从自然语言生成几何时空逻辑规范用于操作任务

Licheng Luo, Kaier Liang, Yu Xia, Mingyu Cai

机构 * University of California, Riverside(加州大学河滨分校) Lehigh University(莱恩大学)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文提出NL2SpaTiaL框架,通过生成层次化逻辑树实现自然语言到时空逻辑规范的高效转换,解决了传统方法在深度嵌套下的性能问题,验证了结构化方法在操作任务验证中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23365 2026-03-25 cs.RO 79%

PinPoint: Monocular Needle Pose Estimation for Robotic Suturing via Stein Variational Newton and Geometric Residuals

PinPoint:通过Stein变分牛顿和几何残差进行机器人缝合的单目针姿态估计

Jesse F. d'Almeida, Tanner Watts, Susheela Sharma Stern, James Ferguson, Alan Kuntz, Robert J. Webster

机构 * Department of Mechanical Engineering, Vanderbilt University(范德比尔特大学机械工程系) Department of Electrical and Computer Engineering and Department of Computer Science, Vanderbilt University(范德比尔特大学电气与计算机工程系和计算机科学系) The Robotics Center and the Kahlert School of Computing, University of Utah(犹他大学机器人中心和Kahlert计算学院)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO

AI总结 PinPoint通过Stein变分牛顿和几何残差方法,解决单目内窥镜下针姿态估计的深度模糊和旋转对称性问题,显著降低位姿估计误差。

Comments 15 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG 77%

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12101 2026-03-25 cs.DS 71%

Efficient Binary Decision Diagram Manipulation in External Memory

外部内存中二进制决策图操作的高效方法

Steffan Christ Sølvsten, Jaco van de Pol, Anna Blume Jakobsen, Mathias Weller Berg Thomasen

专题命中 机器人操作 :manipulation(title)

AI总结 本文提出基于迭代I/O高效算法的BDD操作方法,改进了原有算法性能,并扩展至其他BDD操作,实现更高效的外部内存处理。

Comments 41 pages, 14 figures and 7 tables; Sølvsten, S.C. et al. (2022). Adiar: Binary Decision Diagrams in External Memory. In: Tools and Algorithms for the Construction and Analysis of Systems (TACAS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23152 2026-03-25 cs.RO 57%

PHANTOM Hand

PHANTOM手

Teng Yan, Jiongxu Chen, Qixiang Hua, Yue Yu, Zihang Wang, Yaohua Liu, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 PHANTOM手通过结合精确分析形状与鲁棒合规抓取,实现自由运动规划的亚度精度和连续可预测力输出,提升欠驱动手的负载与灵活性。

Comments 8 pages. Submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01356 2026-03-25 cs.CV 57%

Quasi-Conformal Convolution : A Learnable Convolution for Deep Learning on Simply Connected Open Surfaces

准共形卷积:一种用于深度学习在单连通开放曲面上的可学习卷积

Han Zhang, Tsz Lok Ip, Lok Ming Lui

机构 * Department of Mathematics, City University of Hong Kong(香港城市大学数学系) Department of Mathematics, Chinese University of Hong Kong(香港中文大学数学系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出准共形卷积(QCC),通过准共形理论在单连通开放曲面上定义卷积,结合可训练估计模块实现自适应卷积操作,用于几何数据的分类与医学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23102 2026-03-25 cond-mat.soft 50%

Template-free fabrication of reconfigurable magnetic micropillars and filaments through controlled Nanoflower assembly and actuation

无需模板的可重构磁性微柱和丝的制备:通过受控的纳米花组装与驱动

Caterina Landi, Rosa Pérez-Garrido, Julio Marco Cuenca, Javier Tajuelo, Chantal Valeriani, Helena Gavilán, Fernando Martínez-Pedrero

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出一种无需模板的自组装策略,利用可控的纳米花组装和驱动,制备出动态、响应磁场的磁性微柱和丝,展示了其在微流体操控和生物微机器人中的应用潜力。

Comments 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22747 2026-03-25 physics.optics 50%

Standing-Wave Optical Trap Based on Retro-Reflection Photonic Nanojet

基于反反射驻波光子纳 jet 的光学陷阱

Yu. E. Geints, I. V. Minin, O. V. Minin

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出一种基于反反射驻波光子纳 jet 的创新光学陷阱,通过双不同几何形状微粒形成开放共振腔,实现高光场强度,提升光学捕获能力,且技术实现简单,可集成微流控技术进行纳米物体操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01714 2026-03-25 cond-mat.mes-hall 50%

Electric spin and valley Hall effects

电荷自旋和谷Hall效应

W. Zeng

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出电荷自旋和谷Hall效应,通过垂直电场在二维材料中产生横向自旋和谷电流,揭示了电场诱导的背反射相位机制,为自旋和谷Hall效应提供了新方法。

Comments 6 pages, 4 figures

Journal ref Phys. Rev. B 113, 115421 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17820 2026-03-25 cond-mat.supr-con cond-mat.mes-hall 50%

Electric Control of Polarity in Spin-Orbit Josephson Diode

铁磁控旋轨耦合在约瑟夫森二极管中的极性控制

Junghyun Shin, Jae-Ho Han, Anjali Rathore, Joon Sue Lee, Seung-Bo Shim, Jinwoong Cha, Sunghun Park, Junho Suh

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过调控局部电场观察到约瑟夫森二极管极性反转,揭示了旋轨耦合对非 reciprocal 约瑟夫森电流的影响,理论模型解释了极性反转与磁场的关系。

Comments 39 pages, 18 figures, 1 table

Journal ref Phys. Rev. Applied 25, 034070 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 11 篇

2603.22800 2026-03-25 cs.RO 79%

CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation

CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航

Aditya Potnis, Francisco Affonso, Shreya Gummadi, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22502 2026-03-25 cs.RO 79%

MapForest: A Modular Field Robotics System for Forest Mapping and Invasive Species Localization

MapForest:一种用于森林制图和入侵物种定位的模块化野外机器人系统

Sandeep Zachariah, Francisco Yandun, Sachet Korada, Abhisesh Silwal

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 具身导航 :robotics(title,abstract);分类 cs.RO

AI总结 本文提出MapForest,一种模块化机器人系统,利用多模态传感器数据生成GIS-ready的入侵物种地图,通过LiDAR-惯性制图、图像识别和地理参考制图实现精准定位,实验显示其在GNSS间断环境下具有高精度和鲁棒性。

Comments 8 pages, 9 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23112 2026-03-25 cs.RO 74%

Active Robotic Perception for Disease Detection and Mapping in Apple Trees

主动机器人感知用于苹果树疾病检测与制图

Hayden Feddock, Francisco Yandun, Srđan Aćimović, Abhisesh Silwal

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Plant Pathology, Virginia Polytechnic Institute and State University(弗吉尼亚理工大学植物病理学系)

专题命中 具身导航 :robotic(title);分类 cs.RO

AI总结 本文提出一种自主移动主动感知系统,用于在苹果树休眠期精准检测和制图疾病,通过融合多种传感技术实现疾病症状的精确定位,并评估了三种视角规划策略以提升观测精度。

Comments 8 pages, 6 figures, IROS 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23342 2026-03-25 cs.RO cs.AI 73%

Edge Radar Material Classification Under Geometry Shifts

边缘雷达材质分类在几何位移下的应用

Jannik Hohmann, Dong Wang, Andreas Nüchter

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种轻量级毫米波雷达材质分类方法,用于低功耗边缘设备,在正常训练几何下宏F1达94.2%,但在现实几何位移下性能下降至68.5%,通过归一化、几何增强和运动感知特征提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22583 2026-03-25 cs.CV cs.RO 62%

A vision-language model and platform for temporally mapping surgery from video

一种用于手术时间映射的视觉-语言模型和平台

Dani Kiyasseh

机构 * Halsted AI

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Halsted模型,基于Halsted手术图谱实现手术行为映射,提供更全面且高效的解决方案,并开发Halsted平台使外科医生能自动映射自身手术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22312 2026-03-25 cs.AI cs.CL cs.LG 62%

The Efficiency Attenuation Phenomenon: A Computational Challenge to the Language of Thought Hypothesis

思维效率衰减现象:对思维语言假说的计算挑战

Di Zhang

机构 * School of Advanced Technology(先进技术学院)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文通过计算实验探讨思维是否需要语言式格式,提出AI私有语言假想实验,证明在多智能体强化学习中,高效协议在被迫使用人类可理解语言时效率下降,挑战了思维语言假说。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22903 2026-03-25 cs.RO 57%

Task-Aware Positioning for Improvisational Tasks in Mobile Construction Robots via an AI Agent with Multi-LMM Modules

面向即兴任务的移动建筑机器人AI代理的定位任务感知

Seongju Jang, Francis Baek, SangHyun Lee

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16228 2026-03-25 cs.RO 57%

PA-LVIO: Real-Time LiDAR-Visual-Inertial Odometry and Mapping with Pose-Only Bundle Adjustment

PA-LVIO: 基于姿态仅捆绑调整的实时激光雷达-视觉-惯性里程计与建图

Hailiang Tang, Tisheng Zhang, Liqiang Wang, Xin Ding, Man Yuan, Xiaoji Niu

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出PA-LVIO,通过姿态仅捆绑调整实现高精度实时激光雷达-视觉-惯性里程计与建图,结合无边际化和帧到地图的激光雷达测量模型,消除里程计漂移,实现高精度点云地图生成。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09204 2026-03-25 cs.RO 57%

Risk-Aware Obstacle Avoidance Algorithm for Real-Time Applications

面向实时应用的风险感知障碍避障算法

Ozan Kaya, Emir Cem Gezer, Roger Skjetne, Ingrid Bouwer Utne

机构 * Department of Marine Technology, Norwegian University of Science and Technology(挪威科学技术大学海洋技术系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种混合风险感知导航架构,结合障碍物概率建模与平滑轨迹优化,提升自主水面 vessel 在动态环境中的安全性和自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11467 2026-03-25 eess.SY cs.SY 50%

A Goal-Oriented Approach for Active Object Detection with Exploration-Exploitation Balance

面向目标的主动物体检测与探索-利用平衡方法

Yalei Yu, Matthew Coombes, Wen-Hua Chen, Cong Sun, Myles Flanagan, Jingjing Jiang, Pramod Pashupathy, Masoud Sotoodeh-Bahraini, Peter Kinnell, Niels Lohse

专题命中 具身导航 :robotic(abstract)

AI总结 本文提出一种面向目标的主动物体检测方法,通过探索-利用平衡的成本函数指导下一步视角选择,结合不确定性估计实现高效检测,适用于未知环境中的制造任务。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19341 2026-03-25 physics.bio-ph q-bio.CB 50%

Competing chemical gradients change chemotactic dynamics and cell distribution

竞争性化学梯度改变趋化动力学和细胞分布

Emiliano Perez Ipiña, Brian A. Camley

专题命中 具身导航 :navigation(abstract)

AI总结 研究探讨了细胞在多个趋化梯度下如何整合和优先处理信号,揭示了梯度感知精度对细胞导航行为的影响,包括各向异性空间模式和不同约束程度的细胞分布。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 9 篇

2603.22796 2026-03-25 cs.CV cs.AI cs.RO 85%

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

专题命中 具身推理 :robotic(title);embodied agent(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI 84%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02982 2026-03-25 cs.CV cs.RO 84%

U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences

U4D:从LiDAR序列中构建不确定性感知的4D世界模型

Xiang Xu, Alan Liang, Youquan Liu, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) SKL-TI

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出U4D框架,通过估计空间不确定性图和分阶段生成方法,提升LiDAR序列的几何精度和时间一致性,推动自动驾驶感知与模拟的可靠性。

Comments CVPR 2026; 20 pages, 7 figures, 11 tables; Code at https://github.com/worldbench/U4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23497 2026-03-25 cs.CV 79%

WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG

WildWorld: 一个大规模动态世界建模数据集,包含动作和显式状态,面向生成式ARPG

Zhen Li, Zian Meng, Shuwei Shi, Wenshuo Peng, Yuwei Wu, Bo Zheng, Chuanhao Li, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,Shanda AI东京研究院) Beijing Institute of Technology(北京理工大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Tsinghua University(清华大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出WildWorld数据集,通过AAA动作角色扮演游戏Monster Hunter: Wilds自动收集,包含1.08亿帧视频和450多种动作,包含骨骼、世界状态、相机姿态和深度图标注,用于评估动作跟随和状态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-03-25 cs.AI 79%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07145 2026-03-25 cs.CV 79%

LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models

LiveWorld: 生成视频世界模型中模拟视线外动态

Zicheng Duan, Jiatong Xia, Zeyu Zhang, Wenbo Zhang, Gengze Zhou, Chenhui Gou, Yefei He, Feng Chen, Xinyu Zhang, Lingqiao Liu

机构 * Adelaide University(阿德莱德大学) The Australian National University(澳大利亚国立大学) Monash University(莫纳什大学) Zhejiang University(浙江大学) University of Auckland(奥克兰大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 LiveWorld提出了一种新框架,解决视频世界模型中视线外动态缺失问题,通过持久化全球状态和监控机制实现持续演化,提升场景一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏