arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3061 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 350 篇

2606.15594 2026-06-16 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 新提交 83%

Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC

从像素到证明:通过并行保形鲁棒MPC实现概率安全的潜在世界模型控制

Devesh Nath, Anutam Srinivasan, Haoran Yin, Ruitong Jiang, Jeffrey Fang, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出SLS^2框架,结合保形预测与鲁棒模型预测控制,在学习的潜在世界模型中实现基于视觉的安全运动规划,提升目标到达性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12783 2026-06-12 cs.AI 新提交 83%

A Tutorial on World Models and Physical AI

世界模型与物理AI教程

Il-Seok Oh

机构 * Department of Computer Science and Artificial Intelligence/CAIIT, Jeonju, Jeonbuk, South Korea(韩国全北全州计算机科学与人工智能系/CAIIT)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI

AI总结 本文提出统一框架,区分显式与隐式世界模型,并探讨其在机器人、自动驾驶等物理AI领域的应用,以及迈向通用人工智能的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06832 2026-06-08 cs.RO 新提交 83%

STRIPS-WM: Learning Grounded Propositional STRIPS-style World Models from Images

STRIPS-WM:从图像学习基于命题的STRIPS风格世界模型

Abhiroop Ajith, Constantinos Chamzas

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出STRIPS-WM框架,从图像转换中学习符号化世界模型,用于机器人视觉任务规划,提升规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12078 2026-08-13 cs.CV cs.AI cs.LG 新提交 83%

Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models

更好的槽,更好的世界:以对象为中心的世界模型中的表示质量与鲁棒性

Shukrullo Nazirjonov, Sai Prasanna, Anna Manasyan, Georg Martius

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 该研究通过受控实验分析以对象为中心的世界模型,发现槽质量与规划成功率正相关,槽绑定良好时可减少辅助输入,且在分布偏移下其鲁棒性优于LeWM,预训练特征是鲁棒性关键因素。

Comments Published at Model-Based RL in the Era of Generative World Models Workshop at RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10781 2026-07-14 cs.CV cs.RO 新提交 82%

Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models

你所需要的只是能量引导吗?用于驱动世界模型的无训练规范注入

Xiyan Su, Frank Diermeyer, Markus Lienkamp

机构 * Institute of Automotive Technology, Technical University of Munich(慕尼黑工业大学汽车技术研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 研究基于大型视频扩散主干的驾驶世界模型难以控制的问题,提出通过可微能量函数在采样时操控规划轨迹,无需重新训练主干,以Open-Sora 2.0 MM-DiT主干模型为例验证,指出跨流耦合是端到端可控关键。

Comments Accepted to Robotics: Science and Systems 2026 Robot World Models Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06544 2026-08-10 cs.AI cs.CV cs.LG 新提交 82%

TaskSense: Focusing on What Matters in World Models

TaskSense:聚焦世界模型中的关键内容

SM Mazharul Islam, Manfred Huber

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 TaskSense是一种以任务为中心的世界建模框架,通过可微随机空间注意力机制结合辅助逆动力学目标,提升了视觉控制模型对干扰环境的鲁棒性,在Distracting Control Suite上性能优于DreamerV3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02713 2026-08-05 cs.CV cs.AI cs.RO 新提交 82%

Quo Vadis, World Modeling?

世界建模,何去何从?

Yu Yang, Xuemeng Yang, Licheng Wen, Lingdong Kong, Xiaobin Hu, Dongyue Lu, Wei Chow, Xiyan Huang, Yuxiang Feng, Yue Liao, Jianbiao Mei, Daocheng Fu, Rong Wu, Pinlong Cai, Ran Yi, Ying Tai, Jiangning Zhang, Botian Shi, Yong Liu, Shuicheng Yan

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究提出以智能体为中心的交互式世界代理,将世界建模范式从物理状态转换转向智能体可用信息转换,划分六种代理类型与三个赋能层面,为构建赋能智能体的世界代理建立路线图。

Comments Technical Blog at https://worldbench.github.io/awesome-agentic-world-model GitHub Repo at https://github.com/worldbench/awesome-agentic-world-model

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28362 2026-07-31 cs.CV cs.AI cs.LG 新提交 82%

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow

ShadowDancer:通过从视频及其阴影中学习统一动力学表示,赋予视频世界模型任意动作控制能力

Jin Cao, Zian Meng, Kaipeng Zhang

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 ShadowDancer通过阴影对与跨阴影预测学习统一动力学表示,实现视频世界模型的任意动作帧级控制,在多动力学族上的动作迁移与长回放性能优于基线,平均盲胜率达86%。

Comments https://ShadowDancer-1.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 82%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 具身推理 :world model(title,abstract)

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23602 2026-07-28 cs.RO cs.AI cs.LG 新提交 82%

Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models

物理空间中相邻集的动作优于世界模型中的最佳预测

Liangyu Li, Qingwen Liu, Mingqing Liu

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究基于采样和潜在世界模型的控制器存在的条件失败提议过度生成问题,提出相邻集动作重建(ASAR)方法,在携带和释放评估集上,相比匹配选择提高了事件完成成功率,还刻画了选择风险。

Comments 26 pages, 7 figures. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16314 2026-07-21 cs.CV cs.LG cs.RO 新提交 82%

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data

深度正则化JEPA世界模型从真实户外机器人数据中学习更多可转移表示

Usman M. Khan

机构 * Aigen(爱igen)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对从真实户外机器人数据学习世界模型的挑战,引入深度作为训练几何先验,结合SIGReg等方法,训练18M参数模型,实验表明该方法在降低视觉里程计误差、增加意外分数分离及提高多步展开保真度等方面有显著提升,增强了模型泛化能力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05352 2026-07-08 cs.CV cs.AI cs.LG 新提交 82%

Multiplayer Interactive World Models with Representation Autoencoders

基于表示自编码器的多智能体交互世界模型

Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Alyx Liao, Amélie Royer, Manu Orsini, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez

机构 * Epic Games École nationale des ponts et chaussées(法国国家桥梁与道路学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对复杂物理交互的高动态环境,该研究提出首个多智能体世界模型,以多智能体动作流为条件训练隐扩散模型,可实时生成稳定长时四智能体对局,开源相关资源。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02634 2026-07-07 eess.SP 新提交 82%

Metasurface embodied intelligence through electromagnetic world model

通过电磁世界模型实现超表面的具身智能

Che Liu, Zhenhao Fu, Qian Ma, Jiajing Wu, Wen Ming Yu, Lianlin Li, Tie Jun Cui

专题命中 具身推理 :world model(title,abstract);manipulation(abstract)

AI总结 提出超表面具身智能通过世界模型(metaEI-WM)范式,集成语义环境建模与电动力学先验,理解电磁动力学,优化编码配置塑造电磁环境,实现复杂场景中多种无线任务自动化。

Comments 85 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04112 2026-07-07 cs.LG cs.AI cs.CL cs.CV 新提交 82%

DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics

DynaVieW:用于理解分层视觉动态的模式引导世界建模

Silin Gao, Hao Zhao, Zeming Chen, Sepideh Mamooler, Antara Raaghavi Bhattacharya, Qiyu Wu, Hiromi Wakaki, Yuki Mitsufuji, Li Mi, Syrielle Montariol, Antoine Bosselut

机构 * EPFL, Switzerland(瑞士联邦理工学院) Harvard University(哈佛大学) Sony Group Corporation(索尼集团) ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27326 2026-06-26 cs.LG cs.CV cs.RO 新提交 82%

Hallucination in World Models is Predictable and Preventable

世界模型中的幻觉是可预测且可预防的

Nicklas Hansen, Xiaolong Wang

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文发现世界模型中的幻觉源于状态-动作空间的低覆盖区域,提出三种可预测幻觉的信号,并开发覆盖感知采样和好奇心奖励方法,仅需50条真实轨迹即可微调模型适应新环境。

Comments Interactive paper, live demo, code, dataset, and models: https://www.nicklashansen.com/mmbench2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20764 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 82%

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Sun Yat-Sen University(中山大学) Technical University of Munich(慕尼黑工业大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Institute(慕尼黑数据研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18208 2026-06-17 cs.LG cs.AI cs.CL cs.CV 新提交 82%

Looped World Models

循环世界模型

Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang, Jinrui Zeng, Bowen Cao, Lingwei Meng, Mocheng Li, Zezhong Wang, Haonan Yin, Naifu Xue, Minyu Chen, Cenyuan Zhang, Zefan Zhang, Hao Wei, Jiawei Zhou, Haoran Xu, Hao Yang, Ronglai Zuo, Tongda Xu, Yonghao Li, Jian Chen, Hebin Wang, Zeyu Gao, Yang Li, Wei Zhao, Qimin Zhong, Siqi Liu, Yumeng Zhang, Leyan Cui, Zhangyu Wang, Wai Lam

机构 * FaceMind Research Asia

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出循环世界模型(LoopWM),通过参数共享的Transformer块迭代细化潜在环境状态,实现高达100倍参数效率,并建立迭代潜在深度作为世界模拟的新缩放轴。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 82%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract)

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09028 2026-06-09 cs.CV cs.AI cs.RO 新提交 82%

ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models

ATM:用于诊断和改进潜在世界模型的动作一致性转移矩阵

Jiaheng Chen

机构 * School of Software, Northeastern University(东北大学软件学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出ATM矩阵,通过轻量级探针比较真实与预测潜在转移中的动作信息,无需模拟器即可诊断世界模型质量,并引入AITS利用动作可识别性作为训练信号提升下游规划。

Comments 13 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13518 2026-08-14 cs.LG cs.CV 新提交 82%

Intervention-Aware Clinical World Model for Post-Op Outcome Forecasting in Cardiology

面向心脏病术后结局预测的干预感知临床世界模型

Yunsung Chung, Yingshuo Liu, Abboud F. Hassan, Han Feng, Mary M. Maleckar, Nassir Marrouche, Jihun Hamm

机构 * Tulane University(杜兰大学) Simula Research Laboratory(Simula研究实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究针对心脏病术后结局预测的不规则轨迹问题,提出干预感知临床世界模型,在DECAAF-II数据集上实现心房颤动消融后复发预测及疤痕范围估计的良好性能。

Comments Medical World Models (MWM) Workshop at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17959 2026-08-19 cs.AI cs.LG 新提交 81%

Towards Zero-Shot Task Transfer with Neurosymbolic World Models

面向基于神经符号世界模型的零样本任务迁移

Isidoro Tamassia, Lennert De Smet, Giuseppe Marra

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种神经符号世界模型,通过解耦观测重构与奖励预测,实现无需额外环境交互的零样本任务迁移,其泛化能力优于纯神经方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17956 2026-08-19 cs.LG cs.AI eess.SY 新提交 81%

An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models

被遗漏的模式即罕见规则:连续代码世界模型中的采样-验证危险定律

Javier Aguilar Martín

机构 * AGILabs

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究揭示连续代码世界模型中采样-验证机制的危险,通过理论分析与实验发现,LLM合成的模式盲模型易被利用,接受仅能证明样本一致性,无法保证连续控制任务的性能。

Comments 92 pages, 5 figures. Code, data and result artifacts: this https URL (https://github.com/JaviMaligno/code-world-models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17542 2026-08-19 cs.LG cs.AI 新提交 81%

No Gaussian Required: Contrastive Inverse Dynamics for JEPA World Models

无需高斯:用于JEPA世界模型的对比逆动力学

Jack Boylan, Chris Hokamp

机构 * Quantexa(昆泰克萨公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出AC-MTM,用对比逆动力学替代JEPA世界模型的高斯型抗坍塌机制,在多目标视觉任务上性能优于SIGReg,且训练稳定无额外复杂组件

Comments 17 pages, 5 figures. Code: this https URL (https://github.com/jackboyla/action-contrastive-jepa)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16829 2026-08-18 cs.LG cs.AI 新提交 81%

CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?

CaliBench:视频世界模型的随机动力学是否经过物理校准?

Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke

机构 * Odyssey(奥德赛公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 CaliBench用于测试视频世界模型的物理校准,将性能分解为可评分性与校准度,发现多数场景-模型组合显著未校准,发布了mnTV指标用于模型对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15156 2026-08-18 cs.RO cs.AI 新提交 81%

Low-Rank Dynamics-Effective Latent Carriers for Counterfactual Rollout in Learned World Models

用于学习世界模型中反事实滚动的低秩动力学有效潜在载体

Yang Liu, Yuming Chen

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文针对学习世界模型的反事实滚动问题,提出基于低秩动力学有效潜在载体的方法,在两物体碰撞环境中验证秩4修补块可实现稳定的12步自主反事实滚动,且效果可复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14952 2026-08-18 cs.RO cs.CV eess.SP 新提交 81%

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

不存在的证据:当视觉失效时维持世界模型的跨模态溯因风险感知

Cong Xu, Ravi Sankar

机构 * University of South Florida(南佛罗里达大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究提出跨模态溯因风险感知方法,在视觉失效时通过声学线索维持世界模型,可提前1.7秒预警,虚警减少42%,校准良好,能在视觉退化下保持高危险感知度。

Comments 7 pages, 3 figures. Working draft prepared for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14022 2026-08-17 cs.CV cs.AI 新提交 81%

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

ForgeWM:面向少步骤动作条件视频世界模型的渐进式因果训练

Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

机构 * CUHK(香港中文大学) Tencent PCG(腾讯平台与内容事业群) FDU(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 ForgeWM 是一种渐进式框架,通过多阶段技术将双向动作条件视频生成器转化为少步骤世界模型,在 Minecraft 和 FPS 游戏任务中实现了更优的可控少步骤视频生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12959 2026-08-14 cs.LG cs.AI 新提交 81%

The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use

目标是瓶颈:潜在世界模型编码了其规划器无法使用的内容

Joyjeet Singh

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现潜在世界模型的规划瓶颈在于规划器目标而非预测器,通过替换目标无需额外训练即可大幅提升长视野规划性能,揭示模型编码了规划器未利用的可达性信息。

Comments Follow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10386 2026-08-12 cs.LG cs.RO 新提交 81%

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving

Dreamer-SAC:用于样本高效自动驾驶的潜世界模型离线策略学习

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出Dreamer-SAC框架,结合循环状态空间世界模型与离线策略SAC算法,在自动驾驶场景中优于DreamerV3、SAC等基线,且所需真实环境交互更少。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08553 2026-08-11 cs.CV cs.LG cs.MM 新提交 81%

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏