arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-07 至 2026-07-07 共收录 9 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 具身与机器人 9 篇

2512.11797 2026-07-07 cs.RO cs.CV 版本更新 84%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02604 2026-07-07 cs.CV cs.RO 新提交 83%

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation

DynaWM:用于移动物体操纵的基于基础VLA的世界基础模型

Chongkei Chang, Zhidong Deng

机构 * Department of Computer Science and Technology, THUAI, Tsinghua University, Beijing 100084, China(计算机科学与技术系,THUAI,清华大学,北京100084,中国)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 针对移动物体操纵挑战,提出DynaWM模型,用多种编码器提取特征,联合条件流匹配DiT生成动作轨迹,构建数据集评估,相比其他模型有性能提升,消融实验验证各部分作用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03283 2026-07-07 cs.AI 新提交 81%

Embodied Operators and Benchmarking: Toward Reusable and Deployable Embodied Intelligence Systems

具身算子与基准测试:迈向可复用和可部署的具身智能系统

Junwu Xiong, Jiaxuan Gao, Wei Chai, Renxing Chen, Yuzhen Li, Yu Guo, Yucheng Guo, Mingxi Luo, Wenyang Ma, Yiyun Mou, Yifei Zhang, Chen Zhou, Yongjian Guo

机构 * JDT Tsinghua University(清华大学) Tianjin University(天津大学) Beihang University(北京航空航天大学)

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究具身智能系统中可复用功能模块即具身算子,明确其定义边界、构建分类法,提出多维度基准框架,探讨加速及挑战,为具身智能系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04927 2026-07-07 cs.RO cs.AI 新提交 71%

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

DSWAM:用于细粒度机器人操作的双系统世界行动基础模型

Jian Zhu, Jianjun Zhang, Taiyi Su, Tianbin Liu, Zhangyuan Wang, Kai Xie, Zitai Huang, Chong Ma, Youzhang He, Tianjian Wang, Hanyang Wang, Weihao Ding, Yi Xu

机构 * AIRC, Midea Group(美的集团美云智数) Tongji University(同济大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02542 2026-07-07 cs.AI cs.CV 新提交 71%

iFLYTEK-Embodied-Omni Technical Report

科大讯飞-具身全能技术报告

Yuan Zhang, Jingfei Ni, Guanchen Lu, Shiqi Zhang, Qingshan Xu, Chi Liu, Xin Nie, Wenjie Xu, Lin Gao, Zhiyuan Cheng, Mingxin Zhou, Jiajia Wu, Diyuan Liu, Jia Pan, Chao Ji

机构 * iFLYTEK LindenBot University of Science and Technology of China(中国科学技术大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 研究通用具身智能体,提出统一多模态基础模型iFLYTEK-Embodied-Omni,通过共享多模态自注意力联合建模视觉、语言和动作,结合多种数据构建数据集并采用四阶段策略训练,实现脑-小脑协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00678 2026-07-07 cs.CV cs.RO 新提交 71%

ABot-M0.5: Unified Mobility-and-Manipulation World Action Model

ABot-M0.5:统一移动与操作的世界动作模型

Ronghan Chen, Yandan Yang, Zuojin Tang, Dongjie Huo, Tong Lin, Haoning Wu, Haoyun Liu, Yuzhi Chen, Lulu Zheng, Botai Yuan, Tianlun Li, Mingxin Wang, Dekang Qi, Bin Hu, Wei Mei, Yuze Xuan, Haolong Yang, Yanqing Zhu, Mu Xu, Zhiheng Ma, Xinyuan Chang

机构 * AMAP CV Lab(AMAP CV实验室)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 针对移动操作任务中VLA策略缺乏世界建模、动作空间耦合及训练-推理不一致的问题,提出ABot-M0.5模型,通过三级对齐(时间粒度、动作空间、训练-测试一致性)实现细粒度控制,在长时域任务成功率和控制精度上达到最优。

Comments Code: https://github.com/amap-cvlab/ABot-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 69%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 具身与机器人 :world-model(abstract);world-model(abstract);分类 cs.RO

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 69%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30988 2026-07-07 cs.RO 新提交 69%

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

多感官持续学习:将预训练的视觉运动策略适应到力觉

Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 具身与机器人 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 提出MuSe方法,通过多阶段融合、多感官未来预测和预训练数据经验回放,将有限的多感官数据融入预训练的纯视觉策略,在保持原始任务性能的同时适应新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏