arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-18 至 2026-03-18 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 6 篇

2603.16860 2026-03-18 cs.RO 85%

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器

Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14497 2026-03-18 cs.CV cs.RO 81%

WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning

WorldVLM:结合世界模型预测与视觉语言推理

Stefan Englmeier, Katharina Winter, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用科学大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 WorldVLM结合视觉语言模型与世界模型,通过统一架构提升自动驾驶中的环境预测与决策能力,解决空间理解受限问题。

Comments 8 pages, 6 figures, 5 tables; submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16306 2026-03-18 cs.CV 57%

DriveFix: Spatio-Temporally Coherent Driving Scene Restoration

DriveFix:时空一致的驾驶场景修复

Heyu Si, Brandon James Denis, Muyang Sun, Dragos Datcu, Yaoru Li, Xin Jin, Ruiju Fu, Yuliia Tatarinova, Federico Landi, Jie Song, Mingli Song, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 DriveFix提出一种多视角修复框架,通过交错扩散变换器架构和几何感知损失,实现驾驶场景时空一致性,提升4D世界建模的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13961 2026-03-18 cs.CV 57%

USIS-PGM: Photometric Gaussian Mixtures for Underwater Salient Instance Segmentation

USIS-PGM:用于水下显著实例分割的光度高斯混合

Lin Hong, Xiangtong Yao, Mürüvvet Bozkurt, Xin Wang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering(电子与计算机工程系) The Hong Kong University of Science and Technology(香港科学与技术大学) School of CIT, Chair i6(CIT学院,Chair i6) Technical University of Munich(慕尼黑技术大学) School of CIT(CIT学院) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 本文提出USIS-PGM框架,通过频率感知模块增强边界线索,结合动态加权模块进行内容自适应特征重加权,利用光度高斯混合生成多尺度高斯热图以监督解码器特征,提升水下显著实例分割的定位精度和掩码预测的结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13029 2026-03-18 cs.CV 57%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 具身推理 :manipulation(abstract);分类 cs.CV

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16253 2026-03-18 cs.CV 57%

Open-Vocabulary Octree-Graph for 3D Scene Understanding

开放词汇八叉树图用于3D场景理解

Zhigang Wang, Yifei Su, Chenhui Li, Dong Wang, Yan Huang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) CASIA TeleAI

专题命中 具身推理 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出Octree-Graph,通过CGSM和IFA算法获取3D实例及语义特征,构建适应性八叉树结构以高效表示场景,实验表明其在多种任务中具有广泛适用性和有效性。

Comments Accepted by ICCV25. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏