arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-31 至 2026-03-31 共收录 11 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 11 篇

2603.26814 2026-03-31 cs.CV cs.RO 84%

arg-VU: Affordance Reasoning with Physics-Aware 3D Geometry for Visual Understanding in Robotic Surgery

arg-VU:结合物理感知的3D几何进行视觉理解的意图推理

Nan Xiao, Yunxin Fan, Farong Wang, Fei Liu

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Stanford University(斯坦福大学)

专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV

AI总结 arg-VU通过整合时间一致的几何跟踪与约束诱导的机械建模,提升手术场景中变形组织的意图推理能力,实现更稳定和物理一致的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27287 2026-03-31 cs.RO cs.CV 81%

Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving

Uni-World VLA:自主驾驶中的交织世界建模与规划

Qiqi Liu, Huan Xu, Jingyu Li, Bin Sun, Zhihui Hao, Dangen She, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Li Auto Inc.(理想汽车) University of Surrey(萨里大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出Uni-World VLA模型,通过交织未来帧预测与轨迹规划提升自主驾驶决策能力,结合单目深度信息增强场景预测。

Comments 22 pages, 8 figures. Submitted to ECCV 2026. Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25716 2026-03-31 cs.CV cs.AI 81%

Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models

视线之外但未被遗忘:动态视频世界模型的混合记忆

Kaijin Chen, Dingkang Liang, Xin Zhou, Yikang Ding, Xiaoqiang Liu, Pengfei Wan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出混合记忆机制,解决动态主体消失后重现时的连续性问题,通过HM-World数据集和HyDRA架构提升视频世界模型的动态一致性与生成质量。

Comments Project Page: https://kj-chen666.github.io/Hybrid-Memory-in-Video-World-Models/ Code: https://github.com/H-EmbodVis/HyDRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16377 2026-03-31 cs.RO cs.AI 81%

VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving

VLM-SAFE: 基于世界模型的视觉-语言模型引导的安全强化学习用于自动驾驶

Yansong Qu, Zilin Huang, Zihao Sheng, Jiancong Chen, Yue Leng, Samuel Labi, Sikai Chen

机构 * Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建筑工程学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出VLM-SAFE框架,通过观察-想象-评估-行动闭环,利用视觉语言模型提供语义安全信号,结合世界模型预测未来轨迹,优化策略以提升自动驾驶的安全性和效率。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25240 2026-03-31 q-bio.QM cs.AI q-bio.GN 79%

Lingshu-Cell: A generative cellular world model for transcriptome modeling toward virtual cells

Lingshu-Cell: 一个生成性细胞世界模型用于转录组建模以实现虚拟细胞

Han Zhang, Guo-Hua Yuan, Chaohao Yuan, Tingyang Xu, Tian Bian, Hong Cheng, Wenbing Huang, Deli Zhao, Yu Rong

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 Lingshu-Cell通过生成式模型学习转录组状态分布,支持在扰动下进行条件模拟,能够准确复现转录组分布和细胞亚型比例,展现复杂细胞异质性的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV 79%

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV 77%

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 具身推理 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25741 2026-03-31 cs.CV cs.AI cs.RO 67%

Vega: Learning to Drive with Natural Language Instructions

Vega:通过自然语言指令学习驾驶

Sicheng Zuo, Yuxuan Li, Wenzhao Zheng, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) GigaAI

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Vega模型,通过自然语言指令生成和规划,提升自动驾驶的灵活性和个性化水平,基于大规模驾驶数据集InstructScene进行实验验证。

Comments Code is available at https://github.com/zuosc19/Vega

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI 62%

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01342 2026-03-31 cs.CV 57%

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next:无需视频-文本监督的通用视频基础模型

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26997 2026-03-31 cs.RO cs.HC 57%

ROSClaw: An OpenClaw ROS 2 Framework for Agentic Robot Control and Interaction

ROSClaw: 一种用于代理机器人控制与交互的OpenClaw ROS 2框架

Irvin Steve Cardenas, Marcus Anthony Arnett, Natalie Catherine Yeo, Lucky Sah, Jong-Hoon Kim

机构 * Advanced Telerobotics Research Lab, Kent State University(肯特州立大学先进远程机器人研究实验室) OpenDive Technologies

专题命中 具身推理 :embodied AI(abstract);分类 cs.RO

AI总结 ROSClaw通过整合OpenClaw代理运行时与ROS 2,实现任意基础模型与ROS-enabled机器人之间的交互,支持动态能力发现、多模态观察归一化、预执行动作验证和结构化审计日志,验证了执行层设计对任务完成与安全行为的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏