arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-25 至 2026-03-25 共收录 9 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 9 篇

2603.22796 2026-03-25 cs.CV cs.AI cs.RO 85%

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

专题命中 具身推理 :robotic(title);embodied agent(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI 84%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02982 2026-03-25 cs.CV cs.RO 84%

U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences

U4D:从LiDAR序列中构建不确定性感知的4D世界模型

Xiang Xu, Alan Liang, Youquan Liu, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) SKL-TI

专题命中 具身推理 :world model(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出U4D框架,通过估计空间不确定性图和分阶段生成方法,提升LiDAR序列的几何精度和时间一致性,推动自动驾驶感知与模拟的可靠性。

Comments CVPR 2026; 20 pages, 7 figures, 11 tables; Code at https://github.com/worldbench/U4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23497 2026-03-25 cs.CV 79%

WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG

WildWorld: 一个大规模动态世界建模数据集,包含动作和显式状态,面向生成式ARPG

Zhen Li, Zian Meng, Shuwei Shi, Wenshuo Peng, Yuwei Wu, Bo Zheng, Chuanhao Li, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,Shanda AI东京研究院) Beijing Institute of Technology(北京理工大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Tsinghua University(清华大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出WildWorld数据集,通过AAA动作角色扮演游戏Monster Hunter: Wilds自动收集,包含1.08亿帧视频和450多种动作,包含骨骼、世界状态、相机姿态和深度图标注,用于评估动作跟随和状态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-03-25 cs.AI 79%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07145 2026-03-25 cs.CV 79%

LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models

LiveWorld: 生成视频世界模型中模拟视线外动态

Zicheng Duan, Jiatong Xia, Zeyu Zhang, Wenbo Zhang, Gengze Zhou, Chenhui Gou, Yefei He, Feng Chen, Xinyu Zhang, Lingqiao Liu

机构 * Adelaide University(阿德莱德大学) The Australian National University(澳大利亚国立大学) Monash University(莫纳什大学) Zhejiang University(浙江大学) University of Auckland(奥克兰大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 LiveWorld提出了一种新框架,解决视频世界模型中视线外动态缺失问题,通过持久化全球状态和监控机制实现持续演化,提升场景一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01415 2026-03-25 cs.RO cs.AI 73%

RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems

RoboMemory:一种脑启发的多记忆代理框架,用于物理具身系统中的交互环境学习

Mingcong Lei, Honghao Cai, Yuyuan Yang, Yimou Wu, Jinke Ren, Zezhou Cui, Liangchen Tan, Junkun Hong, Gehan Hu, Shuangyu Zhu, Shaohan Jiang, Ge Wang, Junyuan Tan, Zhenglin Wan, Zheng Li, Zhen Li, Shuguang Cui, Yiming Zhao, Yatong Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK-Shenzhen(SSE,CUHK-深圳) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Ising AI

专题命中 具身推理 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出RoboMemory框架,通过整合空间、时间、事件和语义记忆,提升机器人在复杂环境中的长期规划与交互学习能力,实验表明其在EmbodiedBench上成功率提升26.5%,超越现有SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22899 2026-03-25 cs.RO 70%

Agile-VLA: Few-Shot Industrial Pose Rectification via Implicit Affordance Anchoring

Agile-VLA: 通过隐式 affordance 锚定实现少样本工业姿态校正

Teng Yan, Zhengyang Pei, Chengyu Shi, Yue Yu, Yikun Chen, Zilong Zhu, Zelin Fang, Kaile Guo, Zihang Wang, Peigen Tian, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身推理 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出Agile-VLA框架,通过隐式affordance锚定机制将几何视觉线索映射为参数化动作原语,减少对高延迟语义推理的依赖,实现边缘设备上的高频率动态操作控制。

Comments 8 pages. Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22561 2026-03-25 cs.AI 57%

AI Mental Models: Learned Intuition and Deliberation in a Bounded Neural Architecture

AI 心智模型:在有限神经架构中学习的直觉与推理

Laurence Anthony

机构 * Waseda University(早稻田大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文探讨有限神经架构是否能在经典64项演绎推理基准上实现直觉与推理的分工。研究提出双路径架构,通过直觉与推理路径的分离,展示出在交叉验证中推理路径的显著优势,表明模型具备结构化内部计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏