arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-28 至 2026-07-28 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 12 篇

2607.24207 2026-07-28 cs.RO 新提交 88%

FloAff-Kitchen: Bridging Navigation and Manipulation via Canonical and Progressive Floor Affordance Learning

FloAff-Kitchen:通过规范和渐进式地面可供性学习连接导航与操作

Ping Zhong, Manling Teng, Tao Wu, Bolei Chen, Jiazhi Xia, Jianxin Wang

专题命中 具身推理 :manipulation(title,abstract);navigation(title,abstract);分类 cs.RO

AI总结 研究针对移动操作中FloAff预测难题,提出含规范表示学习和渐进式可供性先验学习的统一框架,引入CFAR和PFAL,建立FloAff-Kitchen基准,实验证明该方法优于基线,验证了组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23899 2026-07-28 cs.RO cs.AI 新提交 86%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 具身推理 :world model(title,journal_ref);robotics(abstract,comments);navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28963 2026-07-28 cs.RO cs.AI cs.CV cs.LG 版本更新 83%

AutoWorld: Learning Multi-Agent Traffic Simulation with Self-Supervised World Models

AutoWorld: 通过自监督世界模型扩展多智能体交通仿真

Mozhgan Pourkeshavarz, Tianran Liu, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出AutoWorld框架,利用未标记的LiDAR数据自监督学习世界模型,提升多智能体交通仿真的真实感与性能,实验表明未标记数据能有效提升仿真效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23602 2026-07-28 cs.RO cs.AI cs.LG 新提交 82%

Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models

物理空间中相邻集的动作优于世界模型中的最佳预测

Liangyu Li, Qingwen Liu, Mingqing Liu

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究基于采样和潜在世界模型的控制器存在的条件失败提议过度生成问题,提出相邻集动作重建(ASAR)方法,在携带和释放评估集上,相比匹配选择提高了事件完成成功率,还刻画了选择风险。

Comments 26 pages, 7 figures. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24267 2026-07-28 cs.RO 新提交 79%

FeelWorld: Visuo-Tactile World Model for Hierarchical Contact Prediction and Planning

FeelWorld:用于分层接触预测和规划的视觉触觉世界模型

Wenxuan Ma, Chaofan Zhang, Chao Xue, Yinghao Cai, Guocai Yao, Shaowei Cui, Shuo Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Imprintx Robotics(印记机器人公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 研究针对现有视觉世界模型忽视触觉状态问题,提出分层视觉触觉世界模型FeelWorld,通过联合预测视觉和触觉状态、引入注意力机制及训练方法,实现接触预测与规划,实验表明其能降低预测误差并提高规划成功率。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23517 2026-07-28 cs.CV 新提交 79%

Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction

用于上身人体-物体交互的实时以人为中心的世界建模

Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

机构 * Tongyi Lab(通义实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 该研究提出用于上身人体-物体交互的实时以人为中心世界模型,采用连续-离散联合控制方案,结合多尺度运动编码的连续人体状态控制与语言编码离散交互状态控制,能精确建模人物与环境交互,提炼后实现高效实时推理,实验验证了其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23147 2026-07-28 cs.CR cs.AI 新提交 79%

False Prophets: On the Security of World Models in Agentic Systems

虚假预言:论智能体系统中世界模型的安全性

Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究智能体系统中世界模型的安全性,发现其存在特定漏洞,引入安全基准数据集,指出攻击者能诱导错误预测,成功率达95%,并为从业者提供减轻危害、强化系统的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22430 2026-07-28 cs.LG 版本更新 79%

On the Identifiability of Controlled World Models

关于受控世界模型的可识别性

Xiangteng Zhang, Yang Guan, Bo Zhang, Hongyang Li, Ya-Qin Zhang, Shengbo Eben Li

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24720 2026-07-28 cs.CL cs.AI cs.LG 新提交 62%

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后

Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 57%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22732 2026-07-28 cs.AI 新提交 57%

Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning

大语言模型游戏智能体中的空间推理:因果上下文和多步规划的影响

Mohit Jiwatode, Ronja Fuchs, Robin Schmöcker, Bodo Rosenhahn, Alexander Dockhorn

专题命中 具身推理 :navigation(abstract);分类 cs.AI

AI总结 研究基于大语言模型的游戏智能体在复杂任务中表现不佳的问题,通过实验验证因果提示增强和多步规划可提升胜率并控制延迟,引入新基准评估,发现较大模型定位更准,融入因果上下文和多步规划能优化性能与速度。

Comments To be published at COG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新 57%

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏