arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-21 至 2026-04-21 共收录 11 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 11 篇

2604.16405 2026-04-21 cs.RO cs.AI cs.CV cs.LG 83%

ICAT: Incident-Case-Grounded Adaptive Testing for Physical-Risk Prediction in Embodied World Models

ICAT:基于事件-案例的自适应测试用于体素世界模型中的物理风险预测

Zhenglin Lai, Sirui Huang, Yuteng Li, Changxin Huang, Jianqiang Li, Bingzhe Wu

机构 * Shenzhen University(深圳大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 ICAT通过结合真实事故报告和安全手册构建结构化风险记忆,约束生成具有因果链和严重程度标签的风险案例,提升体素世界模型在物理风险预测中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06155 2026-04-21 cs.LG cs.AI cs.CL 81%

Toward Consistent World Models with Multi-Token Prediction and Latent Semantic Enhancement

迈向一致的世界模型:多令牌预测与潜在语义增强

Qimin Zhong, Hao Liao, Haiming Qin, Mingyang Zhou, Rui Mao, Wei Chen, Naipeng Chao

机构 * Shenzhen University(深圳大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过多令牌预测和潜在语义增强方法,解决大语言模型内部世界模型一致性问题,提升表示对齐性和鲁棒性。

Comments Accepted by ACL 2026 Main Conference. 21 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17651 2026-04-21 cs.CV cs.RO 81%

Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception

以基础设施为中心的世界模型:弥合时间深度与空间广度以实现道路感知

Siyuan Meng, Chengbo Ai

机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(土木与环境工程系,马萨诸塞大学阿默斯特分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出以基础设施为中心的世界模型,通过时空互补性提升道路感知能力,提出三阶段框架和双层架构,结合多模态数据引擎和开放源代码基础,推动基础设施理解交通。

Comments 18 pages, 7 tables, 1 figure, vision paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16585 2026-04-21 cs.LG cs.AI 81%

The Global Neural World Model: Spatially Grounded Discrete Topologies for Action-Conditioned Planning

全局神经世界模型:用于动作条件规划的空间接地离散拓扑

Noureddine Kermiche

机构 * Western Digital Corporation(西部数据公司)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出全局神经世界模型,通过平衡的连续熵约束实现拓扑量化,采用连续动作条件联合嵌入预测架构,将环境映射到离散2D网格,防止流形漂移,通过最大熵探索学习通用过渡动态。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16824 2026-04-21 cs.CR cs.AI 79%

SafeDream: Safety World Model for Proactive Early Jailbreak Detection

SafeDream: 用于主动早期对抗检测的安全世界模型

Bo Yan, Weikai Lin, Yada Zhu, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of Rochester(罗切斯特大学) IBM Research(IBM研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文提出SafeDream,一种轻量级世界模型框架,通过安全状态模型、CUSUM检测和对比想象组件,实现早期对抗检测,提升检测及时性并降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04052 2026-04-21 cs.RO cs.CL 70%

Stable Language Guidance for Vision-Language-Action Models

用于视觉-语言-动作模型的稳定语言引导

Zhihao Zhan, Yuhao Chen, Jiaying Zhou, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出RSS框架,通过解耦物理 affordance 与语义执行,提升视觉-语言-动作模型在语言扰动下的鲁棒性,实验表明其在多种操作基准测试中达到最优性能。

Comments Accepted to ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14902 2026-04-21 cs.AI cs.CL cs.CV cs.RO 67%

ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints

ADAPT:在未指定 affordance 约束下评估常识规划的基准测试

Pei-An Chen, Yong-Ching Liang, Jia-Fong Yeh, Hung-Ting Su, Yi-Ting Chen, Min Sun, Winston Hsu

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学)

专题命中 具身推理 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出 ADAPT 模块,通过显式 affordance 推理提升智能具身代理的鲁棒性和任务成功率,展示了领域适应的视觉语言模型在 affordance 推理中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16320 2026-04-21 cs.SE cs.AI cs.LG 62%

How Robustly do LLMs Understand Execution Semantics?

大语言模型如何理解执行语义的鲁棒性?

Claudio Spiess, Prem Devanbu, Earl T. Barr

机构 * University College London(伦敦大学学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过代码输出预测任务评估大语言模型对代码理解的鲁棒性,发现开源模型在代码变换和输入扰动下表现稳定,而前沿模型GPT-5.2表现出显著的脆弱性,且异常处理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18000 2026-04-21 cs.RO 57%

Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models

揭示视觉-语言-动作模型中具身推理的幻觉

Haiweng Xu, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Ziheng Xi, Zongqing Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) BeingBeyond

专题命中 具身推理 :robotic(abstract);分类 cs.RO

AI总结 本文通过BeTTER基准测试揭示现有VLA模型在动态场景中表现不佳,指出其根本问题在于架构瓶颈导致的语义表示退化,强调需解决高频率控制与高层推理间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11789 2026-04-21 cs.CV 57%

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

LMMs 与以物体为中心的视觉:理解、分割、编辑和生成

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 具身推理 :manipulation(abstract);分类 cs.CV

AI总结 本文探讨了LMMs与以物体为中心的视觉结合,总结了在理解、分割、编辑和生成方面的新进展,提出了开放挑战和未来方向。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13637 2026-04-21 cs.CV cs.MM 57%

Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation

探索互惠的跨模态注意力以实现情境感知的人体可供性生成

Prasun Roy, Saumik Bhattacharya, Subhankar Ghosh, Umapada Pal, Michael Blumenstein

机构 * University of Technology Sydney(技术大学悉尼大学) Indian Institute of Technology, Kharagpur(印度理工学院哈里科特) Indian Statistical Institute, Kolkata(印度统计研究所科契)

专题命中 具身推理 :navigation(abstract);分类 cs.CV

AI总结 本文提出一种互惠的跨模态注意力机制,通过不同模态的空间特征图互相关注,以提升2D场景中人体可供性预测的准确性与效率。

Comments Accepted in The IEEE Transactions on Artificial Intelligence (TAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏