arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-07-28 至 2026-07-28 共收录 14 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 9 篇

2607.23602 2026-07-28 cs.RO cs.AI cs.LG 新提交 94%

Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models

物理空间中相邻集的动作优于世界模型中的最佳预测

Liangyu Li, Qingwen Liu, Mingqing Liu

机构 * Tongji University(同济大学)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究基于采样和潜在世界模型的控制器存在的条件失败提议过度生成问题,提出相邻集动作重建(ASAR)方法,在携带和释放评估集上,相比匹配选择提高了事件完成成功率,还刻画了选择风险。

Comments 26 pages, 7 figures. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23147 2026-07-28 cs.CR cs.AI 新提交 93%

False Prophets: On the Security of World Models in Agentic Systems

虚假预言:论智能体系统中世界模型的安全性

Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 研究智能体系统中世界模型的安全性,发现其存在特定漏洞,引入安全基准数据集,指出攻击者能诱导错误预测,成功率达95%,并为从业者提供减轻危害、强化系统的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24267 2026-07-28 cs.RO 新提交 91%

FeelWorld: Visuo-Tactile World Model for Hierarchical Contact Prediction and Planning

FeelWorld:用于分层接触预测和规划的视觉触觉世界模型

Wenxuan Ma, Chaofan Zhang, Chao Xue, Yinghao Cai, Guocai Yao, Shaowei Cui, Shuo Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Imprintx Robotics(印记机器人公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 研究针对现有视觉世界模型忽视触觉状态问题,提出分层视觉触觉世界模型FeelWorld,通过联合预测视觉和触觉状态、引入注意力机制及训练方法,实现接触预测与规划,实验表明其能降低预测误差并提高规划成功率。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23517 2026-07-28 cs.CV 新提交 88%

Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction

用于上身人体-物体交互的实时以人为中心的世界建模

Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

机构 * Tongyi Lab(通义实验室)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 该研究提出用于上身人体-物体交互的实时以人为中心世界模型,采用连续-离散联合控制方案,结合多尺度运动编码的连续人体状态控制与语言编码离散交互状态控制,能精确建模人物与环境交互,提炼后实现高效实时推理,实验验证了其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24425 2026-07-28 cs.LG 新提交 69%

Context Is King: How In-Context Specification Shapes the Geometry of Concepts

上下文为王:上下文规范如何塑造概念的几何结构

Elad David, Max Fomin

机构 * Zenity

专题命中 通用世界模型 :world-model(abstract);world-model(abstract);分类 cs.LG

AI总结 研究大型语言模型中上下文规范对概念几何结构的塑造,发现上下文决定模型实际使用的结构,声明性规则可确定几何编码关系及拓扑类型,不同规模模型表现不同,同一模型家族中较大模型存在的机制在较小模型中可能不存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 69%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24256 2026-07-28 cs.LG cs.AI 新提交 64%

ML-based Predictive Models for Power Consumption in Virtualised O-RANs

基于机器学习的虚拟无线接入网功耗预测模型

Rishu Raj, Genevieve Akude, Urooj Tariq, Daniel Kilper

专题命中 通用世界模型 :predictive model(title);predictive models(title);分类 cs.AI、cs.LG

AI总结 研究虚拟无线接入网功耗预测问题,采用基于特征提取和回归器的机器学习方法,测试深度神经网络三种变体,结果显示结合DNN与XGBoost的混合模型性能最佳,平均相对误差低于0.5%,可用于未来网络节能编排。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24569 2026-07-28 physics.flu-dyn cs.LG 新提交 60%

The balance between compactness and forecast accuracy of data-driven latent-space reduced-order models in controlled wake flows

数据驱动的潜在空间降阶模型在受控尾流中的紧凑性与预测精度平衡

Alberto Solera-Rico, Patricia García-Caspueñas, Carlos Sanmiguel Vila, Stefano Discetti

专题命中 通用世界模型 :latent dynamics(abstract);分类 cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 研究受控尾流中数据驱动潜在空间降阶模型,比较POD、CAEs等压缩方法及基于长短期记忆网络的预测器,发现CAEs压缩效率高但长期预测差,POD潜在轨迹更平滑,揭示紧凑性与预测精度权衡,为实时流动控制设计预测ROMs提供指导。

Comments 32 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23696 2026-07-28 cs.AI cs.LG 新提交 50%

Offline-to-Online Creative Optimization with Generative Models and Adaptive Testing

基于生成模型和自适应测试的离线到在线创意优化

Kevin Lee, Benjamin Letham, Zhiyuan Jerry Lin, Elodie Samson, Eric Onofrey, Poppy Zhang, Shawndra Hill, Eytan Bakshy

机构 * University of Michigan(密歇根大学) Meta

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 研究如何利用历史A/B测试数据,通过性能驱动的离线到在线工作流程,用预测模型指导生成测试广告位候选创意,经实验验证该方法能有效提升创意参与度,为创意优化提供设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 3 篇

2607.23899 2026-07-28 cs.RO cs.AI 新提交 89%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 具身与机器人 :world model(title,journal_ref);world model(title,journal_ref);world-model(abstract);world-model(abstract)

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23181 2026-07-28 cs.CV 新提交 83%

Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation

迈向视觉语言导航的双脑最小充分表示

Yihao Wu, Chenyi Xu, Liqi Yan, Chenhuan Cai, Geyong Min, Bin Lin, Fangli Guan, Jianhui Zhang, Pan Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) University of Zurich(苏黎世大学) University of Exeter(埃克塞特大学)

专题命中 具身与机器人 :world model(abstract);world-model(abstract);world model(abstract);world-model(abstract)

AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24481 2026-07-28 cs.RO 新提交 81%

ArmnetBench v0.1: Parallel Real-World Evaluation of Manipulation Policies on a Low-Cost Arm Farm

ArmnetBench v0.1:在低成本机械臂集群上对操作策略进行并行实际评估

Praveen Selvaraj, Lorenzo Uttini, Ville Kuosmanen

专题命中 具身与机器人 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 研究针对通用机器人操作策略开发中实际评估的瓶颈问题,引入ArmnetBench v0.1基准测试,在低成本机械臂集群上对7种策略进行评估,涵盖12项任务,通过大量演示训练策略,发布核心情节数据,支持下游学习并给出排行榜比较结果。

Comments 11 pages, 6 tables, 3 figures. data available at https://huggingface.co/collections/armnet/armnetbench-v01

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 仿真与规划 2 篇

2607.24720 2026-07-28 cs.CL cs.AI cs.LG 新提交 71%

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后

Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 仿真与规划 :world model(abstract);world model(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24259 2026-07-28 cs.AI 新提交 53%

Generative Artificial Intelligence (GenAI) to convert images of queuing networks into verifiable simulation models: an open-weight LLM workflow approach

生成式人工智能(GenAI)将排队网络图像转换为可验证的仿真模型:一种开放权重的大语言模型工作流方法

Thomas Monks, Alison Harper, Amy Heather, Navonil Mustafee

专题命中 仿真与规划 :simulation model(title,abstract);分类 cs.AI

AI总结 研究提出Sketch2DES工作流,利用开放权重LLMs将排队网络图像转换为可验证仿真模型,经多阶段处理,在多图表评估中各阶段可靠性高,相比直接代码生成提升多项性能,证明结构化工作流模型生成对LLM辅助仿真建模的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏