arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-20 至 2026-07-20 共收录 9 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 9 篇

2607.15898 2026-07-20 cs.CV cs.AI cs.LG cs.RO 新提交 83%

Orbis 2: A Hierarchical World Model for Driving

Orbis 2:一种用于驾驶的分层世界模型

Sudhanshu Mittal, Arian Mousakhan, Silvio Galesso, Karim Farid, Jonannes Dienert, Rajat Sahay, Thomas Brox

机构 * University of Freiburg(弗莱堡大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对当前世界模型不足提出分层驾驶世界模型,跨两层分解预测,结合扩散强制预训练和教师强制微调,在长距离生成保真度等多方面取得领先成果。

Comments Project page: https://lmb-freiburg.github.io/orbis2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22204 2026-07-20 cs.RO cs.AI 版本更新 81%

Human-Inspired Neuro-Symbolic World Modeling and Logic Reasoning for Interpretable Safe UAV Landing Site Assessment

受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

机构 * Macquarie University(麦考瑞大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。

Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15901 2026-07-20 cs.AI 新提交 79%

DSWorld: A Data Science World Model for Efficient Autonomous Agents

DSWorld:用于高效自主智能体的数据科学世界模型

Zherui Yang, Fan Liu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究自主数据科学智能体依赖试错流程效率低的问题,提出数据科学世界模型概念及DSWorld框架,含多种技术。构建数据集并引入优化策略,实验显示其加速智能体训练和推理,在转换预测任务上超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15550 2026-07-20 cs.AI 新提交 79%

SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction

SeerGuard:一种通过世界模型预测实现的移动 GUI 代理安全框架

Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng

机构 * JIUTIAN Research(九天研究)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究针对移动 GUI 代理安全风险问题,提出 SeerGuard 框架,通过执行前指令级筛选和行动级风险评估减轻风险。构建安全增强世界模型,经实验验证其在不同代理上有效泛化,提升了安全效用分数并降低风险成本分数。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-07-20 cs.AI 新提交 79%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 31 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16012 2026-07-20 cs.CV cs.AI cs.RO 新提交 67%

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

DPNeXt:用于基于高效视觉Transformer的多任务密集预测的轻量级多尺度特征融合框架

Jehun Kang, Jungha Wang, Youngjun Hwang, David Hyunchul Shim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对机器人感知系统多任务学习中现有解码策略瓶颈,提出DPNeXt框架,用双深度可分离倒置瓶颈及MTBG策略,在多任务密集预测上表现出色,相比DPT大幅减少参数并提升推理速度。

Comments 8 pages, 5 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15536 2026-07-20 cs.CV cs.LG 新提交 62%

E3DGS: Unified Geometric-Photometric Equivariance for 3D Gaussian Splatting via Color-as-Geometry Embedding

E3DGS:通过颜色作为几何嵌入实现3D高斯点云的统一几何-光度等变性

Chankyo Kim, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 研究针对3D高斯点云构建等变架构的表示瓶颈问题,提出基于表示理论的统一解决方案,通过将光度学与几何张量同构等方法,引入统一矩阵嵌入,构建E3DGS架构,提升了相机帧变化下的鲁棒性和数据效率。

Comments 31 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新 62%

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

专题命中 具身推理 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18929 2026-07-20 cs.CV 版本更新 57%

On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training

在手术视觉基础模型中深度的作用:一项关于RGB-D预训练的实证研究

John J. Han, Adam Schmidt, Muhammad Abdullah Jamal, Chinedu Nwoye, Anita Rau, Jie Ying Wu, Omid Mohareri

机构 * Vanderbilt University(范德比尔大学) Intuitive Surgical Inc.(Intuitive Surgical公司)

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 本研究通过比较不同预训练方法,发现几何感知的多模态预训练能显著提升手术视觉模型的性能,且无需改变推理架构。

Comments Inaccurate findings

详情

展开后加载摘要…

URL PDF HTML 收藏