arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-16 至 2026-07-16 共收录 97 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 18 篇

2607.13553 2026-07-16 cs.RO cs.LG cs.SY eess.SY 新提交 86%

Flow-aware Optimal Navigation in Unsteady Flows through Reinforcement Learning

通过强化学习在非定常流中进行流量感知最优导航

Andrea Maria Braghin, Nicolò Botteghi, Matteo Tomasetto, Andrea Manzoni, Gabriele Cazzulani

机构 * Politecnico di Milano(米兰理工大学) MOX(数学优化与工程计算实验室)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究在非定常流中自主机器人导航问题,用TD3算法训练智能体在双涡旋流中到达目标。评估五种生物启发观测策略及全局流参数影响,发现速度感知与涡度传感器效用有权衡,明确参数会降性能,为机器人导航从模拟到现实提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13624 2026-07-16 cs.RO cs.AI 新提交 84%

From Language to Navigation Goals: A Vision-Language Approach for Semantic Navigation of Mobile Robots Using RGB-D Perception

从语言到导航目标:一种使用RGB-D感知的移动机器人语义导航的视觉-语言方法

Jose Martínez-Fajardo, Pablo Pueyo, Fernando Caballero, Luis Merino

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究如何让移动机器人根据自然语言请求进行语义导航,提出基于ROS 2组件的语言驱动导航框架,能识别目标、估计位置并生成导航目标,经仿真和实际场景评估,证明该框架可实现直观人机交互。

Comments 8 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13245 2026-07-16 cs.CV cs.RO 新提交 84%

Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics

即时场景图增长:应对长期机器人感知饱和

Yue Chang, Rufeng Chen, Yifan Tian, Dazhi Huang, Zhaofan Zhang, Yi Chen, Wenze Zhang, Li Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 具身导航 :robotics(title);embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对长期机器人任务中传统3D场景图构建方式导致感知饱和的问题,提出JITOMA闭环框架,利用任务热图过滤观察、大语言模型解析意图动态唤醒锚点,经JITOMA-Bench评估,该框架有效减小图大小和延迟,保持处理时间稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13461 2026-07-16 cs.RO 新提交 83%

Joint On-and-Off Policy Learning for Vision-and-Language Navigation

用于视觉与语言导航的联合在线与离线策略学习

Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

机构 * Joy Future Academy(京东探索研究院)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 研究视觉与语言导航问题,提出JOP-VLN框架,通过三阶段训练流程,协同结合离线策略模仿学习和在线策略探索,采用高熵轨迹采样和纠错优先轨迹排序策略,在相关基准上取得高成功率,创技术新水平。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13110 2026-07-16 cs.LG cs.AI eess.SP 新提交 81%

A Hybrid Mamba for Audio-Visual Navigation

用于视听导航的混合曼巴

Yi Wang, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对视听导航骨干网络多年未变的问题,提出Samba,用曼巴状态编码器取代传统GRU,构建音频曼巴编码器,实验表明其泛化性能出色,能提升导航成功率,以低成本解锁更强能力,为范式演进提供途径。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems and Man and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13072 2026-07-16 cs.RO cs.AI eess.SP 新提交 81%

HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models

HRO:用于基于大语言模型的零样本目标导航的分层房间到物体框架

Luyuan Jia, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 针对零样本目标导航问题,提出LLM驱动的分层房间到物体(HRO)框架,引导智能体粗到细探索导航至目标物体,实验表明该框架在Gibson和HM3D数据集上优于现有基于LLM的方法。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01531 2026-07-16 cs.AI cs.LG 版本更新 81%

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3

OPINE-World:基于本体错误优先的交互式探索的程序化世界建模

David Courtis, Wenhao Li, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 具身导航 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出OPINE-World,一种在线交互学习面向对象的程序化世界模型的LLM智能体,通过本体错误度量引导探索,在ARC-AGI-3基准上无需逐游戏训练即解决20/25个游戏,动作效率达78.4。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13768 2026-07-16 cs.RO 新提交 79%

The Nonsmooth Impact Direction (NSID) of Robotic Systems

机器人系统的非光滑碰撞方向 (NSID)

Annika Kirner, Christian Ott

机构 * Automation and Control Institute, TU Wien(维也纳工业大学自动化与控制研究所) Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(德国航空航天中心机器人与机电一体化研究所)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO

AI总结 研究机器人系统的非光滑碰撞方向 (NSID),通过系统分析碰撞前后速度,表明其为机器人碰撞特征方向且独立于接触特性,适用于多种机器人系统,理论分析与实验验证为相关规划和控制算法奠定基础。

Comments 18 pages, 17 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13485 2026-07-16 eess.SP 新提交 78%

Pinching-Antenna Systems (PASS)-Based User-Side Navigation: An Anchor-Line-based Approach

基于收缩天线系统(PASS)的用户侧导航:一种基于锚线的方法

Zongyi Li, Jun Wang, Tianwei Hou, Anna Li

专题命中 具身导航 :navigation(title,abstract)

AI总结 本文提出基于收缩天线系统(PASS)的用户侧导航框架,开发LWF-PAP算法推导PA位置等,制定WLS-PAN算法实现最小方差无偏估计,定义PA-PDOP指标,仿真表明该框架能实现厘米级定位精度,验证了其有效性和鲁棒性。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13516 2026-07-16 cs.RO 新提交 70%

Improving Map Consistency in Graph-Based LiDAR SLAM Through Information-Aware Odometry and Retroactive Loop Closure

通过信息感知里程计和追溯回环闭合改进基于图的激光雷达SLAM中的地图一致性

Saurabh Gupta, Niklas Trekel, Louis Wiesmann, Cyrill Stachniss

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 该研究针对3D激光雷达SLAM中地图一致性问题提出解决方案,通过估计信息矩阵加权里程计约束,引入分层及追溯回环闭合模块,实验证明能提升轨迹精度与地图一致性。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13584 2026-07-16 cs.NE cs.CV cs.RO 新提交 62%

Visual Place Recognition Using Rate-Encoded Spiking Neural Networks with Discrete STDP Learning

使用具有离散STDP学习的速率编码脉冲神经网络进行视觉场所识别

Altzi Tsanko, Oikonomou Katerina Maria, Antonios Gasteratos

机构 * Department of Production and Management Engineering, Democritus University of Thrace(生产与管理工程系,德摩克利特大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究基于STDP的SNN-VPR视觉场所识别,提出离散张量原生实现,用PyTorch和snnTorch在Nordland数据集评估。通过闭式张量管道神经元分配、查询后状态重置及速度补偿滑动窗口聚合提高召回精度,虽各机制贡献待进一步研究,但已展示推理阶段决策影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14009 2026-07-16 cs.RO 新提交 57%

AeroMap3D: Anchoring Monocular UAV 6-DoF Localization to Visual-Geometric-Semantic Map Priors

AeroMap3D:将单目无人机6自由度定位锚定到视觉-几何-语义地图先验上

Zhiyun Deng, Luis Sentis

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 AeroMap3D是用于无GNSS导航的单目无人机6自由度定位系统,针对地图参考空中定位挑战,引入轻量级适配器,利用地图注释去除不可靠匹配,结合延迟状态EKF融合测量与先验,实现高精度定位,多地轨迹定位误差小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13622 2026-07-16 cs.RO 新提交 57%

Design, Modeling and Experimental Validation of a Miniature Hybrid Underwater Glider With Large-Range Foldable Deflectable Wings

一种具有大范围可折叠可偏转机翼的微型混合水下滑翔器的设计、建模与实验验证

Yongjian Zhu, Yusen Tao, Feitian Zhang

机构 * Peking University(北京大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究微型混合水下滑翔器,通过将机翼配置视为结构变量开发多体动力学模型,基于CRBA投影形成统一动态模型,提出顺序参数识别框架,经实验验证能在受限水下环境主动重构形态并增强导航。

Comments 11 pages, 8 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13038 2026-07-16 cs.CY cs.AI 新提交 57%

Designing Safety-Constrained LLM Systems for Public Health Information Access

设计用于公共卫生信息访问的安全约束大语言模型系统

Ben Torkian, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 针对公共卫生信息访问,尤其是母婴健康资源导航,设计实现安全约束大语言模型系统。采用多层架构,含领域受限RAG等,通过可控数据管道确保回复基于精选资源。经场景验证,系统安全约束执行一致、性能稳定,为相关领域部署LLM系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12785 2026-07-16 cs.CV 版本更新 57%

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting

ExtraGS:通过扩散引导的3D高斯点渲染增强内窥镜视图外推

Cheng-Tai Hsieh, Jiwei Shan, Han Fang, Jianshu Hu, Tao Ni, Lijun Han, Yutong Ban, Shing Shin Cheng, Hesheng Wang

机构 * The School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, and the Shanghai Key Laboratory of Navigation and Location-Based Services(上海交通大学自动化与智能感知学院以及上海市导航与位置服务重点实验室) Global College, Shanghai Jiao Tong University(上海交通大学密西根学院) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 研究针对传统内窥镜视野局限及神经渲染外推有伪影问题,提出ExtraGS框架,通过不确定性引导虚拟相机采样、扩散模型细化视图及置信加权微调策略,增强内窥镜视图外推,在新视图合成中达先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19108 2026-07-16 cs.RO 版本更新 57%

Understanding Fire Through Thermal Radiation Fields for Mobile Robots

通过热辐射场理解火灾以实现移动机器人安全导航

Anton R. Wagner, Madhan Balaji Rao, Xuesu Xiao, Sören Pirk

机构 * Department of Computer Science, Kiel University(计算机科学系,基尔大学) Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出通过实时热辐射场帮助移动机器人安全导航,利用斯特凡-玻尔兹曼定律识别火灾并生成热安全路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14893 2026-07-16 cs.RO 版本更新 57%

STITCHER: Constrained Trajectory Planning in Complex Environments with Real-Time Motion Primitive Search

STITCHER:通过实时运动原语搜索在复杂环境中进行约束轨迹规划

Helene J. Levy, Brett T. Lopez

机构 * VECTR Laboratory, University of California, Los Angeles(VECTR实验室,加州大学洛杉矶分校)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究针对自主高速穿越复杂环境的轨迹规划问题,提出无优化规划框架STITCHER,通过拼接短轨迹段和图搜索实时计算轨迹,经模拟与硬件测试验证其性能优越,能满足多种约束并高速实时规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13447 2026-07-16 eess.SY cs.SY 新提交 50%

Machine Learning Challenges in Intelligent Unmanned Aerial Vehicle Operations in Developing Economie

发展中经济体智能无人机操作中的机器学习挑战

Isuru Munasinghe, Nethmi Pathirana, Charitha Dombawala, Asanka Perera, Akila Pemasiri

专题命中 具身导航 :navigation(abstract)

AI总结 探讨发展中经济体无人机智能操作面临的机器学习挑战,涉及导航、感知等核心功能领域,因资源、环境等因素受限,凸显了实验性能与实际部署间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 10 篇

2607.13560 2026-07-16 q-bio.NC cs.AI 新提交 89%

Grounded world models in biological organisms and future embodied AI

生物有机体和未来具身人工智能中的基础世界模型

Giovanni Pezzulo, Davide Nuzzi, Marco D'Alessandro, Riccardo Proietti, Roberto Bottini, Paul Cisek

专题命中 具身推理 :embodied AI(title,abstract);world model(title,abstract);navigation(abstract);分类 cs.AI

AI总结 研究探讨生物有机体中基础世界模型,通过五个神经回路例子揭示当前具身人工智能缺失的特征,如内在动力学作用等,还讨论了生物系统原则对未来具身人工智能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 84%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.CV、cs.LG

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13612 2026-07-16 cs.LG cs.AI 新提交 81%

The SIGReg Objective as Variational Free Energy: A Theoretical Active-Inference Account of JEPA World Models

作为变分自由能的SIGReg目标:JEPA世界模型的理论主动推理解释

Fabio Arnez, Alexandra Gomez-Villa

机构 * Université Paris-Saclay, CEA, List(巴黎萨克雷大学,法国国家科学研究中心,List研究所) Computer Vision Center Barcelona(巴塞罗那计算机视觉中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究JEPA世界模型,通过将四个正则化器组织成层次结构,证明选择抗坍缩正则化器决定训练目标是否为有效AIF变分自由能,在特定条件下SIGReg有优势,还扩展对应关系并确定未计算的AIF项。

Comments Theoretical paper; empirical validation of the stated predictions is left to separate work. 28 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13172 2026-07-16 cs.AI cs.LG 新提交 81%

Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

通过世界模型从人类偏好和理由中学习安全智能体行为

Ilias Kazantzidis, Timothy J. Norman, Yali Du, Christopher T. Freeman

机构 * University of Southampton(南安普顿大学) King’s College London(伦敦国王学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在环境未知且无合适奖励函数时安全训练与部署智能体策略的问题,提出DROPJ方法,先学习世界模型,由人类在其中生成模拟轨迹并给出偏好及理由,据此训练奖励模型用于部署,实验表明该方法可降低训练成本、提升部署性能及安全性。

Comments 42 pages, 18 figures. Extended version of a paper presented at ICAART 2026; submitted for consideration in the ICAART 2026 post-publication selected-papers volume in Lecture Notes in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04464 2026-07-16 cs.LG cs.AI 版本更新 81%

Operator-on-F complements value-equivalence: a planning-time diagnostic for latent world models

算子对F补充值等价性:潜在世界模型的规划时诊断

Donna Vakalis

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对基于模型的强化学习中世界模型评估问题,引入算子对F诊断,通过模型自身预测器比较模型与环境的k步潜在前推,揭示其与规划回报的强关联及在跨架构比较中的作用,补充而非替代值等价性诊断。

Comments Accepted at RLC 2026 WM Workshop. V2 places the diagnostic in Koopman representation theory; references expanded. Results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14076 2026-07-16 cs.CV 新提交 79%

From Pixels to States: Rethinking Interactive World Models as Game Engines

从像素到状态:将交互式世界模型重新思考为游戏引擎

Zhen Li, Zian Meng, Shuwei Shi, Mingliang Zhai, Jiaming Tan, Chuanhao Li, Kaipeng Zhang

机构 * Alaya Lab(阿亚实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文从玩家动作控制等四个维度审视交互式游戏世界建模,分析现有方法优缺点,还为《黑神话:悟空》提供可扩展数据引擎,收集相关游戏资源用于状态感知建模,助力推动交互式游戏世界发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13651 2026-07-16 cs.CV 新提交 79%

From Surface Forecasting to Observability Forecasting: A Latent World Model for Cloud-Aware EO Monitoring

从地表预测到可观测性预测:用于云感知地球观测监测的潜在世界模型

Mohanad Albughdadi

机构 * European Centre for Medium-Range Weather Forecasts(欧洲中期天气预报中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 研究地球观测处理链中地表可观测性预测问题,采用LeWorldModel模型并将其应用于云感知地球观测序列,经训练和评估,该模型在可观测性基准上优于持久性方法,在多方面表现良好且能产生异常信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13410 2026-07-16 cs.RO 新提交 79%

Ego-Dynamics-Augmented World Model for Autonomous Driving with Zero-Shot Cross-Chassis Adaptation

用于零样本跨底盘自适应自动驾驶的自我动力学增强世界模型

Zhidong Wang, Jingsong Liang, Zirui Li, Zhan Chen, Han Yu, Chen Lv

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与宇航工程学院) Collaborative Initiative, Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目合作计划) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 研究针对自动驾驶中基于世界模型的强化学习问题,提出DynaDreamer方法,通过增强自我动力学先验改进世界模型,减少自我运动建模负担,实现零样本跨底盘自适应,实验证明该方法显著提升驾驶任务成功率。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12474 2026-07-16 cs.AI 版本更新 79%

From Observation to Insight: Mechanistic World Models and the Quest for Autonomous Discovery

从观察到洞察:机制世界模型与自主发现探索

Ingmar Posner, Anson Lei, Bernhard Schölkopf

机构 * MPI for Intelligent Systems & ELLIS Institute(马克斯·普朗克智能系统研究所及埃利斯研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文探讨科学发现问题,提出机制世界模型这一新设计范式,将可重复使用机制置于核心,推导其计算能力、设计原则等,指出虽有不同研究方向捕捉该范式要素但缺统一框架,为推动AI走向自主科学发现提供基础和蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交 57%

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 9 篇

2607.08448 2026-07-16 cs.RO 版本更新 83%

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人基础模型 :manipulation(title,abstract);navigation(abstract);分类 cs.RO

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14604 2026-07-16 cs.RO cs.CV cs.LG 版本更新 67%

Tactile Modality Fusion for Vision-Language-Action Models

触觉模态融合用于视觉-语言-动作模型

Charlotte Morissette, Amin Abyaneh, Wei-Di Chang, Anas Houssaini, David Meger, Hsiu-Chin Lin, Jonathan Tremblay, Gregory Dudek

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出TacFiLM,一种轻量级模态融合方法,将视觉-触觉信号整合到视觉-语言-动作(VLA)模型中。通过特征级线性调制(FiLM)对中间视觉特征进行条件化,提升接触丰富操作行为的性能。

Comments Accepted to the European Conference on Computer Vision (ECCV), 2026, 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏