arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3361 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3361 篇

2512.17435 2026-05-01 cs.RO 67%

ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

ImagineNav++: 通过场景想象促使视觉语言模型作为具身导航器

Teng Wang, Xinxin Zhao, Wenzhe Cai, Changyin Sun

机构 * School of Automation, Southeast University(东南大学自动化学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出ImagineNav++,通过场景想象将视觉语言模型用于无地图导航,利用想象模块生成高探索潜力的视点,并通过选择性聚焦记忆机制实现空间一致性,实验表明其在无地图导航中表现优异。

Comments 17 pages, 10 figures. arXiv admin note: text overlap with arXiv:2410.09874

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26839 2026-04-30 cs.RO 67%

Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance

带我走:面向以人为本的户外助行的长周期社交导航

Lingfeng Zhang, Xiaoshuai Hao, Xizhou Bu, Yingbo Tang, Hongsheng Li, Jinghui Lu, Xiu-shen Wei, Jiayi Ma, Yu Liu, Jing Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Hefei University of Technology(合肥工业大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出Walk with Me框架,通过高阶视觉语言模型和轻量级兴趣点,实现无地图的长周期社交导航,结合语义意图定位、安全推理和低层动作生成,提升户外助行的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 67%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);verifier(abstract)

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17190 2026-04-21 cs.CV 67%

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20879 2026-04-21 cs.CV 67%

DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking

DriveAgent-R1: 通过主动感知和混合思维推进基于视觉语言模型的自动驾驶

Weicheng Zheng, Xiaofei Mao, Nanfei Ye, Pengxiang Li, Kun Zhan, Xianpeng Lang, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) LiAuto Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 DriveAgent-R1通过主动感知和混合思维框架,提升自动驾驶中的视觉推理能力,采用三阶段训练策略,在复杂场景中实现高效决策,展现与顶级模型相当的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16298 2026-04-20 cs.CV cs.RO 67%

FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation

FineCog-Nav:整合细粒度认知模块以实现零样本多模态无人机导航

Dian Shao, Zhengzheng Xu, Peiyang Wang, Like Liu, Yule Wang, Jieqi Shi, Jing Huo

机构 * Northwestern Polytechnical University(西北工业大学) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出FineCog-Nav框架,通过细粒度认知模块提升无人机零样本多模态导航性能,构建了AerialVLN-Fine基准测试集,实验表明其在指令遵循、长视距规划和环境泛化方面优于基线方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07267 2026-04-15 cs.RO 67%

Bio-Inspired Topological Autonomous Navigation with Active Inference in Robotics

生物启发的拓扑自主导航与主动推断在机器人中的应用

Daria de Tinguy, Tim Verbelen, Emilio Gamba, Bart Dhoedt

机构 * Ghent University(根特大学) Verses Flanders Make(佛兰德斯制造)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种基于主动推断框架的生物启发代理,实现环境拓扑地图的实时生成与更新,通过概率推理框架实现可解释的导航,并在动态和未知环境中表现出鲁棒适应性。

Comments Conference ICCAS 2025 - accepted (in processing)

Journal ref Communications in Computer and Information Science, vol 2857, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08509 2026-04-10 cs.CV cs.RO 67%

Visually-grounded Humanoid Agents

基于视觉的人形代理

Hang Ye, Xiaoxuan Ma, Fan Lu, Wayne Wu, Kwan-Yee Lin, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。

Comments Project page: https://alvinyh.github.io/VGHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05800 2026-03-31 cs.RO cs.CV 67%

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26322 2026-03-30 cs.RO 67%

DiffusionAnything: End-to-End In-context Diffusion Learning for Unified Navigation and Pre-Grasp Motion

DiffusionAnything: 端到端的上下文扩散学习用于统一导航和预抓取运动

Iana Zhura, Yara Mahmoud, Jeffrin Sam, Hung Khang Nguyen, Didar Seyidov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院数字工程中心智能空间机器人实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种端到端的上下文扩散学习方法,通过多尺度特征调制实现统一的导航与精细操控,仅需5分钟自监督数据即可实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09575 2026-03-27 cs.RO 67%

Traffic Scene Generation from Natural Language Description for Autonomous Vehicles with Large Language Model

基于大语言模型的自然语言描述生成交通场景用于自动驾驶车辆

Bo-Kai Ruan, Hao-Tang Tsui, Yung-Hui Li, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Carnegie Mellon University(卡内基梅隆大学) AI Research Center, Hon Hai Research Institute(鸿海研究院人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出TTSG框架,通过自然语言生成可控交通场景,解决文本到空间布局、无预设位置场景构建及多智能体行为规划问题,实验表明其在安全关键场景中碰撞率低且提升驾驶 captioning 模型性能。

Comments Accepted by WAD@CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12469 2026-03-24 cs.CV 67%

Unleashing Video Language Models for Fine-grained HRCT Report Generation

释放视频语言模型以生成细粒度HRCT报告

Yingying Fang, Huichi Zhou, KinHei Lee, Yijia Wang, Zhenxuan Zhang, Jiahao Huang, Guang Yang

机构 * Bioengineering Department, Imperial College London, London, UK School of Biomedical Engineering \& lmaging Sciences, King's College London, London,UK

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AbSteering框架,通过异常中心方案和直接偏好优化目标,提升视频语言模型在HRCT报告生成中的精度与细粒度区分能力,优于现有领域特定CT基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01049 2026-03-24 cs.CV cs.RO 67%

KeySG: Hierarchical Keyframe-Based 3D Scene Graphs

KeySG:基于关键帧的层次化3D场景图

Abdelrhman Werby, Dennis Rotondi, Fabio Scaparro, Kai O. Arras

机构 * Socially Intelligent Robotics Lab, Institute for Artificial Intelligence University of Stuttgart, Germany(社会智能机器人实验室,人工智能研究所,斯图加特大学,德国)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 KeySG通过层次化3D场景图结构,结合关键帧提取多模态信息,提升复杂环境中的语义推理与规划能力,优于现有方法。

Comments Code and video are available at https://keysg-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18443 2026-03-20 cs.CV 67%

SR-Nav: Spatial Relationships Matter for Zero-shot Object Goal Navigation

SR-Nav:空间关系对于零样本物体目标导航至关重要

Leyuan Fang, Zan Mao, Zijing Wang, Yinlong Yan

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SR-Nav通过建模观察和经验的空间关系,提升感知与规划能力,在HM3D实验中实现最先进的成功率和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17993 2026-03-19 cs.CV cs.RO 67%

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

GMT:用于3D场景中6自由度物体轨迹合成的目标条件多模态Transformer

Huajian Zeng, Abhishek Saroha, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆桑大学人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出GMT,一种多模态Transformer框架,通过结合3D边界框几何、点云上下文、语义物体类别和目标末端姿态,生成真实且目标导向的物体轨迹,提升了空间精度和方向控制。

Comments Accpeted by 3DV 2026. Project Page: https://huajian-zeng.github.io/projects/gmt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09205 2026-03-17 cs.CL cs.AI cs.LG 67%

Emotion is Not Just a Label: Latent Emotional Factors in LLM Processing

情感不只是一个标签:大型语言模型处理中的潜在情绪因素

Benjamin Reichman, Adar Avsian, Samuel Webster, Larry Heck

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究情绪作为潜在因素对LLM处理的影响,分析情绪如何改变transformer模型的注意力几何结构,并提出AURA-QA数据集和情绪正则化框架以提升阅读理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12238 2026-03-13 cs.CV 67%

SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation

SceneAssistant: 一种用于开放词汇3D场景生成的视觉反馈代理

Jun Luo, Jiaxiang Tang, Ruijie Lu, Gang Zeng

机构 * Peking University(北京大学) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SceneAssistant通过视觉反馈驱动代理实现开放词汇3D场景生成,结合3D物体生成模型和视觉-语言模型的空间推理能力,生成高质量且多样化的3D场景。

Comments Code: https://github.com/ROUJINN/SceneAssistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08113 2026-03-10 cs.CV 67%

SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving

SAMoE-VLA:一种面向自动驾驶的场景自适应混合专家视觉-语言-动作模型

Zihan You, Hongwei Liu, Chenxu Dang, Zhe Wang, Sining Ang, Aoqi Wang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) School of Instrument Science and Engineering, Southeast University(仪器科学与工程学院,东南大学) Zhili College, Tsinghua University(紫荆学院,清华大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学) Department of Automation, University of Science and Technology of China(自动化学院,中国科学技术大学) Department of Automation, University of Science and Technology Beijing(自动化学院,北京科技大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SAMoE-VLA通过场景自适应混合专家机制提升自动驾驶中的视觉-语言-动作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06918 2026-03-10 cs.RO 67%

T2Nav Algebraic Topology Aware Temporal Graph Memory and Loop Detection for ZeroShot Visual Navigation

T2Nav 基于代数拓扑的时序图记忆与循环检测用于零样本视觉导航

Quang-Anh N. D., Duc Pham, Minh-Anh Nguyen, Tung Doan, Tuan Dang

机构 * International School, Vietnam National University, Hanoi, Vietnam(越南国家大学河内国际学校) Hanoi University of Science, Vietnam National University, Hanoi, Vietnam(越南国家大学河内科学大学) Hanoi University of Science and Technology, Hanoi, Vietnam(河内科学技术大学) Cognitive Robotics Lab, Department of Electrical Engineering and Computer Science, University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校电气工程与计算机科学系认知机器人实验室) University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 T2Nav通过整合异构数据和基于图的推理,实现零样本视觉导航,具备高效探索和路径规划能力,适用于视觉相似但空间不同的目标实例导航。

Journal ref EEE International Conference on Robotics & Automation 2026 (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06914 2026-03-10 cs.RO 67%

SysNav: Multi-Level Systematic Cooperation Enables Real-World, Cross-Embodiment Object Navigation

SysNav:多级系统性合作实现现实世界跨载体物体导航

Haokun Zhu, Zongtai Li, Zihan Liu, Kevin Guo, Zhengzhi Lin, Yuxin Cai, Guofei Chen, Chen Lv, Wenshan Wang, Jean Oh, Ji Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SysNav通过多级系统性合作实现现实世界跨载体物体导航,提升复杂环境下的导航效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19655 2026-03-05 cs.RO 67%

LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments

LaViRA: 语言-视觉-机器人动作翻译用于连续环境中的零样本视觉语言导航

Hongyu Ding, Ziming Xu, Yudong Fang, You Wu, Zixuan Chen, Jieqi Shi, Jing Huo, Yifan Zhang, Yang Gao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 LaViRA通过分解动作层次结构,利用多模态大语言模型的优势,实现连续环境中零样本视觉语言导航的高效导航与泛化能力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00515 2026-03-03 cs.CV 67%

MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence

MLLM-4D: 向基于视觉的空间-时间智能迈进

Xingyilang Yin, Chengzhengxu Li, Jiahao Chang, Chi-Man Pun, Xiaodong Cun

机构 * University of Macau(澳门大学) Xi'an Jiaotong University(西安交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) GVC Lab, Great Bay University(大湾大学GVC实验室)

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract)

AI总结 MLLM-4D通过改进的数据筛选和训练策略,实现了从2D输入中强大的空间-时间理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18941 2026-02-24 cs.CV 67%

Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation

全局指挥官与局部执行者:一种双智能体框架用于场景导航

Kaiming Jin, Yuefan Wu, Shengqiong Wu, Bobo Li, Shuicheng Yan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Simon Fraser University(西蒙弗雷泽大学) University of Oxford(牛津大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 DACo提出双智能体框架,通过解耦全局推理与局部执行,提升复杂环境中长时序导航的稳定性和性能。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15400 2026-02-18 cs.RO 67%

One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation

一个引导所有代理:通过显式世界表示增强多模态大语言模型用于视觉-语言导航

Zerui Li, Hongpei Zheng, Fangguo Zhao, Aidan Chan, Jian Zhou, Sihao Lin, Shijie Li, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 通过显式世界表示增强多模态大语言模型,实现视觉-语言导航的解耦框架,提升导航性能与现实应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11858 2026-02-17 cs.CV cs.AI cs.CL cs.LG 67%

Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception

无需缩放:用于细粒度多模态感知的区域到图像蒸馏

Lai Wei, Liangbo He, Jun Lan, Lingzhong Dong, Yutong Cai, Siyuan Li, Huijia Zhu, Weiqiang Wang, Linghe Kong, Yue Wang, Zhuosheng Zhang, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出区域到图像蒸馏方法,通过训练时间内化代理缩放能力,提升细粒度多模态感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13148 2026-02-16 cs.SD 67%

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

大音频语言模型能理解音频吗?LALMs的语音、场景和事件理解基准

Han Yin, Jung-Woo Choi

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学电气工程学院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SSEU-Bench,首个考虑语音与非语音音频能量差异的音频理解基准,通过链式思维提升LALMs在联合理解任务中的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15933 2026-02-12 cs.CV 67%

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

城市真实环境中的导航:探索从大规模知识中涌现的导航

Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出稀疏关联视觉导航任务,通过CityNav基准评估MLLMs在真实城市环境中的导航能力,并提出VoP方法提升导航性能。

Comments Accepted at EACL 2026 (ORAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 67%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09657 2026-02-11 cs.RO 67%

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

AutoFly:面向野外无人机自主导航的视觉-语言-动作模型

Xiaolou Sun, Wufei Si, Wenhui Ni, Yuntian Li, Dongming Wu, Fei Xie, Runwei Guan, He-Yang Xu, Henghui Ding, Yuan Wu, Yutao Yue, Yongming Huang, Hui Xiong

机构 * Southeast University(东南大学) Purple Mountain Labs(紫金山实验室) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 AutoFly是一种面向野外无人机自主导航的视觉-语言-动作模型,通过伪深度编码器和渐进两阶段训练策略,实现自主避障和规划,提升导航成功率。

Comments Acceped by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19942 2026-02-10 cs.SE 67%

Prometheus: Towards Long-Horizon Codebase Navigation for Repository-Level Problem Solving

Prometheus:面向仓库级问题解决的长周期代码库导航

Yue Pan, Zimin Chen, Siyu Lu, Zhaoyang Chu, Xiang Li, Han Li, Yang Feng, Claire Le Goues, Federica Sarro, Martin Monperrus, He Ye

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 Prometheus通过统一知识图谱和增强内存引擎,实现长周期代码库导航,提升仓库级问题解决的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏