arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3352 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3352 篇

2409.13675 2026-06-30 cs.RO 67%

OLiVia-Nav: An Online Lifelong Vision Language Approach for Mobile Robot Social Navigation

OLiVia-Nav: 一种面向移动机器人社交导航的在线终身视觉语言方法

Siddarth Narasimhan, Aaron Hao Tan, Daniel Choi, Goldie Nejat

机构 * University of Toronto(多伦多大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 OLiVia-Nav通过融合视觉语言模型与在线终身学习框架,实现机器人社交导航中的社会规范适应与动态轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18375 2026-06-24 cs.RO 新提交 67%

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

PAIWorld: 用于机器人操作的三维一致世界基础模型

Yuhang Huang, Xuan Lv, Junyan Xu, Zhiyuan Yu, Jiazhao Zhang, Ruizhen Hu, Wancheng Feng, Shilong Zou, Hewen Xiao, Ziqiao Zhou, Kaiyun Huang, Zhiyu Peng, Juzhan Xu, Hang Zhao, Chenyang Zhu, Renjiao Yi, Yifei Huang, Douhui Wu, Yan Zhang, Kexu Cheng, Chunhe Song, Yunzhi Xue, Xiuhong Zhang, Leitao Guo, Yunji Chen, Bin Wu, Haibin Yu, Kai Xu

机构 * Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 提出PAIWorld框架,通过几何感知交叉注意力、几何旋转位置编码和潜在3D-REPA蒸馏,解决多视图世界模型的3D不一致问题,在机器人操作基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22617 2026-06-23 cs.CV 新提交 67%

OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs

OmniSpace: 自动驾驶多模态大语言模型的高效几何感知

Hao Vo, Phu Loc Nguyen, Khoa Vo, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le

机构 * University of Arkansas(阿肯色大学) Google Research, Google(谷歌研究院) University of Liverpool(利物浦大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 提出OmniSpace,一种即插即用的几何感知范式,通过相机位姿注入器、多视图极线注意力模块和3D几何蒸馏目标,从纯2D观测中提升MLLM的空间推理能力,在多个自动驾驶基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30711 2026-06-23 cs.CL cs.AI cs.LG stat.ML 版本更新 67%

SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs

SAGE: 一种用于智能体大语言模型中高效记忆演化的新颖门控机制

Sijia Wang, Dhanajit Brahma, Ricardo Henao

机构 * Duke University(杜克大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SAGE门控机制,基于von Mises-Fisher密度估计和自适应阈值,将记忆写入控制建模为新奇性检测问题,在LoCoMo上以更低成本实现最优token-F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19750 2026-06-19 cs.LG cs.AI cs.CL 新提交 67%

Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models

流形赌博机:大语言模型潜在几何上的贝叶斯课程学习

Darrien McKenzie, Nicklas Hansen, Xiaolong Wang

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出贝叶斯流形课程(BMC)框架,将问题采样建模为流形结构赌博机问题,通过层次任务树和贝叶斯学习引导采样,平衡学习信号、多样性和实用性。

Comments Webpage: https://darrienmckenzie.com/manifold-bandits/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13883 2026-06-15 cs.RO 新提交 67%

Guided Diffusion with Distilled Vision-Language Reliability for Aerial Navigation

基于蒸馏视觉语言可靠性的引导扩散用于空中导航

Ivan Valuev, Iana Zhura, Valerii Serpiva, Didar Seyidov, Dzmitry Tsetserukou

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 提出一种可靠性感知的扩散规划器,通过蒸馏视觉语言模型生成场景级可靠性热图,引导去噪过程处理不可靠区域,显著降低无人机导航中的障碍物违反率并提高区域可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03896 2026-06-12 cs.CV cs.RO 版本更新 67%

GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert

GAE: 利用可泛化动作专家释放VLM的物理潜力

Mingyu Liu, Zheng Huang, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Yating Wang, Haoyi Zhu, Hao Chen, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11680 2026-06-11 cs.AI cs.CL cs.LG 新提交 67%

Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

先组织再检索:面向高效智能体的层次化记忆导航

Hao-Lun Hsu, Nikki Lijing Kuang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Duke University(杜克大学) Snowflake AI Research(Snowflake AI研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HORMA框架,通过构建文件系统式的层次化记忆结构并利用强化学习训练的轻量级导航代理,实现高效检索,在长时任务中提升性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13207 2026-06-11 cs.RO cs.CV 版本更新 67%

PIGEON: VLM-Driven Object Navigation via Points of Interest Selection

PIGEON: 通过兴趣点选择的VLM驱动物体导航

Cheng Peng, Zhenzhe Zhang, Xiaobao Wei, Yanhao Zhang, Heng Wang, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Shanghang Zhang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出PIGEON框架,将物体导航建模为基于原始观测的稀疏决策问题,通过兴趣点(PoI)作为视觉决策单元,结合VLM选择关键点,实现零样本SOTA性能并迁移至主动具身问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09809 2026-06-10 cs.CV 版本更新 67%

SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing

SciFlow-Bench:通过逆解析评估结构感知的科学图表生成

Tong Zhang, Honglin Lin, Zhou Liu, Chong Chen, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Huawei Cloud BU(华为云业务部) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 提出SciFlow-Bench基准,通过逆解析将生成的图表图像转换为结构化图进行比较,以结构可恢复性而非视觉相似性评估科学图表生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07528 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

BEACON: Behavioral Entropy Aggregation for Cross-Model Hallucination Detection in Large Language Models

BEACON: 面向大语言模型跨模型幻觉检测的行为熵聚合

Naveen Bera, Pulijala Sai Nikhila, Kondaguduru Abhiram, Shaik Gayaz Ali, Shoaib Sadiq Salehmohamed, Shaik Mohammed Omar, Jinal Prashant Thakkar, Hansika Aredla, Shalmali Ayachit

机构 * LLM Lens

专题命中 视觉空间推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BEACON框架,通过多维度行为特征(语义熵、嵌入几何、思维链一致性、释义稳定性)的黑盒检测方法,在7个基准上达到0.8123 AUROC,优于现有方法。

Comments 12 pages, 6 tables, 1 figure. Code and data available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10376 2026-06-09 cs.CV 版本更新 67%

SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation

SleepWalk:一种三层压力测试基准,用于指导的视觉-语言导航

Niyati Rawal, Sushant Ravva, Shah Alam Abir, Saksham Jain, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * Indian AI Research Organization (IAIRO)(印度人工智能研究组织) ĸragya Lab, BITS Pilani Goa(BITS Pilani Goa 的 ĸragya 实验室) University of Dhaka(达卡大学) Delhi Technological University(德里技术大学) Apple(苹果公司) Meta

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出SleepWalk基准,用于评估基于指令的轨迹预测,针对局部化、交互导向的具身推理,揭示当前VLM在空间推理中的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07172 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 67%

Textual Supervision Enhances Geospatial Representations in Vision-Language Models

文本监督增强视觉-语言模型中的地理空间表示

Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon, Luiz Felipe Vecchietti, Bryan Nathanael Wijaya, Cheng Yaw Low, Virgilio Almeida, Meeyoung Cha

机构 * University of São Paulo(圣保罗大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究视觉、视觉-语言及多模态模型的地理空间表示能力,发现文本监督能有效提升空间编码,推动地理空间AI发展。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05635 2026-06-05 cs.CV cs.MM 67%

ShotCrop$^3$: Cropping Human-Centric Images into Cinematic Triple-Shot Compositions

ShotCrop$^3$:将人物中心图像裁剪为电影级三镜头构图

Dehong Kong, Lina Lei, Lingtao Zheng, Chenyang Wu, Ailing Zhang, Xinran Qin, Teng Ma, Jiaqi Xu, Zhixin Wang, Zhikai Chen, Xuecheng Qi, Renjing Pei, Fan Li

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出三镜头构图任务,通过三阶段训练流程(思维链微调、半监督微调和组相对策略优化)从单张人物中心图像生成远景、中景和特写三张裁剪图,并附带简短描述,以支持视觉叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04436 2026-06-04 cs.CV cs.RO 67%

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达梦机器人) Great Bay University(大亚大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01247 2026-06-02 cs.CV 67%

Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?

看向哪里:基础模型能否通过主动探索达到目标视角?

Liyang Li, Muzhi Zhu, Zhiyue Zhao, Hengyu Zhao, Ke Liu, Linhao Zhong, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn)

AI总结 提出目标视角复现(TVR)任务及TVRBench基准,通过分析现有模型瓶颈并构建统一后训练框架,将9B开源模型成功率提升至50%以上。

Comments Project page: https://github.com/aim-uofa/TVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00828 2026-06-02 cs.CV 67%

RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes

RoboStressBench: 在具身场景中基准测试VLM对物理视觉压力的鲁棒性

Leyi Wu, Yifan Zhao, Jinjie Zhang, Suzeyu Chen, Wosong Chen, Zhifei Chen, Tianshuo Xu, Qingchun He, Hongxin Hu, Haojian Huang, Yangkai Wei, Wenqian Li, Yinchuan Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出RoboStressBench,从逆图形学角度将视觉压力分解为材质、视角、光照和几何四个物理维度,系统评估VLM在真实物理压力下的鲁棒性,并引入压力感知求解器提升高压力场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18859 2026-05-29 cs.AI cs.CL cs.LG 67%

RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models

RewardFlow: 面向大语言模型智能体强化学习的拓扑感知状态图奖励传播

Xiao Feng, Bo Han, Zhanke Zhou, Jiaqi Fan, Jiangchao Yao, Ka Ho Li, Dahai Yu, Michael Kwok-Po Ng

机构 * TMLR Group(TMLR小组) Hong Kong Baptist University(香港 Baptist大学) TCL Corporate Research (HK) Co Ltd(TCL企业研究(香港)有限公司) Cooperative Medianet Innovation Center Shanghai Jiao Tong University(合作中位网创新中心上海交通大学) Department of Mathematics Hong Kong Baptist University(香港 Baptist大学数学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RewardFlow方法,通过构建状态图进行拓扑感知的奖励传播,为智能体推理提供无标注的密集奖励,显著提升强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27038 2026-05-27 cs.RO 67%

TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving

TPS-Drive: 基于VLM的自动驾驶任务引导表示净化

Jiaxiang Li, Yumao Liu, Ke Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 提出TPS-Drive框架,通过任务引导的表示净化(Agent-Centric Tokenizer)解决VLM在自动驾驶中的空间幻觉和表示干扰问题,实现精确的3D空间预测与安全规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18746 2026-05-26 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

ESI-Bench: 迈向闭环感知-动作的具身空间智能

Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) Northwestern University(西北大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ESI-BENCH基准,通过主动探索(感知、移动、操作)在OmniGibson环境中评估具身空间智能,发现主动探索显著优于被动方法,失败主因是动作盲视而非感知弱,且模型存在元认知差距。

Comments https://esi-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15876 2026-05-21 cs.CV 67%

Unlocking Dense Metric Depth Estimation in VLMs

解锁VLMs中的密集度量深度估计

Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu, Lei Ke

机构 * Zhejiang University(浙江大学) Tencent Hunyuan LLM(腾讯混元大模型) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉空间推理 :reasoning(abstract,abstract_cn)

AI总结 本文提出DepthVLM,一种将单个VLM转换为原生密集几何预测器的简单有效框架,同时保持其多模态能力。通过在LLM主干上附加轻量级深度头,并在统一的视觉-文本监督范式下进行训练,DepthVLM能够在单次前向传递中生成高分辨率深度图和语言输出。此外,还引入了一个统一的室内-室外度量深度基准,实验表明DepthVLM在推理效率、复杂3D空间推理等方面均优于现有VLMs和纯视觉模型。

Comments Project Page: https://depthvlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04128 2026-05-21 cs.GR cs.AI cs.CL cs.CV cs.LG 67%

JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation

JoyAI-Image: 激活统一多模态理解和生成中的空间智能

Lin Song, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, Yicheng Xiao, Jianhui Liu, Yanbing Zhang, Guohui Zhang, Wenhu Zhang, Hang Xu, Nan Jiang, Xin Han, Haoze Sun, Maoquan Zhang, Haoyang Huang, Nan Duan

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出JoyAI-Image,一种统一的多模态基础模型,用于视觉理解、文本到图像生成和指令引导的图像编辑。该模型结合了空间增强的多模态大语言模型(MLLM)和多模态扩散Transformer(MMDiT),通过共享的多模态接口实现感知与生成的交互。构建可扩展的训练配方,结合统一指令微调、长文本渲染监督、空间 grounded 数据和通用及空间编辑信号,使模型具备广泛的多模态能力,同时增强几何感知推理和可控视觉合成。实验表明,JoyAI-Image在理解、生成、长文本渲染和编辑基准上达到最先进的性能。更重要的是,增强的理解、可控的空间编辑和新视角辅助推理之间的双向循环使模型超越一般视觉能力,向更强的空间智能发展。

Comments Code: https://github.com/jd-opensource/JoyAI-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20525 2026-05-21 cs.CV cs.AI cs.CL cs.LG eess.IV 67%

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

NeuroQA: 一种大规模的3D脑部MRI理解图像 grounded 评估基准

Mohammad H. Abbasi, Favour Nerrise, Shaurnav Ghosh, Ridvan Yesiloglu, Yuncong Mao, Bailey Trang, Mohammad Asadi, Merryn Daniel, Gustavo Chau Loo Kung, Ken Chang, Pavan Pinkesh Shah, Adam Turnbull, Kyan Younes, Seena Dehkharghani, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出NeuroQA,一个大规模的3D脑部MRI视觉问答基准,包含来自12977名受试者的56953个问答对,涵盖5-104岁及五个临床领域,通过3D体积评估11种临床推理技能,并提供可复现的生成脚本和在线排行榜。

Comments 30 pages, dataset and benchmark release

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26745 2026-05-19 cs.LG cs.AI cs.CL stat.ML 67%

Deep sequence models tend to memorize geometrically; it is unclear why

深度序列模型倾向于记忆几何学;不清楚为何

Shahriar Noroozizadeh, Vaishnavh Nagarajan, Elan Rosenfeld, Sanjiv Kumar

机构 * Machine Learning Department \& Heinz College, Carnegie Mellon University, Pittsburgh, PA, USA Google Research, NY, USA

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了深度序列模型中原子事实的存储机制,发现几何记忆能编码全局关系,即使在训练中未共现的实体间也能建立联系,挑战了传统关联记忆的观点。

Comments Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21363 2026-05-19 cs.RO 67%

A Deployable Embodied Vision-Language Navigation System with Hierarchical Cognition and Context-Aware Exploration

可部署的具身视觉-语言导航系统:具有层次认知和上下文感知探索

Kuan Xu, Ruimeng Liu, Yizhuo Yang, Denan Liang, Tongxing Jin, Shenghai Yuan, Chen Wang, Lihua Xie

机构 * Center for Advanced Robotics Technology Innovation (CARTIN), School of Electrical and Electronic Engineering, Nanyang Technological University(先进机器人技术与创新中心(CARTIN)、电子工程学院、南洋理工大学) Spatial AI & Robotics Lab, Department of Computer Science and Engineering(空间人工智能与机器人实验室、计算机科学与工程系)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种可部署的具身视觉-语言导航系统,通过分层认知和上下文感知探索,在真实机器人上实现高效导航与强推理能力。

Comments 10 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10038 2026-05-15 cs.CL cs.AI cs.LG 67%

On the Diagram of Thought

思维图式图示

Yifan Zhang, Yang Yuan, Andrew Chi-Chih Yao

机构 * IIIS Tsinghua University(清华大学人工智能研究院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出思维图式(DoT)框架,使LLM能构建动态推理图谱,通过类型推理记录和范畴论数学框架,实现可审计的分步推理,区分类型子轨迹与自然语言文本的语义保障。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17435 2026-05-01 cs.RO 67%

ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

ImagineNav++: 通过场景想象促使视觉语言模型作为具身导航器

Teng Wang, Xinxin Zhao, Wenzhe Cai, Changyin Sun

机构 * School of Automation, Southeast University(东南大学自动化学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出ImagineNav++,通过场景想象将视觉语言模型用于无地图导航,利用想象模块生成高探索潜力的视点,并通过选择性聚焦记忆机制实现空间一致性,实验表明其在无地图导航中表现优异。

Comments 17 pages, 10 figures. arXiv admin note: text overlap with arXiv:2410.09874

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26839 2026-04-30 cs.RO 67%

Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance

带我走:面向以人为本的户外助行的长周期社交导航

Lingfeng Zhang, Xiaoshuai Hao, Xizhou Bu, Yingbo Tang, Hongsheng Li, Jinghui Lu, Xiu-shen Wei, Jiayi Ma, Yu Liu, Jing Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Hefei University of Technology(合肥工业大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出Walk with Me框架,通过高阶视觉语言模型和轻量级兴趣点,实现无地图的长周期社交导航,结合语义意图定位、安全推理和低层动作生成,提升户外助行的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 67%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);verifier(abstract)

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17190 2026-04-21 cs.CV 67%

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏