From LLM to Conversational Agent: A Memory Enhanced Architecture with Fine-Tuning of Large Language Models
专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments ICCV 2023, project page: https://github.com/MarSaKi/VLN-BEVBert
GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测
机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; Independent Researcher(独立研究员) ; National Center for Research (NCR)(国家研究中心)
专题命中 视觉空间推理 :reasoning(title)
AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。
Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026
利用年际一致的历史预测作为免费输入模态的多年地理空间推理
机构 * VITO Remote Sensing(VITO遥感公司)
专题命中 视觉空间推理 :reasoning(title)
AI总结 该研究将过往预测和BVL掩码纳入模型,提出CTY嵌入编码器,在540万像素的泛欧数据集上使作物F1提升,纠正召回偏差,为地理空间模型提供低成本方案。
Comments 17 pages, 7 figures Updated abstract to match with arxiv submission
基于参考的操作:多模态空间推理的框架与流程
专题命中 视觉空间推理 :reasoning(title)
AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。
Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)
StyleForge:基于超图场中反事实推理的室内家具风格生成
专题命中 视觉空间推理 :reasoning(title)
AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。
零样本长时程灵巧操作:基于多视图3D接地VLM推理
机构 * Seoul National University(首尔国立大学)
专题命中 视觉空间推理 :reasoning(title)
AI总结 提出零样本框架,利用多视图RGB图像通过VLM生成3D任务规划,结合三角测量和射线投票实现精确3D接地,支持抓取和工具使用,在真实实验中优于基线方法。
PoseGAM: 通过几何感知多视图推理实现鲁棒的未见物体姿态估计
机构 * KAUST(卡塔尔科技大学)
专题命中 视觉空间推理 :reasoning(title)
AI总结 提出PoseGAM,一种基于多视图基础模型的几何感知框架,直接预测未见物体的6D姿态,无需显式匹配,通过点云几何和特征网络整合几何信息,在多个基准上平均AR提升5.1%。
Comments Accepted by CVPR 2026 (Oral). Project page: https://windvchen.github.io/PoseGAM/
ReVSI:重建视觉空间智能评估以准确评估VLM 3D推理
机构 * Simon Fraser University(西蒙弗雷泽大学) ; University of Waterloo(滑铁卢大学) ; Hong Kong University of Science(香港科学大学) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所(Amii))
专题命中 视觉空间推理 :reasoning(title)
AI总结 ReVSI通过改进数据质量和评估可控性,解决现有空间智能评估在VLM 3D推理中的系统性失效问题,提供更可靠的诊断评估。
Comments Project Page: https://3dlg-hcvc.github.io/revsi/
通过多轮基于定位的强化学习实现高分辨率视觉推理
机构 * Fudan University(复旦大学) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室)
专题命中 视觉空间推理 :reasoning(title)
AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。
Comments Accepted by ACL(Findings) 2026
POINTS-Long: 基于人类视觉系统的自适应双模式视觉推理MLLM
机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院) ; WeChat AI, Tencent(腾讯微信人工智能)
专题命中 视觉空间推理 :reasoning(title)
AI总结 POINTS-Long引入动态视觉token缩放机制,通过聚焦模式和待机模式实现效率与精度的动态平衡,在细粒度视觉任务中保持最优性能,在长形式视觉理解中使用1/40-1/10的视觉token保留97.7-99.7%的精度,支持流式视觉理解。
基于渲染的视频生成与基于代理的推理
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
专题命中 视觉空间推理 :reasoning(title)
AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。
Comments Accepted to CVPR 2026
FunFact:通过因子图推理构建概率性功能3D场景图
机构 * ETH Zürich(苏黎世联邦理工学院) ; Microsoft(微软) ; University of Bonn & Lamarr Institute(波恩大学与拉马尔研究所)
专题命中 视觉空间推理 :reasoning(title)
AI总结 FunFact通过因子图推理构建概率性功能3D场景图,结合语义和几何先验,提升场景功能理解的鲁棒性与准确性。
DecoVLN:解耦观察、推理与修正以实现视觉-语言导航
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Shandong University(山东大学)
专题命中 视觉空间推理 :reasoning(title)
AI总结 DecoVLN通过优化长期记忆构建和修正策略,提升长周期导航的鲁棒性与稳定性,实验证明其在真实环境中的有效性。
Comments 16 pages, 8 figures, CVPR2026
探索并弥合几何-交互线索以实现视觉基础模型中的可及性推理
专题命中 视觉空间推理 :reasoning(title)
AI总结 本文探讨了视觉基础模型中几何感知与交互感知对可及性推理的互补作用,通过融合DINO的几何原型与Flux的交互地图,实现了与弱监督方法相当的可及性估计。
Comments 11 pages, 12 figures, Accepted to CVPR 2026
基于空间代码的物理世界视频推理
专题命中 视觉空间推理 :reasoning(title)
AI总结 基于空间代码的物理世界视频推理方法,通过空间编码器生成3D表示并提升大语言模型的推理能力。
Comments Code at https://github.com/Beckschen/spatialcode
osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航
机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) ; University of Bonn(波恩大学) ; Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)
专题命中 视觉空间推理 :reasoning(title)
AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。
Comments accepted at RA-L 2026
连续环境中的视觉-语言导航(VLN-CE)需要一个具身体验的智能体在连续环境中导航至目标,遵循自然语言指令。虽然当前基于图的方法通过将环境抽象为拓扑地图并简化动作空间到路径选择,提供了一种高效、结构化的方法,但它们在利用大规模数据和先进训练范式方面落后于基于大视觉-语言模型(LVLMs)的方法。在本文中,我们通过引入ETP-R1框架,将数据扩展和强化微调(RFT)范式应用于基于图的VLN-CE模型,以弥合这一差距。
机构 * Zhejiang University(浙江大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)
专题命中 视觉空间推理 :planning(title)
AI总结 ETP-R1通过数据扩展和强化微调范式,提升基于图的连续环境视觉-语言导航性能,实现新状态最先进的表现。
Comments 8 pages, 6 figures
机构 * Ubiquant(乌比量化)
专题命中 视觉空间推理 :reasoning(title)
机构 * Queen Mary University of London(伦敦女王学院)
专题命中 视觉空间推理 :reasoning(title)
Comments A. Xenos, N. Foteinopoulou and I. Ntinou contributed equally to this work; 14 pages, 5 figures; Accepted at IJCNN 2025
机构 * Southeast University(东南大学) ; National University of Singapore(新加坡国立大学) ; Sichuan University(四川大学) ; Agency for Science, Technology and Research, Singapore(新加坡科技研究局) ; CFAR, Agency for Science, Technology and Research, Singapore(新加坡科技研究局)
专题命中 视觉空间推理 :reasoning(title)
机构 * ETH Zurich(苏黎世联邦理工学院) ; TU Munich(慕尼黑技术大学)
专题命中 视觉空间推理 :reasoning(title)
专题命中 视觉空间推理 :reasoning(title)
Comments CVPR 2025
专题命中 视觉空间推理 :reasoning(title)
Comments 11 pages, 6 figures
专题命中 视觉空间推理 :reasoning(title)
MELLON——面向在线导航的多模态增强型大语言模型
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。
Fly0: 解耦语义定位与几何规划以实现零样本空中导航
机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) ; National University of Defense Technology(国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; Information Support Force Engineering University(信息支援力量工程大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。
ABot-N1:迈向通用视觉语言导航基础模型
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 研究旨在构建通用视觉语言导航基础模型,针对当前方法问题,提出ABot-N1,通过慢-快架构解耦认知与控制,利用双视觉语言信号,实现跨场景稳健、可推广且可解释的导航,在城市规模导航等任务中表现出色并开源新基准。
VIA:用于机器人控制的视觉接口代理
机构 * Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。