arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2512.20557 2025-12-24 cs.CV 50%

Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

在4D中学习推理:面向视觉语言模型的动态空间理解

Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出DSR套件,通过生成多选题-答案对和轻量级几何选择模块提升视觉语言模型的动态空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18684 2025-12-23 cs.CV 50%

A Study of Finetuning Video Transformers for Multi-view Geometry Tasks

对多视角几何任务进行视频变换器微调的研究

Huimin Wu, Kwang-Ting Cheng, Stephen Lin, Zhirong Wu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文通过微调视频基础模型,提出了一种简单有效的方法,实现了多视角几何任务如光流估计的高性能表现。

Comments AAAI 20206, Project website: geovit-aaai26.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08930 2025-12-23 cs.CV cs.GR 50%

Selfi: Self Improving Reconstruction Engine via 3D Geometric Feature Alignment

Selfi: 通过3D几何特征对齐实现自改进的重建引擎

Youming Deng, Songyou Peng, Junyi Zhang, Kathryn Heal, Tiancheng Sun, John Flynn, Steve Marschner, Lucy Chai

机构 * Cornell University(康奈尔大学) Google(谷歌) UC Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Selfi通过特征对齐提升3D重建精度,利用VGGT输出作为伪地面真实值,实现NVS和姿态估计的高性能表现。

Comments Project Page: https://denghilbert.github.io/selfi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18448 2025-12-23 cs.CV 50%

Object-Centric Framework for Video Moment Retrieval

面向视频时刻检索的对象中心框架

Zongyao Li, Yongkang Wong, Satoshi Yamazaki, Jianquan Liu, Mohan Kankanhalli

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出面向对象的视频时刻检索框架,通过场景图解析和关系跟踪器变压器,提升对对象层面语义和动态的建模能力,从而在多个基准上取得更优性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18028 2025-12-23 cs.RO cs.CV 50%

Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation

Embodied4C: 评估具身视觉-语言导航中至关重要的因素

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) UAS Esslingen(埃森嫩大学) TU Wien(维也纳技术大学) Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Embodied4C通过三种异构具身评估VLMs的具身能力,发现跨模态对齐和指令微调比规模更重要,而空间和时间推理是可靠具身能力的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05769 2025-12-23 cs.CV 50%

Digital Twin Buildings: 3D Modeling, GIS Integration, and Visual Descriptions Using Gaussian Splatting, ChatGPT/Deepseek, and Google Maps Platform

数字孪生建筑:利用高斯点扩散、ChatGPT/DeepSeek和Google地图平台进行3D建模、GIS集成和视觉描述

Kyle Gao, Dening Lu, Liangzhi Li, Nan Chen, Hongjie He, Linlin Xu, Jonathan Li

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种基于高斯点扩散、ChatGPT和Google地图平台的数字孪生建筑框架,用于实现建筑的3D建模、GIS集成和视觉描述。

Comments -Fixed minor typo

Journal ref IEEE Geoscience and Remote Sensing Letters 22 (2025) 6013405

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22685 2025-12-22 cs.RO 50%

Deadlock-Free Hybrid RL-MAPF Framework for Zero-Shot Multi-Robot Navigation

无死锁的混合式RL-MAPF框架用于零样本多机器人导航

Haoyi Wang, Licheng Luo, Yiannis Kantaros, Bruno Sinopoli, Mingyu Cai

机构 * Department of Mechanical Engineering University of California Riverside CA USA(加州大学河滨分校机械工程系) Department of Electrical and Systems Engineering Washington University in St. Louis MO USA(华盛顿大学圣路易斯分校电气与系统工程系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种无死锁的混合RL-MAPF框架,通过整合反应性RL导航与按需MAPF干预,实现零样本多机器人导航的鲁棒性能。

Comments 18 pages (including appendix), 3 figures. Project page (videos, animations, additional resources): https://wanghaoyi518.github.io/rl-mapf-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16724 2025-12-19 cs.RO cs.CV 50%

VERM: Leveraging Foundation Models to Create a Virtual Eye for Efficient 3D Robotic Manipulation

VERM:利用基础模型创建虚拟眼睛以实现高效的3D机器人操作

Yixiang Chen, Yan Huang, Keji He, Peiyan Li, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新技术实验室,多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges Shandong University(山东大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 VERM通过利用基础模型创建虚拟视图,提升3D机器人操作的效率和准确性,实现训练和推理速度的显著提升。

Comments Accepted at RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15701 2025-12-18 cs.CV 50%

VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官

Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Zhang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14222 2025-12-18 cs.CV cs.RO 50%

History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation

基于历史增强的双阶段变压器用于空域视觉与语言导航

Xichen Ding, Jianzhe Gao, Cong Pan, Wenguan Wang, Jie Qin

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出HETT框架,通过粗到细的导航流程整合全局环境推理与局部场景理解,提升无人机在大规模城市环境中基于语言指令的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20047 2025-12-17 cs.CV eess.IV 50%

Med3DVLM: An Efficient Vision-Language Model for 3D Medical Image Analysis

Med3DVLM: 一种高效的视觉-语言模型用于3D医学图像分析

Yu Xin, Gorkem Can Ates, Kuang Gong, Wei Shao

机构 * University of Florida(佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Med3DVLM通过三个创新提出,实现了高效的3D医学图像分析,显著提升了图像-文本检索、报告生成和视觉问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13250 2025-12-16 cs.CV 50%

Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection

迈向便携视觉:基于视觉的主动视角选择

Juil Koo, Daehyeon Choi, Sangwoo Youn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。

Comments Project page: https://active-view-selection.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13015 2025-12-16 cs.CV 50%

What Happens Next? Next Scene Prediction with a Unified Video Model

接下来会发生什么?一种统一的视频模型用于下一场景预测

Xinjie Li, Zhimin Chen, Rui Zhao, Florian Schiffers, Zhenyu Liao, Vimal Bhat

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Next Scene Prediction任务,通过联合框架结合Qwen-VL和LTX,利用预训练、监督微调和强化学习提升视频模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18734 2025-12-16 cs.RO 50%

Learning Obstacle Avoidance using Double DQN for Quadcopter Navigation

使用双DQN学习避障以实现四旋翼导航

Nishant Doshi, Amey Sutavani, Sanket Gujar

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出使用双DQN算法,通过深度相机实现四旋翼机器人在模拟城市环境中的避障导航学习。

Comments Fixed typo in second author's name throughout the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11490 2025-12-15 cs.CV cs.IR 50%

VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing

VLM2GeoVec:迈向通用遥感多模态嵌入

Emanuel Sánchez Aimar, Gulnaz Zhambulova, Fahad Shahbaz Khan, Yonghao Xu, Michael Felsberg

机构 * Linköping University(_linköping大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VLM2GeoVec通过单编码器对比学习实现遥感多模态嵌入,统一可扩展检索与区域推理,提升遥感场景分析的连贯性。

Comments 21 pages, 7 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21451 2025-12-15 cs.CV 50%

MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

MM-SeR: 多模态自反思用于轻量级图像描述

Junha Song, Yongsik Jo, So Yeon Min, Quanting Xie, Taehwan Kim, Yonatan Bisk, Jaegul Choo

机构 * KAIST(韩国科学技术院) UNIST(全南国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 MM-SeR通过轻量级多模态自反思框架,在减少计算成本的同时,实现了与大规模模型相当的图像描述性能,并扩展到长距离视频问答任务。

Comments Project page: https://sites.google.com/view/junha/mm-ser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10956 2025-12-12 cs.CV 50%

Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision

通过立体视觉和中等层次视觉增强动态城市导航

Wentao Zhou, Xuweiyi Chen, Vignesh Rajagopal, Jeffrey Chen, Rohan Chandra, Zezhou Cheng

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出StereoWalker,通过引入立体视觉和中等层次视觉模块,提升动态城市导航性能,仅用1.5%数据即可达到先进水平。

Comments Project Page: https://www.cs.virginia.edu/~tsx4zn/stereowalk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09583 2025-12-12 cs.CV 50%

UnReflectAnything: RGB-Only Highlight Removal by Rendering Synthetic Specular Supervision

UnReflectAnything:通过渲染合成镜面监督实现仅RGB的高光去除

Alberto Rota, Mert Kiray, Mert Asim Karaoglu, Patrick Ruhkamp, Elena De Momi, Nassir Navab, Benjamin Busam

机构 * Politecnico di Milano(米兰理工学院) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ImFusion(ImFusion公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 UnReflectAnything通过渲染合成镜面监督,实现仅RGB图像的高光去除,适用于自然和手术领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02427 2025-12-12 cs.CV cs.RO 50%

From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics

从实验室到现实应用:评估边缘设备上用于移动机器人的零样本场景解读

Nicolas Schuler, Lea Dewald, Nick Baldig, Jürgen Graf

机构 * Laboratories for Cognitive Systems and Robotics(认知系统与机器人实验室) University of Luxembourg(卢森堡大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文评估了适用于移动机器人边缘设备的小型视觉语言模型在零样本场景解读任务中的性能与应用潜力。

Comments 15 pages, 6 figures, 1 table; accepted for AI-2025 Forty-fifth SGAI International Conference on Artificial Intelligence CAMBRIDGE, ENGLAND 16-18 DECEMBER 2025

Journal ref Artificial Intelligence XLII. SGAI-AI 2025. Lecture Notes in Computer Science, vol 16302. Springer, Cham (2026), pp 301-315

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09619 2025-12-11 cs.RO 50%

GLaD: Geometric Latent Distillation for Vision-Language-Action Models

GLaD:面向视觉-语言-动作模型的几何潜在蒸馏

Minghao Guo, Meng Cao, Jiachen Tao, Rongtao Xu, Yan Yan, Xiaodan Liang, Ivan Laptev, Xiaojun Chang

机构 * MBZUAI University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GLaD通过引入几何意识的预训练机制,提升了视觉-语言-动作模型的空间推理和策略泛化能力,无需依赖深度传感器或3D标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09364 2025-12-11 cs.CV 50%

ASSIST-3D: Adapted Scene Synthesis for Class-Agnostic 3D Instance Segmentation

ASSIST-3D: 为无类别3D实例分割适应的场景合成

Shengchao Zhou, Jiehong Lin, Jiahui Liu, Shizhen Zhao, Chirui Chang, Xiaojuan Qi

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ASSIST-3D通过异构对象选择、场景布局生成和点云构建,提升无类别3D实例分割的泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00718 2025-12-11 cs.CV 50%

VFM-ISRefiner: Towards Better Adapting Vision Foundation Models for Interactive Segmentation of Remote Sensing Images

VFM-ISRefiner: 向更适应交互分割遥感图像的视觉基础模型迈进

Deliang Wang, Peng Liu, Yan Ma, Rongkai Zhuang, Lajiao Chen, Bing Li, Yi Zeng

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) School of Information Science and Technology, Beijing Forestry University(北京林业大学信息科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VFM-ISRefiner提出了一种基于点击的交互分割框架,通过适配器调优和混合注意力机制提升遥感图像分割的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV 50%

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 50%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14555 2025-12-09 cs.CV 50%

Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions

Descrip3D: 通过物体级文本描述增强基于大语言模型的3D场景理解

Jintang Xue, Ganning Zhao, Jie-En Yao, Hong-En Chen, Yue Hu, Meida Chen, Suya You, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Descrip3D通过引入物体级文本描述,提升大语言模型在3D场景理解中的关系推理能力,有效增强复杂室内场景的语义理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06424 2025-12-09 cs.CV 50%

DragMesh: Interactive 3D Generation Made Easy

DragMesh: 交互式3D生成变得容易

Tianshan Zhang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 DragMesh通过解耦运动学推理和运动生成,实现实时交互式3D生成,无需重新训练即可在新对象上生成合理运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06096 2025-12-09 cs.CV 50%

BeLLA: End-to-End Birds Eye View Large Language Assistant for Autonomous Driving

BeLLA:端到端的鸟瞰图大语言助手用于自动驾驶

Karthik Mohan, Sonam Singh, Amit Arvind Kale

机构 * UC San Diego(加州大学圣地亚哥分校) Robert Bosch Corporate Research India(博世印度公司研究)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 BeLLA通过端到端架构连接统一的360°鸟瞰图表示与大语言模型,提升自动驾驶中的空间推理和问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01946 2025-12-09 cs.CV 50%

3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

3DRS: MLLMs 需要 3D 意识表示监督以实现场景理解

Xiaohu Huang, Jingjing Wu, Qunyi Xie, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 3DRS 通过引入预训练 3D 基础模型的监督,提升 MLLM 的 3D 表示能力,从而增强场景理解性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05815 2025-12-08 cs.RO 50%

Optimal Safety-Aware Scheduling for Multi-Agent Aerial 3D Printing with Utility Maximization under Dependency Constraints

多智能体空中3D打印的最优安全意识调度与效用最大化在依赖约束下

Marios-Nektarios Stamatopoulos, Shridhar Velhal, Avijit Banerjee, George Nikolakopoulos

机构 * Robotics and AI Group, Luleå University of Technology(机器人与人工智能组,卢勒奥技术大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种基于效用最大化的优化框架,用于在依赖约束下实现多智能体空中3D打印的最优安全调度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05398 2025-12-08 cs.CV 50%

The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos

动态先验:为随意动态视频理解3D结构

Zhuoyuan Wu, Xurui Yang, Jiahui Huang, Yue Wang, Jun Gao

机构 * PKU(北京大学) NVIDIA(英伟达) USC(南加州大学) University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出动态先验模型,利用Vision-Language Models和SAM2实现无需任务特定训练的动态物体识别,提升结构3D理解的准确性和鲁棒性。

Comments Code is available at https://github.com/wuzy2115/DYNAPO

详情

展开后加载摘要…

URL PDF HTML 收藏