arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-11 至 2026-05-11 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2512.03454 2026-05-11 cs.CV cs.AI 81%

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) UESTC(电子科技大学) Purdue University(普渡大学) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07817 2026-05-11 cs.CV cs.AI cs.CL 81%

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) TU Wien(维也纳技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07660 2026-05-11 cs.CL 79%

Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

并非所有令牌都以相同方式学习:注意力熵揭示了强化学习推理中的异质信号

Gengyang Li, Zheng-Fan Wu, Siqi Bao, Yunfang Wu

机构 * Baidu(百度) School of Computer Science, Peking University(北京大学计算机科学系) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究通过注意力熵揭示强化学习推理中令牌层面的异质性,发现高熵令牌(探索者)与低熵令牌(锚点)在学习信号上有显著差异,动态熵感知的软重加权干预提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07106 2026-05-11 cs.CL 79%

Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

检索、整合与综合:空间-语义 grounded 的潜在视觉推理

Jin Cui, Xinyue Long, Xunyong Zhang, Yadong Zhang, Chuanchang Su, Jingye Gan, Boran Zhao, Pengju Ren

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出RIS框架,通过空间-语义 grounded 方法改进多模态大语言模型的视觉推理,通过构建逐步 grounded 数据集并引入短语言过渡token,提升潜在状态与词汇对齐的解码能力,实验显示在多个基准上优于现有基线。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 78%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06761 2026-05-11 cs.AI cs.CV cs.LG 62%

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

Weblica: 可扩展且可重复的视觉网络代理训练环境

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 视觉空间推理 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 Weblica提出一种可扩展且可重复的视觉网络代理训练框架,通过HTTP级缓存和LLM环境合成技术,实现大规模多样化的网络环境训练,其最佳模型在多个网络导航基准中表现优异。

Comments 28 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08003 2026-05-11 cs.CV 50%

SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

SphereVAD: 基于单位超球面几何推断的无训练视频异常检测

Chao Huang, Penfei Wei, Wei Wang, Jie Wen, Zhihua Wang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。

Comments 48 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07642 2026-05-11 cs.CV 50%

EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

EggHand:一种用于第一人称手姿态预测的多模态基础模型

Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park

机构 * DGIST, Republic of Korea(韩国忠南科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出EggHand模型,通过结合视觉-语言-动作模型的动作解码器和第一人称视频-文本编码器,实现对第一人称视频中手姿态序列的预测,提升了在剧烈视角变化下的鲁棒性和可控性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02991 2026-05-11 cs.CV 50%

GraphFusion3D: Dynamic Graph Attention Convolution with Adaptive Cross-Modal Transformer for 3D Object Detection

GraphFusion3D: 动态图注意力卷积与自适应跨模态Transformer用于3D目标检测

Md Sohag Mia, Md Nahid Hasan, Muhammad Abdullah Adnan

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GraphFusion3D框架,结合多模态融合与先进特征学习,通过自适应跨模态Transformer增强几何与语义信息,并引入图推理模块捕捉局部结构与全局语义,实验在SUN RGB-D和ScanNetV2上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07264 2026-05-11 cs.CV 50%

Sat3R: Satellite DSM Reconstruction via RPC-Aware Depth Fine-tuning

Sat3R: 通过RPC-aware深度微调实现卫星DSM重建

Qiaoyi Yang, Chaoyi Zhou, Xi Liu, Run Wang, Minghui Xu, Mert D. Pesé, Feng Luo, Yuhao Xu, Zhi-Qi Cheng, Qiushi Chen, Hairong Qi, Siyu Huang

机构 * Clemson University(克莱姆森大学) University of Washington(华盛顿大学) University of Tennessee(田纳西大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 Sat3R通过RPC-aware深度微调Depth Anything V2,利用SiLog损失构建物理一致的伪深度监督,实现无需每场景优化的卫星DSM重建,实验显示其在精度和速度上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07148 2026-05-11 cs.CV 50%

Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models

揭示和塑造视觉-语言模型中3D场景拓扑的潜在表示

Haoming Wang, Wei Gao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了视觉-语言模型是否能构建3D环境的拓扑表示,通过隔离空间子空间并数学塑造潜在表示,证明其与场景3D高斯核图的拉普拉斯特征映射一致,并在空间任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19974 2026-05-11 cs.CV 50%

RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection

基于内在反思的生成式空间推理器:RL-RIG

Tianyu Wang, Zhiyuan Ma, Qian Wang, Xinyi Zhang, Xinwei Long, Bowen Zhou

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RL-RIG通过生成-反思-编辑范式,提升图像生成的精细空间关系捕捉能力,采用Scene Graph IoU和VLM评估策略,在空间一致性上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏