arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-23 至 2026-03-23 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 5 篇

2512.15160 2026-03-23 cs.CV 82%

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

EagleVision:基于BEV的双阶段框架用于空间智能

Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

机构 * Atlas Lab(Atlas实验室) School of Aerospace, BUAA(北京航空航天大学航空学院) School of Software, BUAA(北京航空航天大学软件学院) State Key Laboratory of HERATT(HERATT国家重点实验室) Key Laboratory of SDODS (MOE) Project(SDODS重点实验室(教育部))

专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 EagleVision通过结合几何感知帧选择与主动BEV推理,提升视频空间推理能力,实现空间感知与验证的闭环循环。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI 74%

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19203 2026-03-23 cs.CV 50%

Tinted Frames: Question Framing Blinds Vision-Language Models

着色边框:问题框架使视觉语言模型失明

Wan-Cyuan Fan, Jiayun Luo, Declan Kutscher, Leonid Sigal, Ritwik Gupta

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Vector Institute for AI(人工智能向量研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究视觉语言模型在不同问题框架下的注意力分配问题,发现框架影响其视觉输入处理,提出轻量级提示调优方法提升视觉感知能力。

Comments Preprint. Project page: https://davidhalladay.github.io/tinted_frames_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 50%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19481 2026-03-23 cs.CV 50%

Narrative Aligned Long Form Video Question Answering

叙事对齐的长视频问答

Rahul Jain, Keval Doshi, Burak Uzkent, Garin Kessler

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏