arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-02 至 2026-04-02 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 9 篇

2604.00558 2026-04-02 cs.CV 82%

STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO

STAR:通过转弯点对齐和段级DPO缓解空间推理中的级联错误

Pukun Zhao, Longxiang Wang, Chen Chen, Peicheng Wang, Fanqing Zhou, Runze Li, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东财经大学) Chongqing University(重庆大学) Westlake University(西湖大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(abstract)

AI总结 本文提出STAR框架,通过拓扑锚点解决复杂拓扑中的级联错误问题,引入RedMaze-23K数据集并采用段级DPO提升长距离导航的自我修正能力,实验表明其32B版本在开源模型中表现最优。

Comments 9 pages, 6 figures, 4 tables, Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00057 2026-04-02 cs.MM cs.AI 79%

Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning

面向知识增强视觉推理的自动足球解说生成

Zeyu Jin, Xiaoyu Qin, Songtao Zhou, Kaifeng Yun, Jia Jia

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出GameSight模型,通过视觉推理与知识增强生成更准确的足球解说,提升解说质量与上下文相关性。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00867 2026-04-02 cs.CV 78%

A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video

一种用于无训练代理推理的4D表示

Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmoteit, Benjamin D. Killeen, Christian Heiliger, Nassir Navab

机构 * Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所) Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出一种基于显式4D表示的框架,利用多模态大语言模型实现无训练的手术代理推理,提升时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12545 2026-04-02 cs.CV 78%

Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA

空间推理并非免费午餐:对LLaVA的受控研究

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A., Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

机构 * Cohere Labs Community(Cohere Labs社区) Indian Institute of Science, Bangalore(印度科学研究所班加罗尔分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Imperial College London(伦敦帝国学院) Eisai Inc.(卫材公司) EleutherAI Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文通过LLaVA框架探讨了空间推理能力不足的原因,发现图像编码器设计和位置编码结构对空间理解有显著影响,但无法完全解决空间推理问题。

Comments Accepted as a poster at ICLR 2026 workshop ICBINB, typo fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17312 2026-04-02 cs.CV 78%

CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理

Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao

机构 * Beihang University(北京航空航天大学) Westlake University(西湖大学) ByteDance Singapore(字节跳动新加坡) ByteDance China(字节跳动中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。

Comments CVPR 2026. Project page: https://codedance-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00597 2026-04-02 cs.CV 50%

Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors

面向视角鲁棒的端到端自动驾驶与3D基础模型先验

Hiroki Hashimoto, Hiromichi Goto, Hiroyuki Sugai, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国立信息学研究所)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种无需数据增强的端到端自动驾驶方法,利用3D基础模型的几何先验提升视角变化鲁棒性,实验显示在pitch和高度扰动下性能提升显著。

Comments Accepted at CVPR Workshop on Simulation for Autonomous Driving 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00507 2026-04-02 cs.CV 50%

RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

RegFormer:可转移的交互关系接地以实现高效的弱监督人类-物体交互检测

Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) LG Energy Solution(LG新能源) Korea University(高丽大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RegFormer通过空间接地信号实现高效的弱监督人类-物体交互检测,无需额外训练即可直接迁移至实例级推理,实验表明其在效率和性能上均优于传统方法。

Comments Accepted at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27183 2026-04-02 cs.CV 50%

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

关于空间的交流:通过语言介导的空间整合跨部分视图

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究探讨多模态大语言模型能否通过对话整合不同视角,发现其在识别共享锚点物体上表现较好,但在关系推理和全局地图构建上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19660 2026-04-02 cs.CV cs.SD 50%

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏