arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-03 至 2026-04-03 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 13 篇

2601.02991 2026-04-03 cs.CV cs.AI 85%

Towards Faithful Reasoning in Comics for Small MLLMs

面向小规模MLLMs的漫画中忠实推理方法

Chengcheng Feng, Haojie Yin, Yucheng Jin, Kaizhu Huang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02318 2026-04-03 cs.RO cs.CV 82%

Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning

停止游荡:通过元认知推理实现高效的视觉-语言导航

Xueying Li, Feng Lyu, Hao Wu, Mingliu Liu, Jia-Nan Liu, Guozi Liu

机构 * Central South University(中南大学) Nanjing University(南京大学) State Grid Hubei Electric Power Research Institute(国网湖北省电力有限公司电力科学研究院) Dongguan University of Technology(东莞理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出MetaNav,通过整合空间记忆、历史感知规划和反思修正,提升视觉-语言导航的效率与鲁棒性,实验显示其在多个基准上表现优异,减少了20.7%的VLM查询。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01610 2026-04-03 cs.AI 79%

GraphWalk: Enabling Reasoning in Large Language Models through Tool-Based Graph Navigation

GraphWalk: 通过基于工具的图导航在大语言模型中实现推理

Taraneh Ghandi, Hamidreza Mahyar, Shachar Klaiman

机构 * McMaster University(麦克马斯特大学) BASF Digital Solutions(巴斯夫数字解决方案)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GraphWalk通过基于工具的图导航框架,使大语言模型能够高效进行多跳推理,提升在不同任务中的性能,尤其在大规模知识图谱中表现更优。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01764 2026-04-03 cs.CV 79%

Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning

显而易见的隐含意义:RebusBench用于评估认知视觉推理

Seyed Amir Kasaei, Arash Marioriyad, Mahbod Khaleti, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出RebusBench基准,用于评估模型在需要多步推理的隐含意义理解能力,发现现有模型在认知连接方面存在缺陷。

Comments Accepted at ICLR 2026 Workshop: From Human Cognition to AI Reasoning (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01882 2026-04-03 cs.CV 78%

A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes

A3R: 通过跨维度证据进行3D高斯场景中的代理 affordance 推理

Di Li, Jie Feng, Guanbin Li, Ronghua Shang, Yuhui Zheng, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) Qinghai Normal University(青海师范大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出A3R框架,通过跨维度证据获取提升复杂3D高斯场景中细粒度affordance推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02071 2026-04-03 cs.CV cs.AI cs.LG 62%

Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection

挖掘实例导向的视觉-语言上下文以实现人-物交互检测

Soo Won Seo, KyungChae Lee, Hyungchan Cho, Taein Son, Nam Ik Cho, Jun Won Choi

机构 * Seoul National University(首尔国立大学) Hanyang University(汉阳大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出InCoM-Net框架,通过整合VLM提取的语义知识与实例特征,提升人-物交互检测的交互推理能力,实验表明其在HICO-DET和V-COCO基准上达到最优性能。

Comments Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 57%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 57%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10853 2026-04-03 cs.AI cs.HC 57%

Advanced Assistance for Traffic Crash Analysis: An AI-Driven Multi-Agent Approach to Pre-Crash Reconstruction

交通碰撞分析的高级辅助:一种基于AI的多智能体方法用于碰撞前重建

Gerui Xu, Boyou Chen, Huizhong Guo, Dave LeBlanc, Arpan Kusari, Efe Yarbasi, Ananna Ahmed, Zhaonan Sun, Shan Bao

机构 * Industrial and Manufacturing Systems Engineering Department, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校工业与制造系统工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Toyota Motor Engineering & Manufacturing North America, Inc.(丰田汽车工程与制造北美公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的多智能体框架,通过多模态输入生成碰撞前场景重建,并结合事件数据记录器信号识别碰撞车辆,验证了该框架在碰撞前行为推断中的高准确率。

Comments 36 pages, 14 figures

Journal ref SAE International Journal of Transportation Safety, 14(1), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02252 2026-04-03 cs.CV 50%

SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

SPAR:单次通过任意分辨率ViT用于开放词汇分割

Naomi Kombol, Ivan Martinović, Siniša Šegvić, Giorgos Tolias

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SPAR通过单次通过任意分辨率ViT实现高效高分辨率推理,提升开放词汇分割的mIoU性能,无需架构改动或像素级监督。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02020 2026-04-03 cs.CV 50%

Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence

VLMs在天空与空间之间迷失了吗?LinkS$^2$Bench用于无人机-卫星动态跨视角空间智能

Dian Liu, Jie Feng, Di Li, Yuhui Zheng, Guanbin Li, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Qinghai Normal University(青海师范大学) Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出LinkS$^2$Bench,首个评估VLMs跨视角空间智能的综合基准,通过动态无人机视频与高分辨率卫星图像构建17.9k高质量问题-答案对,揭示VLMs在动态跨视角对齐中的性能瓶颈,并提出跨视角对齐适配器提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01678 2026-04-03 cs.CV 50%

Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding

Director: 用于动态场景建模与理解的实例感知高斯点云

Yuheng Jiang, Yiwen Cai, Zihao Wang, Yize Wu, Sicheng Li, Zhuo Su, Shaohui Jiao, Lan Xu

机构 * ShanghaiTech University(上海科技大学) ByteDance(字节跳动)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Director通过联合建模人类性能、高保真渲染和实例级语义,实现动态场景的时空高斯表示,提升动态场景理解的稳定性与准确性。

Comments Project page: https://caiyw2023.github.io/Director/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01421 2026-04-03 cs.CV 50%

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

EgoFlow:基于梯度的流匹配用于第一人称6自由度物体运动生成

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出EgoFlow,通过多模态第一人称观察生成物理合理的物体运动轨迹,结合Mamba-Transformer-Perceiver架构和梯度引导推理,提升运动生成的准确性和物理真实性。

Comments CVPR 2026: https://abhi-rf.github.io/egoflow/

详情

展开后加载摘要…

URL PDF HTML 收藏