arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-03 至 2026-04-03 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 11 篇

2604.01764 2026-04-03 cs.CV 85%

Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning

显而易见的隐含意义:RebusBench用于评估认知视觉推理

Seyed Amir Kasaei, Arash Marioriyad, Mahbod Khaleti, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);LLaVA(abstract);InternVL(abstract)

AI总结 本文提出RebusBench基准,用于评估模型在需要多步推理的隐含意义理解能力,发现现有模型在认知连接方面存在缺陷。

Comments Accepted at ICLR 2026 Workshop: From Human Cognition to AI Reasoning (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02991 2026-04-03 cs.CV cs.AI 73%

Towards Faithful Reasoning in Comics for Small MLLMs

面向小规模MLLMs的漫画中忠实推理方法

Chengcheng Feng, Haojie Yin, Yucheng Jin, Kaizhu Huang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01681 2026-04-03 cs.RO cs.AI 70%

Bridging Large-Model Reasoning and Real-Time Control via Agentic Fast-Slow Planning

通过代理快慢规划弥合大模型推理与实时控制

Jiayi Chen, Shuai Wang, Guangxu Zhu, Chengzhong Xu

机构 * Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong (Shenzhen)(深圳市大数据研究院,香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(澳门大学智慧城市物联网国家重点实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出一种分层框架,通过感知-决策-轨迹-控制的分离,提升自动驾驶系统在扰动下的鲁棒性,减少侧向偏移和完成时间。

Comments 8 pages, 12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 62%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16082 2026-04-03 q-bio.QM cs.AI cs.LG 62%

BIOGEN: Evidence-Grounded Multi-Agent Reasoning Framework for Transcriptomic Interpretation in Antimicrobial Resistance

BIOGEN:基于证据的多智能体推理框架用于抗菌药物耐药性中的转录组解释

Elias Hossain, Mehrdad Shoeibi, Ivan Garibay, Niloofar Yousefi

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 BIOGEN通过结合生物信息检索、结构化推理和多批评验证,生成可追溯的转录组模块解释,其在抗菌药物耐药性研究中表现出强生物学基础和零幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01754 2026-04-03 cs.CL cs.AI cs.LG 62%

LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches

LiveMathematicianBench: 一个用于数学家级推理的实时基准

Linyang He, Qiyao Yu, Hanze Dong, Baohao Liao, Xinxing Xu, Micah Goldblum, Jiang Bian, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LiveMathematicianBench,一个基于近期arXiv论文的动态多选基准,用于评估大语言模型的数学推理能力,通过证明草图指导的干扰项生成机制,提升对真实理解的检测。

Comments Project page: https://livemathematicianbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02318 2026-04-03 cs.RO cs.CV 57%

Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning

停止游荡:通过元认知推理实现高效的视觉-语言导航

Xueying Li, Feng Lyu, Hao Wu, Mingliu Liu, Jia-Nan Liu, Guozi Liu

机构 * Central South University(中南大学) Nanjing University(南京大学) State Grid Hubei Electric Power Research Institute(国网湖北省电力有限公司电力科学研究院) Dongguan University of Technology(东莞理工学院)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出MetaNav,通过整合空间记忆、历史感知规划和反思修正,提升视觉-语言导航的效率与鲁棒性,实验显示其在多个基准上表现优异,减少了20.7%的VLM查询。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01882 2026-04-03 cs.CV 57%

A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes

A3R: 通过跨维度证据进行3D高斯场景中的代理 affordance 推理

Di Li, Jie Feng, Guanbin Li, Ronghua Shang, Yuhui Zheng, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) Qinghai Normal University(青海师范大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出A3R框架,通过跨维度证据获取提升复杂3D高斯场景中细粒度affordance推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01634 2026-04-03 cs.LG cs.CL 57%

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01610 2026-04-03 cs.AI 57%

GraphWalk: Enabling Reasoning in Large Language Models through Tool-Based Graph Navigation

GraphWalk: 通过基于工具的图导航在大语言模型中实现推理

Taraneh Ghandi, Hamidreza Mahyar, Shachar Klaiman

机构 * McMaster University(麦克马斯特大学) BASF Digital Solutions(巴斯夫数字解决方案)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 GraphWalk通过基于工具的图导航框架,使大语言模型能够高效进行多跳推理,提升在不同任务中的性能,尤其在大规模知识图谱中表现更优。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 50%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏