arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-20 至 2026-08-20 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 11 篇

2604.21079 2026-08-20 cs.CV 版本更新 79%

Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models

聚焦推理:面向视觉语言模型的有状态、基于动作的视觉聚焦

Juhong Min, Lazar Valkov, Vitali Petsiuk, Hossein Souri, Deen Dayal Mohan

机构 * AI Center -- Mountain View, Samsung Electronics(三星电子山景城人工智能中心)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出Foveated Reasoner,通过整合聚焦与推理机制,提升视觉语言模型在高分辨率图像下的效率与准确性,实验证明其在多种基准测试中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06422 2026-08-20 cs.CL cs.AI cs.CV 版本更新 79%

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04759 2026-08-20 cs.CV cs.CL 版本更新 77%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17253 2026-08-20 cs.LG cs.AI cs.CV 版本更新 75%

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Co-RL:多智能体强化学习中多样群体涌现的无监督推理

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li

机构 * University of Exeter(埃克塞特大学) ByteDance(字节跳动) Johns Hopkins University(约翰斯·霍普金斯大学) UC San Diego(加州大学圣迭戈分校)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。

Comments 30 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 74%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18504 2026-08-20 cs.AI 新提交 70%

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

UMER:通过感知对的判别推理统一嵌入与排序以实现通用多模态检索

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对通用多模态检索的需求,提出UMER框架,通过感知对的判别推理联合学习对比式嵌入与判别式排序,在MMEB-V2基准上实现最优性能且支持可调整预算的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18111 2026-08-20 cs.AI 新提交 70%

Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry

求解不等于绘图:奥林匹克几何图解推理基准

Hsien Xin Peng, Anthony Kim, Alvin Li, Calvin Supasanya, Shivank Garg, Kevin Zhu

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对基础模型图解推理能力评估缺口,构建含954道奥林匹克几何题的基准,发现模型求解与绘图能力存在显著差距,绘图平均编译成功率仅36.14%。

Comments ICML 2026, AI4MATH Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06185 2026-08-20 cs.AI cs.CV 版本更新 62%

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18993 2026-08-20 cs.CV 新提交 57%

ForeSightGuide: An Anticipatory Framework toward Accurate and Low-Redundancy Guidance for the Visually Impaired

ForeSightGuide:面向视障人士的精准低冗余前瞻式导航框架

Zhiyuan Wang, Xu Li, Shikang Guo, Wei Meng, Quan Liu, Jie Zuo

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对视障人士出行的信息过载问题,提出前瞻式导航框架ForeSightGuide,结合语义理解与危险预测,在新数据集及公共基准上实现最优性能,冗余警报与漏险率表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18878 2026-08-20 cs.AI cs.MA 新提交 57%

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架

Zijie Meng, Xiwei Dai, Yixuan Tang, Jin Hao, Yang Feng, Fudong Zhu, Xiaoqiang Liu, Shaosheng Cao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Angelalign Technology Inc.(时代天使科技有限公司) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18574 2026-08-20 cs.LG 新提交 57%

Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR

持续推理环境:诊断与利用持续RLVR中的共享推理

Lirui Luo, Guoxi Zhang, Hongming Xu, Rongqing Li, Cong Fang, Lifeng Fan

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI)) Beijing Institute of Technology(北京理工大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室、北京大学智能科学与技术学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG

AI总结 本研究提出持续推理环境,针对持续RLVR中顺序训练性能低于MTRL的问题,提出CPR方法利用共享推理,使模型平均达到MTRL级性能。

详情

展开后加载摘要…

URL PDF HTML 收藏