arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-17 至 2026-08-17 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 12 篇

2608.13791 2026-08-17 eess.IV cs.CV 新提交 91%

VLM- and LLM-Driven Multi-Agent System for PET Image Denoising

基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统

Boxiao Yu, Savas Ozdemir, Yang Xing, Fumio Hashimoto, Jiong Wu, Yizhou Chen, Axel Rominger, Ruogu Fang, Kuangyu Shi, Tinsu Pan, Kuang Gong

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13766 2026-08-17 cs.CV 新提交 89%

ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究

Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14015 2026-08-17 cs.CV cs.AI 新提交 87%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14026 2026-08-17 cs.CE 新提交 85%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14309 2026-08-17 cs.CV q-bio.TO 新提交 84%

Spatial Message Passing in Language Space for Pathology Image Interpretation

面向病理图像解读的语言空间空间消息传递

Jing-Cheng Yang, Hao-Jung Wang, Jinhao Du, Yang Hu, Ming-shan Tsai, Jens Rittscher, Bin Li

机构 * National Taiwan University(台湾大学) University of Oxford(牛津大学) ZYTCA Limited(ZYTCA有限公司)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。

Comments Accepted at MICCAI 2026 Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08990 2026-08-17 cs.CV 版本更新 83%

ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning

ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别

Shifeng Liu, Zhengye Zhang, Sirui Zhao, Xinglong Mao, Zhehan Kan, Zhixiang Wei, Shiwei Wu, Chaoyou Fu, Tong Xu, Enhong Chen

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 75%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13570 2026-08-17 cs.CL cs.AI cs.LG 新提交 73%

Think in Latent, Explain in Language: Self-Explainable Latent Reasoning

在潜空间思考,以语言解释:自解释潜推理

Dayuan Zhao, Shengcao Cao, Yu-Xiong Wang, Liang-Yan Gui

专题命中 视觉推理 :vision-language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究提出自解释潜推理框架SELR,通过多任务训练使单个模型兼具高效潜推理与自解释能力,在LLMs和VLMs上实现更优效率、准确性与自包含可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09508 2026-08-17 cs.CV cs.AI 版本更新 73%

VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning

VISOR: 通过迭代搜索和超视距推理实现基于视觉检索的增强生成

Yucheng Shen, Jiulong Wu, Jizhou Huang, Dawei Yin, Lingyong Yan, Min Cao

机构 * Soochow University(苏州大学) Baidu Inc.(百度公司)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 VISOR通过结构化证据空间和动态轨迹机制解决多步推理中的视觉证据稀疏和搜索漂移问题,实现高效长视距视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 57%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21114 2026-08-17 cs.CV 版本更新 57%

CVT-Bench: Probing Spatial-State Integrity through Counterfactual Viewpoint Transformations

CVT-Bench:反事实视角变换揭示多模态大语言模型中不稳定的空间表征

Shanmukha Vellamcheti, Uday Kiran Kothapalli, Disharee Bhowmick, Sathyanarayanan N. Aakur

机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯杜大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 CVT-Bench通过控制诊断基准评估多模态大语言模型在反事实视角变换下的关系一致性,发现尽管单视角准确率高,但系统在反事实视角变换下存在系统性退化,揭示了表征结构对反事实空间推理的重要性。

Comments Reframed CVT-Bench around spatial-state integrity, added real-world benchmark derived from 3dSGG, context controls and other minor changes. 21 pages, 10 figures, 15 tables. Project page: this https URL (https://shanmukha-here.github.io/CVT-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08151 2026-08-17 cs.CV cs.MM 版本更新 57%

Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention

视觉与语言在哪里交汇?通过对比注意力理解并优化MLLMs中的视觉融合

Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Jun Ma, Jie Yu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 通过对比注意力框架,研究揭示了MLLMs中视觉-文本融合的层次演变,并改进了多模态推理性能。

Comments CVPR Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏