arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-10 至 2026-07-10 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 8 篇

2511.20644 2026-07-10 cs.CV 版本更新 84%

Vision-Language Memory for Spatial Reasoning

用于空间推理的视觉语言记忆

Zuntao Liu, Yi Du, Taimeng Fu, Shaoshu Su, Cherie Ho, Chen Wang

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。

Comments Accepted to European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08059 2026-07-10 cs.LG cs.AI 新提交 84%

When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models

当思考有害时:视觉语言模型推理链中的认知信号

Mayank Singal

专题命中 视觉推理 :visual language model(title,abstract);VLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型推理链中的认知信号,通过在相同对抗样本上运行四个模型,发现不同模型的答案熵行为模式有差异,思考链熵在部分情况下优于答案熵,还发现结构化弃权及其实用弃权门可提升准确率。

Comments 7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08024 2026-07-10 cs.CV cs.AI cs.LG cs.RO 新提交 83%

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

APIVOT:具有交错视觉语言思维的自适应规划

Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。

Comments Project Page: https://emilyzjin.github.io/projects/apivot.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-07-10 cs.CV 版本更新 77%

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08233 2026-07-10 cs.AI cs.CV 新提交 62%

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

玩禅道世界:在主动视觉概念归纳中挑战人工智能代理

Sophia Koehler, Antonia Wüst, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Kristian Kersting

机构 * AIML Lab, TU Darmstadt(人工智能机器学习实验室,达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森州人工智能中心) Psychology of Information Processing, TU Darmstadt(信息处理心理学,达姆施塔特工业大学) Centre for Cognitive Science, TU Darmstadt(认知科学中心,达姆施塔特工业大学) Cornell University(康奈尔大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学研究所,SIC组) German Center for AI (DFKI)(德国人工智能研究中心)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究构建智能系统时代理感知、假设形成及实验设计问题,提出禅道世界环境,评估多种代理方法,发现预测标签精度与恢复潜在规则无关,感知和归纳是不同瓶颈,基于视觉语言模型的代理实验无信息,还收集人类数据揭示差距及改进途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21917 2026-07-10 cs.CV cs.AI 版本更新 62%

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07761 2026-07-10 cs.AI 新提交 57%

Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning

对齐临床需求与人工智能能力:医学推理大语言模型综述

Qi Peng, Jiatong Li, Sirui Huang, Yiyang Jiang, Kaisong Gong, Ronger Ding, Shijie Ye, Changmeng Zheng, Yi Cai, Xiaobo Yang, Jin Huang, Xiao-Yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University(香港大学) South China University of Technology(华南理工大学) University of Toronto(多伦多大学) Peking Union Medical College Hospital(北京地坛医院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 综述医学大语言模型在医疗领域的进展,提出双视角方法,连接临床实践与计算方法,建立五级能力方案并关联推理模式与医学任务,引入基准数据集并报告模型结果,讨论进展与挑战及未来方向。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 50%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏