arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-10 至 2026-07-10 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 3 篇

2511.20644 2026-07-10 cs.CV 版本更新 84%

Vision-Language Memory for Spatial Reasoning

用于空间推理的视觉语言记忆

Zuntao Liu, Yi Du, Taimeng Fu, Shaoshu Su, Cherie Ho, Chen Wang

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。

Comments Accepted to European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-07-10 cs.CV 版本更新 77%

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21917 2026-07-10 cs.CV cs.AI 版本更新 62%

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 4 篇

2512.21414 2026-07-10 cs.CV cs.LG 版本更新 87%

A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding

用于临床信息丰富且可解释的医学图像理解的工具瓶颈框架

Christina Liu, Alan Q. Wang, Joy Hsu, Jiajun Wu, Ehsan Adeli

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对医学图像理解中工具组合难的问题,提出工具瓶颈框架(TBF),利用工具瓶颈模型(TBM)组合VLM选择的工具,通过神经网络计算融合工具输出,在组织病理学和皮肤病学任务中表现出色,提升医学图像理解且使预测更具可解释性。

Journal ref Proceedings of the 9th International Conference on Medical Imaging with Deep Learning, Proceedings of Machine Learning Research 315 (2026) 2958-2986

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12138 2026-07-10 cs.AI cs.CL cs.IR 版本更新 74%

Retrieval-Augmented Generation Must Move Beyond Factual Grounding to Represent Diverse Opinions

检索增强生成必须超越事实基础以代表多样化观点

Aditya Agrawal, Alwarappan Nakkiran, Darshan Fofadiya, Alex Karlsson, Harsha Aduri, Aman Singh Thakur

机构 * Amazon.com(亚马逊公司)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本文指出检索增强生成系统存在系统性事实偏差,并提出需要在检索系统设计上进行范式转变,通过不确定性量化方法提出统一目标,并展示Opinion-Aware RAG架构在两个领域中的实验结果,证明其在多样性、公平性和准确性方面的提升。

Comments 18 pages, Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15543 2026-07-10 cs.CL cs.AI 版本更新 57%

ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation

ParamMute:抑制知识关键的前馈神经网络以实现忠实的检索增强生成

Pengcheng Huang, Zhenghao Liu, Yukun Yan, Haiyan Zhao, Xiaoyuan Yi, Hao Chen, Zhiyuan Liu, Maosong Sun, Tong Xiao, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究RAG中LLMs不忠实生成问题,提出ParamMute框架抑制相关FFNs激活并校准模型,通过CoFaithfulQA基准评估,显著提升忠实性,减少对参数记忆依赖,为提高LLM在RAG中的可信度提供新方向。

Comments 26 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05622 2026-07-10 cs.CL 版本更新 50%

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

AdaPlanBench: 在世界约束和用户约束下评估大语言模型智能体的自适应规划能力

Jiayu Liu, Cheng Qian, Zhenhailong Wang, Bingxuan Li, Jiateng Liu, Qing Zong, Heng Wang, Jeonghwan Kim, Yumeng Wang, Bingxiang He, Xiusi Chen, Yi R. Fung, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对现有基准未充分探索渐进揭示的双重约束下的自适应规划问题,提出动态交互基准AdaPlanBench,通过307个家务任务和可扩展的约束构建流程,评估LLM智能体在交互中根据反馈迭代调整计划的能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 文档图表理解 1 篇

2602.13376 2026-07-10 cs.CV cs.AI cs.CL 版本更新 62%

An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

用于流程图图像到代码生成的在线无参考评估框架

Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO Singapore(AUMOVIO新加坡) VinUniversity(文理大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对流程图图像到代码生成在生产中无真实代码难以评估输出质量的问题,提出无参考评估框架,通过RecallOCR和PrecisionVE两个指标及调和均值F1OCR-VE监测生成质量,在FlowVQA数据集验证了其可靠性。

Comments This manuscript was inadvertently made publicly available before all necessary internal review processes had been completed. The authors are withdrawing the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 2 篇

2407.09016 2026-07-10 cs.RO 版本更新 67%

Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

通过用密集CLIP泛化语义映射实现开放词汇目标导航

Meng Wei, Chenyang Wan, Tai Wang, Yuqiang Yang, Wenzhe Cai, Yilun Chen, Hanqing Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01803 2026-07-10 cs.CV 版本更新 57%

Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

生成式动作叙事:评估合成视频中的人体运动

Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Belmont High School(贝利蒙高中) Canyon Crest Academy(坎波尔峡谷学院) Runway

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 1 篇

2511.19032 2026-07-10 cs.CV 版本更新 87%

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title);分类 cs.CV

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 4 篇

2606.06379 2026-07-10 cs.CV cs.AI 版本更新 86%

EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models

EasyLens: 一种无需训练的即插即用型微病变表示放大器,用于医学视觉语言模型

Qiwei Zeng, Hao Wang, Jinghao Lin, Shuchang Ye, Yuezhe Yang, Yige Peng, Haoyuan Che, Jinman Kim, Lei Bi

机构 * Jilin University(吉林大学) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ByteDance(字节跳动) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出EasyLens,一种无需训练的即插即用模块,通过构建病理-解剖原型空间、反事实推理选择病变相关补丁以及形态引导残差增强,放大医学视觉语言模型对微病变的表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12999 2026-07-10 cs.CV cs.AI 版本更新 85%

Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs

概念树:一个可控的合成数据框架助力更强的个性化视觉语言模型

Ruichuan An, Kai Zeng, Ming Lu, Sihan Yang, Renrui Zhang, Huitong Ji, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) CUHK MMLab(香港中文大学MMLab) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究提升VLM个性化能力问题,提出概念树(CaT)框架,以树结构表示概念生成多样正负样本,经数据过滤策略确保质量,实验证明该框架显著增强VLM在个性化基准测试中的能力,是首个可控合成数据管道。

Comments ECCV26 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11530 2026-07-10 cs.CV cs.AI 版本更新 81%

Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models

超越注意力分数:基于SVD的视觉令牌修剪用于高效视觉-语言模型

Yvon Apedo, Martyna Poreba, Michal Szczepanski, Samia Bouchafa

机构 * anoncvlab(匿名计算机视觉实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SVD-Prune方法,通过SVD分解视觉令牌特征矩阵并利用统计杠杆分数选择顶级令牌,以在极端视觉令牌预算下保持高性能,优于现有修剪方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10946 2026-07-10 cs.IT cs.AI cs.LG eess.SP math.IT 版本更新 73%

ToDMA: Large Model-Driven Massive Token Communications for Semantic Multiple Access

ToDMA:用于语义多址接入的大模型驱动海量令牌通信

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Robert Schober, Deniz Gündüz

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) University of Surrey(Surrey大学) Friedrich-Alexander-University Erlangen-Nurnberg(埃森哲-亚琛工业大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ToDMA,一种大模型驱动的语义多址接入方案,将无源随机接入与上下文感知令牌处理结合,用于海量令牌通信。通过压缩感知检测令牌及估计信道状态信息,利用上下文模型恢复冲突令牌,能降低接入延迟并保持令牌恢复与语义重建质量。

Comments Submitted to IEEE journals

详情

展开后加载摘要…

URL PDF HTML 收藏