arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-23 至 2026-06-23 共收录 160 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2603.04205 2026-06-23 cs.CV 版本更新 70%

Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild

Real5-OmniDocBench:面向野外鲁棒文档解析的全尺度物理重建基准

Changda Zhou, Ziyue Gao, Xueqing Wang, Tingquan Gao, Cheng Cui, Jing Tang, Yi Liu

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出首个对OmniDocBench v1.5进行全尺度一对一物理重建的基准Real5-OmniDocBench,覆盖扫描、弯曲、屏幕摄影、光照和倾斜五种真实场景,通过完整真值映射实现性能退化的因子级归因,揭示文档解析中的“现实鸿沟”。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 9 篇

2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 80%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 79%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23623 2026-06-23 cs.RO 新提交 67%

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract_cn);grounding(abstract)

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21470 2026-06-23 cs.RO cs.CV cs.LG 新提交 62%

ASCII Art Turns LLMs into VLA Controllers

ASCII艺术将LLMs转化为VLA控制器

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)

专题命中 GUI与屏幕智能体 :VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20711 2026-06-23 cs.CV cs.AI 新提交 62%

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

Video2Code: 通过动作感知重访从UI视频生成交互式网页

Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang

机构 * University of Waterloo(滑铁卢大学) Tsinghua University(清华大学) Zhipu AI(智谱AI) Beihang University(北京航空航天大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出Video2Code方法,通过动作感知重访UI视频中的关键区域,恢复可执行的状态转换,生成HTML/CSS/JavaScript代码,提升多步交互的代码功能正确性。

Comments 31 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18212 2026-06-23 cs.LG cs.AI cs.RO cs.SY eess.SY 62%

SCoTT: Strategic Chain-of-Thought Tasking for Wireless-Aware Robot Navigation in Digital Twins

SCoTT:面向数字孪生的无线感知机器人导航战略链式思维任务规划

Aladin Djuhera, Amin Seffo, Vlad C. Andrei, Holger Boche, Walid Saad

机构 * Technical University of Munich(慕尼黑技术大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCoTT框架,利用视觉语言模型优化路径收益与轨迹长度,通过分解搜索问题提升无线约束下的路径规划效率,实验显示其性能接近最优动态规划算法且生成更短轨迹。

Journal ref Asilomar Conference on Signals, Systems, and Computers, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23565 2026-06-23 cs.RO cs.CV 新提交 57%

HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory

HoloAgent-0:具有3D空间记忆的统一具身智能体框架

Xiaolin Zhou, Liu Liu, Tingyang Xiao, Wei Feng, Fa Fu, Xinrui Meng, Xinjie Wang, Jialiang Han, Boyang Yu, Yun Du, Wei Sui, Zhizhong Su

机构 * Horizon Robotics D-Robotics Robotics

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 提出HoloAgent-0统一框架,通过三层耦合结构(具身AgentOS、3D空间记忆、具身技能)实现真实机器人闭环执行,在长程导航、跨机器人协调等任务上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 57%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23420 2026-06-23 cs.RO 新提交 50%

Flowing With Purpose: Latent Action Guided Flow Matching Policies For Robotic Manipulation

有目的的流动:潜在动作引导的流匹配策略用于机器人操作

Bruno Machado, Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * École Centrale de Lyon(里昂中央理工学院) LIRIS, UMR5205(LIRIS实验室,UMR5205)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 提出潜在动作引导流匹配(LAFM)框架,通过自适应先验分布库替代固定高斯分布,利用潜在动作模型选择结构对齐的初始化,解决流匹配策略中向量场纠缠问题,在真实机器人部署中成功率提升23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与鲁棒性 12 篇

2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 90%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20244 2026-06-23 cs.CV cs.AI 新提交 90%

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

SPOT-E:基于视觉聚光灯的冻结VLM测试时熵整形

Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑工业大学) Sagenic Tech Zhejiang University(浙江大学) vivo Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :VLM(title_cn,summary_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出SPOT-E方法,通过测试时熵整形和视觉聚光灯,解决VLM在证据密集型任务中因忽视局部关键证据而表现不佳的问题,无需重新训练即可提升定位与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20852 2026-06-23 cs.CV cs.AI 新提交 89%

Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays

将推理时控制转化为放射学视觉语言模型:针对胸部X光片肺炎分类的激活引导

Eduardo Moreno Judice de Mattos Farina, Mateus A. Esmeraldo, Felipe Akio Matsuoka, Paulo Eduardo de Aguiar Kuriki, Felipe Campos Kitamura

机构 * Universidade Federal de São Paulo (UNIFESP)(圣保罗联邦大学) Hospital Israelita Albert Einstein(以色列阿尔伯特·爱因斯坦医院) Stanford University School of Medicine(斯坦福大学医学院) DASA University of Texas Southwestern Medical Center (UTSW)(德克萨斯大学西南医学中心) Eden

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究评估对比激活添加(CAA)能否在不微调模型权重的情况下改善胸部X光片视觉语言模型(VLM)的肺炎分类性能,在三个冻结模型上测试,发现对其中一个模型有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20702 2026-06-23 cs.CV cs.AI cs.LG 新提交 80%

Beyond Templates: Revisiting Zero-Shot Remote Sensing through Meta-Prompting

超越模板:通过元提示重新审视零样本遥感

Eirini Baltzi, Dionysis Christopoulos, Sotiris Spanos, Valsamis Ntouskos, Konstantinos Karantzalos

机构 * Remote Sensing Lab, National Technical University of Athens(遥感实验室,国家技术大学雅典分校) Remote Sensing Lab, Department of Engineering and Sciences, National Technical University of Athens(遥感实验室,工程与科学系,国家技术大学雅典分校) Universitas Mercatorum(默卡托大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究通过元提示框架(MPVR)在17种视觉语言模型和12个遥感数据集上探索零样本性能,发现语义丰富的LLM生成描述可能引入噪声,而轻量级查询嵌入校准能稳定提升分类和检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23487 2026-06-23 cs.AI 新提交 79%

CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应

Amrita Singh, Rishabh Jha

机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20770 2026-06-23 cs.CL cs.AI cs.LG 新提交 79%

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn);visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。

Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21993 2026-06-23 cs.SE cs.CV 新提交 77%

From Driving Videos to Simulatable Scenarios

从驾驶视频到可模拟场景

Alexandre Levy, Ernest Valveny Llobet, Antonio Manuel López

机构 * Dept. Computer Science, Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学计算机科学系) Computer Vision Center (CVC), UAB(UAB计算机视觉中心)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 提出D-V2S框架,通过视觉语言模型和大语言模型从驾驶视频自动生成可模拟场景,实现90%语义元素保留和75%偏好率。

Comments 8 pages, 11 figures and Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16214 2026-06-23 cs.LG cs.AI 新提交 62%

Calibrated Sampling-Free Uncertainty Estimation in Bayesian Deep Learning

贝叶斯深度学习中的校准无采样不确定性估计

Tobias Jan Wieczorek, Leon de Andrade, Thomas Möllenhoff, Marcus Rohrbach

机构 * TU Darmstadt & hessian.AI, Darmstadt, Germany(达姆施塔特工业大学 & hessian.AI,德国达姆施塔特) RIKEN Center for Advanced Intelligence Project, Tokyo, Japan(日本理化学研究所革新智能研究中心,日本东京)

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出校准方差传播(CVP),通过新型归一化层传播方法、激活函数处理技术及轻量校准步骤,在单次前向传播中高效估计不确定性,在Transformer和CNN上达到与MC采样相当的精度,成本显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01989 2026-06-23 cs.CV cs.AI 版本更新 62%

Attention at Rest Stays at Rest: Breaking Visual Inertia for Cognitive Hallucination Mitigation

静止的注意力保持静止:打破视觉惯性以缓解认知幻觉

Boyang Gong, Yu Zheng, Fanye Kong, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出惯性感知视觉激发(IVE)方法,通过建模视觉注意力的动态响应性,打破多模态大模型中的视觉惯性,从而缓解需要对象间关系推理的认知幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22889 2026-06-23 cs.LG 新提交 57%

Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study

生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究

Khalil Ahammad, Derek Abbott, Mohsen Dorraki

机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) Pi MedTech(Pi医疗科技) School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22474 2026-06-23 cs.CL cs.AI 新提交 57%

Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation

并非所有声明都同样有风险:FACTOR 用于事实性长文本生成中的自适应验证

Areeba Hassan, Arooj Kausar, Syeda Kisaa Fatima, Gibrail Islam, Mehwish Fatima

机构 * School of Electrical Engineering Computer Science (SEECS), National University of Sciences

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出 FACTOR 方法,通过不确定性估计、自适应语言推理验证和候选重排序,在长文本生成中按声明级别风险分配验证资源,同时提高事实性和降低验证成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20526 2026-06-23 cs.AI 新提交 57%

DeepSWIP: Quotient-WMC Counterfactuals for Neural Probabilistic Logic Programs

DeepSWIP: 神经概率逻辑程序的商-WMC反事实

Saimun Habib, Vaishak Belle, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出DeepSWIP,一种用于DeepProbLog程序的单世界反事实语义,通过神经物化、SWIP和加权模型计数实现精确反事实推理,实验证明比孪生网络方法快2.14倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. VLM训练与架构 39 篇

2606.22918 2026-06-23 cs.CV cs.GT 新提交 91%

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

各有所尺:发现用于物理视频评估的每VLM分类体系

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Darwin Research Center(华为达尔文研究中心) Imperial College London(伦敦帝国理工学院)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21358 2026-06-23 cs.CV 新提交 91%

LEViL: Label-Efficient Video Learning via Zero-Shot Distillation over VLM-Generated Pseudo-Label Spaces

LEViL: 通过VLM生成的伪标签空间上的零样本蒸馏实现标签高效视频学习

Aslı Çelik

机构 * Kocaeli University(科贾埃利大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出一种无需标注的视频预训练与目标标签集感知微调结合的标签高效视频学习框架,利用VLM生成伪标签空间进行零样本蒸馏,在有限标签下优于半监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13312 2026-06-23 cs.MM cs.LG 版本更新 91%

Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架

Yuxuan Yang, Xiaotong Mao, Jingyao Wang

机构 * National Jiangsu University of Finance(江苏财经大学) University of Lorraine(洛林大学) Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.LG

AI总结 提出Design-MLLM框架,通过双分支美学导向奖励的强化对齐,解决室内设计中空间可行性硬约束与美学偏好软约束的矛盾,生成既可行又美观的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00918 2026-06-23 cs.AI 版本更新 89%

Sparse Neuron Ablation Triggers Catastrophic Collapse of the Language Core in Large Vision-Language Models

稀疏神经元消融引发大型视觉-语言模型中语言核心的灾难性崩溃

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士洛桑联邦理工学院) Idiap Research Institute(日内瓦研究所)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 提出渐进式神经元消融方法CAN,发现消融极少量(如LLaVA-1.5-7b中仅4个)位于语言模型下投影层的神经元即可导致LVLM灾难性崩溃,揭示功能依赖语言骨干中的稀疏神经元子集。

Comments Accepted to ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23729 2026-06-23 cs.CV cs.AI cs.LG eess.IV 版本更新 88%

LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

LUQ: 多模态大语言模型的逐层超低位量化

Shubhang Bhatnagar, Andy Xu, Kar-Han Tan, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校) HP Inc.(惠普公司)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。

Comments Published in Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21194 2026-06-23 cs.CV cs.AI cs.CL 新提交 88%

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试

Han Jang, Junhyeok Lee, Songsoo Kim, Chae Young Lim, Hyeonjin Goh, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔大学) Seoul National University Hospital(首尔大学医院) Seoul National University College of Medicine(首尔大学医学院) Sungkyunkwan University School of Medicine(成均馆大学医学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。

Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 87%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);分类 cs.CV

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17901 2026-06-23 cs.CV cs.MM cs.SD 版本更新 86%

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施

Geewook Kim, Minjoon Seo

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国国立庆北大学AI)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏