arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-05 至 2026-08-05 共收录 101 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 9 篇

2608.03270 2026-08-05 cs.CV cs.AI 新提交 92%

GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs

GUI-Lens:面向通用视觉语言模型(VLM)的GUI定位粗到精裁剪框架

Zichuan Fu, Shirong Wang, Wenlin Zhang, Guojing Li, Yimin Deng, Jingtong Gao, Junjia Qi, Hanyu Yan, Yefeng Zheng, Xiaopeng Li, Wanyu Wang, Xian Wu, Xiangyu Zhao

专题命中 GUI与屏幕智能体 :VLM(title_cn,summary_cn);grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GUI-Lens是面向通用VLM的GUI定位粗到精裁剪框架,通过主动视觉观察逐步聚焦确定目标,在四个基准和三个VLM后端上使定位准确率最高提升24.9个百分点,在GPT-5.5上达SOTA性能。

Comments Preprint. Code: https://github.com/Fzkuji/GUI-Agent-Harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27180 2026-08-05 cs.CV cs.RO 版本更新 89%

HumanCLAW: Can Vision-Language Models Act Through a Body?

HumanCLAW:视觉-语言模型能否通过实体身体执行动作

Li Siyao, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

机构 * Meta Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学) Brown University(布朗大学) Northwestern University(西北大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。

Comments Project page: https://human-claw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03740 2026-08-05 cs.AI 新提交 79%

MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models

MissClick:利用序列化数字坐标攻击GUI定位模型

Yu Ran, Wentao Zhao, Xin Zhang, Yi Pan

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI

AI总结 本研究提出MissClick攻击方法,针对GUI定位模型设计两种目标的白盒对抗攻击,在OS-Atlas和UGround数据集上大幅提升无目标与有目标攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03474 2026-08-05 cs.CV 新提交 77%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03143 2026-08-05 cs.CV cs.RO 新提交 70%

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

从路线到步骤:在视觉语言导航中分离语义进展与局部执行

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对视觉语言导航中进展与执行错误难区分的问题,提出Route2Step框架,通过步骤级接口分离语义进展跟踪与动作生成,在R2R-CE数据集上显著提升了导航性能,且在真实环境中具备实用性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03052 2026-08-05 cs.RO 新提交 67%

How Should Vision-Language-Action Models Use Proprioceptive State?

视觉-语言-动作(VLA)模型应如何使用本体感受状态?

Yiren Zhao, Ziyang Chen, Ziyang Rao, Pengteng Li, He Zhang, Weiyu Guo, Yandong Guo, Rushi Dai

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本研究针对视觉-语言-动作(VLA)模型的本体感受状态接入方式开展受控实验,探究状态接入位置、历史长度等问题,得出系统性答案并提炼为可验证的VLA模型设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03148 2026-08-05 cs.LG cs.AI 新提交 62%

Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation

面向移动端检索增强生成的轻量级分块选择

Sicong Chang, Yidan Shen, Wen Yu, Jiefu Chen, Xin Fu, Renjie Hu

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 57%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 57%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 10 篇

2608.02790 2026-08-05 cs.CV 新提交 89%

Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

自信但不可靠:对基于脑MRI的视觉语言模型的行为安全审计

Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey Plis

机构 * Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) TReNDS Center(TReNDS中心)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究对6个指令微调VLMs开展脑MRI行为安全审计,发现其置信度校准差、存在大量高置信度错误,提出医学图像VLM评估需报告置信度可靠性等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 89%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交 87%

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

专题命中 幻觉与鲁棒性 :MLLM(title_cn,summary_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03691 2026-08-05 cs.SE cs.AI cs.CV 新提交 79%

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

像素上的模式:测量多模态代码生成中的模式完成偏差

Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态代码生成中存在的模式完成偏差问题,构建了首个视觉模式完成偏差基准,评估发现前沿MLLMs均存在严重偏差,且偏差与视觉显著性密切相关。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03791 2026-08-05 cs.AI 新提交 70%

Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

遗忘能否跨模态迁移?面向跨模态知识遗忘评估的真实世界基准

Chunlin Liu, Junnian Chen, Haitong Jiang, Jianyu Zhao, Yingsen Pang, Jingchen Li, Jiabiao He, Youming Lu, Jinhe Bi, Yuntao Du

专题命中 幻觉与鲁棒性 :vision-language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对跨模态知识遗忘迁移研究缺口,推出UNLINK-VL基准,实验发现跨模态遗忘存在不对称性,纯文本遗忘迁移效果差,凸显跨模态遗忘与评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03782 2026-08-05 cs.AI 新提交 57%

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

KnowHal:用于全面多模态幻觉评估的知识驱动基准

Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLMs)的幻觉评估缺口,提出知识驱动的KnowHal基准,涵盖四个幻觉维度,经评估发现知识维度是模型最大挑战,多数模型对错误前提鲁棒性有限。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02621 2026-08-05 cs.CL cs.AI 新提交 57%

Knowing the Form, Not the Function: Automatically Auditing Answer--Authority Decoupling in Legal Benchmarks

知晓形式,而非功能:自动审计法律基准中答案与权威的脱钩问题

Hsien-Jyh Liao

机构 * Ministry of Justice, Taiwan(台湾法务部)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文针对法律基准中答案与权威脱钩问题,联合审计四款LLMs在台湾律师考试题上的表现,发现答案与引用行为可独立变化,提出答案与权威联合评估的方法。

Comments 9 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25242 2026-08-05 cs.CV 版本更新 57%

Medical world models in healthcare: foundations, applications, and challenges for trustworthy clinical translation

医疗保健中的医学世界模型:可信临床翻译的基础、应用与挑战

Zhaoyan Chen, Zhongxiu Cong, Zhuanfeng Jin, Wanshu Fan, Dongsheng Zhou, Qi Ai, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) Department of Radiology, Xinhua Hospital Affiliated to Dalian University(大连大学附属新华医院放射科) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 探讨医学世界模型在医疗保健中的应用,通过结构化综合定义其领域相关内容,围绕四种能力组织,涵盖多方面证据,虽有早期可行性证据,但受多种因素限制,临床翻译需多方面保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03563 2026-08-05 cs.RO 新提交 50%

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

统一视觉运动目标:监督视觉语言智能体(VLA)超越物理动作

Zhenyang Feng, Unnat Jain

专题命中 幻觉与鲁棒性 :VLM(abstract_cn)

AI总结 本研究针对VLA模型训练中视觉语言高级表示与机器人低级动作的不匹配问题,提出UVT统一视觉运动目标,无需改动架构或额外数据,在仿真与真实双臂任务中提升了VLA的训练效率、性能与鲁棒性

Comments Accepted at IROS 2026. Project page: https://unified-visuomotor-targets.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03485 2026-08-05 cs.CR 新提交 50%

SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills

SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界

Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 19 篇

2608.03428 2026-08-05 cs.CV cs.AI 新提交 89%

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

OliveGemma:一款用于识别地中海与欧洲饮食的30亿参数视觉语言模型

Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);visual language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建基于PaliGemma-2-3B的OliveGemma,经LoRA微调后在欧洲饮食识别任务上超越多数前沿模型,仅逊于DenseNet-121,小型VLM经PEFT适配可在专业任务超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03875 2026-08-05 cs.LG cs.AI 新提交 86%

Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning

通过结构感知微调增强视觉语言模型奖励模型

Pyrros Koussios, Chenhao Li, Xin Chen, Andreas Krause

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出结构感知微调(SAFT)方法,利用LoRA适配器和内在结构先验优化视觉语言模型奖励信号,实现更快策略收敛与更好对齐,为稳定文本条件强化学习提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27975 2026-08-05 cs.CV cs.AI 版本更新 85%

TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions

TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准

Ce Chen, Yi Ren, Yuanming Li, Viktor Goriachko, Zhenhui Ye, Zujin Guo, Zhibin Hong, Mingming Gong

机构 * University of Melbourne(墨尔本大学) HeyGen Research(HeyGen研究院) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。

Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03660 2026-08-05 cs.AI 新提交 84%

Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training

驯服隐式:面向持续多模态后训练的双通道风险感知强化微调

Yibei Liu, Jiajun Chen, Qianle Zhang, Tangyue Jin, Mengying Zhu, Meng Xi, Yangyang Wu

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 针对持续多模态后训练中RFT算法在任务分布偏移下遗忘加剧的问题,提出双通道风险感知强化微调框架RAPO,通过策略与数据通道的风险管控降低遗忘,在MLLM-CL基准上使遗忘减少79.8%且保留新任务竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 83%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07551 2026-08-05 cs.HC cs.AI cs.DL 83%

ArchiveGPT: A human-centered evaluation of using a vision language model for image cataloguing

Line Abele, Gerrit Anders, Tolgahan Aydın, Jürgen Buder, Helen Fischer, Dominik Kimmel, Markus Huff

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.AI

Comments 56 pages, 7 figures

Journal ref Humanit. Soc. Sci. Commun. 13, 300 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03083 2026-08-05 cs.CV cs.CL 新提交 81%

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV

AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。

Comments 4 figures, accepted to ACM MM 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13040 2026-08-05 cs.RO 版本更新 80%

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试

Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) China University of Mining Technology(中国矿业大学)

专题命中 VLM训练与架构 :InternVL(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn)

AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03580 2026-08-05 cs.CV 新提交 79%

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models

SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择

Yaozhi Wen, Jialong Guo, Zhenliang Ni, Han Shu, Xinghao Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03632 2026-08-05 cs.AI 新提交 77%

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

当教师误导时:感知虚假信号的在线策略蒸馏

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 针对在线策略蒸馏中存在的虚假信号问题,提出SA-OPD框架,通过输入接地性代理过滤误导性token级监督,实验表明其性能优于普通OPD及其他选择性方法。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 73%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏