arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-11 至 2026-08-11 共收录 168 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 17 篇

2608.07525 2026-08-11 cs.CL cs.AI 新提交 85%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08077 2026-08-11 cs.AI cs.MA cs.RO 新提交 84%

Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?

Gabriele La Malfa, Nitay Alon, Emanuele La Malfa, Reuth Mirsky, Stefan Sarkadi

专题命中 幻觉与鲁棒性 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI

AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03100 2026-08-11 cs.CV cs.AI 版本更新 79%

TGIF: Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs

基于文本引导的层融合缓解多模态大语言模型中的幻觉

Chenchen Lin, Sanbao Su, Rachel Luo, Yuxiao Chen, Yan Wang, Marco Pavone, Fei Miao

机构 * University of Connecticut(康涅狄格大学) NVIDIA(NVIDIA公司) Stanford University(斯坦福大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 TGIF通过文本引导的层融合方法,有效缓解多模态大语言模型中的幻觉问题,提升视觉接地能力。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22038 2026-08-11 cs.CL 版本更新 78%

Source-Modality Monitoring in Vision-Language Models

视觉-语言模型中的源模态监控

Etha Tianze Hua, Tian Yun, Ellie Pavlick

机构 * Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了多模态模型追踪并沟通信息来源的能力,分析了语法与语义信号在绑定提示词与输入组件中的作用,发现语义信号在模态分布差异大时更占主导。

Comments Accepted at COLM 2026. All resources will be available at https://github.com/ethahtz/source-modality-monitoring

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07822 2026-08-11 cs.RO cs.HC 版本更新 75%

Knowing When to Ask: Resolving Uncertainty in Human-Robot Joint Planning via Explicit Dialogue and Implicit Intent Cues

不确定性缓解与意图推断:一种双模式人机联合规划系统

Zeyu Fang, Yuxin Lin, Cheng Liu, Beomyeol Yu, Zeyuan Yang, Rongqian Chen, Taeyoung Lee, Mahdi Imani, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(电气与计算机工程系,乔治华盛顿大学) Department of Mechanical and Aerospace Engineering, George Washington University(机械与航空航天工程系,乔治华盛顿大学) Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出一种双模式人机联合规划系统,通过缓解不确定性与推断意图,提升人机协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交 73%

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08045 2026-08-11 cs.AI 新提交 70%

Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities

Lingjing:面向开放城市多智能体具身任务的仿真测试平台

Xiaohe Li, Yiru Wang, Junhao Fan, Mingyuan Liu, Jie Huang, Kaixin Zhang, Jiahao Li, Chen Qian, Zide Fan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 Lingjing 是一款面向开放城市异构多智能体具身任务的仿真测试平台,支持城市多智能体协同的可复现评估与故障诊断,通过评估视觉语言模型等揭示了环境感知等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09474 2026-08-11 cs.CV 新提交 57%

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索

Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai, Son Nguyen Minh Le, Khang Le Minh, Hoang Vo, Minh-Chi Phung, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息技术大学) Ho Chi Minh city University of Science(胡志明市科学大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09344 2026-08-11 cs.CV 新提交 57%

Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs

超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间

Ali Cheraghian, Hamidreza Dastmalchi, Hamed Barzamini, Morteza Saberi, Mojtaba Golzan, Shafin Rahman, Hossein Rahmani

机构 * Macquarie University(麦考瑞大学) York University(约克大学) Northern Illinois University(北伊利诺伊大学) University of Technology Sydney(悉尼科技大学) North South University(北南大学) Lancaster University(兰卡斯特大学) Australian National University(澳大利亚国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09190 2026-08-11 cs.AI cs.LO 新提交 57%

Structure-Preserving Uncertainty Propagation in First-Order Proof Search

一阶证明搜索中的结构保留型不确定性传播

Tanel Tammet

机构 * Tallinn University of Technology(塔林理工大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 该研究针对一阶证明器GK框架,提出结构保留型不确定性传播方法,通过重构基前提、解析正负支持等计算,实现带不确定性的证明报告,经实验验证其有效性并与相关逻辑系统对比。

Comments 79 pages, 6 figures. Executable binaries, documentation, examples, and public samplers: https://github.com/tammet/gkreasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09011 2026-08-11 cs.LG 新提交 57%

Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning

视觉-语言表示学习中的动态分布感知不确定性跟踪

Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Shufan Yang, Haoru Chen, Qing Gu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance Inc(字节跳动公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.LG

AI总结 针对视觉-语言模型事后不确定性量化方法忽略测试分布动态性的问题,提出DDA-UQ框架,通过高斯混合模型建模嵌入空间,实现动态不确定性估计,性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07902 2026-08-11 cs.CY cs.AI cs.HC 新提交 57%

Beyond "I Can't Help With That": How Child Safety Experts Evaluate AI Chatbot Safety

超越“我无法对此提供帮助”:儿童安全专家如何评估AI聊天机器人的安全性

Hannah Cha, Neha Shukla, Solon Barocas, Alexandra Chouldechova, Eugenia Kim, Jennifer Wortman Vaughan

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文通过访谈19名儿童安全相关从业者,分析现有AI聊天机器人儿童安全评估的局限,提出需将从业者视角纳入安全评估工作的建议。

Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05971 2026-08-11 cs.CV cs.CL 版本更新 57%

Is CLIP Cross-Eyed? Revealing and Mitigating Center Bias in the CLIP Family

CLIP是否双目偏视?揭示并缓解CLIP家族中的中心偏差

Oscar Chew, Hsiao-Ying Huang, Kunal Jain, Tai-I Chen, Khoa D Doan, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(国立台湾大学) ASUS(华硕) VinUniversity

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 研究揭示CLIP家族模型存在中心偏差问题,导致对图像边缘重要物体识别困难,通过可解释方法分析发现嵌入表示和注意力机制中的信息丢失是原因,提出无需训练的视觉提示和注意力重分布策略缓解偏差。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16445 2026-08-11 cs.CV 57%

CLAP: Isolating Content from Style through Contrastive Learning with Augmented Prompts

Yichao Cai, Yuhang Liu, Zhen Zhang, Javen Qinfeng Shi

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) University of Adelaide(阿德莱德大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments Accepted as a conference paper at ECCV 2024; v7: Minor corrections to the adversarial robustness results and corresponding text. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏

2. VLM训练与架构 28 篇

2606.28551 2026-08-11 cs.CV cs.CL cs.LG 版本更新 93%

DataComp-VLM: Improved Open Datasets for Vision-Language Models

DataComp-VLM:改进的视觉语言模型开放数据集

Matteo Farina, Vishaal Udandarao, Thao Nguyen, Selim Kuzucu, Maximilian Böther, Andreas Hochlehnert, Adhiraj Ghosh, Marianna Nezhurina, Karsten Roth, Joschka Struber, Yuhui Zhang, Sebastian Dziadzio, Elaine Sui, Soumya Jahagirdar, Dhruba Ghosh, Hasan Hammoud, Thomas De Min, Simone Caldarella, Jehanzeb Mirza, Sedrick Keh, Mehdi Cherti, Hilde Kuehne, Bernt Schiele, Serena Yeung-Levy, Muhammad Ferjad Naeem, Federico Tombari, Ana Klimovic, Elisa Ricci, Matthias Bethge, Sewoong Oh, Ameya Prabhu, Alessio Tonioni, Jenia Jitsev, Massimiliano Mancini, Ludwig Schmidt, Nikhil Parthasarathy

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出DataComp-VLM基准,通过数据混合(而非过滤)策略提升视觉语言模型训练效果,在8B模型上达到63.6%准确率,比现有最优数据集提升5.4个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07537 2026-08-11 cs.NE cs.AI cs.CL cs.HC cs.MA 新提交 92%

An evolutionary model of animats with VLM-based subjective evaluation

基于视觉语言模型(VLM)主观评估的动物机器人进化模型

Shota Miyazaki, Takaya Arita, Reiji Suzuki

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出将VLM主观评估融入遗传算法的框架,使虚拟软体机器人同步进化形态与运动,实验显示该方法可加快种群收敛,且VLM主观选择的结果与人类评估倾向相似。

Comments 18 pages, 12 figures, 2 tables. This manuscript has been accepted for publication in Artificial Life and Robotics following peer review

Journal ref Shota Miyazaki, Takaya Arita and Reiji Suzuki: An evolutionary model of animats with VLM-based subjective evaluation, Artificial Life and Robotics (2026). https://link.springer.com/article/10.1007/s10015-026-01135-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 89%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 VLM训练与架构 :InternVL(summary_cn,abstract);multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08622 2026-08-11 cs.CV 新提交 86%

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

VADER:用于视频大语言模型幻觉缓解的自适应去偏方法

Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本研究针对视频大语言模型的幻觉问题,提出无训练自适应去偏框架VADER,通过视觉焦点重分配与选择性证据擦除模块结合对比解码,在LLaVA-Video-7B等模型的EventHallusion任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26798 2026-08-11 cs.LG cs.AI 版本更新 86%

Explaining, Verifying, and Aligning Semantic Hierarchies in Vision-Language Model Embeddings

解释、验证和对齐视觉语言模型嵌入中的语义层次结构

Gesina Schwalbe, Mert Keser, Moritz Bayerkuhnlein, Edgar Heinert, Annika Mütze, Marvin Keller, Sparsh Tiwari, Georgii Mikriukov, Diedrich Wolter, Jae Hee Lee, Matthias Rottmann

机构 * University of Lübeck(吕贝克大学) Technical University of Munich(慕尼黑工业大学) AUMOVIO SE Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy(莱布尼茨农业工程与生物经济研究所) University of Hamburg(汉堡大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于解释、验证和对齐视觉语言模型嵌入中的语义层次结构,通过聚类和概念库匹配提取层次结构,并利用人类本体评估其合理性,最终提出基于本体的对齐方法以提升共享嵌入空间的语义对齐。

Comments camera-ready version of accepted IJCAI-ECAI 2026 paper including supplementary material; code: https://github.com/gesina/ontological-commitment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07596 2026-08-11 cs.RO cs.CV 新提交 84%

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

LIRA:面向视觉-语言-动作解码的局部跨层信息路由

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。

Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30716 2026-08-11 cs.CV cs.AI 版本更新 84%

Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation

用于病例级病理学概要报告生成的简单令牌高效视觉语言模型

Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE), Concordia University, Montreal, Canada(计算机科学与软件工程系(CSSE),康科迪亚大学,蒙特利尔,加拿大) Axe Cancer, Centre de recherche du CHUM, Université de Montréal, Montreal, Canada(Axe癌症,CHUM研究中心,蒙特利尔大学,蒙特利尔,加拿大) Institut de recherche en immunologie et cancérologie (IRIC), Université de Montréal(免疫学与癌症研究所(IRIC),蒙特利尔大学) Mila - Quebec AI Institute, Montreal, Canada(魁北克AI研究所(Mila),蒙特利尔,加拿大)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出一种简单令牌高效的视觉语言模型,通过5倍放大率的512×512补丁和两阶段监督训练,在有限GPU内存下实现病例级多WSI病理报告生成,显著降低序列长度并提升效率。

Comments DeLTA 2026 Conference Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09778 2026-08-11 cs.RO 新提交 83%

RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera

RoboSeg:基于单眼在手相机的机器人操作的在线部件级语义重建

Zhaochen Lan, Mengxiang Lin

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 RoboSeg是无需CAD模型的部件级语义重建系统,结合VLM、TSDF融合与SAM3,实现机器人操作的部件语义索引,在24次物理试验中21次完成综合任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08815 2026-08-11 cs.LG 新提交 83%

Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏

Pedram MohajerAnsari, Amir Salarpour, Mert D. Pesé

机构 * Clemson University(克莱姆森大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16598 2026-08-11 cs.CV 版本更新 81%

VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs

VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩

Jiaying Zhu, Yurui Zhu, Xin Lu, Wenrui Yan, Dong Li, Kunlin Liu, Xueyang Fu, Zheng-Jun Zha

专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07562 2026-08-11 cs.CV cs.LG 新提交 81%

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。

Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16305 2026-08-11 cs.CV cs.AI 版本更新 81%

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models

LookME:用于视觉语言模型层注入的基于查找的多模态嵌入

Zeyu Xu, Xingzhong Hou, Pengkai Guo, Siling Lin, Xiao Xu, Menghua Zhai, Haoyu Chen, Yunke Zhang, Fei Huang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文针对视觉语言模型在资源受限环境中部署的问题,提出LookME框架。通过分层两级查找方法和稀疏注入策略,实现基于查找的多模态嵌入增强,实验表明该方法优于仅文本的PLE风格方法,有效提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08060 2026-08-11 cs.CV 新提交 79%

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

ZOMP:面向视觉-语言模型的零阶多模态提示调优

Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ZOMP方法,通过跨模态低秩重参数化等技术,在仅前向传递的条件下高效调优CLIP模型,在13个基准上优于现有无反向传播的提示调优方法,泛化能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08805 2026-08-11 cs.CV 新提交 77%

LASA: Language-and-Source-Anchored Alignment for Domain Generalized Semantic Segmentation

LASA:面向域泛化语义分割的语言与源锚定对齐

Jinhong Zhu, Weiqi Yan, Shengchuan Zhang, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对域泛化语义分割中传统方法损害特征完整性的问题,提出LASA框架,含三个协同组件,实验显示其性能优于现有最优方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 77%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09176 2026-08-11 cs.CV cs.AI 新提交 73%

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) University of Surrey(萨里大学) Nankai University(南开大学) Cornell University(康奈尔大学) City University of Hong Kong(香港城市大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏