arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2602.19024 2026-02-24 cs.CV 79%

Towards Calibrating Prompt Tuning of Vision-Language Models

面向视觉-语言模型提示微调的校准

Ashshak Sharifdeen, Fahad Shamshad, Muhammad Akhtar Munir, Abhishek Basu, Mohamed Insaf Ismithdeen, Jeyapriyan Jeyamohan, Chathurika Sewwandi Silva, Karthik Nandakumar, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) University of Colombo(科伦坡大学) Michigan State University(密歇根州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种校准框架,通过引入均值-方差边际惩罚和文本矩匹配损失,提升视觉-语言模型提示微调的预测可靠性与置信度校准。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 79%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11737 2026-02-13 cs.CV cs.CL 79%

Mask What Matters: Mitigating Object Hallucinations in Multimodal Large Language Models with Object-Aligned Visual Contrastive Decoding

关注关键要素:通过对象对齐的视觉对比解码缓解多模态大语言模型中的对象幻觉

Boqi Chen, Xudong Liu, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) Amazon(亚马逊) MBZUAI(穆罕默德·本·拉什德智能科学技术研究院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出了一种通过对象对齐的视觉对比解码缓解多模态大语言模型中对象幻觉的方法,具有计算开销低且兼容性强的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09825 2026-02-11 cs.CV 79%

SAKED: Mitigating Hallucination in Large Vision-Language Models via Stability-Aware Knowledge Enhanced Decoding

SAKED: 通过稳定性感知知识增强解码缓解大视觉-语言模型中的幻觉

Zhaoxu Li, Chenqi Kong, Peijun Bao, Song Xia, Yi Tu, Yi Yu, Xinghao Jiang, Xudong Jiang

机构 * ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(ROSE实验室,电子工程学院,南洋理工大学,新加坡) ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(ROSE实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Physical and Mathematical Sciences, Nanyang Technological University, Singapore(物理与数学科学学院,南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 SAKED通过引入稳定性感知知识增强解码方法,有效缓解大视觉-语言模型中的幻觉问题,无需训练即可集成至不同架构中,实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08311 2026-02-10 cs.AI 79%

Moral Sycophancy in Vision Language Models

视觉语言模型中的道德趋炎奉承

Shadman Rabby, Md. Hefzul Hossain Papon, Sabbir Ahmed, Nokimul Hasan Arif, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * University of Dhaka(达卡大学) Daffodil International University(达福迪国际大学) Islamic University of Technology(伊斯兰技术大学) University of Central Florida(佛罗里达中央大学) King Fahad University of Petroleum and Minerals(国王法赫德石油与矿物大学) SDAIA - KFUPM Joint research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在道德决策中的趋炎奉承现象,发现模型在用户偏见下易产生道德错误回应,揭示了模型在伦理一致性与稳健性上的权衡问题。

Comments 13 pages, 6 figures, 8 tables, Submitted for review in ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07899 2026-02-10 cs.CV 79%

Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models

重新思考视觉-语言模型的实用且高效的量化校准

Zhenhao Shang, Haizhao Jing, Guoting Wei, Haokui Zhang, Rong Xiao, Jianqing Gao, Peng Wang

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) Nanjing University of Science and Technology, Nanjing, China(南京理工大学,南京,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 TLQ通过标记级重要性整合和多GPU层级校准,提升视觉-语言模型的量化稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02419 2026-02-04 cs.AI cs.SE 79%

SafeGround: Know When to Trust GUI Grounding Models via Uncertainty Calibration

SafeGround: 通过不确定性校准了解何时信任GUI接地模型

Qingni Wang, Yue Fan, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.AI

AI总结 SafeGround通过不确定性校准提升GUI接地模型的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21984 2026-02-04 cs.CV cs.CL 79%

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

超越视觉编码器:识别和缓解大视觉-语言模型中的空间偏差

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出AGCI机制,通过动态注入全局视觉上下文缓解大视觉-语言模型中的空间偏差问题,提升模型的空间鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00993 2026-02-03 cs.RO cs.AI 79%

HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving

HERMES: 一种集成端到端风险感知多模态具身系统,用于长尾自动驾驶

Weizhe Tang, Junwei You, Jiaxi Liu, Zhaoyi Wang, Rui Gan, Zilin Huang, Feng Wei, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(土木与环境工程系,威斯康星大学麦迪逊分校)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 HERMES通过整合视觉-语言模型和多模态感知,提升自动驾驶在长尾混合交通场景中的风险感知和轨迹规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13223 2026-01-26 cs.LG 79%

Data Matters Most: Auditing Social Bias in Contrastive Vision Language Models

数据最为关键:审计对比视觉语言模型中的社会偏见

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦女王学院) Institut Jožef Stefan(Jožef Stefan研究所)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.LG

AI总结 研究通过对比CLIP和OpenCLIP模型,发现数据来源是偏见的主要驱动因素,不同去偏策略在不同模型和数据规模下效果各异。

Comments Published at TMLR; updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07812 2026-01-13 cs.CV 79%

More Images, More Problems? A Controlled Analysis of VLM Failure Modes

更多图像,更多问题?对VLV失败模式的受控分析

Anurag Das, Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Bernt Schiele, Georgios Tzimiropoulos, Brais Martinez

机构 * MPI for Informatics Saarland Informatics Campus(马克斯·普朗克研究所(信息学)萨尔兰信息学校区) Samsung AI Cambridge(三星人工智能(剑桥)) Technical University of Iași Romania(罗文扎大学(罗马尼亚)) Queen Mary University of London UK(伦敦女王大学(英国))

专题命中 幻觉与鲁棒性 :VLM(title);vision language model(abstract);分类 cs.CV

AI总结 MIMIC基准通过诊断实验揭示LVLM在多图像任务中的失败模式,并提出数据生成和注意力遮罩方案以提升跨图像信息聚合能力。

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06757 2026-01-13 cs.CL cs.AI 79%

MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues

MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估

Zheyuan Liu, Dongwhi Kim, Yixin Wan, Xiangchi Yuan, Zhaoxuan Tan, Fengran Mo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Georgia Institute of Technology(佐治亚理工学院) University of Montreal(蒙特利尔大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。

Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06464 2026-01-13 cs.CV 79%

On the Adversarial Robustness of 3D Large Vision-Language Models

关于3D大视觉-语言模型的对抗鲁棒性

Chao Liu, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了3D大视觉-语言模型的对抗鲁棒性,提出两种攻击策略评估其鲁棒性,发现其在无目标攻击下较脆弱,但在有目标攻击中更稳健。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22535 2026-01-06 cs.AI cs.CL 79%

OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models

OFFSIDE: 多模态大语言模型中误信信息消除的基准测试

Hao Zheng, Zirui Pang, Ling li, Zhijie Deng, Yuhan Pu, Zhaowei Zhu, Xiaobo Xia, Jiaheng Wei

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、浙江工业大学及D5Data.ai) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 OFFSIDE通过足球转会谣言数据集,评估多模态大语言模型中误信信息消除的挑战与方法,揭示现有技术的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00659 2026-01-05 cs.CV 79%

CRoPS: A Training-Free Hallucination Mitigation Framework for Vision-Language Models

CRoPS:一种用于视觉-语言模型的无训练幻觉缓解框架

Neeraj Anand, Samyak Jha, Udbhav Bamba, Rahul Rahaman

机构 * Indian Institute of Technology (ISM)(印度理工学院(ISM)) Transmute AI National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 CRoPS通过选择性移除关键文本标记和广义对比解码,有效缓解视觉-语言模型的幻觉问题,提升CHAIR分数20%并优于现有无训练方法。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00623 2026-01-05 cs.AI 79%

DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations

DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化

Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Lingang Laboratory(灵冈实验室) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

AI总结 DA-DPO通过难度感知机制优化多模态大语言模型的偏好学习,有效减少幻觉并提升模型鲁棒性与泛化能力。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21337 2025-12-25 cs.CV 79%

Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models

超越记忆:一个多模态序回归基准以揭示视觉-语言模型中的流行偏差

Li-Zhong Szu-Tu, Ting-Lin Wu, Chia-Jui Chang, He Syu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出一个多模态序回归基准,揭示视觉-语言模型在流行度上的偏差,通过YearGuessr数据集验证模型在记忆化与未识别对象上的表现差异。

Comments Project page: https://sytwu.github.io/BeyondMemo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17004 2025-12-24 cs.CV cs.CL 79%

Vision Language Models are Confused Tourists

视觉语言模型是困惑的游客

Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出ConfusedTourist,通过文化对抗鲁棒性测试揭示视觉语言模型在文化线索干扰下的稳定性问题,发现其在简单扰动下表现显著下降,凸显了多文化环境下模型鲁棒性的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19317 2025-12-23 cs.AI 79%

SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models

SafeMed-R1: 为视觉-语言模型中的通用性和鲁棒性医疗推理设计的对抗强化学习

A. A. Gde Yogi Pramana, Jason Ray, Anthony Jaya, Michael Wijaya

机构 * National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);visual question answering(abstract);分类 cs.AI

AI总结 SafeMed-R1通过对抗训练与组相对策略优化提升视觉-语言模型在医疗推理中的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19070 2025-12-23 cs.CV cs.CL 79%

Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding

Watch Closely: 通过解耦解码缓解大视觉-语言模型中的物体幻觉

Ruiqi Ma, Yu Yan, Chunhong Zhang, Minghao Yin, XinChao Liu, Zhihong Jin, Zheng Hu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The University of Hong Kong(香港大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过解耦解码方法,无需训练即可缓解大视觉-语言模型中的物体幻觉问题,提升模型的视觉性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18231 2025-12-23 cs.CV cs.CL 79%

Investigating Spatial Attention Bias in Vision-Language Models

探究视觉-语言模型中的空间注意力偏差

Aryan Chaudhary, Sanchit Goyal, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学研究院,帕利尼,印度)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了视觉-语言模型在处理水平拼接图像时存在的系统性空间注意力偏差,发现模型倾向于优先描述左位置内容,且该偏差在不同架构和语言训练下均存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17509 2025-12-19 cs.CV 79%

MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models

MoAPT: 基于对抗提示微调的视觉-语言模型混合

Shiji Zhao, Qihui Zhu, Shukun Xiong, Shouwei Ruan, Maoxun Yuan, Jialing Tao, Jiexi Liu, Ranjie Duan, Jie Zhang, Jie Zhang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) Center for Frontier AI Research, A*STAR, Singapore(A*STAR前沿人工智能研究中心) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 MoAPT通过混合对抗提示微调提升视觉-语言模型对多种对抗攻击的鲁棒性,通过学习多个提示的混合权重以增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07141 2025-12-09 cs.CV cs.CL 79%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02161 2025-12-03 cs.CV 79%

FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges

FineGRAIN:通过视觉语言模型法官评估文本到图像模型的故障模式

Kevin David Hayes, Micah Goldblum, Vikash Sehwag, Gowthami Somepalli, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Columbia University(哥伦比亚大学) Sony AI(索尼人工智能)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

AI总结 FineGRAIN通过视觉语言模型评估文本到图像模型的故障模式,揭示属性保真度和物体表示的系统性错误,强调了针对性基准测试对生成模型可靠性的重要性。

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22664 2025-12-01 cs.CV 79%

VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models

VaMP:用于视觉-语言模型的变分多模态提示学习

Silin Cheng, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 VaMP提出了一种变分多模态提示学习框架,通过实例条件提示和不确定性建模提升视觉-语言模型在少样本和领域泛化任务中的性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17448 2025-11-24 cs.CV 79%

MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models

MMT-ARD: 多模态多教师对抗蒸馏用于鲁棒视觉-语言模型

Yuqi Li, Junhao Dong, Chuanguang Yang, Shiping Wen, Piotr Koniusz, Tingwen Huang, Yingli Tian, Yew-Soon Ong

机构 * The City University of New York, CUNY(纽约城市大学) Nanyang Technological University(南洋理工大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Technology Sydney(悉尼技术大学) Data61, CSIRO(CSIRO数据61研究所) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 MMT-ARD通过多教师对抗蒸馏提升视觉-语言模型的对抗鲁棒性,实验显示鲁棒精度提升4.32%,训练效率提高2.3倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05923 2025-11-20 cs.CV 79%

Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Weitao Ma, Xiachong Feng

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09353 2025-11-18 cs.CR cs.CV 79%

DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt

Yitong Zhang, Jia Li, Liyi Cai, Ge Li

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05982 2025-11-18 cs.CV 79%

MCA-Bench: A Multimodal Benchmark for Evaluating CAPTCHA Robustness Against VLM-based Attacks

Zonglin Wu, Yule Xue, Yaoyao Feng, Xiaolong Wang, Yiren Song

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments we update the paper supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07570 2025-11-17 cs.CV 79%

Adaptive Cache Enhancement for Test-Time Adaptation of Vision-Language Models

Khanh-Binh Nguyen, Phuoc-Nguyen Bui, Hyunseung Choo, Duc Thanh Nguyen

机构 * Deakin University(德克萨斯大学) Sungkyunkwan University(成均馆大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments 12 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏