arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-24 至 2026-03-24 共收录 92 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2505.12299 2026-03-24 cs.CL cs.AI 57%

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10154 2026-03-24 cs.RO 50%

CompassNav: Steering From Path Imitation To Decision Understanding In Navigation

CompassNav: 从路径模仿到决策理解的导航导航

LinFeng Li, Jian Zhao, Yuan Xie, Xin Tan, Xuelong Li

机构 * East China Normal University(东华师范大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出CompassNav方法,通过引入Compass-Data-22k数据集和gap-aware奖励函数,使导航代理能理解而非单纯模仿路径,实现更高效的导航性能。

Journal ref Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21263 2026-03-24 cs.SE 50%

From Natural Language to Executable Properties for Property-based Testing of Mobile Apps

从自然语言到可执行属性:用于移动应用基于属性测试的可执行属性

Yiheng Xiong, Ting Su, Jingling Sun, Jue Wang, Qin Li, Geguang Pu, Zhendong Su

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出了一种新的结构化属性合成方法,将自然语言属性描述自动转换为可执行属性,并通过iPBT工具验证,展示了其在提升测试效率和鲁棒性方面的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 10 篇

2603.20985 2026-03-24 cs.CV 85%

Consistent but Dangerous: Per-Sample Safety Classification Reveals False Reliability in Medical Vision-Language Models

一致却危险:每样本安全分类揭示医疗视觉-语言模型中的虚假可靠性

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(SAIL实验室,新罕布什尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV

AI总结 研究揭示医疗VLMs中一致性指标的缺陷,通过四象限分类发现危险样本高准确率且低熵,建议部署评估需结合文本基线以识别虚假可靠性。

Comments CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16960 2026-03-24 cs.CR cs.AI 85%

Adversarial attacks against Modern Vision-Language Models

对抗现代视觉-语言模型的攻击

Alejandro Paredes La Torre

机构 * Duke University(杜克大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.AI

AI总结 研究开放源码视觉-语言模型在模拟真实预部署环境中的对抗鲁棒性,评估两种模型在三种梯度攻击下的表现,发现其存在显著的安全差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21426 2026-03-24 cs.CV 83%

Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

面向不确定性的多模态大语言模型知识蒸馏

Jingchen Sun, Shaobo Han, Deep Patel, Wataru Kohno, Can Jin, Changyou Chen

机构 * NEC Laboratories America, Inc.(NEC美洲实验室) University at Buffalo, SUNY(布法罗大学) Rutgers University(罗格斯大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出Beta-KD框架,通过统一贝叶斯视角平衡数据与教师指导,提升多模态VQA任务性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23495 2026-03-24 cs.CV 83%

Embedding Shift Dissection on CLIP: Effects of Augmentations on VLM's Representation Learning

在CLIP上嵌入位移分析:不同增强对VLM表示学习的影响

Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西西比大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 研究分析不同增强技术对CLIP嵌入位移的影响,探讨增强对视觉语言模型表示学习的机械可解释性影响。

Comments accepted at MIV at CVPR 2025

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20827 2026-03-24 cs.RO 82%

Swim2Real: VLM-Guided System Identification for Sim-to-Real Transfer

Swim2Real: 基于视觉-语言模型的系统辨识用于仿真到现实迁移

Kevin Qiu, Kyle Walker, Mike Y. Michelis, Marek Cygan, Josie Hughes

机构 * University of Warsaw(华沙大学) IDEAS NCBR EPFL(瑞士联邦理工学院) ETH Zurich(苏黎世联邦理工学院) Nomagic

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出Swim2Real系统,利用视觉-语言模型反馈校准水下仿真实验室,无需手动设计搜索阶段。通过同时校准16个参数,显著提升仿真到现实的迁移效果,实现零样本强化学习迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16523 2026-03-24 cs.CV cs.AI 81%

TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models

TTP: 视觉-语言模型上的对抗检测与鲁棒适应的测试时填充

Zhiwei Li, Yitian Pang, Weining Wang, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络与模式识别实验室及自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出TTP框架,通过测试时填充实现对抗检测与鲁棒适应,提升视觉-语言模型在对抗攻击下的鲁棒性而不影响清洁准确性。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21047 2026-03-24 cs.CV 79%

When Minor Edits Matter: LLM-Driven Prompt Attack for Medical VLM Robustness in Ultrasound

微小修改同样重要:基于LLM驱动的提示攻击用于医学视觉语言模型在超声中的鲁棒性

Yasamin Medghalchi, Milad Yazdani, Amirhossein Dabiriaghdam, Moein Heidari, Mojan Izadkhah, Zahra Kavian, Giuseppe Carenini, Lele Wang, Dena Shahriari, Ilker Hacihaliloglu

机构 * University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出一个可扩展的对抗评估框架,利用大语言模型生成临床合理的对抗提示变体,评估SOTA医学视觉语言模型在超声中的鲁棒性,揭示模型在临床应用中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20839 2026-03-24 cs.CV cs.AI cs.HC cs.LG 78%

Dodgersort: Uncertainty-Aware VLM-Guided Human-in-the-Loop Pairwise Ranking

Dodgersort: 一种考虑不确定性的视觉语言模型引导的人机协作成对排序

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(翰阳大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 幻觉与鲁棒性 :VLM(title);分类 cs.CV、cs.AI、cs.LG

AI总结 Dodgersort通过CLIP基于的分层预排序、神经排名头和概率集成方法,减少人工比较并提升排序可靠性,在医学影像、历史 dating 和美学任务中实现11-16%的标注减少。

Comments 12 pages, 2 figures, Pacific-Asia Conference on Knowledge Discovery and Data Mining(PAKDD2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23743 2026-03-24 cs.SE cs.AI 57%

Hybrid-Code v2: Zero-Hallucination Clinical ICD-10 Coding via Neuro-Symbolic Verification and Automated Knowledge Base Expansion

Hybrid-Code v2:通过神经符号验证和自动知识库扩展实现零幻觉的临床ICD-10编码

Yunguo Yu

机构 * AI Innovation & Prototyping, Zyter(人工智能创新与原型开发,Zyter)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 Hybrid-Code v2结合神经网络与符号验证,实现零类型I幻觉,同时保持高覆盖率和精度,通过自动知识库扩展解决规则系统扩展性问题。

Comments Version 2: Substantially extended version with (1) multi-layer verification framework (format, evidence, negation, temporal, exclusion), (2) automated knowledge base expansion from unlabeled clinical text, (3) formal zero Type-I hallucination guarantees, and (4) expanded experimental evaluation on 5,000 cases with detailed error analysis. 28 pages, 3 figure, original research paper;

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10065 2026-03-24 cs.AI 57%

RadHiera: Semantic Hierarchical Reinforcement Learning for Medical Report Generation

RadHiera:面向医学报告生成的语义分层强化学习

Bodong Du, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出RadHiera框架,通过分层强化学习提升医学报告生成的语义一致性与诊断准确性,实验表明其在胸部X光和超声报告生成中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 16 篇

2603.21584 2026-03-24 cs.LG cs.CV 84%

SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models

SSAM:奇异子空间对齐用于融合多模态大语言模型

Md Kaykobad Reza, Ameya Patil, Edward Ayrapetian, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) Amazon(亚马逊)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 SSAM通过参数空间对齐融合多模态大语言模型,无需训练数据实现跨模态统一,提升性能并降低资源消耗。

Comments 25 Pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21105 2026-03-24 cs.LG 83%

ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models

ResPrune:基于文本的子空间重建用于大视觉-语言模型中的视觉令牌修剪

Xu Li, Yi Zheng, Yuxuan Liang, Zhe Liu, Xiaolei Chen, Haotian Chen, Rui Zhu, Xiangyang Xue

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.LG

AI总结 ResPrune通过子空间重建方法实现视觉令牌修剪,结合文本相关性选择信息量大的令牌,提升大视觉-语言模型推理效率,减少计算和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16065 2026-03-24 cs.RO cs.AI 79%

Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models

大奖励模型:基于视觉-语言模型的通用在线机器人奖励生成

Yanru Wu, Weiduo Yuan, Ang Qi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 本文提出利用视觉-语言模型生成通用在线机器人奖励,通过零样本方式提升策略学习效率,实验显示在30次迭代内显著提高初始策略成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 78%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20697 2026-03-24 cs.CV cs.AI 73%

Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models

卫星到街道:通过生成视觉模型从卫星图像合成灾害后视角

Yifan Yang, Lei Zou, Wendy Jepson

机构 * Department of Geography Texas A\&M University(地理系德克萨斯农工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过生成视觉模型从卫星图像合成灾害后街道视角的方法,对比了基于VLM和MoE的生成策略,揭示了高现实感生成与结构信息保留之间的平衡问题。

Comments Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR 73%

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22165 2026-03-24 cs.CV 70%

ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints

ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移

Kaili Huang, Hongming Zhang, Rui Shen, Linjun Dai, Jiahao Wang, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);InternVL(abstract);分类 cs.CV

AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI 62%

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21232 2026-03-24 cs.CV cs.AI 62%

QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression

QMoP:基于查询的混合投影器用于高效的视觉令牌压缩

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * East China Normal University(华东师范大学) Li Auto Inc(Li汽车公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QMoP框架,通过三种协作分支实现视觉令牌的自适应压缩,结合查询引导路由和专家融合机制,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17655 2026-03-24 cs.CV cs.AI 62%

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

可解释的跨领域少样本学习与修正的目标域局部对齐

Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CC-CDFSL方法,通过循环一致性解决CLIP-based CDFSL中的局部对齐问题,提升局部视觉语言对齐和可解释性,实现SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22276 2026-03-24 cs.LG stat.ML 57%

Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels

DoRA的扩展:通过因子范数和融合内核进行高秩适应

Alexandra Zelenin, Alexandra Zhuravlyova

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出通过因子范数和融合内核实现高秩适应,减少内存占用并提升计算效率,适用于大规模视觉-语言模型。

Comments 30 pages, 15 figures, 15 tables, including appendices. Code and data at https://github.com/sockeye44/dorafactors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21504 2026-03-24 cs.CV 57%

Parameter-efficient Prompt Tuning and Hierarchical Textual Guidance for Few-shot Whole Slide Image Classification

高效参数提示调优与层次文本引导在少样本整张滑片图像分类中的应用

Jayanie Bogahawatte, Sachith Seneviratne, Saman Halgamuge

机构 * AI, Optimization and Pattern Recognition Research Group(人工智能、优化与模式识别研究组) Dept. of Mechanical Eng., University of Melbourne, Australia(墨尔本大学机械工程系,澳大利亚)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出高效参数提示调优和层次文本引导方法,以解决少样本整张滑片图像分类中的计算成本和信息损失问题,实验显示在乳腺、肺癌和卵巢癌数据集上均取得显著提升。

Comments Accepted for publication at CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models (Med-Reasoner)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 57%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21010 2026-03-24 cs.CV 57%

SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis

SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架

Zhixiang Lu, Shijie Xu, Kaicheng Yan, Xuyue Cai, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20731 2026-03-24 cs.CV 57%

VSD-MOT: End-to-End Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Distillation

VSD-MOT: 低质量视频场景中基于视觉语义蒸馏的端到端多目标跟踪

Jun Du

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VSD-MOT框架,通过视觉语义蒸馏提升低质量视频中多目标跟踪性能,设计双约束语义蒸馏和动态语义权重调节模块,实验证明其在低质量场景和常规场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20492 2026-03-24 cs.LG cs.CL 57%

AE-LLM: Adaptive Efficiency Optimization for Large Language Models

AE-LLM:面向大语言模型的自适应效率优化

Kaito Tanaka, Masato Ito, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(SANNO大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出AE-LLM框架,通过自适应选择和组合最优效率技术,提升大语言模型在不同部署场景下的效率,实验显示在15种模型和10种任务中,效率提升达2.8倍,精度保持在基线1.2%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 3 篇

2603.21484 2026-03-24 cs.CV 79%

Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models

哪些概念需要遗忘以及如何拒绝?分解概念以在大视觉-语言模型中实现持续反学习

Hyundong Jin, Dongyoon Han, Eunwoo Kim

机构 * Chung-Ang University(Chung-Ang大学) NAVER AI Lab(NAVER AI实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种持续反学习框架,通过分解删除目标中的视觉和文本概念,生成基于细粒度描述的拒绝响应,以提升反学习效果和保持通用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏