Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping
构造性失真:通过注意力引导的图像扭曲改进MLLMs
Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain
机构
*
University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Skan AI
;
Texas A&M University(德克萨斯大学阿姆斯特朗分校)
;
University of California, Irvine(加州大学 Irvine 分校)
Towards Joint Quantization and Token Pruning of Vision-Language Models
面向视觉-语言模型的联合量化与令牌剪枝
Xinqing Li, Xin He, Xindong Zhang, Ming-Ming Cheng, Lei Zhang, Yun Liu
机构
*
VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)
;
School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学)
;
OPPO Research Institute(OPPO研究院)
;
Academy for Advanced Interdisciplinary Studies, Nankai University(先进跨学科研究院,南开大学)
;
Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究 institutes,深圳福田)
;
Department of Computing, Hong Kong Polytechnic University(计算学院,香港理工大学)
GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning
GaLa:基于超图的视觉语言模型用于程序规划
Kun Wang, Yiming Li, Mingcheng Qu, Aqiang Zhang, Guang Yang, Tonghua Su
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))
;
Chongqing Research Institute of HIT(重庆哈尔滨工业大学研究院)
专题命中
VLM训练与架构
:visual language model(title);VLM(abstract,abstract_cn);vision language model(abstract)
Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization
针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化
Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang
机构
*
Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡)
;
School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡)
;
College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)
;
DSO National Laboratories, Singapore(新加坡国防科学实验室)
专题命中
VLM训练与架构
:MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI
机构
*
School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院)
;
School of Software, Tsinghua University, Beijing, China(清华大学软件学院)
;
School of Information Resource Management, Renmin University of China,Beijing, China(中国人民大学信息资源管理学院)
;
School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院)
;
Baidu Inc., Beijing, China(百度公司)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract)
MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning
MaLoRA:基于关键空间对齐的门控模态LoRA
Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Institute for Clarity in Documentation(文档清晰研究所)
;
Inria Paris-Rocquencourt(巴黎-鲁维尔研究所)
;
Rajiv Gandhi University(拉贾·甘地大学)
;
Palmer Research Laboratories(帕勒实验室)
专题命中
VLM训练与架构
:LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Shanghai Jiao Tong University(上海交通大学)
;
Northeastern University(东北大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
MBZUAI
专题命中
VLM训练与架构
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
CommentsAccepted at the IEEE Engineering in Medicine and Biology Society Annual International Conference (Proceedings of the 48th International Conference), 2026