LPT: Less-overfitting Prompt Tuning for Vision-Language Model
LPT: 降低过拟合的提示微调用于视觉-语言模型
机构 * IEEE(国际电气电子工程师协会)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出LPT框架,通过CLIP过滤细粒度前景信息并引入结构保持和层级logit约束,提升视觉-语言模型的泛化能力并缓解过拟合问题。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
LPT: 降低过拟合的提示微调用于视觉-语言模型
机构 * IEEE(国际电气电子工程师协会)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出LPT框架,通过CLIP过滤细粒度前景信息并引入结构保持和层级logit约束,提升视觉-语言模型的泛化能力并缓解过拟合问题。
当感知超越认知:在视觉-语言模型中解构知识冲突
机构 * University of Trieste(特里este大学) ; AREA Science Park(AREAS科学公园) ; MPI ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文研究视觉-语言模型如何解决跨模态冲突,通过引入WHOOPS-AHA!数据集,发现特定注意力头可调节模型对内部知识或视觉信息的偏好,提升冲突解决的精确度。
Comments ACL 2026 (Main)
降低现代多模态大语言模型流水线的峰值内存使用
机构 * New York University(纽约大学)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。
Comments ACL 2026
盲人和低视力者如何偏好大型视觉-语言模型生成的场景描述
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 研究探讨了盲人和低视力用户对大型视觉-语言模型生成场景描述的偏好,通过用户研究评估了六种描述类型,发现用户对描述的充分性和简洁性存在较大差异,提出需构建以盲人和低视力用户为中心的评估指标。
Comments This paper has been superseded by version 2 of arXiv:2510.00766
通过视觉记忆机制扩展多模态大语言模型的长视频理解
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) ; National University of Defense Technology(国防科技大学)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。
Comments CVPR 2026
Ego:基于嵌入的视觉-语言模型个性化
机构 * Toyota Motor Europe(丰田欧洲公司)
专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于模型内部机制的高效视觉-语言模型个性化方法,通过提取目标概念的视觉标记实现个性化描述与记忆。
Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
多模态、多任务、多标准自动评估与视觉语言模型
机构 * Institute of Science Tokyo(东京科学研究所) ; MBZUAI ; NII LLMC(日本国立信息与通信技术研究所语言模型中心)
专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出HarmonicEval,一种无需参考的多任务多标准自动评估指标,通过聚合标准评分提升与人类判断的相关性,并构建MMHE基准测试多任务场景下的评估泛化能力。
HeatPrompt: 从卫星图像进行零样本的城市热需求视觉-语言建模
机构 * Institute for Automation and Applied Informatics (IAI), Karlsruhe Institute of Technology (KIT), Germany(自动化与应用信息研究所(IAI)、卡尔斯鲁厄理工学院(KIT))
专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 HeatPrompt通过卫星图像和地理信息数据,利用零样本视觉语言模型估算城市热需求,提升预测精度并支持数据稀缺地区的热规划。
LRR-Bench:左、右还是旋转?视觉-语言模型在空间理解任务上仍面临挑战
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Drexel University(德雷塞尔大学) ; Tianyijiaotong Technology Ltd.(天奕交通技术有限公司)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 LRR-Bench通过合成数据评估视觉-语言模型在空间理解任务上的性能,发现其在复杂任务上的表现远低于人类水平。
LVLM-COUNT: 提升大视觉-语言模型的计数能力
机构 * University of Waterloo(滑铁卢大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 LVLM-COUNT通过分而治之的方法提升大视觉-语言模型对大量对象的计数能力,有效解决计数任务中的重复计数问题。
Comments 38 pages, 24 Figures, 19 Tables
任意到任意的视觉-语言模型用于多模态X射线成像与放射学报告生成
机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与放射物理,乌梅大学) ; College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种任意到任意的视觉-语言模型,用于多模态X射线成像和放射学报告生成,通过生成高质量图像和语义连贯的报告,提升了医疗领域生成模型的临床应用价值。
Comments arXiv admin note: substantial text overlap with arXiv:2501.04614
大规模电商理解中的视觉-语言模型适应
机构 * eBay Inc.(eBay公司) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种方法,通过大规模实验研究,展示如何通过针对性适应通用视觉-语言模型以提升电子商务性能,同时保持多模态能力,并提出新的评估套件。
超越翻译:基于视觉-语言模型的跨文化表情包再创作
机构 * Santa Clara University(圣克拉拉大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于视觉-语言模型的跨文化表情包再创作框架,通过大规模数据集和多维度评估,揭示了跨文化再创作中的方向性差异及挑战。
无需训练的测试时适应与布朗距离协方差在视觉-语言模型中
机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) ; University of Cambridge, Cambridge, UK(剑桥大学) ; Yau Mathematical Sciences Center, Tsinghua University, Beijing, China(清华大学尤里伊数学科学中心) ; Southern University of Science and Technology, Shenzhen, China(南方科技大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 TaTa通过布朗距离协方差实现无需训练的测试时适应,提升视觉-语言模型在领域偏移下的效率与稳定性,同时在泛化性能上取得突破。
Comments Accepted in ICASSP 2026
通过不变轨迹学习实现通用的多模态大语言模型编辑
机构 * Zhejiang University, China(浙江大学) ; Singapore Management University, Singapore(新加坡管理学院) ; National University of Singapore, Singapore(新加坡国立大学) ; Hangzhou Dianzi University, China(杭州电子科技大学) ; Jiangxi Normal University, China(江西师范大学)
专题命中 其他VLM :multimodal large language model(title);MLLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ODEit框架,通过不变轨迹学习提升多模态大语言模型的编辑可靠性、局部性和泛化能力。
PatientVLM 与 DocVLM 相遇:为高效诊断的预咨询对话
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出预咨询对话框架,通过视觉语言模型模拟医生与患者对话,利用合成症状提升诊断效率。
Comments Accepted at AAAI 2026 Main Track
评估专用计数架构和视觉-语言模型的视觉计数能力
机构 * University of Padova(帕多瓦大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文比较了专用计数架构与VLMs在物体计数任务中的性能,发现VLMs在生成中间表示时计数准确率显著提高,但复杂场景计数仍需进一步研究。
视觉语言模型在生成文本天气预报中的巨大潜力
机构 * Met Office(英国气象局) ; Amazon Web Services(亚马逊网络服务) ; University of East Anglia(东安格利亚大学)
专题命中 其他VLM :vision language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了视觉语言模型在直接生成文本天气预报中的潜力,通过视频编码的格网天气数据提升气象服务的生产效率与创新。
Comments 7 pages, 2 tables
机构 * Fudan University(复旦大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI、cs.LG
Comments 15 pages, 11 figures
机构 * New York University(纽约大学)
专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Comments 9 pages, accepted by the 2025 ACM Multimedia Conference. Code is available at https://jus1mple.github.io/Image2CaptionAttack
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2025
机构 * Department of Computer Science(计算机科学系) ; Stony Brook University(史泰尼斯布鲁克大学)
专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.LG
Comments IEEE CAI 2025
Journal ref 2025 IEEE Conference on Artificial Intelligence (CAI), Santa Clara, CA, USA, 2025, pp. 513,518
机构 * ByteDance Inc.(字节跳动公司)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯) ; Shenzhen University(深圳大学) ; Hefei University of Technology(合肥工业大学)
专题命中 其他VLM :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted at ACM MM 2025 Dataset Track
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments 6 pages, IEEE NAECON'25
机构 * National Taiwan University(国立台湾大学) ; National Taiwan Normal University(国立台湾师范大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by MM'25
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted in ICCV 2025 workshops
机构 * Institute of Space Internet, Fudan University, Shanghai China(空间互联网研究所,复旦大学,上海中国)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI、cs.LG
Comments 11 pages, 12 figures
机构 * University of New Brunswick(新 Brunswick大学) ; Institute for Clarity in Documentation(文档清晰研究所) ; Inria Paris-Rocquencourt(巴黎-罗克琴特研究所) ; Rajiv Gandhi University(拉贾·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕勒尔研究实验室)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
Comments 33rd ACM International Conference on Multimedia (MM'25) Grand Challenge on Multimedia Verification