arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5030 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5030 篇

2606.02273 2026-06-02 cs.CV 83%

Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset

用于驾驶员监控系统的视觉语言模型:一个驾驶员活动描述数据集

David J. Lerch, Sarath Mulugurthi, Manuel Martin, Frederik Diederichs, Rainer Stiefelhagen

机构 * Fraunhofer IOSB(弗劳恩霍夫智能系统研究所) Technische Hochschule Ingolstadt(图林根工业大学) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过创建Drive&Act数据集的详细自然语言版本,评估并微调视觉语言模型,以提升对驾驶员细微动作的识别能力,微调后的模型在跨数据集评估中表现更优。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00913 2026-05-28 cs.CV cs.CL 83%

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

跨描绘装配指令对齐的视觉-语言模型基准测试与机制分析

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 构建IKEA-Bench基准,评估19个视觉-语言模型在装配图与视频帧对齐任务上的表现,发现视觉编码是提升跨描绘鲁棒性的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06687 2026-05-26 cs.CV cs.CL cs.ET cs.MM cs.RO 83%

TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings

TimeSpot: 在真实世界场景中评估视觉语言模型的地理时间理解能力

Azmine Toushik Wasi, Shahriyar Zaman Ridoy, Koushik Ahamed Tonmoy, Kinga Tshering, S. M. Muhtasimul Hasan, Wahid Faisal, Tasnim Mohiuddin, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory (CIOL), Bangladesh(计算智能与运筹实验室(CIOL),孟加拉国) Shahjalal University of Science and Technology (SUST), Sylhet, Bangladesh(沙赫jalal科学与技术大学(SUST),沙赫里尔,孟加拉国) North South University (NSU), Dhaka, Bangladesh(北南大学(NSU),达卡,孟加拉国) Qatar Computing Research Institute (QCRI), Doha, Qatar(卡塔尔计算研究中心(QCRI),多哈,卡塔尔)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出TimeSpot基准,通过1,455张全球图像评估视觉语言模型在时间属性(季节、月份、时段、日光相位)和地理属性(大洲、国家、气候带、环境类型、经纬度)上的推理能力,发现现有模型性能低下,尤其时间推理不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20477 2026-05-26 cs.LG 83%

Bi-CoG: Bi-Consistency-Guided Self-Training for Vision-Language Models

Bi-CoG:面向视觉语言模型的双一致性引导自训练

Rui Zhu, Song-Lin Lv, Zi-Kang Wang, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.LG

AI总结 针对半监督微调中模型偏差和超参数敏感问题,提出一种利用模型间和模型内一致性以及误差感知动态伪标签分配策略的即插即用方法Bi-CoG,在14个数据集上显著提升现有方法性能。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17186 2026-05-22 cs.CV 83%

Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain

聚焦视觉关键点:通过视觉信息增益进行大视觉语言模型的定向训练

Seulbi Lee, Sangheum Hwang

机构 * Department of Data Science, Seoul National University of Science and Technology(数据科学系,首尔科学技术大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出通过视觉信息增益(VIG)指标,对大视觉语言模型进行定向训练,以提升视觉基础性并减少语言偏见,通过优先选择高VIG样本和token来提高性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17093 2026-05-19 cs.CV cs.CL 83%

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

HEED:基于密度加权残差对齐的混合视觉-语言模型蒸馏

Yihao Liang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出HEED方法,通过密度加权残差对齐改进混合视觉-语言模型蒸馏,提升在OCR和文档任务中的性能,同时在不同教师模型和混合架构上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11444 2026-05-14 cs.CV 83%

Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

通过混合频率专家利用多模态大语言模型实现一站式图像修复

Eunho Lee, Rei Kawakami, Youngbae Hwang

机构 * Chungbuk National University(Chungbuk国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种利用多模态大语言模型指导的图像修复框架,通过混合频率专家模块提升对复合退化特征的建模能力,在多个数据集上取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14129 2026-05-14 cs.CV 83%

PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution

PVLM:面向零样本深度伪造属性识别的解析感知视觉语言模型

Yaning Zhang, Jiahe Zhang, Chunjie Ma, Weili Guan, Tian Gan, Zan Gao

机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) Shandong University of Science and Technology(山东科技大学) Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) School of Electronics and Information Engineering, Harbin Institute of Technology(电子与信息工程学院,哈尔滨工业大学(深圳)) School of Computer Science and Technology, Shandong University(计算机科学与技术学院,山东大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出PVLM模型,通过动态对比学习实现对未知高级生成器的细粒度追踪,利用面部解析特征捕捉伪造表示,提升深度伪造属性识别性能。

Comments Accepted to IEEE Transactions on Dependable and Secure Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00829 2026-04-28 cs.CV cs.CL 83%

LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation

LinguDistill: 通过选择性跨模态蒸馏恢复视觉语言模型中的语言能力

Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji, Yova Kementchedjhieva

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出LinguDistill方法,通过利用冻结的原始语言模型作为教师,选择性蒸馏语言信号以恢复语言能力,同时保持视觉基础,提升了语言和知识基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04468 2026-04-28 cs.CV 83%

NVILA: Efficient Frontier Visual Language Models

NVILA:高效的前沿视觉语言模型

Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Vishwesh Nath, Jinyi Hu, Sifei Liu, Ranjay Krishna, Daguang Xu, Xiaolong Wang, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, Yao Lu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 NVILA通过'缩放后再压缩'方法提升效率与准确性,降低训练和推理成本,适用于高分辨率图像和长视频处理。

Comments CVPR 2025. Project page: https://z-lab.ai/projects/nvila/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14980 2026-04-23 cs.AI cs.CL cs.HC 83%

Hybrid Decision Making via Conformal VLM-generated Guidance

通过符合性VLM生成的指导实现混合决策

Debodeep Banerjee, Burcu Sayin, Stefano Teso, Andrea Passerini

机构 * University of Pisa(帕尔米斯大学) DISI, University of Trento(特伦托大学DISI研究所) CIMEC, University of Trento(特伦托大学CIMEC研究所)

专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.AI

AI总结 本文提出ConfGuide方法,通过符合性风险控制生成简洁精准的指导,提升多标签医学诊断任务中的决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11374 2026-04-14 cs.CV cs.CL 83%

What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?

视觉-语言模型如何编码个性化图像审美评估?

Koki Ryu, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文分析了视觉-语言模型内部表示中审美属性的分布,利用这些属性实现轻量级个性化图像审美评估,无需微调模型。

Comments To appear at ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15489 2026-04-14 cs.CV cs.CL cs.MM 83%

Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models

穿透欺骗:在多模态新闻中揭示误导性创作者意图

Jiaying Wu, Fanxiao Li, Zihang Fu, Min-Yen Kan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Yunnan University(云南大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DeceptionDecoded基准数据集,通过意图引导模拟框架生成12000组图像-描述对,旨在揭示多模态虚假信息中的误导性意图,评估14种最新视觉-语言模型,发现其在意图推理上存在不足,提出系统合成数据以提升模型意图理解能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07912 2026-04-10 cs.CV cs.RO 83%

ParkSense: Where Should a Delivery Driver Park? Leveraging Idle AV Compute and Vision-Language Models

ParkSense: 送货司机应该在哪里停车?利用空闲自动驾驶计算和视觉-语言模型

Die Hu, Henan Li

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Independent Researcher(独立研究员)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ParkSense框架,利用自动驾驶低风险状态下的空闲计算资源运行视觉-语言模型,解决精准停车问题,并提出Delivery-Aware Precision Parking问题,展示量化7B VLM在硬件上的推理速度及对司机收入的提升。

Comments 7 pages, 3 tables. No university resources were used for this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08410 2026-04-10 cs.CV 83%

Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval

通过一次剪辑检索增强多模态大语言模型的长视频理解

Tao Chen, Shaobo Ju, Qiong Wu, Chenxin Fang, Kun Zhang, Jun Peng, Hui Li, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) Xiamen University(厦门大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18117 2026-04-08 cs.CV 83%

Online In-Context Distillation for Low-Resource Vision Language Models

在线上下文蒸馏用于低资源视觉语言模型

Zhiqi Kang, Rahaf Aljundi, Vaggelis Dorovatas, Karteek Alahari

机构 * Inria(法国国家信息与自动化研究所) Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出在线上下文蒸馏方法,通过小模型与强教师模型协作,利用稀疏演示高效缩小性能差距,提升小模型性能达33%,在低资源条件下实现与零样本性能相当的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 83%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 VLM训练与架构 :grounding(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11683 2026-04-03 cs.RO cs.AI 83%

Robot Collapse: Supply Chain Backdoor Attacks Against VLM-based Robotic Manipulation

机器人崩溃:针对基于VLM的机器人操控的供应链后门攻击

Xianlong Wang, Hewen Pan, Hangtao Zhang, Minghui Li, Shengshan Hu, Ziqi Zhou, Lulu Xue, Peijin Guo, Aishan Liu, Leo Yu Zhang, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学) Griffith University(格里菲斯大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出TrojanRobot框架,通过在模块化机器人策略中嵌入恶意模块,操控LLM到VLM路径,验证了在18个真实任务和4个VLM上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00592 2026-04-02 cs.CV cs.HC 83%

HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models

HarassGuard: 在社交虚拟现实中利用视觉-语言模型检测骚扰行为

Junhee Lee, Minseok Kim, Hwanjo Heo, Seungwon Woo, Jinwoo Kim

机构 * Kwangwoon University(光云大学) ETRI(韩国电子通信研究院) Chungbuk National University(忠北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出HarassGuard系统,通过视觉输入检测社交VR中的身体骚扰行为,利用提示工程和微调VLMs,在不使用敏感生物数据的情况下实现高准确率的骚扰检测。

Comments To appear in the 2026 TVCG Special Issue on the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11919 2026-04-01 cs.CV 83%

TimeSenCLIP: A Time Series Vision-Language Model for Remote Sensing

TimeSenCLIP: 一种用于遥感的时序视觉-语言模型

Pallavi Jain, Diego Marcos, Dino Ienco, Roberto Interdonato, Tristan Berchoux

机构 * Mediterranean Agronomic Institute of Montpellier - CIHEAM-IAMM(地中海农艺研究所蒙彼利埃分校 - CIHEAM-IAMM) Inria(法国国家信息与自动化研究所) INRAE(法国国家农业、食品与环境研究院) Cirad(法国农业国际合作研究发展中心) UMR TETIS(TETIS 联合研究单位) Univ. of Montpellier(蒙彼利埃大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出TimeSenCLIP,一种轻量级遥感时序视觉-语言模型,通过跨视图时间对比框架对多光谱Sentinel-2时序与地理标记地面影像对齐,无需文本标注,强调时序和光谱信号,探索单像素时序信息在多种任务中的有效性。

Comments Accepted (ISPRS Journal of Photogrammetry and Remote Sensing)

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing Volume 236, June 2026, Pages 99-119

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27737 2026-03-31 cs.CV 83%

Synergizing Discriminative Exemplars and Self-Refined Experience for MLLM-based In-Context Learning in Medical Diagnosis

融合判别示例与自我优化经验的医学诊断基于MLLM的上下文学习

Wenkai Zhao, Zipei Wang, Mengjie Fang, Di Dong, Jie Tian, Lingwei Zhang

机构 * CAS Key Laboratory of Molecular Imaging, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所分子影像重点实验室) School of Software, North University of China(中北大学软件学院)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Clinician Mimetic Workflow框架,结合判别示例核心集选择与自我优化经验总结,提升医学诊断中基于MLLM的上下文学习性能,超越零样本通用和医疗MLLM,并接近全监督视觉模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27522 2026-03-31 cs.CL cs.CR cs.LG 83%

Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models

隐性广告:用于视觉语言模型中广告注入的行为触发语义后门

Duanyi Yao, Changyue Li, Zhicong Huang, Cheng Hong, Songze Li

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本文提出隐性广告攻击,通过用户行为触发在视觉语言模型中注入未经授权的广告,利用自然用户行为实现高效且隐蔽的广告注入,同时评估了不同防御方法的失效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27070 2026-03-31 cs.CV 83%

Structural Graph Probing of Vision-Language Models

视觉-语言模型的结构图谱探查

Haoyu He, Yue Zhuo, Yu Zheng, Qi R. Wang

机构 * Northeastern University(东北大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 研究通过神经拓扑分析视觉-语言模型的层间相关图谱,揭示群体结构对行为的意义、跨模态变化及因果影响,提出神经拓扑作为解释性中间尺度。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22674 2026-03-31 cs.CV 83%

VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration

VisionTrim: 一种用于无训练多模态大语言模型加速的统一视觉标记压缩方法

Hanxun Yu, Wentong Li, Xuan Qu, Song Wang, Junbo Chen, Jianke Zhu

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) NUAA(南京航空航天大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VisionTrim,通过整合DVTS和TGVC模块,有效减少视觉标记,提升多模态大语言模型在高分辨率和视频场景中的计算效率。

Comments ICLR2026, Code Link: https://github.com/hanxunyu/VisionTrim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26589 2026-03-30 cs.CV 83%

The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding

图像与文本学习的极限:视觉语言模型与具身场景理解

Gillian Rosenberg, Skylar Stadhard, Bruce C. Hansen, Michelle R. Greene

机构 * Barnard College, Columbia University(哥伦比亚大学巴纳德学院) Colgate University(科尔盖特大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 研究探讨图像与文本学习在人类场景理解中的局限性,通过对比18个视觉语言模型与2000名人类观察者在15项任务中的表现,发现模型在具身认知任务中存在显著缺陷,表明分布学习不足以实现基于 affordance 的场景理解。

Comments 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19530 2026-03-30 cs.CV 83%

ORION: ORthonormal Text Encoding for Universal VLM AdaptatION

ORION:用于通用视觉语言模型适应的正交文本编码

Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montréal, Canada(蒙特利尔高等技术学院(加拿大))

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 ORION通过低秩适应优化正交损失,提升预训练VLM的文本嵌入质量,实验表明其在多个基准上显著提升性能。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24578 2026-03-26 cs.CV eess.IV 83%

Vision-Language Models vs Human: Perceptual Image Quality Assessment

视觉-语言模型与人类:感知图像质量评估

Imran Mehmood, Imad Ali Shah, Ming Ronnier Luo, Brian Deegan

机构 * School of Engineering, University of Galway(Galway大学工程学院) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光信息获取国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文研究视觉语言模型是否能近似人类对图像质量的感知判断,通过对比心理物理数据,发现模型在颜色丰富度上表现优异,但在对比度上表现较差,且模型一致性与人类对齐性存在矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22622 2026-03-25 cs.CV 83%

A Vision Language Model for Generating Procedural Plant Architecture Representations from Simulated Images

一种用于从模拟图像生成程序化植物建筑表示的视觉语言模型

Heesup Yun, Isaac Kazuo Uyehara, Ioannis Droutsas, Earl Ranario, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * Biological and Agricultural Engineering(生物与农业工程系) Department of Plant Sciences(植物科学系) Viticulture and Enology(葡萄栽培与酿酒系) Wageningen University & Research(瓦赫宁根大学与研究学院)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种视觉语言模型,通过合成图像生成3D植物建筑模型,提取器官级参数,验证了从图像数据中提取植物建筑参数的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21105 2026-03-24 cs.LG 83%

ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models

ResPrune:基于文本的子空间重建用于大视觉-语言模型中的视觉令牌修剪

Xu Li, Yi Zheng, Yuxuan Liang, Zhe Liu, Xiaolei Chen, Haotian Chen, Rui Zhu, Xiangyang Xue

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.LG

AI总结 ResPrune通过子空间重建方法实现视觉令牌修剪,结合文本相关性选择信息量大的令牌,提升大视觉-语言模型推理效率,减少计算和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09262 2026-03-19 cs.CV 83%

MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models

MultiMedEval:用于评估医学视觉-语言模型的基准和工具包

Corentin Royer, Bjoern Menze, Anjany Sekuboyina

机构 * University of Zürich(苏黎世大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 MultiMedEval通过23个数据集和11个医学领域,评估六种多模态任务,提供开源工具简化VLM评估,促进公平统一的基准测试。

Comments Accepted at MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏