arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5030 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5030 篇

2603.13728 2026-03-19 cs.CV cs.CR 83%

Bodhi VLM: Privacy-Alignment Modeling for Hierarchical Visual Representations in Vision Backbones and VLM Encoders via Bottom-Up and Top-Down Feature Search

Bodhi VLM:通过自上而下和自下而上的特征搜索实现视觉主干和VLM编码器中层次视觉表示的隐私对齐建模

Bo Ma, Wei Qi Yan, Jinsong Wu

机构 * Auckland University of Technology(奥克兰技术大学) Resideo Technologies, Inc.(Resideo技术公司) Guilin University of Electronic Technology(桂林电子科技大学) Universidad de Chile(智利大学)

专题命中 VLM训练与架构 :VLM(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出Bodhi VLM框架,通过NCP和MDAV聚类将敏感概念与分层神经表示的层间分组关联,并利用自上而下和自下而上的策略定位敏感特征区域,结合EMPA模块生成可解释的隐私预算对齐信号,验证了在目标检测和VLM视觉编码器中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16653 2026-03-18 cs.CV 83%

HeBA: Heterogeneous Bottleneck Adapters for Robust Vision-Language Models

HeBA:异构瓶颈适配器用于鲁棒的视觉-语言模型

Md Jahidul Islam

机构 * Department of Electrical and Electronic Engineering(电气电子工程系) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 HeBA通过引入模态特定的结构归纳偏置,改进了视觉-语言模型在下游任务中的适应性,提升了稳定性和准确性,达到11个少样本基准的新状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11098 2026-03-18 cs.CV cs.RO 83%

Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description

面向增材制造场景的红外工业感知的视觉-语言模型

Nazanin Mahjourian, Vinh Nguyen

机构 * Department of Mechanical and Aerospace Engineering, Michigan Technological University(机械与航空航天工程系,密歇根技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VLM-IRIS框架,通过预处理红外图像为RGB兼容输入,利用CLIP编码器实现无监督的零样本工作件存在检测,展示了在热成像中的高精度应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15166 2026-03-17 cs.CV 83%

DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer

DAIT: 从视觉-语言模型到轻量分类器的适应性中间教师知识蒸馏

Zhengxu He, Jun Li, Zhijian Wu

机构 * School of Computer and Electronic Information, Nanjing Normal University, Nanjing, China(南京师范大学计算机与电子信息学院) Medical Artificial Intelligence Lab, Westlake University(西湖大学医学人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DAIT方法,通过引入可训练的中间教师模型,从冻结的视觉-语言模型中适应性地蒸馏出任务对齐的知识,提升细粒度视觉分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06569 2026-03-17 cs.CV 83%

Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

Penguin-VL:探索基于大语言模型的视觉编码器的效率极限

Boqiang Zhang, Lei Ke, Ruihan Yang, Qi Gao, Tianyuan Qu, Rossell Chen, Dong Yu, Leoweiliang

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。

Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00819 2026-03-16 cs.RO cs.AI 83%

DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Driving

DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶

Dawood Wasif, Terrence J. Moore, Chandan K. Reddy, Frederica Free-Nelson, Seunghyun Yoon, Hyuk Lim, Dan Dongseong Kim, Jin-Hee Cho

专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。

Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16201 2026-03-16 cs.CV 83%

Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation

医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成

Sarosij Bose, Ravi K. Rajendran, Biplob Debnath, Konstantinos Karydis, Amit K. Roy-Chowdhury, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美洲实验室) University of California, Riverside(加州大学河滨分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00511 2026-03-16 cs.CV 83%

ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

ID-Crafter:基于视觉语言模型的在线强化学习多主体视频生成框架

Panwang Pan, Jingjing Zhao, Yuchen Lin, Chenguo Lin, Chenxin Li, Hengyu Liu, Tingting Shen, Yadong MU

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出ID-Crafter框架,通过层次化注意力机制、预训练视觉语言模型和在线强化学习,提升多主体视频生成中身份保持与语义一致性。

Comments Project page: https://angericky.github.io/ID-Crafter, Code: https://github.com/paulpanwang/IDCrafter

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11219 2026-03-13 cs.CV 83%

Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning

Senna-2:对齐视觉语言模型与端到端驾驶策略以实现一致的决策与规划

Yuehao Song, Shaoyu Chen, Hao Gao, Yifan Zhu, Weixiang Yue, Jialv Zou, Bo Jiang, Zihao Lu, Yu Wang, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 Senna-2通过三阶段训练范式对齐视觉语言模型与端到端驾驶策略,提升决策与规划的一致性,增强驾驶安全性和效率。

Comments 15 pages, 8 figures. Project page: https://ambitious-idiot.github.io/senna2-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02421 2026-03-13 cs.CV 83%

Generalizing Vision-Language Models with Dedicated Prompt Guidance

通过专用提示引导泛化视觉语言模型

Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出GuiDG框架,通过提示微调和跨模态注意力模块提升视觉语言模型的领域泛化能力,并在ImageNet-DG上验证了其有效性。

Comments Accepted to AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10578 2026-03-12 cs.CV cs.DB 83%

R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment

R4-CGQA: 基于检索的视觉语言模型用于计算机图形图像质量评估

Zhuangzi Li, Jian Jin, Shilv Cai, Weisi Lin

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 R4-CGQA通过构建包含3500张CG图像及其质量描述的数据集,提出双流检索框架提升视觉语言模型对计算机图形图像质量的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV 83%

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10705 2026-03-12 cs.CV 83%

Enhanced Continual Learning of Vision-Language Models with Model Fusion

增强视觉-语言模型的持续学习与模型融合

Haoyuan Gao, Zicong Zhang, Yuqi Wei, Linglan Zhao, Guilin Li, Yexin Li, Bo Wang, Linghe Kong, Weiran Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(国家一般人工智能重点实验室,BIGAI) Tencent(腾讯)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ConDU方法,通过模型融合解决VLMs在持续学习中的灾难性遗忘问题,提升零样本性能和多任务表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08800 2026-03-11 cs.CV 83%

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Granulon: 通过自适应多粒度语义唤醒像素级视觉编码器以实现MLLM

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Granulon通过自适应多粒度语义增强,提升多模态大语言模型的像素级视觉理解和多粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08572 2026-03-10 cs.RO cs.AI 83%

MetaWorld-X: Hierarchical World Modeling via VLM-Orchestrated Experts for Humanoid Loco-Manipulation

MetaWorld-X: 通过VLM协调的专家实现人形机器人的分层世界建模

Yutong Shen, Hangxu Liu, Penghui Liu, Jiashuo Luo, Yongkang Zhang, Rex Morvley, Chen Jiang, Jianwei Zhang, Lei Zhang

机构 * University of Hamburg(汉堡大学) School of Information Science and Technology, Beijing University of Technology(信息科学与技术学院,北京理工大学) School of Information Science and Engineering, Fudan University(信息科学与工程学院,复旦大学) University of Alberta(阿尔伯塔大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 MetaWorld-X通过VLM协调的专家实现人形机器人分层世界建模,解决loco-manipulation任务中的控制策略泛化问题。

Comments 8 figures, https://syt2004.github.io/metaworldX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01111 2026-03-10 cs.CV 83%

DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles

DeAR: 通过分解注意力头角色实现细粒度VLM适应

Yiming Ma, Hongkun Yang, Lionel Z. Wang, Bin Chen, Weizhi Xian, Jianzhi Teng

机构 * Chongqing Research Institute of Harbin Institute of Technology(哈尔滨工业大学重庆研究所) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 DeAR通过分解注意力头角色实现细粒度VLM适应,有效平衡任务适应与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18349 2026-03-05 cs.CV 83%

Human-Object Interaction via Automatically Designed VLM-Guided Motion Policy

通过自动设计的VLM引导运动策略实现人-物交互

Zekai Deng, Ye Shi, Kaiyang Ji, Lan Xu, Shaoli Huang, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) AgiBot

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于VLMs的统一物理框架,通过自动设计的RMD方法实现人-物交互合成,提升了运动生成的自然性和通用性。

Comments iclr camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02609 2026-03-04 cs.CV cs.RO 83%

VLMFusionOcc3D: VLM Assisted Multi-Modal 3D Semantic Occupancy Prediction

VLMFusionOcc3D: 基于VLM的多模态3D语义占位预测

A. Enes Doruk, Hasan F. Ates

机构 * Department of Artificial Intelligence and Data Engineering, Ozyegin University(人工智能与数据工程系,奥克辛大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 VLMFusionOcc3D通过融合视觉语言模型的语义先验,提升多模态3D语义占位预测的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04097 2026-03-03 cs.LG 83%

Do Vision-Language Models Leak What They Learn? Adaptive Token-Weighted Model Inversion Attacks

视觉-语言模型是否会泄露所学内容?基于自适应令牌加权的模型逆向攻击

Ngoc-Bao Nguyen, Sy-Tuyen Ho, Koh Jun Hao, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.LG

AI总结 本研究提出SMI-AW攻击方法,揭示视觉-语言模型在隐私泄露方面的脆弱性,通过自适应令牌加权提升图像重建效果,验证了VLMs在敏感领域中的隐私风险。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00515 2026-03-03 cs.CV 83%

MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence

MLLM-4D: 向基于视觉的空间-时间智能迈进

Xingyilang Yin, Chengzhengxu Li, Jiahao Chang, Chi-Man Pun, Xiaodong Cun

机构 * University of Macau(澳门大学) Xi'an Jiaotong University(西安交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) GVC Lab, Great Bay University(大湾大学GVC实验室)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MLLM-4D通过改进的数据筛选和训练策略,实现了从2D输入中强大的空间-时间理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04395 2026-03-03 cs.CV 83%

Fourier-Attentive Representation Learning: A Fourier-Guided Framework for Few-Shot Generalization in Vision-Language Models

傅里叶-注意力表示学习:一种引导少样本泛化的视觉-语言模型框架

Hieu Dinh Trung Pham, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese German University(越南德语大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出FARL框架,通过傅里叶分析解缠视觉表示,提升视觉-语言模型在少样本场景下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25249 2026-03-02 cs.RO cs.AI 83%

BEV-VLM: Trajectory Planning via Unified BEV Abstraction

BEV-VLM:通过统一的鸟瞰抽象进行轨迹规划

Guancheng Chen, Sheng Yang, Tong Zhan, Jian Wang

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 BEV-VLM通过统一的BEV抽象与VLMs实现高精度轨迹规划,实验显示其在准确性上比现有方法提升53.1%并实现无碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15690 2026-02-24 cs.CV cs.CL 83%

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18766 2026-02-24 cs.CV 83%

Initialization matters in few-shot adaptation of vision-language models for histopathological image classification

初始化在视觉-语言模型少量样本适应中的重要性

Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech)(人类中心技术研究所) Universitat Politécnica de Valencia(巴塞罗那理工大学) Valencian Graduate School and Research Network for Artificial Intelligence (valgrAI)(瓦伦西亚人工智能研究生院和研究网络)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ZS-MIL方法,通过利用视觉-语言模型的类级嵌入优化分类器初始化,提升少量样本场景下的病理图像分类性能。

Comments Accepted as oral presentation at CASEIB 2024 held in Sevilla, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18140 2026-02-24 cs.CV 83%

See-in-Pairs: Reference Image-Guided Comparative Vision-Language Models for Medical Diagnosis

See-in-Pairs: 用于医学诊断的参考图像引导的比较视觉-语言模型

Ruinan Jin, Gexin Huang, Xinwei Shen, Qiong Zhang, Yan Shuo Tan, Xiaoxiao Li

机构 * Electrical and Computer Engineering Department, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) Vector Institute(向量研究所) ETH Zurich(苏黎世联邦理工学院) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 See-in-Pairs通过引入参考图像引导的比较机制,提升医学视觉-语言模型的诊断性能,增强样本效率和视觉-文本对齐。

Comments 25 pages, four figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15549 2026-02-18 cs.RO cs.AI 83%

VLM-DEWM: Dynamic External World Model for Verifiable and Resilient Vision-Language Planning in Manufacturing

VLM-DEWM:动态外部世界模型用于制造中的可验证和抗毁视觉语言规划

Guoqin Tang, Qingxuan Jia, Gang Chen, Tong Li, Zeyuan Huang, Zihang Lv, Ning Ji

机构 * School of Intelligent Engineering and Automation(智能工程与自动化学院)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 VLM-DEWM通过动态外部世界模型提升制造中视觉语言规划的可验证性和抗毁性,显著提高状态跟踪精度和恢复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07849 2026-02-18 cs.AI 83%

LQA: A Lightweight Quantized-Adaptive Framework for Vision-Language Models on the Edge

LQA: 一种轻量级量化自适应框架,用于边缘设备上的视觉-语言模型

Xin Wang, Hong Jia, Hualin Zhou, Sheng Guang Wang, Yu Zhang, Ting Dang, Tao Gu

机构 * School of Computing(计算机学院) Information Systems, University of Melbourne, Melbourne, Australia(信息系统学院,墨尔本大学,澳大利亚墨尔本) Faculty of Science, Auckland, New Zealand(科学学院,新西兰奥克兰) School of Computing, University of Macquarie, Sydney, Australia(计算机学院,麦考瑞大学,澳大利亚悉尼)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 LQA提出了一种轻量级量化自适应框架,用于在边缘设备上高效部署视觉-语言模型,通过选择性混合量化和无梯度适应机制,提升适应性能并降低内存使用。

Comments 15 pages, 9 figures ,9 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08275 2026-02-16 cs.CL cs.AI 83%

MLLM-CTBench: A Benchmark for Continual Instruction Tuning with Reasoning Process Diagnosis

MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断

Haiyun Guo, Zhiyan Hou, Yandu Sun, Jinghan He, Yu Chen, Yuzhe Zhou, Yuheng Jia, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southeast University(东南大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01096 2026-02-16 cs.CV cs.CL 83%

Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages

评估用于低资源语言放射报告生成的视觉语言模型适应

Marco Salmè, Rosa Sicilia, Paolo Soda, Valerio Guarrasi

机构 * Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本研究评估了低资源语言中视觉语言模型在放射报告生成中的适应性,发现语言特定模型和领域特定训练能显著提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12002 2026-02-13 cs.CV 83%

Can Local Vision-Language Models improve Activity Recognition over Vision Transformers? -- Case Study on Newborn Resuscitation

局部视觉-语言模型能否在视觉转换器上提高活动识别?——新生儿复苏案例研究

Enrico Guerriero, Kjersti Engan, Øyvind Meinich-Bache

机构 * University of Stavanger, Dept. of electrical eng. and computer science(斯塔万格大学电气工程与计算机科学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本研究探讨了局部视觉-语言模型在新生儿复苏视频活动识别中的应用,通过LoRA微调提升性能,达到0.91的F1分数,优于TimeSFormer基线。

Comments Presented at the Satellite Workshop on Workshop 15: Generative AI for World Simulations and Communications & Celebrating 40 Years of Excellence in Education: Honoring Professor Aggelos Katsaggelos, IEEE International Conference on Image Processing (ICIP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏