arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5030 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5030 篇

2305.07490 2024-04-08 cs.CL cs.CV 83%

ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter

Zhengqing Yuan, Yunhong He, Kun Wang, Yanfang Ye, Lichao Sun

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17830 2024-03-27 cs.CV 83%

Assessment of Multimodal Large Language Models in Alignment with Human Values

Zhelun Shi, Zhipin Wang, Hongxing Fan, Zaibin Zhang, Lijun Li, Yongting Zhang, Zhenfei Yin, Lu Sheng, Yu Qiao, Jing Shao

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2311.02692

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08255 2024-03-12 cs.CV 83%

Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification

Sravanti Addepalli, Ashish Ramayee Asokan, Lakshay Sharma, R. Venkatesh Babu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Project page: http://val.cds.iisc.ac.in/VL2V-ADiP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13103 2024-03-05 cs.CL cs.CV 83%

Exploring Multimodal Large Language Models for Radiology Report Error-checking

Jinge Wu, Yunsoo Kim, Eva C. Keller, Jamie Chow, Adam P. Levine, Nikolas Pontikos, Zina Ibrahim, Paul Taylor, Michelle C. Williams, Honghan Wu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15021 2024-03-04 cs.CV cs.CL 83%

CLoVe: Encoding Compositional Language in Contrastive Vision-Language Models

Santiago Castro, Amir Ziai, Avneesh Saluja, Zhuoning Yuan, Rada Mihalcea

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18010 2024-02-22 cs.CV cs.MM 83%

Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models

Shuai Zhao, Xiaohan Wang, Linchao Zhu, Yi Yang

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments accepted by ICLR 2024, project page at https://mzhaoshuai.github.io/RLCF/, code is at https://github.com/mzhaoshuai/RLCF

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09199 2023-10-19 cs.CV 83%

PaLI-3 Vision Language Models: Smaller, Faster, Stronger

Xi Chen, Xiao Wang, Lucas Beyer, Alexander Kolesnikov, Jialin Wu, Paul Voigtlaender, Basil Mustafa, Sebastian Goodman, Ibrahim Alabdulmohsin, Piotr Padlewski, Daniel Salz, Xi Xiong, Daniel Vlasic, Filip Pavetic, Keran Rong, Tianli Yu, Daniel Keysers, Xiaohua Zhai, Radu Soricut

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07866 2023-09-21 cs.CV 83%

Gradient constrained sharpness-aware prompt learning for vision-language models

Liangchen Liu, Nannan Wang, Dawei Zhou, Xinbo Gao, Decheng Liu, Xi Yang, Tongliang Liu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 19 pages 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13437 2023-09-15 cs.CV 83%

Position-Enhanced Visual Instruction Tuning for Multimodal Large Language Models

Chi Chen, Ruoyu Qin, Fuwen Luo, Xiaoyue Mi, Peng Li, Maosong Sun, Yang Liu

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00661 2023-09-06 cs.CV 83%

Zero-Shot Video Moment Retrieval from Frozen Vision-Language Models

Dezhao Luo, Jiabo Huang, Shaogang Gong, Hailin Jin, Yang Liu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted by WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18786 2023-06-01 cs.CV cs.CL 83%

Scalable Performance Analysis for Vision-Language Models

Santiago Castro, Oana Ignat, Rada Mihalcea

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Camera-ready version for *SEM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17644 2023-04-03 cs.CV 83%

Vision-Language Modelling For Radiological Imaging and Reports In The Low Data Regime

Rhydian Windsor, Amir Jamaludin, Timor Kadir, Andrew Zisserman

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to MIDL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07795 2022-10-17 cs.CL cs.CV 83%

EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning

Tiannan Wang, Wangchunshu Zhou, Yan Zeng, Xinsong Zhang

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01790 2025-07-03 cs.CL cs.AI cs.CV cs.LG 83%

How Do Vision-Language Models Process Conflicting Information Across Modalities?

Tianze Hua, Tian Yun, Ellie Pavlick

机构 * Brown University(布朗大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG;VLM(comments)

Comments All code and resources are available at: https://github.com/ethahtz/vlm_conflicting_info_processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14130 2026-08-17 cs.MM cs.AI cs.CV cs.HC 新提交 82%

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

AlignFace:具有可解释概念关系的人类对齐人脸相似度度量

Ying Huang, Wencan Zhang, Brian Y. Lim

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。

Comments 10 pages, 10 figures, 2 tables, ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10835 2026-08-12 cs.CV cs.LG 新提交 82%

UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations

UniProbe:基于多结构内部表征的可学习大视觉语言模型(VLM) token 级幻觉检测器

Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal Chechik, Haggai Maron

机构 * NVIDIA Research(英伟达研究院) Technion(以色列理工学院) Bar-Ilan University(巴伊兰大学) University of Groningen(格罗宁根大学)

专题命中 VLM训练与架构 :VLM(title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 UniProbe 是基于 LVLM 异构计算轨迹的可学习 token 级幻觉检测器,通过多结构模块交互实现 SOTA 检测性能,解码时可降 55% 对象幻觉且延迟仅增 6%

Comments Project Page: https://research.nvidia.com/labs/par/uniprobe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23488 2026-07-28 cs.LG cs.CV 新提交 82%

Learning Sampling Parameters for Diffusion Models

学习扩散模型的采样参数

Arisrei Lim, Yossi Gandelsman

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。

Comments Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22709 2026-06-29 cs.CV cs.AI 版本更新 82%

Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

基于置信度蒸馏的门控关系对齐用于高效视觉语言模型

Yanlong Chen, Amirhossein Habibian, Luca Benini, Yawei Li

机构 * Department of Information Technology(信息科技系) Electrical Engineering, ETH Zurich, Zurich, Switzerland(电气工程,苏黎世联邦理工学院,苏黎世,瑞士) Qualcomm AI Research, Amsterdam, the Netherlands(高通人工智能研究,阿姆斯特丹,荷兰) Department of Electrical, Electronic and Information Engineering(电气、电子与信息工程系) University of Bologna, Bologna, Italy(博洛尼亚大学,博洛尼亚,意大利) School of Electrical and Electronic Engineering(电气与电子工程学院)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出GRACE框架,通过信息瓶颈原理统一知识蒸馏与量化感知训练,使用置信度门控解耦蒸馏、关系中心核对齐和自适应控制器,在INT4量化下实现性能超越FP16基线并接近教师模型,同时显著降低内存和提升吞吐量。

Comments Accepted to the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11670 2026-06-11 cs.CV cs.AI 新提交 82%

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成

Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

机构 * Peking University(北京大学) Kuaishou Technology(快手科技) Xiamen University(厦门大学)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11661 2026-06-11 cs.CV cs.LG 新提交 82%

Learning Instance-Adaptive Low-Rank Orthogonal Subspaces for Clothes-Changing Person Re-Identification

学习实例自适应低秩正交子空间用于换衣行人重识别

Dong-Woo Kim, Tae-Kyun Kim

机构 * Dongwoo Kim(金东吾) Tae-Kyun Kim(金泰勋)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 提出Ortho-ReID方法,通过从VLM文本描述中显式建模低秩服装子空间,并利用几何约束提取服装不变特征,在多个基准数据集上取得最优性能。

Comments Accepted to the ICML 2026 Workshop on CoLoRAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19111 2026-05-20 cs.CV cs.AI 82%

FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

FAGER:基于事实的文本到图像模型评估与改进

Youngsun Lim, Cusuh Ham, Pin-Yu Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Adobe(Adobe公司) IBM Research(IBM研究院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FAGER框架,用于评估和改进文本到图像模型的事实准确性,通过结合LLM生成事实和参考引导的视觉事实提取与验证,构建结构化事实评估标准,并通过VLM进行评估,验证FAGER在事实性测试中优于现有方法,并能无训练改进T2I输出。

Comments It was accepted for an oral presentation at the 2nd Workshop on the Evaluation of Generative Foundation Models (EVGENFM2026) at CVPR 2026. Total 8 pages (1 page for references). 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16732 2026-05-19 cs.CV cs.LG 82%

DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers

DiRotQ:面向4位扩散变换器的旋转感知量化

Sayeh Sharify, Mahsa Salmani, Hesham Mostafa

机构 * d-Matrix

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 本文提出DiRotQ,一种W4A4量化框架,通过旋转感知激活量化缓解扩散变换器在4位精度下的性能下降问题,同时引入VLM-as-a-Judge评估协议和Triton定制内核提升压缩下的效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 82%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27389 2026-05-14 cs.CV cs.AI 82%

COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

COHERENCE:在交错多模态上下文中细粒度图像-文本对齐的基准测试

Bingli Wang, Huanze Tang, Haijun Lv, Zhishan Lin, Lixin Gu, Lei Feng, Qipeng Guo, Kai Chen

机构 * Southeast University Shanghai AI Laboratory(上海大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 COHERENCE旨在评估MLLM在交错多模态上下文中恢复细粒度图像-文本对应关系的能力,涵盖四个领域,包含6161个高质量问题,并进行六类错误分析以识别当前MLLM的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08404 2026-05-12 cs.CL cs.AI cs.CV cs.ET 82%

Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models

利用大视觉-语言模型从遥感图像中推导建成环境

Dongdong Wang, Deepak Balakrishnan, Ravi Srinivasan, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系)

专题命中 VLM训练与架构 :InternVL(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了大语言模型在智慧城市中的应用,通过多尺度遥感图像输入多模态语言模型,评估其对建成环境推理的影响,并比较了InternVL和Qwen等先进模型在生成建成环境建议中的准确性和可靠性。

Comments Published in the International Conference on Industrialized Construction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 82%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11515 2025-06-16 cs.CV cs.CL cs.LG 82%

Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs

Xiao Xu, Libo Qin, Wanxiang Che, Min-Yen Kan

机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology(社会计算与信息检索研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 VLM训练与架构 :VLM(abstract);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). June 2025. DOI: https://doi.org/10.1109/TCSVT.2025.3578266

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06960 2023-12-13 cs.CV cs.LG 82%

Remote Sensing Vision-Language Foundation Models without Annotations via Ground Remote Alignment

Utkarsh Mall, Cheng Perng Phoo, Meilin Kelsey Liu, Carl Vondrick, Bharath Hariharan, Kavita Bala

专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00653 2023-10-03 cs.CV cs.AI 82%

Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants

Tianyu Yu, Jinyi Hu, Yuan Yao, Haoye Zhang, Yue Zhao, Chongyi Wang, Shan Wang, Yinxv Pan, Jiao Xue, Dahai Li, Zhiyuan Liu, Hai-Tao Zheng, Maosong Sun

专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);LLaVA(abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08891 2026-08-13 cs.CE 版本更新 82%

Ortho2CAD: 3D CAD generation from orthographic drawings using vision language models

Ortho2CAD:使用视觉语言模型从正投影图生成3D CAD

Aditya Joglekar, Amit Regmi, Kenji Shimada, Levent Burak Kara

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)

AI总结 研究旨在解决工程设计中从正投影图到3D CAD模型转换的问题,核心方法是利用视觉语言模型Ortho2CAD,通过监督微调与强化学习训练,借助绘图生成器实现大规模学习,主要贡献是代码有效率高且3D CAD精度超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏