arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2408.11305 2024-10-15 cs.CV cs.AI 76%

UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation

Xiangyu Zhao, Yuehan Zhang, Wenlong Zhang, Xiao-Ming Wu

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI

Comments Accepted by EMNLP 2024, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15534 2024-09-25 cs.LG cs.AI cs.CL q-bio.QM 76%

Geneverse: A collection of Open-source Multimodal Large Language Models for Genomic and Proteomic Research

Tianyu Liu, Yijia Xiao, Xiao Luo, Hua Xu, W. Jim Zheng, Hongyu Zhao

专题命中 其他VLM :multimodal large language model(title);分类 cs.AI、cs.LG

Comments 8 pages

Journal ref EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08864 2024-09-16 cs.LG cs.AI 76%

Exploring Graph Structure Comprehension Ability of Multimodal Large Language Models: Case Studies

Zhiqiang Zhong, Davide Mottin

专题命中 其他VLM :multimodal large language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01821 2024-09-05 cs.CV cs.LG 76%

When Does Visual Prompting Outperform Linear Probing for Vision-Language Models? A Likelihood Perspective

Hsi-Ai Tsao, Lei Hsiung, Pin-Yu Chen, Tsung-Yi Ho

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09100 2024-07-02 cs.CV cs.CL cs.LG 76%

Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models

Xinyang Liu, Dongsheng Wang, Bowei Fang, Miaoge Li, Zhibin Duan, Yishi Xu, Bo Chen, Mingyuan Zhou

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG

Comments Accepted by UAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00675 2024-05-28 cs.CV cs.AI 76%

LLM meets Vision-Language Models for Zero-Shot One-Class Classification

Yassir Bendou, Giulia Lioi, Bastien Pasdeloup, Lukas Mauch, Ghouthi Boukli Hacene, Fabien Cardinaux, Vincent Gripon

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10286 2024-05-17 cs.CV cs.AI 76%

FFF: Fixing Flawed Foundations in contrastive pre-training results in very strong Vision-Language models

Adrian Bulat, Yassine Ouali, Georgios Tzimiropoulos

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI

Comments Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14245 2024-02-23 cs.RO cs.AI cs.LG 76%

Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models

Jinyi Liu, Yifu Yuan, Jianye Hao, Fei Ni, Lingzhi Fu, Yibin Chen, Yan Zheng

专题命中 其他VLM :multimodal large language model(title);分类 cs.AI、cs.LG

Comments Presented at AAAI 2024 RL+LLMs Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06560 2024-02-12 cs.CV cs.LG 76%

Video Annotator: A framework for efficiently building video classifiers using vision-language models and active learning

Amir Ziai, Aneesh Vartakavi

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG

Comments Submitted for review to KDD '24 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13013 2023-10-18 cs.LG cs.CV 76%

Stable and low-precision training for large-scale vision-language models

Mitchell Wortsman, Tim Dettmers, Luke Zettlemoyer, Ari Morcos, Ali Farhadi, Ludwig Schmidt

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07699 2023-02-20 cs.CV cs.CL cs.LG 76%

Write and Paint: Generative Vision-Language Models are Unified Modal Learners

Shizhe Diao, Wangchunshu Zhou, Xinsong Zhang, Jiawei Wang

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG

Comments ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20646 2026-05-21 cs.SI 75%

DisImpact: Quantifying the Physi-Social Impact of Natural Disasters Through Social Media

DisImpact:通过社交媒体量化自然灾害的生理-社会影响

Ruichen Yao, Tejna Dasari, Xuanyu Meng, Elliot Cao, Zelin Li, Yifan Liu, Yaokun Liu, Lanyu Shang, Dong Wang

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文提出DisImpact框架,利用多模态大语言模型系统量化自然灾害的生理和社会影响,通过社交媒体内容分类和构建灾害影响指数,实现对灾害影响的统一表示和分析。

Comments Accepted by ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00114 2026-04-20 cs.CV cs.AI cs.LG 75%

1S-DAug: One-Shot Data Augmentation for Robust Few-Shot Generalization

1S-DAug:一种用于鲁棒少样本泛化的单次数据增强

Yunwei Bai, Ying Kiat Tan, Yao Shu, Tsuhan Chen

机构 * National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他VLM :vision language model(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出1S-DAug,一种基于单例图像生成多样且忠实变体的生成增强算子,通过结合传统几何扰动、受控噪声注入和去噪扩散过程,提升少样本分类性能,实现在多个基准测试中提升20%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05148 2025-08-12 cs.CV cs.AI cs.LG 75%

LoRA.rar: Learning to Merge LoRAs via Hypernetworks for Subject-Style Conditioned Image Generation

Donald Shenaj, Ondrej Bohdal, Mete Ozay, Pietro Zanuttigh, Umberto Michieli

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICCV 2025. Project page: https://donaldssh.github.io/LoRA.rar

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11925 2025-03-11 cs.AI cs.CV cs.LG 75%

GRAPHGPT-O: Synergistic Multimodal Comprehension and Generation on Graphs

Yi Fang, Bowen Jin, Jiacheng Shen, Sirui Ding, Qiaoyu Tan, Jiawei Han

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05505 2026-08-07 cs.CV 新提交 74%

DynaPix: Can Vision-Language Models Identify the Exact Future?

DynaPix:视觉语言模型能否识别准确的未来?

Thong Nguyen, Vinh-Hien Do, Quynh Vo, Cong-Duy Nguyen, See-Kiong Ng

机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) National University of Singapore(新加坡国立大学)

专题命中 其他VLM :vision-language model(title);分类 cs.CV

AI总结 研究构建基准DynaPix,发现视觉语言模型能较好将预测与事件关联,但难以锚定时间,经模拟器真实记录训练可改善多数问题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12217 2026-05-20 cs.CV 74%

HyperCap: Hyperspectral Land Cover Captioning Dataset for Vision Language Models

HyperCap:面向视觉语言模型的超光谱土地覆盖描述数据集

Aryan Das, Tanishq Rachamalla, Pravendra Singh, Koushik Biswas, Vinay Kumar Verma, Salvador Garcia, Antonio Plaza, Swalpa Kumar Roy

机构 * Department of Computer Science and Engineering, Vellore Institute of Technology(计算机科学与工程系,维洛雷理工学院) Department of Information Technology, Siddhartha Academy of Higher Education(信息技术系,斯里达拉塔高等教育学院) Department of Computer Science and Engineering, Indian Institute of Technology, Roorkee(计算机科学与工程系,印度理工学院罗尔基分校) Department of Computer Science and Engineering, Indraprastha Institute of Information Technology Delhi(计算机科学与工程系,印度信息技术学院德里) Department of Computer Science and Engineering, Indian Institute of Technology, Kanpur(计算机科学与工程系,印度理工学院坎浦尔) Department of Computer Science and Artificial Intelligence, University of Granada(计算机科学与人工智能系,格拉纳达大学) Hyperspectral Computing Laboratory, Department of Computers and Communications, University of Extremadura(超光谱计算实验室,计算机与通信系,埃斯特拉达大学)

专题命中 其他VLM :vision language model(title);分类 cs.CV

AI总结 本文提出HyperCap数据集,通过整合光谱数据与像素级文本标注,提升遥感应用中的模型性能,为未来研究提供基础资源。

Comments Accepted for publication in IEEE Geoscience and Remote Sensing Magazine (GRSM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09833 2026-03-23 cs.LG 74%

ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking

ACT作为人类:多模态大语言模型数据标注中的批判性思维

Lequan Lin, Dai Shi, Andi Han, Feng Chen, Qiuzheng Chen, Jiawen Li, Zhaoyang Li, Jiyuan Li, Zhenbang Sun, Junbin Gao

机构 * University of Sydney(悉尼大学) University of Cambridge(剑桥大学) Riken AIP(理化学研究所AIP分所) University of Adelaide(阿德莱德大学) ByteDance Australia(字节跳动澳大利亚)

专题命中 其他VLM :multimodal large language model(title);分类 cs.LG

AI总结 本文提出ACT标注框架,利用大语言模型作为评判者提高标注效率,通过批判性思维识别潜在错误,减少人工成本,提升标注质量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23088 2026-02-27 cs.CV 74%

Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy

词中结构:用于人类大脑显微镜的弱监督视觉-语言建模

Matthew Sutton, Katrin Amunts, Timo Dickscheid, Christian Schiffer

机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)

专题命中 其他VLM :vision-language model(title);分类 cs.CV

AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。

Comments 8 pages, 3 figures, submitted for inclusion at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01127 2026-02-03 cs.CV 74%

Koo-Fu CLIP: Closed-Form Adaptation of Vision-Language Models via Fukunaga-Koontz Linear Discriminant Analysis

Koo-Fu CLIP:通过Fukunaga-Koontz线性判别分析实现视觉语言模型的闭式适应

Matej Suchanek, Klara Janouskova, Ondrej Vasatko, Jiri Matas

机构 * Visual Recognition Group(视觉识别组) Department of Cybernetics(cybernetics系) Faculty of Electrical Engineering(电气工程系) Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 其他VLM :vision-language model(title);分类 cs.CV

AI总结 Koo-Fu CLIP通过Fukunaga-Koontz线性判别分析实现视觉语言模型的闭式适应,提升类别分离性和降维效率,实现高效的大规模分类与检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19676 2025-11-26 cs.CV 74%

INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models

INTERLACE:大规模视觉-语言模型中的交错层剪枝与高效适应

Parsa Madinei, Ryan Solgi, Ziqi Wen, Jonathan Skaza, Miguel Eckstein, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 其他VLM :vision-language model(title);分类 cs.CV

AI总结 INTERLACE通过交错微调冻结设计,在剪枝25%网络后实现88.9%的性能保留,达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08054 2025-10-13 cs.CV 74%

RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models

Moon Ye-Bin, Roy Miles, Tae-Hyun Oh, Ismail Elezi, Jiankang Deng

机构 * POSTECH Huawei London Research Center(华为伦敦研究中心) KAIST(韩国科学技术院) Imperial College London(伦敦帝国理工学院)

专题命中 其他VLM :vision language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03497 2025-08-15 cs.CV 74%

EditGarment: An Instruction-Based Garment Editing Dataset Constructed with Automated MLLM Synthesis and Semantic-Aware Evaluation

Deqiang Yin, Junyi Guo, Huanda Lu, Fangyu Wu, Dongming Lu

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) NingboTech University(宁波科技学院) Zhejiang University(浙江大学)

专题命中 其他VLM :MLLM(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05790 2025-07-09 cs.CV 74%

TalkFashion: Intelligent Virtual Try-On Assistant Based on Multimodal Large Language Model

Yujie Hu, Xuanyu Zhang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University, China(北京大学电子与计算机工程学院) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 其他VLM :multimodal large language model(title);分类 cs.CV

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23856 2025-07-01 cs.CV 74%

A Closer Look at Conditional Prompt Tuning for Vision-Language Models

Ji Zhang, Shihan Wu, Lianli Gao, Jingkuan Song, Nicu Sebe, Heng Tao Shen

机构 * Southwest Jiaotong University(西南交通大学) University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学) University of Trento(特伦特大学)

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15668 2025-06-27 cs.CV 74%

What Do You See? Enhancing Zero-Shot Image Classification with Multimodal Large Language Models

Abdelrahman Abdelhamed, Mahmoud Afifi, Alec Go

机构 * Google Research(谷歌研究)

专题命中 其他VLM :multimodal large language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07956 2025-05-20 cs.LG cs.NE cs.SC 74%

Symbolic Regression with Multimodal Large Language Models and Kolmogorov Arnold Networks

Thomas R. Harvey, Fabian Ruehle, Kit Fraser-Taliente, James Halverson

机构 * NSF AI Institute for Fundamental Interactions, MIT, Cambridge, MA 02139, USA(NSF人工智能基础相互作用研究所,麻省理工学院,剑桥,马萨诸塞州,02139,美国) Department of Physics, Northeastern University, Boston, MA 02115, USA(物理系,东北大学,波士顿,马萨诸塞州,02115,美国) Department of Mathematics, Northeastern University, Boston, MA 02115, USA(数学系,东北大学,波士顿,马萨诸塞州,02115,美国) Rudolf Peierls Centre for Theoretical Physics, University of Oxford, Oxford OX1 2JD, UK(鲁道夫·佩尔尔斯理论物理中心,牛津大学,牛津 OX1 2JD,英国)

专题命中 其他VLM :multimodal large language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21051 2025-05-01 cs.LG cs.CL cs.MM 74%

Multimodal Large Language Models for Medicine: A Comprehensive Survey

Jiarui Ye, Hao Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 其他VLM :multimodal large language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10573 2025-04-17 cs.CV 74%

Queryable Prototype Multiple Instance Learning with Vision-Language Models for Incremental Whole Slide Image Classification

Jiaxiang Gou, Luping Ji, Pei Liu, Mao Ye

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21483 2025-03-28 cs.CV 74%

BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding

Shuming Liu, Chen Zhao, Tianqi Xu, Bernard Ghanem

专题命中 其他VLM :vision-language model(title);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏