arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2503.13108 2025-03-18 cs.CV cs.AI 62%

Lifting the Veil on Visual Information Flow in MLLMs: Unlocking Pathways to Faster Inference

Hao Yin, Guangzong Si, Zilei Wang

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12834 2025-03-18 cs.CV cs.AI 62%

PASTA: Part-Aware Sketch-to-3D Shape Generation with Text-Aligned Prior

Seunggwan Lee, Hwanhee Jung, Byoungsoo Koh, Qixing Huang, Sangho Yoon, Sangpil Kim

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12326 2025-03-18 cs.CV cond-mat.mtrl-sci cs.AI 62%

Leveraging Vision Capabilities of Multimodal LLMs for Automated Data Extraction from Plots

Maciej P. Polak, Dane Morgan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12281 2025-03-18 cs.CV cs.LG 62%

Exploration of VLMs for Driver Monitoring Systems Applications

Paola Natalia Cañas, Marcos Nieto, Oihana Otaegui, Igor Rodríguez

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted in 16th ITS European Congress, Seville, Spain, 19-21 May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02155 2025-03-11 cs.AI cs.CL cs.CV 62%

From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities

Wanpeng Zhang, Zilong Xie, Yicheng Feng, Yijiang Li, Xingrun Xing, Sipeng Zheng, Zongqing Lu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19527 2025-03-10 cs.AI cs.CV cs.CY 62%

BuildingView: Constructing Urban Building Exteriors Databases with Street View Imagery and Multimodal Large Language Mode

Zongrong Li, Yunlei Su, Hongrong Wang, Wufan Zhao

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00726 2025-03-04 cs.GR cs.AI cs.CV 62%

Enhancing Monocular 3D Scene Completion with Diffusion Model

Changlin Song, Jiaqi Wang, Liyun Zhu, He Weng

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments All authors had equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17516 2025-02-26 cs.LG cs.AI 62%

A Survey on Mechanistic Interpretability for Multi-Modal Foundation Models

Zihao Lin, Samyadeep Basu, Mohammad Beigi, Varun Manjunatha, Ryan A. Rossi, Zichao Wang, Yufan Zhou, Sriram Balasubramanian, Arman Zarei, Keivan Rezaei, Ying Shen, Barry Menglong Yao, Zhiyang Xu, Qin Liu, Yuxiang Zhang, Yan Sun, Shilong Liu, Li Shen, Hongxuan Li, Soheil Feizi, Lifu Huang

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 30 pages, 4 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06875 2025-02-12 cs.CV cs.AI cs.CL 62%

Beyond Vision: How Large Language Models Interpret Facial Expressions from Valence-Arousal Values

Vaibhav Mehra, Guy Laban, Hatice Gunes

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04923 2025-02-10 cs.CV cs.AI 62%

Cached Multi-Lora Composition for Multi-Concept Image Generation

Xiandong Zou, Mingzhu Shen, Christos-Savvas Bouganis, Yiren Zhao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI

Comments The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04353 2025-02-10 cs.CL cs.AI cs.CV 62%

CognArtive: Large Language Models for Automating Art Analysis and Decoding Aesthetic Elements

Afshin Khadangi, Amir Sartipi, Igor Tchappi, Gilbert Fridgen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17586 2025-01-31 cs.CV cs.LG 62%

Boosting Weak Positives for Text Based Person Search

Akshay Modi, Ashhar Aziz, Nilanjana Chatterjee, A V Subramanyam

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16404 2025-01-29 cs.LG cs.AI cs.CL 62%

DynaPrompt: Dynamic Test-Time Prompt Tuning

Zehao Xiao, Shilin Yan, Jack Hong, Jiayin Cai, Xiaolong Jiang, Yao Hu, Jiayi Shen, Qi Wang, Cees G. M. Snoek

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14189 2025-01-27 cs.AI cs.LG cs.MA 62%

Distributed Multi-Agent Coordination Using Multi-Modal Foundation Models

Saaduddin Mahmud, Dorian Benhamou Goldfajn, Shlomo Zilberstein

专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01432 2025-01-17 cs.CV cs.LG 62%

VLG-CBM: Training Concept Bottleneck Models with Vision-Language Guidance

Divyansh Srivastava, Ge Yan, Tsui-Wei Weng

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Appeared at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04695 2025-01-09 cs.LG cs.CV cs.IR cs.IT math.IT 62%

Re-ranking the Context for Multimodal Retrieval Augmented Generation

Matin Mortaheb, Mohammad A. Amir Khojastepour, Srimat T. Chakradhar, Sennur Ulukus

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00546 2025-01-08 cs.AI cs.LG 62%

AllSpark: A Multimodal Spatio-Temporal General Intelligence Model with Ten Modalities via Language as a Reference Framework

Run Shao, Cheng Yang, Qiujun Li, Qing Zhu, Yongjun Zhang, YanSheng Li, Yu Liu, Yong Tang, Dapeng Liu, Shizhong Yang, Haifeng Li

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 19 tables, 3 figures

Journal ref IEEE Transactions on Geoscience and Remote Sensing. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02922 2025-01-07 cs.CV cs.AI 62%

Label-free Concept Based Multiple Instance Learning for Gigapixel Histopathology

Susu Sun, Leslie Tessier, Frédérique Meeuwsen, Clément Grisi, Dominique van Midden, Geert Litjens, Christian F. Baumgartner

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00340 2025-01-06 cs.CV cs.LG 62%

Dynamic Prompt Adjustment for Multi-Label Class-Incremental Learning

Haifeng Zhao, Yuguang Jin, Leilei Ma

专题命中 其他VLM :visual language model(abstract);分类 cs.CV、cs.LG

Comments published to BICS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17251 2024-12-24 cs.CV cs.LG eess.IV 62%

GCS-M3VLT: Guided Context Self-Attention based Multi-modal Medical Vision Language Transformer for Retinal Image Captioning

Teja Krishna Cherukuri, Nagur Shareef Shaik, Jyostna Devi Bodapati, Dong Hye Ye

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments This paper has been accepted for presentation at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03556 2024-12-23 cs.CL cs.AI cs.LG 62%

Best-of-N Jailbreaking

John Hughes, Sara Price, Aengus Lynch, Rylan Schaeffer, Fazl Barez, Sanmi Koyejo, Henry Sleight, Erik Jones, Ethan Perez, Mrinank Sharma

专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08271 2024-12-12 cs.CV cs.AI 62%

Position-aware Guided Point Cloud Completion with CLIP Model

Feng Zhou, Qi Zhang, Ju Dai, Lei Li, Qing Fan, Junliang Xing

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02779 2024-12-10 cs.LG cs.AI cs.ET 62%

Synergistic Development of Perovskite Memristors and Algorithms for Robust Analog Computing

Nanyang Ye, Qiao Sun, Yifei Wang, Liujia Yang, Jundong Zhou, Lei Wang, Guang-Zhong Yang, Xinbing Wang, Chenghu Zhou, Wei Ren, Leilei Gu, Huaqiang Wu, Qinying Gu

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13853 2024-12-10 cs.RO cs.AI cs.CV 62%

RealDex: Towards Human-like Grasping for Robotic Dexterous Hand

Yumeng Liu, Yaxun Yang, Youzhuo Wang, Xiaofei Wu, Jiamin Wang, Yichen Yao, Sören Schwertfeger, Sibei Yang, Wenping Wang, Jingyi Yu, Xuming He, Yuexin Ma

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://4dvlab.github.io/RealDex_page/

Journal ref Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00754 2024-12-02 cs.CV cs.LG 62%

CLIPArTT: Adaptation of CLIP to New Domains at Test Time

Gustavo Adolfo Vargas Hakim, David Osowiechi, Mehrdad Noori, Milad Cheraghalikhani, Ali Bahri, Moslem Yazdanpanah, Ismail Ben Ayed, Christian Desrosiers

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18101 2024-11-28 cs.CV cs.LG 62%

Aligning Knowledge Concepts to Whole Slide Images for Precise Histopathology Image Analysis

Weiqin Zhao, Ziyu Guo, Yinshuang Fan, Yuming Jiang, Maximus Yeung, Lequan Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15488 2024-11-26 cs.CL cs.AI cs.CV 62%

Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark

Rong-Cheng Tu, Zi-Ao Ma, Tian Lan, Yuehao Zhao, Heyan Huang, Xian-Ling Mao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02537 2024-11-12 cs.CV cs.AI cs.CL cs.IR 62%

INQUIRE: A Natural World Text-to-Image Retrieval Benchmark

Edward Vendrow, Omiros Pantazis, Alexander Shepard, Gabriel Brostow, Kate E. Jones, Oisin Mac Aodha, Sara Beery, Grant Van Horn

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Published in NeurIPS 2024, Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03531 2024-11-07 cs.CV cs.AI 62%

Personalized Video Summarization by Multimodal Video Understanding

Brian Chen, Xiangyuan Zhao, Yingnan Zhu

专题命中 其他VLM :visual language model(abstract);分类 cs.CV、cs.AI

Comments In Proceedings of CIKM 2024 Applied Research Track

Journal ref 33rd ACM International Conference on Information and Knowledge Management (CIKM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02437 2024-11-06 cs.CV cs.AI 62%

TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models

Georgia Gabriela Sampaio, Ruixiang Zhang, Shuangfei Zhai, Jiatao Gu, Josh Susskind, Navdeep Jaitly, Yizhe Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏