arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2411.19106 2025-01-09 cs.CV 57%

Detailed Object Description with Controllable Dimensions

Xinran Wang, Haiwen Zhang, Baoteng Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00117 2025-01-09 cs.RO cs.LG 57%

Goal Representations for Instruction Following: A Semi-Supervised Language Interface to Control

Vivek Myers, Andre He, Kuan Fang, Homer Walke, Philippe Hansen-Estruch, Ching-An Cheng, Mihai Jalobeanu, Andrey Kolobov, Anca Dragan, Sergey Levine

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments 15 pages, 5 figures

Journal ref Conference on Robot Learning (CoRL), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02751 2025-01-07 eess.IV cs.CV cs.MM 57%

Ultrasound-QBench: Can LLMs Aid in Quality Assessment of Ultrasound Imaging?

Hongyi Miao, Jun Jia, Yankun Cao, Yingjie Zhou, Yanwei Jiang, Zhi Liu, Guangtao Zhai

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20916 2024-12-31 cs.CV 57%

Low-Light Image Enhancement via Generative Perceptual Priors

Han Zhou, Wei Dong, Xiaohong Liu, Yulun Zhang, Guangtao Zhai, Jun Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18604 2024-12-25 cs.CV 57%

Explaining in Diffusion: Explaining a Classifier Through Hierarchical Semantics with Text-to-Image Diffusion Models

Tahira Kazimi, Ritika Allada, Pinar Yanardag

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11892 2024-12-18 cs.CV 57%

From 2D CAD Drawings to 3D Parametric Models: A Vision-Language Approach

Xilin Wang, Jia Zheng, Yuanchao Hu, Hao Zhu, Qian Yu, Zihan Zhou

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments To Appear in AAAI 2025. The project page is at https://manycore-research.github.io/CAD2Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12087 2024-12-17 cs.CV 57%

Instruction-based Image Manipulation by Watching How Things Move

Mingdeng Cao, Xuaner Zhang, Yinqiang Zheng, Zhihao Xia

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Project page: https://ljzycmd.github.io/projects/InstructMove/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10958 2024-12-17 cs.MM cs.CR cs.CV eess.IV 57%

Towards Effective User Attribution for Latent Diffusion Models via Watermark-Informed Blending

Yongyang Pan, Xiaohong Liu, Siqi Luo, Yi Xin, Xiao Guo, Xiaoming Liu, Xiongkuo Min, Guangtao Zhai

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09501 2024-12-13 cs.CV cs.MM 57%

Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition

Zhisheng Zhong, Chengyao Wang, Yuqi Liu, Senqiao Yang, Longxiang Tang, Yuechen Zhang, Jingyao Li, Tianyuan Qu, Yanwei Li, Yukang Chen, Shaozuo Yu, Sitong Wu, Eric Lo, Shu Liu, Jiaya Jia

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08388 2024-12-12 cs.CV 57%

LOMA: Language-assisted Semantic Occupancy Network via Triplane Mamba

Yubo Cui, Zhiheng Li, Jiaqiang Wang, Zheng Fang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06184 2024-12-10 cs.CV 57%

Evaluating Model Perception of Color Illusions in Photorealistic Scenes

Lingjun Mao, Zineng Tang, Alane Suhr

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14229 2024-12-10 cs.RO cs.AI 57%

Words2Contact: Identifying Support Contacts from Verbal Instructions Using Foundation Models

Dionis Totsila, Quentin Rouxel, Jean-Baptiste Mouret, Serena Ivaldi

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05840 2024-12-10 cs.CV 57%

LVP-CLIP:Revisiting CLIP for Continual Learning with Label Vector Pool

Yue Ma, Huantao Ren, Boyu Wang, Jingang Jin, Senem Velipasalar, Qinru Qiu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments submitted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05756 2024-12-10 cs.CV 57%

Compositional Image Retrieval via Instruction-Aware Contrastive Learning

Wenliang Zhong, Weizhi An, Feng Jiang, Hehuan Ma, Yuzhi Guo, Junzhou Huang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10215 2024-12-10 cs.CL cs.LG 57%

DevBench: A multimodal developmental benchmark for language learning

Alvin Wei Ming Tan, Sunny Yu, Bria Long, Wanjing Anya Ma, Tonya Murray, Rebecca D. Silverman, Jason D. Yeatman, Michael C. Frank

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04083 2024-12-06 cs.CV 57%

Unified Framework for Open-World Compositional Zero-shot Learning

Hirunima Jayasekara, Khoi Pham, Nirat Saini, Abhinav Shrivastava

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03297 2024-12-05 cs.CV 57%

Composed Image Retrieval for Training-Free Domain Conversion

Nikos Efthymiadis, Bill Psomas, Zakaria Laskar, Konstantinos Karantzalos, Yannis Avrithis, Ondřej Chum, Giorgos Tolias

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01598 2024-12-05 cs.CV 57%

Learning Prompt with Distribution-Based Feature Replay for Few-Shot Class-Incremental Learning

Zitong Huang, Ze Chen, Zhixing Chen, Erjin Zhou, Xinxing Xu, Rick Siow Mong Goh, Yong Liu, Wangmeng Zuo, Chunmei Feng

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13596 2024-12-02 cs.CV 57%

EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing

Wei Zhang, Miaoxin Cai, Tong Zhang, Jun Li, Yin Zhuang, Xuerui Mao

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16809 2024-11-27 cs.CR cs.AI 57%

Blockchain Meets LLMs: A Living Survey on Bidirectional Integration

Jianghao Gong, Peiqi Yan, Yue Zhang, Hongli An, Logan Liu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16327 2024-11-26 cs.CV 57%

CapHDR2IR: Caption-Driven Transfer from Visible Light to Infrared Domain

Jingchao Peng, Thomas Bashford-Rogers, Zhuang Shao, Haitao Zhao, Aru Ranjan Singh, Abhishek Goswami, Kurt Debattista

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09894 2024-11-18 cs.CV 57%

Free Lunch in Pathology Foundation Model: Task-specific Model Adaptation with Concept-Guided Feature Enhancement

Yanyan Huang, Weiqin Zhao, Yihang Chen, Yu Fu, Lequan Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19674 2024-11-18 cs.CV 57%

Advancing Prompt Learning through an External Layer

Fangming Cui, Xun Yang, Chao Wu, Liang Xiao, Xinmei Tian

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09293 2024-11-15 cs.CV 57%

LLV-FSR: Exploiting Large Language-Vision Prior for Face Super-resolution

Chenyang Wang, Wenjie An, Kui Jiang, Xianming Liu, Junjun Jiang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02346 2024-11-12 cs.CV 57%

Concept Drift and Long-Tailed Distribution in Fine-Grained Visual Categorization: Benchmark and Method

Shuo Ye, Shiming Chen, Ruxin Wang, Tianxu Wu, Jiamiao Xu, Salman Khan, Fahad Shahbaz Khan, Ling Shao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12964 2024-11-11 cs.CV cs.CL 57%

Enhancing Vision-Language Few-Shot Adaptation with Negative Learning

Ce Zhang, Simon Stepputtis, Katia Sycara, Yaqi Xie

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by WACV 2025. Code is available at https://github.com/zhangce01/SimNL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01090 2024-11-08 cs.CV 57%

Learning Multiple Object States from Actions via Large Language Models

Masatoshi Tateno, Takuma Yagi, Ryosuke Furuta, Yoichi Sato

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments This is an accepted WACV 2025 paper. Project page: https://masatate.github.io/ObjStatefromAction.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23907 2024-11-01 cs.CV 57%

IP-MOT: Instance Prompt Learning for Cross-Domain Multi-Object Tracking

Run Luo, Zikai Song, Longze Chen, Yunshui Li, Min Yang, Wei Yang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23676 2024-11-01 cs.CV 57%

Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach

Mathilde Caron, Alireza Fathi, Cordelia Schmid, Ahmet Iscen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19872 2024-11-01 cs.CV 57%

Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration

Kaihang Pan, Zhaoyu Fan, Juncheng Li, Qifan Yu, Hao Fei, Siliang Tang, Richang Hong, Hanwang Zhang, Qianru Sun

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏