arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2408.03695 2024-08-08 cs.CV 57%

Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling

Zilyu Ye, Jinxiu Liu, Ruotian Peng, Jinjin Cao, Zhiyang Chen, Yiyang Zhang, Ziwei Xuan, Mingyuan Zhou, Xiaoqian Shen, Mohamed Elhoseiny, Qi Liu, Guo-Jun Qi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03149 2024-08-07 cs.CV cs.CL 57%

Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization

Yanghai Zhang, Ye Liu, Shiwei Wu, Kai Zhang, Xukai Liu, Qi Liu, Enhong Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments In ACL-Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19981 2024-08-06 cs.CV 57%

'Person' == Light-skinned, Western Man, and Sexualization of Women of Color: Stereotypes in Stable Diffusion

Sourojit Ghosh, Aylin Caliskan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Upcoming publication, Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17100 2024-08-02 cs.CV 57%

Open-Set Video-based Facial Expression Recognition with Human Expression-sensitive Prompting

Yuanyuan Liu, Yuxuan Huang, Shuyang Liu, Yibing Zhan, Zijing Chen, Zhe Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20920 2024-07-31 cs.CV 57%

SSPA: Split-and-Synthesize Prompting with Gated Alignments for Multi-Label Image Recognition

Hao Tan, Zichang Tan, Jun Li, Jun Wan, Zhen Lei, Stan Z. Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15587 2024-07-30 cs.CV 57%

Composed Image Retrieval for Remote Sensing

Bill Psomas, Ioannis Kakogeorgiou, Nikos Efthymiadis, Giorgos Tolias, Ondrej Chum, Yannis Avrithis, Konstantinos Karantzalos

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted for ORAL presentation at the 2024 IEEE International Geoscience and Remote Sensing Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02364 2024-07-30 cs.CV 57%

What's in a Name? Beyond Class Indices for Image Recognition

Kai Han, Xiaohu Huang, Yandong Li, Sagar Vaze, Jie Li, Xuhui Jia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments CVPR 2024 Workshop on Computer Vision in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18589 2024-07-29 cs.CV 57%

HICEScore: A Hierarchical Metric for Image Captioning Evaluation

Zequn Zeng, Jianqiao Sun, Hao Zhang, Tiansheng Wen, Yudi Su, Yan Xie, Zhengjue Wang, Bo Chen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18121 2024-07-26 cs.CV 57%

Efficient Inference of Vision Instruction-Following Models with Elastic Cache

Zuyan Liu, Benlin Liu, Jiahui Wang, Yuhao Dong, Guangyi Chen, Yongming Rao, Ranjay Krishna, Jiwen Lu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05049 2024-07-22 cs.CV 57%

XPSR: Cross-modal Priors for Diffusion-based Image Super-Resolution

Yunpeng Qu, Kun Yuan, Kai Zhao, Qizhi Xie, Jinhua Hao, Ming Sun, Chao Zhou

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments 19 pages, 7 figures; including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12023 2024-07-18 cs.CL cs.AI 57%

CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models

Zhong-Zhi Li, Ming-Liang Zhang, Fei Yin, Zhi-Long Ji, Jin-Feng Bai, Zhen-Ru Pan, Fan-Hu Zeng, Jian Xu, Jia-Xin Zhang, Cheng-Lin Liu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11375 2024-07-17 cs.CV 57%

Mask-Free Neuron Concept Annotation for Interpreting Neural Networks in Medical Domain

Hyeon Bae Kim, Yong Hyun Ahn, Seong Tae Kim

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11001 2024-07-17 cs.CL cs.LG 57%

Generative AI Systems: A Systems-based Perspective on Generative AI

Jakub M. Tomczak

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14428 2024-07-11 cs.CV 57%

Prompting Language-Informed Distribution for Compositional Zero-Shot Learning

Wentao Bao, Lichang Chen, Heng Huang, Yu Kong

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

Comments ECCV 2024 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05795 2024-07-10 cs.CV 57%

HyCIR: Boosting Zero-Shot Composed Image Retrieval with Synthetic Labels

Yingying Jiang, Hanchao Jia, Xiaobing Wang, Peng Hao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19092 2024-07-09 cs.CV 57%

Benchmarking and Improving Detail Image Caption

Hongyuan Dong, Jiawen Li, Bohong Wu, Jiacong Wang, Yuan Zhang, Haoyuan Guo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03636 2024-07-08 cs.CV 57%

Diff-Restorer: Unleashing Visual Prompts for Diffusion-based Universal Image Restoration

Yuhong Zhang, Hengsheng Zhang, Xinning Chai, Zhengxue Cheng, Rong Xie, Li Song, Wenjun Zhang

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01842 2024-07-03 cs.CV 57%

CLIP the Divergence: Language-guided Unsupervised Domain Adaptation

Jinjing Zhu, Yucheng Chen, Lin Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01155 2024-07-02 cs.LG 57%

CPT: Consistent Proxy Tuning for Black-box Optimization

Yuanyang He, Zitong Huang, Xinxing Xu, Rick Siow Mong Goh, Salman Khan, Wangmeng Zuo, Yong Liu, Chun-Mei Feng

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments 10 pages,2 figures plus supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14676 2024-07-02 cs.CV cs.GR 57%

DreamPBR: Text-driven Generation of High-resolution SVBRDF with Multi-modal Guidance

Linxuan Xin, Zheng Zhang, Jinfu Wei, Wei Gao, Duan Gao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16476 2024-06-25 cs.CV 57%

ResMaster: Mastering High-Resolution Image Generation via Structural and Fine-Grained Guidance

Shuwei Shi, Wenbo Li, Yuechen Zhang, Jingwen He, Biao Gong, Yinqiang Zheng

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05760 2024-06-25 cs.CV cs.CL 57%

Similarity Guided Multimodal Fusion Transformer for Semantic Location Prediction in Social Media

Zhizhen Zhang, Ning Wang, Haojie Li, Zhihui Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02415 2024-06-18 cs.AI 57%

Biologically-Motivated Learning Model for Instructed Visual Processing

Roy Abel, Shimon Ullman

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08572 2024-06-14 cs.CV 57%

LLM-assisted Concept Discovery: Automatically Identifying and Explaining Neuron Functions

Nhat Hoang-Xuan, Minh Vu, My T. Thai

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07236 2024-06-12 cs.LG 57%

Let Go of Your Labels with Unsupervised Transfer

Artyom Gadetsky, Yulun Jiang, Maria Brbic

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments ICML 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01449 2024-06-04 cs.CV 57%

SLANT: Spurious Logo ANalysis Toolkit

Maan Qraitem, Piotr Teterwak, Kate Saenko, Bryan A. Plummer

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03161 2024-06-04 cs.CV cs.CL 57%

Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization

Yang Jin, Zhicheng Sun, Kun Xu, Kun Xu, Liwei Chen, Hao Jiang, Quzhe Huang, Chengru Song, Yuliang Liu, Di Zhang, Yang Song, Kun Gai, Yadong Mu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19267 2024-05-24 cs.CL cs.AI 57%

MineLand: Simulating Large-Scale Multi-Agent Interactions with Limited Multimodal Senses and Physical Needs

Xianhao Yu, Jiaqi Fu, Renjia Deng, Wenjuan Han

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments Project website: https://github.com/cocacola-lab/MineLand

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10140 2024-05-17 cs.CV 57%

Libra: Building Decoupled Vision System on Large Language Models

Yifan Xu, Xiaoshan Yang, Yaguang Song, Changsheng Xu

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

Comments ICML2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02234 2024-05-08 cs.CV 57%

3DTopia: Large Text-to-3D Generation Model with Hybrid Diffusion Priors

Fangzhou Hong, Jiaxiang Tang, Ziang Cao, Min Shi, Tong Wu, Zhaoxi Chen, Shuai Yang, Tengfei Wang, Liang Pan, Dahua Lin, Ziwei Liu

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

Comments Code available at https://github.com/3DTopia/3DTopia

详情

展开后加载摘要…

URL PDF HTML 收藏