arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2412.01814 2025-03-27 cs.CV cs.AI cs.CL cs.LG 67%

COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training

Sanghwan Kim, Rui Xiao, Mariana-Iuliana Georgescu, Stephan Alaniz, Zeynep Akata

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14526 2025-03-27 cs.CV cs.AI cs.CY cs.LG 67%

Fantastic Copyrighted Beasts and How (Not) to Generate Them

Luxi He, Yangsibo Huang, Weijia Shi, Tinghao Xie, Haotian Liu, Yue Wang, Luke Zettlemoyer, Chiyuan Zhang, Danqi Chen, Peter Henderson

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02000 2025-03-19 cs.AI cs.CV cs.LG 67%

Bridging Neural and Symbolic Representations with Transitional Dictionary Learning

Junyan Cheng, Peter Chin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12780 2025-03-18 cs.CV cs.AI cs.LG eess.IV stat.ML 67%

LangDA: Building Context-Awareness via Language for Domain Adaptive Semantic Segmentation

Chang Liu, Bavesh Balaji, Saad Hossain, C Thomas, Kwei-Herng Lai, Raviteja Vemulapalli, Alexander Wong, Sirisha Rambhatla

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06427 2025-03-11 cs.LG cs.AI cs.CV 67%

Pre-Training Meta-Rule Selection Policy for Visual Generative Abductive Learning

Yu Jin, Jingming Liu, Zhexu Luo, Yifei Peng, Ziang Qin, Wang-Zhou Dai, Yao-Xiang Ding, Kun Zhou

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published as a conference paper at IJCLR'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06313 2025-03-11 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Advancing Autonomous Vehicle Intelligence: Deep Learning and Multimodal LLM for Traffic Sign Recognition and Robust Lane Detection

Chandan Kumar Sah, Ankit Kumar Shaw, Xiaoli Lian, Arsalan Shahid Baig, Tuopu Wen, Kun Jiang, Mengmeng Yang, Diange Yang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00778 2025-03-04 cs.RO 67%

AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter

Yingbo Tang, Shuaike Zhang, Xiaoshuai Hao, Pengwei Wang, Jianlong Wu, Zhongyuan Wang, Shanghang Zhang

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01506 2025-03-03 cs.CV cs.AI cs.LG 67%

Learnable Expansion of Graph Operators for Multi-Modal Feature Fusion

Dexuan Ding, Lei Wang, Liyun Zhu, Tom Gedeon, Piotr Koniusz

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at the Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18593 2025-01-31 cs.CV cs.AI cs.LG 67%

Diffusion Autoencoders are Scalable Image Tokenizers

Yinbo Chen, Rohit Girdhar, Xiaolong Wang, Sai Saketh Rambhatla, Ishan Misra

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project page: https://yinboc.github.io/dito/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06887 2025-01-14 cs.CV cs.AI cs.ET cs.LG 67%

MedGrad E-CLIP: Enhancing Trust and Transparency in AI-Driven Skin Lesion Diagnosis

Sadia Kamal, Tim Oates

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to 2025 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10694 2024-12-17 cs.RO 67%

Grasp What You Want: Embodied Dexterous Grasping System Driven by Your Voice

Junliang Li, Kai Ye, Haolan Kang, Mingxuan Liang, Yuhang Wu, Zhenhua Liu, Huiping Zhuang, Rui Huang, Yongquan Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02021 2024-12-12 cs.CV cs.AI cs.LG 67%

Strong but simple: A Baseline for Domain Generalized Dense Perception by CLIP-based Transfer Learning

Christoph Hümmer, Manuel Schwonberg, Liangwei Zhou, Hu Cao, Alois Knoll, Hanno Gottschalk

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to ACCV 2024; Project Page: https://vltseg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08074 2024-12-03 cs.LG cs.AI cs.CL cs.CV 67%

A Concept-Based Explainability Framework for Large Multimodal Models

Jayneel Parekh, Pegah Khayatan, Mustafa Shukor, Alasdair Newson, Matthieu Cord

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14869 2024-12-02 cs.CV cs.AI cs.LG 67%

BIP3D: Bridging 2D Images and 3D Perception for Embodied Intelligence

Xuewu Lin, Tianwei Lin, Lichao Huang, Hongyu Xie, Zhizhong Su

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13053 2024-11-21 cs.CV cs.AI cs.LG 67%

MEGL: Multimodal Explanation-Guided Learning

Yifei Zhang, Tianxu Jiang, Bo Pan, Jingyu Wang, Guangji Bai, Liang Zhao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11771 2024-10-29 cs.CV cs.AI cs.LG 67%

XEdgeAI: A Human-centered Industrial Inspection Framework with Data-centric Explainable Edge AI Approach

Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Hung Cao

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 29 pages, preprint submitted to Information Fusion journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19783 2024-10-17 cs.CV cs.AI cs.LG cs.RO 67%

Instruction-Guided Visual Masking

Jinliang Zheng, Jianxiong Li, Sijie Cheng, Yinan Zheng, Jiaming Li, Jihao Liu, Yu Liu, Jingjing Liu, Xianyuan Zhan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09340 2024-09-25 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding

Baoxiong Jia, Yixin Chen, Huangyue Yu, Yan Wang, Xuesong Niu, Tengyu Liu, Qing Li, Siyuan Huang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08455 2024-09-24 cs.RO 67%

AToM-Bot: Embodied Fulfillment of Unspoken Human Needs with Affective Theory of Mind

Wei Ding, Fanhong Li, Ziteng Ji, Zhengrong Xue, Jia Liu

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10566 2024-09-18 cs.LG cs.AI cs.CL cs.CV 67%

Eureka: Evaluating and Understanding Large Foundation Models

Vidhisha Balachandran, Jingya Chen, Neel Joshi, Besmira Nushi, Hamid Palangi, Eduardo Salinas, Vibhav Vineet, James Woffinden-Luey, Safoora Yousefi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00597 2024-09-04 cs.MM cs.CL 67%

Multimodal Multi-turn Conversation Stance Detection: A Challenge Dataset and Effective Model

Fuqiang Niu, Zebang Cheng, Xianghua Fu, Xiaojiang Peng, Genan Dai, Yin Chen, Hu Huang, Bowen Zhang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract)

Comments ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18137 2024-05-27 cs.RO cs.AI cs.CL cs.CV cs.LG 67%

DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning

Jianxiong Li, Jinliang Zheng, Yinan Zheng, Liyuan Mao, Xiao Hu, Sijie Cheng, Haoyi Niu, Jihao Liu, Yu Liu, Jingjing Liu, Ya-Qin Zhang, Xianyuan Zhan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08246 2024-05-15 cs.CV cs.AI cs.LG 67%

Compositional Text-to-Image Generation with Dense Blob Representations

Weili Nie, Sifei Liu, Morteza Mardani, Chao Liu, Benjamin Eckart, Arash Vahdat

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05852 2024-05-12 cs.CV cs.AI cs.CL cs.LG cs.RO stat.ML 67%

Pre-trained Text-to-Image Diffusion Models Are Versatile Representation Learners for Control

Gunshi Gupta, Karmesh Yadav, Yarin Gal, Dhruv Batra, Zsolt Kira, Cong Lu, Tim G. J. Rudner

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18976 2024-05-01 cs.LG cs.AI cs.CL cs.CV cs.MM 67%

Foundations of Multisensory Artificial Intelligence

Paul Pu Liang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CMU Machine Learning Department PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12839 2024-04-22 cs.CV cs.AI cs.LG 67%

ECOR: Explainable CLIP for Object Recognition

Ali Rasekh, Sepehr Kazemi Ranjbar, Milad Heidari, Wolfgang Nejdl

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17518 2024-04-09 cs.CV cs.AI cs.LG 67%

The devil is in the fine-grained details: Evaluating open-vocabulary object detectors for fine-grained understanding

Lorenzo Bianchi, Fabio Carrara, Nicola Messina, Claudio Gennaro, Fabrizio Falchi

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as Highlight at CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17128 2024-04-04 cs.CV cs.AI cs.CL cs.LG 67%

OSCaR: Object State Captioning and State Change Representation

Nguyen Nguyen, Jing Bi, Ali Vosoughi, Yapeng Tian, Pooyan Fazli, Chenliang Xu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11311 2024-03-26 cs.CL cs.MM 67%

Mixture-of-Prompt-Experts for Multi-modal Semantic Understanding

Zichen Wu, Hsiu-Yuan Huang, Fanyi Qu, Yunfang Wu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

Comments LREC-COLING 2024, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08248 2024-03-14 cs.RO 67%

CoPa: General Robotic Manipulation through Spatial Constraints of Parts with Foundation Models

Haoxu Huang, Fanqi Lin, Yingdong Hu, Shengjie Wang, Yang Gao

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏