arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2406.13219 2024-10-31 cs.CV cs.CL 57%

MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency

Junzhe Zhang, Huixuan Zhang, Xunjian Yin, Baizhou Huang, Xu Zhang, Xinyu Hu, Xiaojun Wan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03373 2024-10-28 cs.CV 57%

Knowledge-aware Text-Image Retrieval for Remote Sensing Images

Li Mi, Xianjie Dai, Javiera Castillo-Navarro, Devis Tuia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by IEEE TGRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15430 2024-10-25 cs.CV 57%

BoostAdapter: Improving Vision-Language Test-Time Adaptation via Regional Bootstrapping

Taolin Zhang, Jinpeng Wang, Hang Guo, Tao Dai, Bin Chen, Shu-Tao Xia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17532 2024-10-24 cs.CL cs.AI 57%

Responsible Multilingual Large Language Models: A Survey of Development, Applications, and Societal Impact

Junhua Liu, Bin Fu

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16840 2024-10-23 cs.CV 57%

MPDS: A Movie Posters Dataset for Image Generation with Diffusion Model

Meng Xu, Tong Zhang, Fuyun Wang, Yi Lei, Xin Liu, Zhen Cui

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15199 2024-10-22 cs.CV cs.GR 57%

CLIPtortionist: Zero-shot Text-driven Deformation for Manufactured 3D Shapes

Xianghao Xu, Srinath Sridhar, Daniel Ritchie

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03615 2024-10-22 cs.AI cs.CL 57%

Optimus-1: Hybrid Multimodal Memory Empowered Agents Excel in Long-Horizon Tasks

Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Dongmei Jiang, Liqiang Nie

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14587 2024-10-21 cs.LG q-fin.CP 57%

Neuro-Symbolic Traders: Assessing the Wisdom of AI Crowds in Markets

Namid R. Stillman, Rory Baggott

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments 8 pages, 4 figures, ACM format

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13989 2024-10-21 cs.CV 57%

Reproducibility study of "LICO: Explainable Models with Language-Image Consistency"

Luan Fletcher, Robert van der Klis, Martin Sedláček, Stefan Vasilev, Christos Athanasiadis

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 15 pages, 2 figures, Machine Learning Reproducibility Challenge 2024

Journal ref Transactions on Machine Learning Research 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13370 2024-10-21 cs.CV cs.CL cs.MM 57%

Movie101v2: Improved Movie Narration Benchmark

Zihao Yue, Yepeng Zhang, Ziheng Wang, Qin Jin

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06750 2024-10-21 cs.CY cs.AI 57%

Frontier AI Ethics: Anticipating and Evaluating the Societal Impacts of Language Model Agents

Seth Lazar

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13088 2024-10-18 cs.LG cs.CL cs.MM 57%

Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models

Jie Ren, Kangrui Chen, Chen Chen, Vikash Sehwag, Yue Xing, Jiliang Tang, Lingjuan Lyu

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10308 2024-10-15 cs.CV 57%

LG-CAV: Train Any Concept Activation Vector with Language Guidance

Qihan Huang, Jie Song, Mengqi Xue, Haofei Zhang, Bingde Hu, Huiqiong Wang, Hao Jiang, Xingen Wang, Mingli Song

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08860 2024-10-14 cs.CL cs.CV 57%

Audio Description Generation in the Era of LLMs and VLMs: A Review of Transferable Generative AI Technologies

Yingqiang Gao, Lukas Fischer, Alexa Lintner, Sarah Ebling

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05363 2024-10-10 cs.CV 57%

Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation

Fanqing Meng, Jiaqi Liao, Xinyu Tan, Wenqi Shao, Quanfeng Lu, Kaipeng Zhang, Yu Cheng, Dianqi Li, Yu Qiao, Ping Luo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://phygenbench123.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19146 2024-10-08 stat.ML cs.LG 57%

I Bet You Did Not Mean That: Testing Semantic Importance via Betting

Jacopo Teneggi, Jeremias Sulam

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17958 2024-09-27 cs.CL cs.CV 57%

The Hard Positive Truth about Vision-Language Compositionality

Amita Kamath, Cheng-Yu Hsieh, Kai-Wei Chang, Ranjay Krishna

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12778 2024-09-24 cs.CV 57%

EventDance++: Language-guided Unsupervised Source-free Cross-modal Adaptation for Event-based Object Recognition

Xu Zheng, Lin Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2403.14082

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09291 2024-09-17 cs.CV 57%

Infrared and Visible Image Fusion with Hierarchical Human Perception

Guang Yang, Jie Li, Xin Liu, Zhusi Zhong, Xinbo Gao

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06853 2024-09-12 cs.CV 57%

ExIQA: Explainable Image Quality Assessment Using Distortion Attributes

Sepehr Kazemi Ranjbar, Emad Fatemizadeh

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00341 2024-09-04 cs.CV 57%

Aligning Medical Images with General Knowledge from Large Language Models

Xiao Fang, Yi Lin, Dong Zhang, Kwang-Ting Cheng, Hao Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13402 2024-09-04 cs.LG 57%

LLaVaOLMoBitnet1B: Ternary LLM goes Multimodal!

Jainaveen Sundaram, Ravi Iyer

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16986 2024-09-02 cs.CV 57%

AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding

Yonghui Wang, Wengang Zhou, Hao Feng, Houqiang Li

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16296 2024-08-30 cs.CV cs.IR 57%

Rethinking Sparse Lexical Representations for Image Retrieval in the Age of Rising Multi-Modal Large Language Models

Kengo Nakata, Daisuke Miyashita, Youyang Ng, Yasuto Hoshi, Jun Deguchi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024 Workshops: 2nd Workshop on Traditional Computer Vision in the Age of Deep Learning (TradiCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14723 2024-08-28 cs.CV cs.IR 57%

Snap and Diagnose: An Advanced Multimodal Retrieval System for Identifying Plant Diseases in the Wild

Tianqi Wei, Zhi Chen, Xin Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07545 2024-08-21 cs.CV 57%

Vision-Language Dataset Distillation

Xindi Wu, Byron Zhang, Zhiwei Deng, Olga Russakovsky

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06158 2024-08-13 cs.CV 57%

OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning

Mushui Liu, Bozheng Li, Yunlong Yu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ECAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04868 2024-08-12 cs.CV 57%

ChatGPT Meets Iris Biometrics

Parisa Farmanifard, Arun Ross

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Published at IJCB 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04671 2024-08-12 cs.CL cs.AI cs.CY 57%

Prompt and Prejudice

Lorenzo Berlincioni, Luca Cultrera, Federico Becattini, Marco Bertini, Alberto Del Bimbo

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

Comments Accepted at ECCV workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04388 2024-08-09 cs.MM cs.AI cs.IR 57%

MM-Forecast: A Multimodal Approach to Temporal Event Forecasting with Large Language Models

Haoxuan Li, Zhengmao Yang, Yunshan Ma, Yi Bin, Yang Yang, Tat-Seng Chua

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏