arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4651 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2508.09087 2025-08-13 cs.CV 70%

Addressing Bias in VLMs for Glaucoma Detection Without Protected Attribute Supervision

Ahsan Habib Akash, Greg Murray, Annahita Amireskandari, Joel Palko, Carol Laxson, Binod Bhattarai, Prashnna Gyawali

机构 * West Virginia University(西弗吉尼亚大学) University of Aberdeen(阿伯丁大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments 3rd Workshop in Data Engineering in Medical Imaging (DEMI), MICCAI-2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08939 2025-08-13 cs.CV 70%

MADPromptS: Unlocking Zero-Shot Morphing Attack Detection with Multiple Prompt Aggregation

Eduarda Caldeira, Fadi Boutros, Naser Damer

机构 * Fraunhofer IGD and Department of Computer Science, TU Darmstadt(弗劳恩霍夫研究所(IGD)和图宾根大学计算机科学系)

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments Accepted at ACM Multimedia Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08926 2025-08-13 cs.AI 70%

Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models

Wei Cai, Jian Zhao, Yuchu Jiang, Tianle Zhang, Xuelong Li

机构 * Peking University(北京大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学) Southeast University(东南大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08644 2025-08-13 cs.CV 70%

AME: Aligned Manifold Entropy for Robust Vision-Language Distillation

Guiming Cao, Yuming Ou

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01219 2025-08-05 cs.CV cs.LG 70%

Eigen Neural Network: Unlocking Generalizable Vision with Eigenbasis

Anzhe Cheng, Chenzhong Yin, Mingxi Cheng, Shukai Duan, Shahin Nazarian, Paul Bogdan

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01308 2025-08-05 cs.CV 70%

Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks

Jiawei Wang, Yushen Zuo, Yuanjun Chai, Zhendong Liu, Yicheng Fu, Yichun Feng, Kin-Man Lam

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学) Nanjing University(南京大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22024 2025-07-30 eess.IV cs.CV 70%

Cardiac-CLIP: A Vision-Language Foundation Model for 3D Cardiac CT Images

Yutao Hu, Ying Zheng, Shumei Miao, Xiaolei Zhang, Jiahao Xia, Yaolei Qi, Yiyang Zhang, Yuting He, Qian Chen, Jing Ye, Hongyan Qiao, Xiuhua Hu, Lei Xu, Jiayin Zhang, Hui Liu, Minwen Zheng, Yining Wang, Daimin Zhang, Ji Zhang, Wenqi Shao, Yun Liu, Longjiang Zhang, Guanyu Yang

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19870 2025-07-29 cs.CV cs.HC 70%

OW-CLIP: Data-Efficient Visual Supervision for Open-World Object Detection via Human-AI Collaboration

Junwen Duan, Wei Xue, Ziyao Kang, Shixia Liu, Jiazhi Xia

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14346 2025-07-29 cs.CV 70%

Egocentric Action-aware Inertial Localization in Point Clouds with Vision-Language Guidance

Mingfang Zhang, Ryo Yonetani, Yifei Huang, Liangyang Ouyang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学) CyberAgent AI Lab(CyberAgent AI实验室)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05983 2025-07-29 cs.CV 70%

Chimera: Improving Generalist Model with Domain-Specific Experts

Tianshuo Peng, Mingsheng Li, Jiakang Yuan, Hongbin Zhou, Renqiu Xia, Renrui Zhang, Lei Bai, Song Mao, Bin Wang, Aojun Zhou, Botian Shi, Tao Chen, Bo Zhang, Xiangyu Yue

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) MMLab College of Future Information Technology, Fudan University(未来信息技术学院,复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by ICCV-2025, Chimera Homepage: https://alpha-innovator.github.io/chimera_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17787 2025-07-25 cs.LG cs.AI 70%

Hyperbolic Deep Learning for Foundation Models: A Survey

Neil He, Hiren Madhu, Ngoc Bui, Menglin Yang, Rex Ying

机构 * Yale University(耶鲁大学) Hong Kong University of Science(香港科学大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments 11 Pages, SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08710 2025-07-14 cs.CV 70%

L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training

Li Li, Yingzhe Peng, Xu Yang, Ruoxi Cheng, Haiyang Xu, Ming Yan, Fei Huang

机构 * Key Laboratory of New Generation Artificial Intelligence Technology & Its Interdisciplinary Applications, (Southeast University),Ministry of Education(新一代人工智能技术及跨学科应用国家重点实验室,东南大学,教育部) Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15484 2025-07-08 cs.CV 70%

Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage

Saehyung Lee, Seunghyun Yoon, Trung Bui, Jing Shi, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Adobe Research(Adobe研究)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02957 2025-07-08 cs.CV 70%

CS-VLM: Compressed Sensing Attention for Efficient Vision-Language Representation Learning

Andrew Kiruluta, Preethi Raju, Priscilla Burity

机构 * Berkeley(伯克利)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12890 2025-07-08 cs.CV 70%

Specialized Foundation Models for Intelligent Operating Rooms

Ege Özsoy, Chantal Pellegrini, David Bani-Harouni, Kun Yuan, Matthias Keicher, Nassir Navab

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01643 2025-07-03 cs.CV 70%

SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement

Weijie Yin, Dingkang Yang, Hongyuan Dong, Zijian Kang, Jiacong Wang, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Inc.(字节跳动公司) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments We release SAILViT, a series of versatile vision foundation models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19288 2025-07-02 cs.CV cs.RO 70%

Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding

Runwei Guan, Ningwei Ouyang, Tianhao Xu, Shaofeng Liang, Wei Dai, Yafeng Sun, Shang Gao, Songning Lai, Shanliang Yao, Xuming Hu, Ryan Wen Liu, Yutao Yue, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) China University of Petroleum (East China)(中国石油大学(华东)) University of Science and Technology of China(中国科学技术大学) Yancheng Institute of Technology(盐城职业技术学院) Wuhan University of Technology(武汉理工大学)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23607 2025-07-01 cs.CV 70%

PGOV3D: Open-Vocabulary 3D Semantic Segmentation with Partial-to-Global Curriculum

Shiqi Zhang, Sha Zhang, Jiajun Deng, Yedong Shen, Mingxiao MA, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) The University of Adelaide(阿德莱德大学)

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05210 2025-07-01 cs.CV 70%

Towards Vision-Language-Garment Models for Web Knowledge Garment Understanding and Generation

Jan Ackermann, Kiyohiro Nakayama, Guandao Yang, Tong Wu, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

Comments Presented at MMFM CVPRW'25, Project Page: https://www.computationalimaging.org/publications/vision-language-garment-models/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18378 2025-06-24 eess.IV cs.CV 70%

Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review

Haoneng Lin, Cheng Xu, Jing Qin

机构 * Center of Smart Health, Hong Kong Polytechnic University, Hong Kong, China(智能健康中心,香港理工大学,中国)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11493 2025-06-16 cs.CV 70%

Preserving Clusters in Prompt Learning for Unsupervised Domain Adaptation

Tung-Long Vuong, Hoang Phan, Vy Vo, Anh Bui, Thanh-Toan Do, Trung Le, Dinh Phung

机构 * Monash University(墨尔本大学) New York University(纽约大学)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19794 2025-06-12 cs.CV 70%

MVTamperBench: Evaluating Robustness of Vision-Language Models

Amit Agarwal, Srikant Panda, Angeline Charles, Bhargava Kumar, Hitesh Patel, Priyaranjan Pattnayak, Taki Hasan Rafi, Tejaswini Kumar, Hansa Meghwani, Karan Gupta, Dong-Kyu Chae

机构 * Liverpool John Moores University(利物浦约翰·穆里斯大学) Birla Institute of Technology(比拉理工学院) Christ University(基督大学) Columbia University(哥伦比亚大学) New York University(纽约大学) University of Washington(华盛顿大学) Hanyang University(翰阳大学)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08429 2025-06-11 cs.CV 70%

Better Reasoning with Less Data: Enhancing VLMs Through Unified Modality Scoring

Mingjie Xu, Andrew Estornell, Hongzheng Yang, Yuzhi Zhao, Zhaowei Zhu, Qi Xuan, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) BIAI-ZJUT Zhejiang University of Technology(浙江工业大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14361 2025-06-11 cs.CV 70%

Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives

Xingxing Weng, Chao Pang, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine

Journal ref IEEE Geoscience and Remote Sensing Magazine, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07905 2025-06-10 cs.CV 70%

WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning

Jie Yang, Feipeng Ma, Zitian Wang, Dacheng Yin, Kang Rong, Fengyun Rao, Ruimao Zhang

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05198 2025-06-06 cs.CV cs.LG 70%

Quantifying Cross-Modality Memorization in Vision-Language Models

Yuxin Wen, Yangsibo Huang, Tom Goldstein, Ravi Kumar, Badih Ghazi, Chiyuan Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00806 2025-06-03 cs.CL 70%

Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering

Songtao Jiang, Chenyi Zhou, Yan Zhang, Yeying Jin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Byte Dance(字节跳动) National University of Singapore(新加坡国立大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08174 2025-06-03 cs.LG cs.AI cs.SI 70%

Can Graph Neural Networks Learn Language with Extremely Weak Text Supervision?

Zihao Li, Lecheng Zheng, Bowen Jin, Dongqi Fu, Baoyu Jing, Yikun Ban, Jingrui He, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.AI

Comments ACL 2025 Main Conference, 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00406 2025-06-03 cs.CV 70%

iDPA: Instance Decoupled Prompt Attention for Incremental Medical Object Detection

Huahui Yi, Wei Xu, Ziyuan Qin, Xi Chen, Xiaohu Wu, Kang Li, Qicheng Lao

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24517 2025-06-02 cs.CV 70%

un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP

Yinqi Li, Jiahe Zhao, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏