arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 45986 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4644 篇

2403.07241 2024-11-05 cs.CV cs.LG 74%

Calibrating Multi-modal Representations: A Pursuit of Group Robustness without Annotations

Chenyu You, Yifei Min, Weicheng Dai, Jasjeet S. Sekhon, Lawrence Staib, James S. Duncan

专题命中 图文多模态 :multi-modal(title);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12736 2024-07-18 cs.CV 74%

Towards Multimodal In-Context Learning for Vision & Language Models

Sivan Doveh, Shaked Perek, M. Jehanzeb Mirza, Wei Lin, Amit Alfassy, Assaf Arbelle, Shimon Ullman, Leonid Karlinsky

专题命中 图文多模态 :multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06586 2024-05-13 cs.CV 74%

Enhancing Weakly Supervised Semantic Segmentation with Multi-modal Foundation Models: An End-to-End Approach

Elham Ravanbakhsh, Cheng Niu, Yongqing Liang, J. Ramanujam, Xin Li

专题命中 图文多模态 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00119 2023-12-05 cs.CV 74%

Fewshot learning on global multimodal embeddings for earth observation tasks

Matt Allen, Francisco Dorr, Joseph A. Gallego-Mejia, Laura Martínez-Ferrer, Anna Jungbluth, Freddie Kalaitzis, Raúl Ramos-Pollán

专题命中 图文多模态 :multimodal(title);分类 cs.CV

Comments 9 pages, 6 figures, presented on NeurIPS workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16529 2023-06-30 cs.IR cs.AI cs.DL 74%

Multimodal Search on Iconclass using Vision-Language Pre-Trained Models

Cristian Santini, Etienne Posthumus, Mary Ann Tan, Oleksandra Bruns, Tabea Tietz, Harald Sack

专题命中 图文多模态 :multimodal(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02828 2023-04-07 cs.CV cs.CY 74%

Uncurated Image-Text Datasets: Shedding Light on Demographic Bias

Noa Garcia, Yusuke Hirota, Yankun Wu, Yuta Nakashima

专题命中 图文多模态 :image-text(title);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17169 2023-03-31 cs.CV 74%

Task-Oriented Multi-Modal Mutual Leaning for Vision-Language Models

Sifan Long, Zhen Zhao, Junkun Yuan, Zichang Tan, Jiangjiang Liu, Luping Zhou, Shengsheng Wang, Jingdong Wang

专题命中 图文多模态 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.13333 2022-09-07 cs.CV cs.GR cs.LG 74%

CLIP-Mesh: Generating textured meshes from text using pretrained image-text models

Nasir Mohammad Khalid, Tianhao Xie, Eugene Belilovsky, Tiberiu Popa

专题命中 图文多模态 :image-text(title);分类 cs.CV

Comments 8 pages, 8 figures, Accepted at SIGGRAPH ASIA 2022, Project Page at https://www.nasir.lol/clipmesh

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11848 2021-09-27 cs.CV 74%

How to find a good image-text embedding for remote sensing visual question answering?

Christel Chappuis, Sylvain Lobry, Benjamin Kellenberger, Bertrand Le Saux, Devis Tuia

专题命中 图文多模态 :image-text(title);分类 cs.CV

Comments 10 pages, 4 figures, presented in the MACLEAN workshop during ECML PKDD 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.08106 2021-05-19 cs.CL 74%

Multi-Modal Image Captioning for the Visually Impaired

Hiba Ahsan, Nikita Bhalla, Daivat Bhatt, Kaivankumar Shah

专题命中 图文多模态 :multi-modal(title);分类 cs.CL

Comments 8 pages, 2 figures, 2 tables, accepted to NAACL-HLT SRW 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.03315 2020-06-08 cs.CV cs.LG eess.IV 74%

Multi-modal Feature Fusion with Feature Attention for VATEX Captioning Challenge 2020

Ke Lin, Zhuoxin Gan, Liwei Wang

专题命中 图文多模态 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11416 2019-09-26 cs.MM 74%

Focus Your Attention: A Bidirectional Focal Attention Network for Image-Text Matching

Chunxiao Liu, Zhendong Mao, An-An Liu, Tianzhu Zhang, Bin Wang, Yongdong Zhang

专题命中 图文多模态 :image-text(title);分类 cs.MM

Comments Accepted by ACMMM2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.09317 2019-08-27 cs.CV 74%

Towards Unsupervised Image Captioning with Shared Multimodal Embeddings

Iro Laina, Christian Rupprecht, Nassir Navab

专题命中 图文多模态 :multimodal(title);分类 cs.CV

Comments ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.01919 2019-08-07 cs.CV 74%

Image Captioning with Clause-Focused Metrics in a Multi-Modal Setting for Marketing

Philipp Harzig, Dan Zecha, Rainer Lienhart, Carolin Kaiser, René Schallner

专题命中 图文多模态 :multi-modal(title);分类 cs.CV

Comments 6 pages, accepted at MIPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.01958 2019-08-07 cs.CV 74%

Multimodal Image Captioning for Marketing Analysis

Philipp Harzig, Stephan Brehm, Rainer Lienhart, Carolin Kaiser, René Schallner

专题命中 图文多模态 :multimodal(title);分类 cs.CV

Comments 4 pages, 1 figure, accepted at MIPR2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.04701 2015-12-16 cs.IR cs.CL cs.SI 74%

Joint Image-Text News Topic Detection and Tracking with And-Or Graph Representation

Weixin Li, Jungseock Joo, Hang Qi, Song-Chun Zhu

专题命中 图文多模态 :image-text(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09562 2026-08-18 cs.CV cs.AI 版本更新 73%

Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges

分割一切模型中的提示工程:方法、应用与新兴挑战

Yidong Jiang, Jiangtong Li, Daiwei Cheng

机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本综述系统梳理了SAM的提示工程技术,将其分为三类并分析方法演变,探讨其跨领域应用,指出三大挑战并提出有前景的研究方向,为相关领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13505 2026-08-14 cs.LG cs.CL cs.CV 新提交 73%

Intern-S2-Preview: Scientific Agentic Foundation Model

Intern-S2-Preview:科学智能体基础模型

Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出Intern-S2-Preview系列科学智能体基础模型,通过多阶段训练与架构优化,在多类基准上取得领先结果,相关模块可提升科学任务表现且无需修改主干模型。

Comments 35 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07712 2026-08-11 cs.CV cs.AI 新提交 73%

SpikeWorld: Fast-State Adaptation for Frozen Spiking World Models

SpikeWorld:用于冻结脉冲世界模型的快速状态适应

Ziqiao Yu

机构 * DiDi International Business Group(滴滴国际业务集团)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 SpikeWorld是145万参数的稀疏脉冲模型,冻结训练参数后通过外部路径实现快速状态适应,提升多模态预测等性能,在Meta-World任务中提高冻结策略奖励与成功率。

Comments 14 pages, 2 figures, 4 tables. Code: https://github.com/Oooorca/SpikeWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07282 2026-08-10 cs.CL cs.CV 新提交 73%

Gaze Behavior in Visual World Experiments Can be Modeled With Off-the-shelf Language-Vision Encoders

视觉世界实验中的注视行为可采用现成的语言-视觉编码器建模

Rahul Murali Shankar, Titus von der Malsburg, Sebastian Padó

机构 * University of Stuttgart(斯图加特大学)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 该研究提出结合CLIP双编码器与双模态归因方法的新方法,无需微调或生成式架构,即可复现经典视觉世界研究的人类注视行为预测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15249 2026-08-04 cs.CV cs.AI 73%

Intersectional Fairness in Vision-Language Models for Medical Image Disease Classification

视觉-语言模型在医学影像疾病分类中的交叉公平性

Yupeng Zhang, Adam G. Dunn, Usman Naseem, Jinman Kim

机构 * Biomedical Data Analysis and Visualisation (BDAV) Lab, School of Computer Science(生物医学数据分析与可视化实验室,计算机科学学院) Sydney School of Public Health(悉尼公共卫生学院) School of Computing(计算学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMAC-MMD框架,通过标准化交叉亚组的诊断确定性,减少医学影像疾病分类中的交叉偏见,提升诊断准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29445 2026-08-03 cs.CV cs.AI 新提交 73%

QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models

用于红外视觉语言模型定向语义攻击的QR结构化热触发装置

Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21970 2026-07-27 cs.CV cs.AI 新提交 73%

TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

TextSLIP:用于医学报告生成的文本自监督CLIP

Haoyu Jiang, Ziping Cong

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有CLIP方法在医学报告生成中语义监督不足问题,提出TextSLIP框架,通过模态内文本对比学习增强CLIP,经实验验证其在报告生成指标上有改进,表明文本级对比学习对改善医学视觉-文本对齐有潜力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-07-21 cs.CV cs.MM 新提交 73%

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交 73%

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18419 2026-07-08 cs.CV cs.AI 版本更新 73%

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03624 2026-07-07 cs.CV cs.AI cs.LG 新提交 73%

RADIO1D: Elastic Representations for Condensed Vision Modeling

RADIO1D:用于压缩视觉建模的弹性表示

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。

Comments Published as main conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01876 2026-07-03 cs.CV cs.AI 新提交 73%

SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

SAB-LVLM: 面向大型视觉-语言模型的重要性感知二值化

Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人学国家重点实验室) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出SAB-LVLM方法,通过构建空间重要性图与模态引导整合策略,实现跨层跨模态权重重要性感知的二值化,在约1比特压缩下优于现有二值化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29586 2026-06-30 cs.CV cs.AI 73%

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

SonoCLIP: 面向胎儿超声分析的掩码引导区域感知视觉-语言预训练

Hang Su, Chao Sun, Zhaofan Li, Wei Hu, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国) Institute of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能研究院,武汉,中国) Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China(武汉大学仁民医院超声科,武汉,中国) National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(武汉大学多媒体软件国家工程研究中心,武汉,中国) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(湖北省多媒体与网络通信工程重点实验室,武汉大学,武汉,中国)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出SonoCLIP,首个百万级区域可控胎儿超声视觉-语言基础模型,通过掩码引导的全局-局部对比学习,提升对临床关键局部结构的敏感性,在零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26794 2026-06-26 cs.CV cs.AI 新提交 73%

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

ReasonCLIP-58M: CLIP的视觉基础常识推理监督

Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(卡利法大学) University of Western Australia(西澳大学) The Chinese University of Hong Kong(香港中文大学) University of Melbourne(墨尔本大学) University of Central Florida(佛罗里达中央大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏