arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2512.23244 2025-12-30 cs.CV cs.AI 62%

ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing

ViLaCD-R1: 一种用于遥感语义变化检测的视觉-语言框架

Xingwei Ma, Shiyang Feng, Bo Zhang, Bin Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ViLaCD-R1通过多图像推理器和掩码引导解码器,提升遥感变化检测的语义识别与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23028 2025-12-30 cs.CV cs.AI cs.SE 62%

An Architecture-Led Hybrid Report on Body Language Detection Project

以架构为导向的混合报告:身体语言检测项目

Thomson Tong, Diba Darooneh

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本报告分析了两种视觉-语言模型的架构特性,并探讨了其在视频到制品管道中的应用及系统限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22238 2025-12-30 cs.LG cs.AI cs.CV 62%

Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

掩码教师与强化学生用于蒸馏视觉-语言模型

Byung-Kwan Lee, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Masters通过掩码教师和强化学生的方法,解决视觉-语言模型蒸馏中的大小差距问题,提升学生模型的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06474 2025-12-30 cs.CV cs.AI cs.LG 62%

Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding

通过不确定性引导的丢弃解码增强视觉-语言模型的可靠性

Yixiong Fang, Ziran Yang, Zhaorun Chen, Zhuokai Zhao, Jiawei Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学) University of Chicago(芝加哥大学) Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 通过不确定性引导的丢弃解码方法,有效减少视觉-语言模型的幻觉问题,提升输出的可靠性和质量。

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21871 2025-12-29 cs.CL cs.AI cs.CR cs.CY 62%

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?

Naen Xu, Jinghuai Zhang, Changjiang Li, Hengyu An, Chunyi Zhou, Jun Wang, Boyu Xu, Yuyuan Li, Tianyu Du, Shouling Ji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20088 2025-12-24 cs.CV cs.AI 62%

Item Region-based Style Classification Network (IRSN): A Fashion Style Classifier Based on Domain Knowledge of Fashion Experts

基于物品区域的风格分类网络(IRSN):一种基于时尚专家领域知识的时尚风格分类器

Jinyoung Choi, Youngchae Kwon, Injung Kim

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 IRSN通过分析物品区域特征和组合,结合双主干架构提升时尚风格分类准确率

Comments This is a pre-print of an article published in Applied Intelligence. The final authenticated version is available online at: https://doi.org/10.1007/s10489-024-05683-9

Journal ref Applied Intelligence, Vol. 54, pp. 6197-6209 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17004 2025-12-24 cs.CV cs.CL 62%

Vision Language Models are Confused Tourists

视觉语言模型是困惑的游客

Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出ConfusedTourist,通过文化对抗鲁棒性测试揭示视觉语言模型在文化线索干扰下的稳定性问题,发现其在简单扰动下表现显著下降,凸显了多文化环境下模型鲁棒性的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20732 2025-12-23 cs.MM cs.CV 62%

Prompt-Aware Adaptive Elastic Weight Consolidation for Continual Learning in Medical Vision-Language Models

面向提示的自适应弹性权重固化用于医学视觉-语言模型的持续学习

Ziyuan Gao, Philippe Morel

机构 * University College London(伦敦大学学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 PA-EWC通过提示引导的参数专门化,有效缓解医疗视觉-语言模型在持续学习中的灾难性遗忘问题,提升多模态医学任务的性能。

Comments Accepted by 32nd International Conference on MultiMedia Modeling (MMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16202 2025-12-19 cs.CV cs.AI 62%

Open Ad-hoc Categorization with Contextualized Feature Learning

开放性即需分类与上下文化特征学习

Zilin Wang, Sangwoo Mo, Stella X. Yu, Sima Behpour, Liu Ren

机构 * University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Bosch Center for AI(博世人工智能中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 OAK通过引入上下文标记和结合CLIP与GCD目标,实现了开放性即需分类的高准确率和可解释性。

Comments 26 pages, 17 figures

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13089 2025-12-19 cs.CV cs.AI 62%

UniVCD: A New Method for Unsupervised Change Detection in the Open-Vocabulary Era

UniVCD:面向开放词汇时代的无监督变化检测新方法

Ziqiang Zhu, Bowei Yang

机构 * School of Aeronautics and Astronautics, Zhejiang University(航空宇航学院,浙江大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 UniVCD是一种基于冻结视觉基础模型的无监督开放词汇变化检测方法,通过轻量级多模态对齐实现高分辨率语义感知变化检测。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09172 2025-12-18 cs.CV cs.AI 62%

Prompt-Based Continual Compositional Zero-Shot Learning

基于提示的持续组成零样本学习

Sauda Maryam, Sara Nadeem, Faisal Qureshi, Mohsen Ali

机构 * Intelligent Machines Lab(智能机器实验室) Information Technology University(信息技术大学) Visual Computing Lab(视觉计算实验室) Ontario Tech University(安大略技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PromptCCZSL通过多教师蒸馏和正交投影损失,实现持续组成零样本学习中的知识保留与泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12701 2025-12-16 cs.CV cs.CL cs.LG 62%

Efficient Vision-Language Reasoning via Adaptive Token Pruning

通过自适应令牌修剪实现高效的视觉语言推理

Xue Li, Xiaonan Song, Henry Hu

机构 * Scholar42(学者42) InfiniPouch LLC(InfiniPouch公司) Labelbox, Inc.(Labelbox公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出自适应令牌修剪方法,通过动态保留关键令牌提升视觉语言模型的推理效率和稳定性,减少计算量并保持精度。

Comments 10 pages, 3 figures. Expanded version of an extended abstract accepted at NeurIPS 2025 Workshop on VLM4RWD. Presents methodology and preliminary experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11167 2025-12-15 cs.CV cs.AI 62%

Image Tiling for High-Resolution Reasoning: Balancing Local Detail with Global Context

图像分块用于高分辨率推理:在局部细节与全局上下文之间取得平衡

Anatole Jacquin de Margerie, Alexis Roger, Irina Rish

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过图像分块技术实现高分辨率图像理解,验证了局部细节恢复的有效性,并探讨了全局上下文对模型性能的影响。

Comments Accepted in AAAI 2025 Workshop on Reproducible AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11015 2025-12-15 cs.CV cs.AI cs.LG 62%

Leveraging Text Guidance for Enhancing Demographic Fairness in Gender Classification

利用文本引导提升面部性别分类中的群体公平性

Anoop Krishnan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过文本引导方法提升面部性别分类中的群体公平性,利用图像文本匹配和融合策略减少偏见并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08981 2025-12-11 cs.CV cs.AI 62%

Mitigating Bias with Words: Inducing Demographic Ambiguity in Face Recognition Templates by Text Encoding

通过词语缓解偏见:通过文本编码在人脸识别模板中诱导人口统计学模糊性

Tahar Chettaoui, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫研究所(IGD)) TU Darmstadt(德累斯顿技术大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 通过引入文本编码,UTIE在人脸识别模板中诱导人口统计学模糊性,以减少偏见并提升验证性能。

Comments Accepted at BMVC workshop (SRBS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08524 2025-12-10 cs.CV cs.CL 62%

Beyond Real Weights: Hypercomplex Representations for Stable Quantization

超越真实权重:用于稳定量化 的超复数表示

Jawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。

Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07360 2025-12-09 cs.CV cs.AI 62%

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation

基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割

Qiming Huang, Hao Ai, Jianbo Jiao

机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。

Comments Accepted to WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05137 2025-12-08 cs.CV cs.AI 62%

ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images

ChromouVQA:在色度伪装图像下评估视觉-语言模型的基准测试

Yunfei Zhang, Yizhuo He, Yuanxun Shao, Zhengtao Yao, Haoyan Xu, Junhao Dong, Zhen Yao, Zhikang Dong

机构 * Amazon(亚马逊公司) Google(谷歌公司) MurcuryMind(MurcuryMind公司) University of Southern California(南加州大学) Nanyang Technological University(南洋理工大学) Lehigh University(莱斯大学) Stony Brook University(石溪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ChromouVQA通过色度伪装图像评估视觉-语言模型在复杂背景下的表现,提出对比度配方提升形状恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04763 2025-12-05 cs.LG cs.CL cs.CV 62%

MemLoRA: Distilling Expert Adapters for On-Device Memory Systems

MemLoRA: 通过专家适配器实现设备端记忆系统

Massimo Bini, Ondrej Bohdal, Umberto Michieli, Zeynep Akata, Mete Ozay, Taha Ceritli

机构 * Samsung R&D Institute UK(三星英国研发中心) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(慕尼黑海德堡研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 MemLoRA通过为小型语言模型添加专用记忆适配器,实现设备端记忆系统的本地部署,并扩展至视觉理解任务,提升多模态场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04309 2025-12-05 cs.CV cs.CL 62%

Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction

仅文本训练的图像描述生成:结合检索增强与模态差距校正

Rui Fonseca, Bruno Martins, Gil Rocha

机构 * INESC-ID, Instituto Superior Tecnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 TOMCap通过检索增强和模态差距校正,实现无需对齐图像-文本对的纯文本训练图像描述生成。

Comments Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02438 2025-12-03 cs.CV cs.AI 62%

Boosting Medical Vision-Language Pretraining via Momentum Self-Distillation under Limited Computing Resources

通过有限计算资源下的动量自蒸馏提升医学视觉-语言预训练

Phuc Pham, Nhu Pham, Ngoc Quoc Ly

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过动量自蒸馏与梯度累积提升医学视觉-语言预训练效率,实现高效多模态学习并提升零样本分类和少量样本适应性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01419 2025-12-02 cs.CV cs.AI 62%

Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries

Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力

Tushar Pranav, Eshan Pandey, Austria Lyka Diane Bala, Aman Chadha, Indriyati Atmosukarto, Donny Soh Cheng Lock

机构 * Singapore Institute of Technology(新加坡理工学院) Amazon GenAI(亚马逊人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI 62%

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23907 2025-12-02 cs.CV cs.AI cs.LG 62%

DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning

DynaStride: 基于MMCoT的动态步长窗多场景描述生成

Eddison Pham, Prisha Priyadarshini, Adrian Maliackel, Kanishk Bandi, Cristian Meo, Kevin Zhu

机构 * Algoverse AI Research(Algoverse人工智能研究)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DynaStride通过多模态链式思考和动态步长窗算法,实现无需手动分割的多场景教学视频连贯描述生成,提升描述的连贯性和信息量。

Comments 16 pages, 15 figures, 5 Tables, Accepted at NeurIPS 7HVU Workshop, Accepted at AAAI AI4ED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19943 2025-12-02 cs.CV cs.AI 62%

Interpreting ResNet-based CLIP via Neuron-Attention Decomposition

通过神经-注意力分解解释基于ResNet的CLIP

Edmund Bu, Yossi Gandelsman

机构 * UC San Diego(圣迭戈大学) UC Berkeley(伯克利大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 通过神经-注意力分解解释CLIP-ResNet中的神经元,实现无训练语义分割和分布偏移监控

Comments Accepted at NeurIPS 2025 Workshop on Mechanistic Interpretability. Project page: https://edmundbu.github.io/clip-neur-attn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00226 2025-12-02 cs.CV cs.AI 62%

DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation

DenseScan: 通过2D密集标注提升3D场景理解

Zirui Wang, Tao Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DenseScan通过2D密集标注提升3D场景理解,结合多视角图像和多模态大语言模型生成丰富语义标注,拓展下游任务应用。

Comments Workshop on Space in Vision, Language, and Embodied AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22903 2025-12-01 cs.CV cs.AI 62%

Leveraging Textual Compositional Reasoning for Robust Change Captioning

利用文本组合推理实现鲁棒的变更描述

Kyu Ri Park, Jiyoung Park, Seong Tae Kim, Hong Joo Lee, Jung Uk Kim

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 CORTEX通过整合文本线索和组合推理,提升图像变化描述的鲁棒性与准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22739 2025-12-01 cs.CV cs.AI 62%

All Centers Are at most a Few Tokens Apart: Knowledge Distillation with Domain Invariant Prompt Tuning

所有中心距离最多几个token:基于领域不变提示微调的知识蒸馏

Amir Mohammad Ezzati, Alireza Malekhosseini, Armin Khosravi, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology, Tehran, Iran(计算机工程系,谢赫拉兹大学,德黑兰,伊朗)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出领域不变提示微调(DIPT)方法,通过学习领域不变提示提升知识蒸馏效果,从而增强病理学领域模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09185 2025-12-01 cs.CV cs.AI 62%

A Neurosymbolic Framework for Interpretable Cognitive Attack Detection in Augmented Reality

面向增强现实的认知攻击检测的神经符号框架

Rongqian Chen, Allison Andreyev, Yanming Xiu, Joshua Chilukuri, Shunav Sen, Mahdi Imani, Bin Li, Maria Gorlatova, Gang Tan, Tian Lan

机构 * George Washington University(乔治华盛顿大学) Duke University(杜克大学) Pennsylvania State University(宾夕法尼亚州立大学) Northeastern University(东北大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CADAR框架,结合神经网络与符号推理,用于增强现实中的认知攻击检测,通过多模态表示和统计推理提升检测的可解释性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10157 2025-12-01 cs.AI cs.CL 62%

One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence

一个患者,许多情境:通过情境智能扩展医疗AI

Michelle M. Li, Ben Y. Reis, Adam Rodman, Tianxi Cai, Noa Dagan, Ran D. Balicer, Joseph Loscalzo, Isaac S. Kohane, Marinka Zitnik

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出情境切换技术,通过调整模型推理而非重新训练,使医疗AI能适应不同专科、人群和地理环境,提升其在现实护理中的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏