VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project Page: https://zhourax.github.io/VEGA/
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project Page: https://zhourax.github.io/VEGA/
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2024. Code & Dataset: https://github.com/baaivision/CapsFusion
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM
Comments ICLR 2024
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Under Review
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI、cs.MM
Comments AAAI 2024, https://github.com/zjukg/Structure-CLIP
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Work in progress. Code and demos are released at https://github.com/Alpha-VLLM/LLaMA2-Accessory
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments CVPR 2023 Main Track Long Paper
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments SIGIR 2023, 10 pages
专题命中 图文多模态 :multimodal(title);multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to ACL 2022
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
通过利用一对一关系进行多模态对抗防御以提升视觉语言模型
机构 * The University of Tokyo(东京大学) ; CyberAgent ; National Institute of Informatics(信息处理研究所)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出多模态对抗训练方法,通过利用图像与文本之间的一对多关系提升视觉语言模型的对抗鲁棒性。
Comments WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training
专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
Comments Project page: https://github.com/donghao51/Awesome-Multimodal-Adaptation
机构 * BIGAI ; BUAA(北京航空航天大学) ; THU(清华大学) ; BIT(北京理工大学) ; RUC(中国人民大学)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract,comments);分类 cs.CV、cs.CL
Comments EMNLP 2025 Findings, Project Page: https://huggingface.co/AdaptLLM/Adapt-MLLM-to-Domains
DGSeg:用于推理分割的语义-空间引导预测的动态门控
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)
专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 研究推理分割问题,提出DGSeg框架,借助MLLM生成语义和空间线索,经动态门控模块自适应融合预测,抑制噪声或冲突区域,在多基准测试中表现出色。
Comments Accepted to ECCV2026
专题命中 图文多模态 :multimodal(title);multimodal foundation model(title);分类 cs.AI
自然语言理解在基于多模态视频的登革热诊断中的作用
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出基于YOLO和CLIP的视觉-语言框架,从视频中分类未受感染与DENV2感染的蚊子,帧级准确率达98.54%、灵敏度达99.91%,证实该框架可用于分析感染相关生物行为。
针对多模态扰动的视觉-语言-动作模型的鲁棒性
专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出RobustVLA,通过多模态鲁棒优化提升视觉-语言-动作模型在多种扰动下的鲁棒性,实验表明其在性能和推理速度上均优于现有方法。
Comments Published as a conference paper at ICLR 2026
SpectralGCD:用于广义类别发现的光谱概念选择和跨模态表示学习
机构 * University of Florence, Media Integration and Communication Center (MICC)(佛罗伦萨大学,媒体整合与通信中心(MICC))
专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究广义类别发现问题,提出SpectralGCD方法,利用CLIP跨模态相似性统一表示,通过光谱滤波和知识蒸馏提升性能,相比现有方法计算成本低且精度高。
Comments Accepted at ICLR 2026. Code available at https://github.com/miccunifi/SpectralGCD
SyncLoop: 一种用于自我改进数学推理的多模态双循环框架
机构 * Sun Yat-sen University(中山大学) ; The Hong Kong Polytechnic University(香港理工大学) ; MBZUAI ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Yinwang Intelligent Technology Co. Ltd(依文智科有限公司)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 提出SyncLoop多模态双循环框架,通过跨模态数据演化循环和数据-模型演化循环联合进化训练数据和模型能力,解决数据复杂度不匹配和演化分离问题,在数学推理基准上持续提升性能。
Comments ECCV2026
CFPO:用于多模态推理的反事实策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 提出反事实策略优化框架,通过跨模态反事实增强机制强制视觉与文本推理的因果一致性,显著提升多模态推理的准确性。
Comments Accepted to ICML 2026. 17 pages
受神经启发的多模态视觉-语言模型对成员推断隐私泄露是否具有弹性?
机构 * The University of Alabama(阿拉巴马大学) ; Alabama Center for the Advancement of AI(阿拉巴马人工智能 advancement 中心) ; Trustworthy AI Lab(可信人工智能实验室) ; Department of Computer Science, The University of Alabama(计算机科学系)
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 研究受神经启发的多模态视觉-语言模型(VLM)对基于图像-文本的成员推断攻击的弹性,提出拓扑正则化框架,实验表明神经VLM在保持模型效用同时显著降低攻击成功率。
Comments Accepted at USENIX WOOT '26
Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 图文多模态 :multimodal(title,title_cn);分类 cs.CV、cs.AI
AI总结 提出一种基于强化学习的模态感知信用分配框架(MoCA),通过感知验证和结构化口头验证解决视觉语言模型中感知与推理的权衡问题,实现多任务性能提升。
Comments Accepted by ICML 2026 as Oral
DenseMLLM:用于密集预测的标准多模态大语言模型
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学电子与计算机工程系) ; Tencent, Youtu-Lab, China(腾讯优图实验室)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 提出DenseMLLM,通过标准多模态大语言模型架构和视觉令牌监督策略,无需任务特定解码器即可实现语义分割、深度估计等密集预测任务,在多个基准上取得竞争性能。
Comments ICML 2026
JUDO: 一种面向工业异常问答的多模态推理框架
机构 * Sungkyunkwan University(成均馆大学) ; Seoul National University(首尔国立大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出JUDO框架,通过结合领域知识和上下文提升多模态推理能力,以解决工业异常检测中模型缺乏领域知识的问题,实验表明其在MMAD基准上优于Qwen2.5-VL-7B和GPT-4o。
Comments Published at ICLR 2026