arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-02 至 2026-04-02 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2601.08476 2026-04-02 cs.CV cs.MM 81%

Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models

跨模态代理演化用于领域外检测与视觉-语言模型

Hao Tang, Yu Liu, Shuanglin Yan, Fei Shen, Shengfeng He, Jing Qin

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoEvo框架,通过双向样本条件适应文本和视觉代理,动态挖掘上下文文本负样本并迭代优化视觉代理,提升跨模态对齐和领域外检测鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00455 2026-04-02 cs.CV cs.AI cs.CL 67%

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

首个Logit提升:一种缓解大视觉-语言模型中物体幻觉的视觉 grounding 方法

Jiwoo Ha, Jongwoo Baek, Jinhyun So

机构 * DGIST EECS(大邱庆北科学技术院电子工程与计算机科学系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出FLB方法,通过存储首个生成token的logit并加到后续预测中,缓解大视觉-语言模型中的长期衰减问题,有效减少物体幻觉并保持视觉信息。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00820 2026-04-02 cs.CV 57%

Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis

遥感持续视觉-语言学习:基准测试与分析

Xingxing Weng, Ruifeng Ni, Chao Pang, XiangYu Hao, Yishan Wang, Xiaokang Zhang, Wei Xu, Gui-Song Xia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出CLEaRS基准,评估遥感视觉-语言模型的持续学习能力,发现现有模型存在灾难性遗忘,需开发专用持续学习方法。

Comments 23 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV 57%

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏