arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-04 至 2026-05-04 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2605.00733 2026-05-04 cs.NI cs.AI cs.LG cs.MM 86%

EASE: Federated Multimodal Unlearning via Entanglement-Aware Anchor Closure

EASE: 通过纠缠感知锚闭合实现联邦多模态去学习

Zihao Ding, Beining Wu, Jun Huang

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI、cs.MM

AI总结 本文提出EASE框架,通过闭合三个锚通道解决联邦多模态学习中的遗忘知识纠缠问题,采用余弦-正弦分解和方向选择性遗忘锁等方法,在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 62%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00824 2026-05-04 cs.MM 57%

CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval

CustomDancer:通过文本-舞蹈检索实现定制化舞蹈推荐

Yawen Qin, Ke Qiu, Qin Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出CustomDancer框架,通过CLIP文本编码器、音乐与运动编码器及音乐-运动融合模块,实现文本与舞蹈的多模态检索,提升舞蹈推荐的个性化与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00323 2026-05-04 cs.CV cs.LG 57%

Online Self-Calibration Against Hallucination in Vision-Language Models

在线对抗幻觉的视觉-语言模型自我校准

Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏