arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-17 至 2026-08-17 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2608.13861 2026-08-17 cs.CV 新提交 79%

XSA-MAD: Cross-modal Semantic Alignment for Morphing Attack Detection

XSA-MAD:用于变形攻击检测的跨模态语义对齐

Jie Jin, Mahiro Tokumasu, Yu Makino, Masakatsu Nishigaki, Tetsushi Ohki

机构 * RIKEN AIP(理化学研究所人工智能项目)

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 针对现有图像型变形攻击检测方法泛化性差的问题,提出基于CLIP的多模态框架XSA-MAD,通过对齐图像与语义空间实现对不同变形攻击的检测,在高保真攻击下性能优于现有方法

Comments accepted to ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21956 2026-08-17 cs.CV 版本更新 77%

Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation

全局-局部双感知用于高分辨率文本密集图像翻译的MLLMs

Junxin Lu, Tengfei Song, Zhanglin Wu, Pengfei Li, Xiaowei Liang, Hui Yang, Kun Chen, Ning Xie, Yunfei Lu, Jing Zhao, Shiliang Sun, Daimeng Wei

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Labs, Huawei Technologies Co., LTD(华为技术有限公司2012实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出GLoTran框架,通过全局-局部双感知方法提升高分辨率文本密集图像翻译的准确性和完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏