2608.13861 2026-08-17 cs.CV 新提交 79% XSA-MAD: Cross-modal Semantic Alignment for Morphing Attack Detection XSA-MAD:用于变形攻击检测的跨模态语义对齐 Jie Jin, Mahiro Tokumasu, Yu Makino, Masakatsu Nishigaki, Tetsushi Ohki 机构 * RIKEN AIP(理化学研究所人工智能项目) 纠错 专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV AI总结 针对现有图像型变形攻击检测方法泛化性差的问题,提出基于CLIP的多模态框架XSA-MAD,通过对齐图像与语义空间实现对不同变形攻击的检测,在高保真攻击下性能优于现有方法 Comments accepted to ICIP2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2602.21956 2026-08-17 cs.CV 版本更新 77% Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation 全局-局部双感知用于高分辨率文本密集图像翻译的MLLMs Junxin Lu, Tengfei Song, Zhanglin Wu, Pengfei Li, Xiaowei Liang, Hui Yang, Kun Chen, Ning Xie, Yunfei Lu, Jing Zhao, Shiliang Sun, Daimeng Wei 机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Labs, Huawei Technologies Co., LTD(华为技术有限公司2012实验室) ; School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) 纠错 专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV AI总结 本文提出GLoTran框架,通过全局-局部双感知方法提升高分辨率文本密集图像翻译的准确性和完整性。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图