arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-07-27 至 2026-07-27 共收录 6
2607.22494 2026-07-27 cs.MM cs.CV 新提交

CARA: Concept-Aware Risk Attention for Interpretable Collision Anticipation

CARA:用于可解释碰撞预测的概念感知风险注意力

Zhishan Tao, Ruoyu Wang, Yucheng Wu, Enjun Du, Yilei Yuan, Sherwin Ho, Yue Su, Jinbo Su, Yi Hong

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学) Renmin University of China(中国人民大学)

AI总结 研究自动驾驶碰撞预测问题,提出CARA框架,从事故叙述中获取风险概念并与视频帧对齐成轨迹,将语义风险因素作为动态证据,结合可解释性与预测过程,实验证明其能提高预测准确性和预警及时性。

Comments Accepted to ACM Multimedia 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21973 2026-07-27 cs.CV 新提交

Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation

重新思考视觉基础模型适应中的逐层信息分配

Yuqi Li, Xi Xiao, Yunbei Zhang, Lin Zhao, Yu Li, Aiden Zhao, Tianyang Wang, Hao Xu, Yingli Tian

机构 * City College of New York, CUNY(纽约市立大学城市学院) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) Northeastern University(东北大学) George Washington University(乔治华盛顿大学) Capital One(第一资本金融公司) Harvard University(哈佛大学)

AI总结 研究视觉基础模型适应中的逐层信息分配问题,提出基于信息瓶颈原理的PIB框架,规范逐层压缩与充分性权衡,促进跨层信息连贯,实验表明该方法在多数据集上表现出色,能解释提示容量缩放行为等。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21908 2026-07-27 cs.MM 新提交

Unsupervised Multimodal Intent Discovery via MLLM-Guided Concept Generation and Semantic Propagation

通过MLLM引导的概念生成和语义传播进行无监督多模态意图发现

Yunjin Gu, Qianrui Zhou, Hua Xu

AI总结 该研究针对无监督多模态意图发现缺乏语义监督及可解释性差的问题,提出MCSP方法,通过MLLM引导的对比推理获取语义概念,再经语义传播生成伪标签,实验证明其性能优于现有方法且能产生可解释的簇。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21897 2026-07-27 cs.CV cs.AI cs.CR 新提交

ISPCloak: Weaponizing ISP for Optimization-Free Physical Camouflage against Deepfake Detectors

ISPCloak:利用互联网服务提供商实现针对深度伪造检测器的无优化物理伪装

Jiale Zhao, Jiajun Wan, Lei Tang, Ye Qin, Kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

AI总结 研究针对深度伪造检测器的对抗攻击,提出ISPCloak框架,利用ISP管道,通过投影到RAW域、注入噪声和前向ISP重建等,将真实相机统计先验印在生成图像上,快速生成对抗样本,扰乱检测机制。

Comments Accpted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10058 2026-07-27 cs.CV 版本更新

Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation

正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成

Sung-Lin Tsai, Bo-Lun Huang, Yu Ting Shen, Cheng Yu Yeo, Chiang Tseng, Bo-Kai Ruan, Wen-Sheng Lien, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。

Comments Accepted to ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16257 2026-07-27 cs.CV 版本更新

Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models

高质量文本,稳健视觉:语言在增强视觉语言模型视觉稳健性中的作用

Futa Waseda, Saku Sugawara, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(日本信息处理研究所) The University of Tokyo, National Institute of Informatics(东京大学、日本信息处理研究所)

AI总结 研究针对视觉语言模型对抗攻击问题,提出质量文本引导的对抗微调方法QT-AFT,利用高质量字幕提升视觉编码器对抗鲁棒性,在多个零样本数据集上实现了最先进的零样本对抗鲁棒性和纯净准确率,并揭示了语言增强视觉鲁棒性的关键见解。

Comments ACMMM 2025 Accepted. Codes are available at: https://github.com/futakw/QTAFT

详情

展开后加载摘要…

URL PDF HTML 收藏