arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-05 至 2026-03-05 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2603.03637 2026-03-05 cs.CV cs.AI cs.CR 81%

Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions

基于图像的提示注入:通过视觉嵌入的对抗性指令劫持多模态大语言模型

Neha Nagaraja, Lan Zhang, Zhilong Wang, Bo Zhang, Pawan Patil

机构 * Northern Arizona University(北亚利桑那大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究提出基于图像的提示注入攻击方法,通过视觉嵌入对抗性指令,成功操控多模态大语言模型输出,揭示了该攻击的有效性和潜在威胁。

Comments 7 pages, published in 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria, 2025, pp. 916-922

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02929 2026-03-05 cs.CV 79%

TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval

TRACE:面向通用多模态检索的任务自适应推理与表征学习

Xiangzhao Hao, Shijie Wang, Tianyu Yang, Tianyue Wang, Haiyun Guo, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 TRACE通过结合生成推理与判别表征学习,实现通用多模态检索中的任务自适应推理,提升检索准确率与推理效率,同时具备强零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10889 2026-03-05 cs.CV cs.AI cs.LG 73%

Topological Alignment of Shared Vision-Language Embedding Space

共享视觉-语言嵌入空间的拓扑对齐

Junwon You, Dasol Kang, Jae-Hun Jung

机构 * Department of Mathematics, POSTECH(POSTECH数学系) BootCamp, Google(Google BootCamp)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 ToMCLIP通过拓扑对齐方法提升多语言视觉-语言模型的结构一致性和零样本性能

Comments 27 pages, 5 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03617 2026-03-05 cs.CV 70%

RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation

RAGTrack: 基于检索增强生成的语言感知RGBT跟踪

Hao Li, Yuhao Wang, Wenning Hao, Pingping Zhang, Dong Wang, Huchuan Lu

机构 * College of Command and Control Engineering, Army Engineering University of PLA(中国人民解放军陆军工程大学指挥控制工程学院) School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 RAGTrack通过引入语言指导的检索增强生成框架,解决RGBT跟踪中外观变化和模态间隙问题,实现稳健的目标定位。

Comments This work is accepted by CVPR2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19888 2026-03-05 cs.CV cs.LG 57%

FlowCLAS: Enhancing Normalizing Flow Via Contrastive Learning For Anomaly Segmentation

通过对比学习增强归一化流用于异常分割

Chang Won Lee, Selina Leveugle, Svetlana Stolpner, Chris Langley, Paul Grouchy, Jonathan Kelly, Steven L. Waslander

机构 * University of Toronto(多伦多大学) MDA Space(MDA空间)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 FlowCLAS通过对比学习增强归一化流,有效提升异常分割性能,达到多个机器人异常分割基准的最先进水平。

Comments WACV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏