arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-07 至 2026-08-07 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2608.06059 2026-08-07 cs.CV 新提交 83%

DARAD: Dual Adapters and Ranking-Aware Distillation for Continual Remote Sensing Image-Text Retrieval

DARAD:用于持续遥感图像-文本检索的双适配器与排序感知蒸馏框架

Xi Chen, Xu Chen, Xiangyang Jia, Wei Wang, Xu Zhang, Zhenyuan Sun

专题命中 跨模态检索 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对持续遥感图像-文本检索中跨模态对齐空间失真的问题,提出双适配器与排序感知蒸馏框架DARAD,通过双分支设计与双向排序蒸馏实现新数据适应性与历史数据有效性的平衡,性能优于现有持续学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06060 2026-08-07 cs.CV 新提交 79%

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索

Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。

Comments 26 pages,10 figures,14 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20269 2026-08-07 cs.CR cs.AI 版本更新 79%

Text Steganography with Dynamic Codebook and Multimodal Large Language Model

基于动态代码本和多模态大语言模型的文本隐写术

Jianxin Gao, Ruohan Lei, Wanli Peng

机构 * China Agricultural University(中国农业大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于动态代码本和多模态大语言模型的文本隐写术,通过共享会话配置和多模态模型构建动态代码本,设计加密隐写映射并引入反馈优化机制,提升隐写术的安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05655 2026-08-07 cs.IR 新提交 78%

Is Personalized Modality Weighting Actually Personalized? A Controlled Audit of Per-User Weighting Claims in Multimodal Recommenders

个性化模态加权真的是个性化的吗?多模态推荐器中每用户加权声明的受控审计

Jingyuan Zheng, Xin Zhang, Yang Gu, Dongjing Wang, Yuxiang Wang, Xudong Shen, Haiping Zhang, Youhuizi Li, Dongjin Yu

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 该研究审计多模态推荐器的每用户模态加权是否真正个性化,发现单一全局模态权重已提供几乎全部内容增益,每用户加权无一致效用,建议将real-GM与real-shuf作为个性化声明的最低证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01280 2026-08-07 cs.CV cs.AI cs.CL 版本更新 67%

Look Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question Answering

二次审视:多模态大语言模型中的免训练证据高亮

Marco Morini, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Look Twice框架,通过模型注意力模式识别相关视觉区域和文本证据,提升预训练MLLMs在多模态证据利用中的表现,实验显示在多个VQA基准上效果显著。

Comments Project Page: https://aimagelab.github.io/LoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 57%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11313 2026-08-07 cs.CV 57%

Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval

Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

机构 * Southeast University(东南大学) The University of Adelaide(阿德莱德大学) The Hong Kong Polytechnic University(香港理工大学) The University of Western Australia(西澳大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏