arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-21 至 2026-08-21 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2608.19218 2026-08-21 cs.CL cs.AI cs.LG 新提交 86%

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life

用于将多模态语言模型与剩余使用寿命关联的时间序列检索

Valeriu Dimidov, Raphaël Frank

机构 * University of Luxembourg(卢森堡大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22547 2026-08-21 cs.CV cs.AI 版本更新 84%

MKG-CARE: Case-Aware Reasoning with Multimodal Knowledge Graphs for Explainable Medical Image Diagnosis

基于多模态知识图谱和可靠性引导精化的病例感知医学图像分类

Yiming Xu, Yixuan Liu, Yuhang Zhang, Ling Zheng, Yihan Wang, Qi Song

机构 * University of Science and Technology of China(科学技术大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于多模态知识图谱的病例感知推理框架,通过构建结构化诊断记忆、自适应检索相似病例、知识传播与注入机制以及置信度校准的决策精化方案,提升医学图像分类的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20019 2026-08-21 cs.AI 新提交 83%

Contrastive Mixed Prompt Learning for Incomplete Multimodal Sentiment Analysis with Unseen Modality Combination

针对未见模态组合的不完整多模态情感分析的对比混合提示学习

Kaixin Xu, NaiJin Liu, Yulin Kang, Tangyue Jin, Zixuan Yu, Wenxi Zhao, Yibei Liu, Qianle Zhang, Yangyang Wu, Mengying Zhu, Meng Xi

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对未见模态组合下的不完整多模态情感分析问题,提出CMPL模型,通过标签引导对比学习、带软路由的模态组合提示及三种提示对比策略,在三类数据集上较SOTA准确率提升超5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16106 2026-08-21 cs.CL 版本更新 79%

Explainable Multimodal Depression Recognition in Clinical Interviews via PHQ-Aligned Symptom Summarization

基于PHQ对齐症状总结的临床访谈中可解释多模态抑郁识别

Wenjie Zheng, Qiming Xie, Jianfei Yu, Yang Wang, Lei Cao, Fei Wang, Shijin Wang, Rui Xia, Chengqing Zong

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对临床访谈多模态抑郁识别的可解释性不足问题,提出Explain-MDRC框架,构建含PHQ-8对齐注释的Explain-DAIC数据集,开发PhqCML模型,提升识别性能并提供可解释中间证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19536 2026-08-21 cs.CV cs.AI cs.RO 新提交 76%

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

CVSD-Reg:用于鲁棒激光雷达配准的跨模态视觉语义先验蒸馏

Eunsoo Im, Junghun Suh, Gyeonggwan Lee, Seunghwan Hong

专题命中 跨模态检索 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出CVSD-Reg框架,通过蒸馏视觉基础模型的语义先验提升激光雷达配准的鲁棒性,在多数据集上的成功率优于现有方法,且无需相机输入或事后ICP精修。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18521 2026-08-21 cs.AI cs.LG 版本更新 57%

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔

Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoying Tang

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22073 2026-08-21 cs.IR 版本更新 50%

BRIDGE: Behavior-Guided Residual Integration with Dual-Frequency Graph Evidence

基于行为的候选校准用于多模态推荐

Zesheng Li, Chengchang Pan, Honggang Qi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出了一种基于行为的候选校准方法,通过将训练-only的共用户重叠转换为带符号的候选证据,并仅应用于多模态骨干网络生成的短名单,以提高多模态推荐系统的性能。

Comments 12 pages, 3 figures. Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026). Project page: this https URL (https://lizesheng13.github.io/bridge/)

详情

展开后加载摘要…

URL PDF HTML 收藏