arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-08 至 2026-07-08 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2607.06032 2026-07-08 cs.IR 新提交 88%

Uncertainty-Aware Cross-Modal Remote Sensing Image-Text Retrieval via Evidential Learning

通过证据学习实现不确定性感知的跨模态遥感图像-文本检索

Zhuoyue Wang, Xueqian Wang, Gang Li, Chengxi Li, Yongpan Liu, Yifang Ban

专题命中 图文多模态 :cross-modal(title,abstract);image-text(title,abstract)

AI总结 针对跨模态遥感图像-文本检索中测试条件非理想、现有方法检索结果不可靠的问题,提出基于证据学习的ELC方法,通过EDL、UCL、RL建模及优化,经实验验证该方法相比现有方法有竞争力且鲁棒性更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05438 2026-07-08 cs.IR cs.AI 新提交 79%

Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级

Xue Li, Yiming Gai

机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18419 2026-07-08 cs.CV cs.AI 版本更新 73%

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15516 2026-07-08 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

Explainable embeddings with Distance Explainer

可解释的嵌入表示与距离解释器

Christiaan Meijer, E. G. Patrick Bos

机构 * Netherlands eScience Center(荷兰eScience中心) Center for Information Technology(信息科技中心) University of Groningen(格罗宁根大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Distance Explainer,通过选择性遮蔽和距离排序的遮蔽过滤生成嵌入空间的局部后验解释,验证了其在跨模态嵌入中的有效性,提升了深度学习应用的透明度和可信度。

Comments 21 pages, 12 figures. Accepted to the 4th World Conference on eXplainable Artificial Intelligence. Method implementation: https://research-software-directory.org/software/distance-explainer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交 57%

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 57%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏