arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-21 至 2026-07-21 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 8 篇

2607.17673 2026-07-21 cs.LG cs.AI 新提交 83%

Beyond Objective Expressivity: Geometry Preservation in Multimodal Contrastive Learning

超越目标表现力:多模态对比学习中的几何保留

Tillmann Rheude, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health, Charité - Universitätsmedizin Berlin(柏林健康研究院,柏林夏里特大学医学中心) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系) Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究院)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 研究多模态对比学习从成对扩展到高阶对齐的挑战,确定编码器雅可比条件是关键因素,引入几何保留编码器,通过正则化调节雅可比,实验证明改善其条件可提升检索和线性探针性能,表明多模态对比学习还取决于编码器几何和优化属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25693 2026-07-21 cs.AI 版本更新 83%

RADD: Retrieval-Augmented Discrete Diffusion for Multi-Modal Knowledge Graph Completion

RADD:基于检索的离散扩散用于多模态知识图谱补全

Guanglin Niu, Bo Li

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出RADD框架,通过分离检索与重排序过程,提升多模态知识图谱补全的性能,实验表明其在多个基准上表现最佳。

Comments 13 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16208 2026-07-21 cs.AI cs.CL 新提交 81%

ColGraphRAG: Late-Interaction Evidence Retrieval for Multimodal GraphRAG

ColGraphRAG:用于多模态GraphRAG的后期交互证据检索

Seonok Kim

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究多模态问答中基于图的证据检索问题,核心方法是在ColBERT/ColPali系列中用后期交互多向量评分替换视觉候选排序算子,主要贡献是改进了图相连图像候选检索及下游问答效果,揭示视觉证据作用模式,为后续工作指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16316 2026-07-21 cs.CV 新提交 79%

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

Eddy-VL 1.9B:用于边缘可部署多模态嵌入的结构剪枝与分层蒸馏

HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

机构 * Urock-AI Lab(Urock人工智能实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍用于边缘可部署视觉语言检索的Eddy-VL 1.9B模型,采用探针驱动结构剪枝和分层知识蒸馏压缩,参数减少约9.5%,在MMEB-V2等评估中保留教师模型大部分性能,降低延迟,证明其在受限边缘部署下多模态检索的有效性。

Comments 11pages,4figures,Model weights and inference code are available on Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10677 2026-07-21 cs.CL cs.AI 版本更新 62%

A Survey on Knowledge-Oriented Retrieval-Augmented Generation

面向知识的检索增强生成综述

Mingyue Cheng, Yucong Luo, Jie Ouyang, Qi Liu, Huijie Liu, Li Li, Shuo Yu, Bohou Zhang, Jiawei Cao, Jie Ma, Daoyu Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该综述对检索增强生成进行全面概述,涵盖其基本组件、关键特性、分类法、评估基准及应用等,讨论了相关挑战与新兴研究方向,强调其在自然语言处理中应对现实挑战及推动发展的潜力。

Comments Accepted by ACM Transactions on Information Systems (TOIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16321 2026-07-21 cs.CV cs.IR 新提交 57%

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

超越语义的艺术:用于多关系表示的层状信息对比学习

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

机构 * University of Zurich(苏黎世大学) Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) Sapienza University of Rome(罗马第一大学) Amazon(亚马逊) University of Amsterdam(阿姆斯特丹大学) The University of Osaka(大阪大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17651 2026-07-21 cs.RO 新提交 50%

HCPG-Flow:Hierarchical Contact-Progress Guidance for Flow-Policy Robot Manipulation

HCPG-Flow:用于流策略机器人操作的分层接触进展引导

Guanghu Xie, Mingxu Li, Shuo Zhang, Yonglong Zhang, Yifan Yang, Yang Liu, Zongwu Xie, Baoshi Cao

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人技术与系统国家重点实验室,哈尔滨工业大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究机器人操作流策略中动作选择问题,提出HCPG-Flow方法,通过分层、以对象为中心的接触进展引导增强SAC-Flow,在模拟和物理任务中提高成功率,减少完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05353 2026-07-21 cs.LG cs.IT math.IT 版本更新 50%

GlyRAG: Context-Aware Retrieval-Augmented Framework for Blood Glucose Forecasting

GlyRAG:用于血糖预测的上下文感知检索增强框架

Shovito Barua Soumma, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究旨在利用连续血糖监测数据进行准确血糖预测,开发了GlyRAG框架,结合大语言模型提取上下文信息并通过检索增强预测,在OhioT1DM和AZT1D数据集上评估,显著提高长期预测的均方根误差,多数预测落在临床可接受区域。

详情

展开后加载摘要…

URL PDF HTML 收藏