arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-23 至 2026-06-23 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 13 篇

2606.22823 2026-06-23 cs.LG q-bio.QM 新提交 82%

Retrieval-Augmented Multimodal Learning for Enzyme-Substrate Interaction Prediction Under Low-Homology Shift

检索增强的多模态学习用于低同源性偏移下的酶-底物相互作用预测

Chen Liu, Bingxin Zhou, Xinyuan Wang, Ming Li, Guisheng Fan, Liang Hong

机构 * School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院) Institute of Natural Sciences and Zhangjiang Institute for Advanced Study, Shanghai Jiao Tong University(上海交通大学自然科学研究院和张江高等研究院) School of Life Sciences and Biotechnology, Shanghai Jiao Tong University(上海交通大学生命科学技术学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出RAMMESI框架,通过跨模态交互建模、自适应融合和检索增强,解决酶-底物相互作用预测中稀疏正监督和低同源性分布偏移问题,在低序列一致性场景下表现优异。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21156 2026-06-23 cs.CV cs.AI 新提交 81%

Contrastive and Adaptive Multi-modal Masked Autoencoder for Spatial Transcriptomics

对比自适应多模态掩码自编码器用于空间转录组学

Joohyeok Kim, Taejin Jeong, Jinyeong Kim, Seong Jae Hwang

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Department of Computer Science, Yonsei University(延世大学计算机科学系) Yonsei University College of Medicine(延世大学医学院)

专题命中 跨模态检索 :multi-modal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于掩码自编码器的空间插补方法,利用对比学习和自适应锚点选择,从少量基因表达和H&E图像预测全切片基因表达,在10%转录组覆盖下仍优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23291 2026-06-23 cs.IR 新提交 78%

URecJPQ: Memory-efficient Multimodal Recommendation Models through RecJPQ in Large-Scale Scenarios

URecJPQ:大规模场景下通过RecJPQ实现内存高效的多模态推荐模型

Giuseppe Spillo, Zixuan Yi, Aleksandr Petrov, Cataldo Musto, Craig Macdonald, Iadh Ounis

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出URecJPQ方法,通过联合乘积量化将用户/物品表示为共享子嵌入的拼接,显著减少参数量和内存占用,在大规模多模态推荐中实现86%-98%的模型压缩,仅轻微损失精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23539 2026-06-23 cs.CV 新提交 77%

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

LightSTAR: 通过视觉自适应精炼的轻量级选择实现高效视觉文档检索

Tongkun Guan, Haocheng Wang, Wei Shen, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院教育部人工智能重点实验室)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 提出LightSTAR框架,通过免LLM的视觉选择快速筛选候选页,再经视觉自适应语义精炼进行细粒度匹配,在保持高检索精度的同时大幅降低延迟。

Comments Accpeted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新 62%

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22872 2026-06-23 cs.CV 新提交 57%

Fursee: Hybrid YOLO-DINOv3 Framework for Fursuit Identity Retrieval and Clustering

Fursee: 用于毛装身份检索与聚类的混合YOLO-DINOv3框架

Jundi Wu

机构 * Shandong University(山东大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对毛装照片人工分类成本高的问题,提出三阶段混合框架Fursee,结合YOLO检测裁剪、ArcFace优化DINOv3嵌入和DBSCAN自动聚类,在检索与聚类任务上超越GPT5.5等主流多模态模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21838 2026-06-23 cs.CV cs.LG 新提交 57%

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification

超越平面标签:面向层次细粒度视觉分类的层级限制对比学习

Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Neuromatch Boston University(波士顿大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态对比学习在层次标签空间中预测不一致的问题,提出层级限制对比学习,仅在同一层级内进行对比,并采用组平衡设计,显著提升层次一致性和分类精度。

Comments Accepted to CVPR 2026 FGVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21174 2026-06-23 cs.CV q-bio.GN 新提交 57%

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis

HERO:基于假设驱动的组学证据检索用于多任务乳腺癌分析

Xiangyu Li, Ran Su

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出HERO框架,将组学数据作为形态学假设进行显式检索,通过稀疏通路先验和TF-IDF检索实现可审计的多模态乳腺癌分析,在TCGA-BRCA上取得多项预测任务的最优结果。

Comments 11 pages, 3 figures, Early accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08819 2026-06-23 cs.IR cs.AI 版本更新 57%

Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage

超越相关性:检索与RAG信息覆盖之间的关系

Saron Samuel, Alexander Martin, Eugene Yang, Andrew Yates, Dawn Lawrie, Ian Soboroff, Laura Dietz, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) National Institute of Standards and Technology(国家标准与技术研究院) University of New Hampshire(新罕布什尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究检索质量与生成响应信息覆盖的关系,发现基于覆盖的检索指标与生成响应中的要点覆盖强相关,支持用检索指标代理RAG性能。

Comments 12 pages, ICTIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13402 2026-06-23 cs.HC cs.IR cs.MM 57%

InfoCIR: Multimedia Analysis for Composed Image Retrieval

InfoCIR:面向复合图像检索的多媒体分析

Ioannis Dravilas, Ioannis Kapetangeorgis, Anastasios Latsoudis, Conor McCarthy, Gonçalo Marcelino, Marcel Worring

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 InfoCIR通过整合检索、可解释性与提示工程,提供交互式界面,帮助用户理解多模态提示与嵌入空间的交互,提升模型开发中的洞察力生成。

Comments 9+2 pages, 8 figures. Accepted for publication in IEEE PacificVis 2026 (Conference Track). Interactive composed image retrieval (CIR) and ranking explanation

Journal ref 2026 IEEE 19th Pacific Visualization Conference (PacificVis), Sydney, Australia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22307 2026-06-23 cs.CV 版本更新 57%

Johnson-Lindenstrauss Lemma Guided Network for Efficient 3D Medical Segmentation

Johnson-Lindenstrauss引理引导的高效3D医学分割网络

Jinpeng Lu, Linghan Cai, Yinda Chen, Guo Tang, Songhan Jiang, Haoyuan Shi, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Dresden University of Technology(德累斯顿理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出VeloxSeg,通过双流CNN-Transformer架构(PWA和JLC)结合格拉姆矩阵空间解耦知识迁移,在低计算预算下实现多模态3D医学图像高效分割,Dice提升26%,GPU吞吐量提升11倍。

Comments 30 pages, 12 figures. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23402 2026-06-23 cs.LG 新提交 50%

Physics-Informed Modeling for Wood Thermal Analysis and Prediction

木材热分析与预测的物理信息建模

Jingren Xie, Alex John Buckthal, Ryan Anthony O'Connor, Isak Worre Foged, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Centre for AI(人工智能先锋中心) The Royal Danish Academy(丹麦皇家艺术学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 提出物理信息深度学习框架,集成偏微分方程预测木材像素级热响应,通过软惩罚和硬编码两种方式嵌入物理知识,在三种真实木材数据集上优于纯数据驱动方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16689 2026-06-23 eess.SP cs.NI 版本更新 50%

Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence

反对单一无线世界模型:为什么NextG需要可组合和代理智能

Aladin Djuhera, Farhan Ahmed, Vlad C. Andrei, Swanand Ravindra Kadhe, Alecio Binotto, Haris Gacanin, Holger Boche

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文指出无线领域缺乏等同于LLM的数据基础,主张采用可组合和代理智能架构以实现可部署的AI原生网络。

Journal ref ICML 2026 Workshop on AI and ML for NextG

详情

展开后加载摘要…

URL PDF HTML 收藏