arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-19 至 2026-05-19 共收录 177 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 33 篇

2510.16416 2026-05-19 cs.CV cs.AI 62%

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL:重新审视自监督学习作为视觉语言推理的内在奖励

Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(技术大学(TUM)) Meituan(美团) Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SSL4RL框架,利用自监督学习任务作为强化学习的可验证奖励,提升视觉语言推理性能,并通过实验验证其在多模态模型对齐中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16464 2026-05-19 cs.CV cs.AI 62%

MHMamba: Multi-Head Mamba for 3D Brain Tumor Segmentation

MHMamba:多头Mamba用于3D脑肿瘤分割

Hanjun Tao, Hua Wang, Fan Zhang

机构 * Shandong Technology and Business University(山东科技与商务大学) Ludong University(鲁东大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MHMamba,结合U型结构与多头状态空间模型,提升3D脑肿瘤分割的长程表示与多模态训练稳定性,实验显示在BraTS数据集上整体准确率和边界平滑度显著提升。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16418 2026-05-19 cs.CV cs.AI 62%

Neural Visual Decoding via Cognitive guided Adaptive Blurring and Information Constrained Alignment

通过认知引导的自适应模糊和信息受限对齐实现神经视觉解码

Fan Yin, Chuhang Zheng, Peiliang Gong, Donghai Guan, Qi Zhu

机构 * Department of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) Department of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CAIA框架,通过认知引导的自适应模糊和信息受限对齐,提升神经信号与视觉语义的映射精度,改进零样本脑-图像检索的Top-1和Top-5准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18039 2026-05-19 cs.CV 57%

SGSoft: Learning Fused Semantic-Geometric Features for 3D Shape Correspondence via Template-Guided Soft Signals

SGSoft: 通过模板引导的软信号学习融合语义-几何特征以实现3D形状对应

Soyeon Yoon, Chang Wook Seo, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Anigma Technologies(Anigma科技公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SGSoft方法,通过模板引导的软信号学习融合语义-几何特征,实现3D形状对应,解决了结构变化、非等距变形和拓扑不一致的挑战,实现了最先进的跨类别泛化和最佳精度-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17354 2026-05-19 cs.CV 57%

GeoHand: Unlocking Prior Geometry Knowledge for Monocular 3D Hand Reconstruction

GeoHand: 解锁先验几何知识以实现单目3D手形 reconstruction

Weiquan Lin, Yaoqing Hu, Liangchen Dai, Xu Tang, Xingyu Chen

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Zhongguancun Academy(中关村学院) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GeoHand框架,通过解锁冻结的基础单目几何估计器MoGe2中的高质量几何先验,结合地图级GeoAdapter和门控跨模态token融合策略,实现高精度手形重建,尤其在严重遮挡和手-物体交互场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16973 2026-05-19 cs.CV cs.LG 57%

SHED: Style-Homogenized Embedding Alignment for Domain Generalization

SHED: 风格均质化嵌入对齐用于领域泛化

Kai Gan, Tong Wei

机构 * School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(1 东南大学计算机科学与工程学院,南京 210096,中国) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(2 教育部计算机网络与信息集成重点实验室(东南大学),中国)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 本文提出SHED方法,通过均质化嵌入对齐来解决领域泛化中的信息不对称问题,实验表明其在多个基准测试中取得了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16893 2026-05-19 cs.AI 57%

NGM: A Plug-and-Play Training-Free Memory Module for LLMs

NGM: 一种无需训练的插拔式内存模块用于大语言模型

Yuwen Qu, Wenhui Dong, Chenyang Si, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出NGM,一种无需训练的插拔式内存模块,通过因果n-gram编码器和余弦门控内存注入器,实现高效的知识检索,提升大语言模型在代码生成和知识密集型任务中的性能。

Comments Code is available at https://github.com/PioneerQyw/NGM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16768 2026-05-19 cs.CV eess.IV 57%

Axial-Relation Guided Fusion State Space Model for Optical-Elevation Sensing Image Segmentation

基于轴向关系引导的融合状态空间模型用于光学-海拔感测图像分割

Feng Gao, Zhilin Jin, Yanhai Gan, Junyu Dong, Qian Du

机构 * State Key Laboratory of Physical Oceanography, Ocean University of China(中国海洋大学物理海洋学国家重点实验室) Department of Electrical and Computer Engineering, Mississippi State University(密苏里州立大学电气与计算机工程系)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于状态空间模型的框架,用于光学-海拔遥感图像分割,通过引入多尺度状态空间模块和轴向关系引导融合模块,有效提升了多源遥感图像语义分割的性能和计算效率。

Comments Accepted by IEEE GRSL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10027 2026-05-19 cs.CV 57%

SinkTrack: Attention Sink based Context Anchoring for Large Language Models

SinkTrack: 基于注意力sink的上下文锚定用于大语言模型

Xu Liu, Guikun Chen, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 SinkTrack通过将<BOS>作为信息锚点,注入关键上下文特征,缓解大语言模型的幻觉和上下文遗忘问题,实验显示在文本和多模态任务中均取得显著提升。

Comments ICLR 2026. Code: https://github.com/67L1/SinkTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08936 2026-05-19 cs.CV 57%

M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model

M-IDoL:面向医学基础模型的模态特定与多样化表示学习的信息分解

Yihang Liu, Longzhen Yang, Jiaxiong Yang, Ying Wen, Lianghua He, Heng Tao Shen

机构 * School of Computer Science and Technique(计算机科学与技术学院) Tongji University(同济大学) School of Communications and Electronic Engineering(通讯与电子工程学院) East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出M-IDoL,通过信息分解提升医学基础模型的模态特异性和多样性,通过最大化跨模态熵和最小化内模态不确定性,在21个下游任务中实现优于现有模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16085 2026-05-19 cond-mat.mtrl-sci cs.CV 57%

Machine Learning Enabled Graph Analysis of Particulate Composites: Application to Solid-state Battery Cathodes

机器学习赋能的颗粒复合材料分析:应用于固态电池正极

Zebin Li, Shimao Deng, Yijin Liu, Jia-Mian Hu

机构 * Department of Materials Science and Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校材料科学与工程系) Walker Department of Mechanical Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于机器学习的框架,将多模态X射线图像转化为拓扑感知图,用于分析颗粒复合材料的微观结构与性能关系,以固态电池正极为例验证了三相交点和离子/电子传导通道的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22901 2026-05-19 cs.LG cs.AI q-bio.BM q-bio.GN 57%

Missing-Modality-Aware Graph Neural Network for Cancer Classification

面向缺失模态的图神经网络用于癌症分类

Sina Tabakhi, Chen, Chen, Haiping Lu

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MAGNET模型,通过动态患者-模态多头注意力机制融合低维模态嵌入,以提升部分模态下的多模态预测性能,实验表明其在癌症分类任务中优于现有方法。

Comments 27 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16414 2026-05-19 cs.CV 57%

NERVE: A Neuromorphic Vision and Radar Ensemble for Multi-Sensor Fusion Research

NERVE:一种用于多传感器融合研究的神经形态视觉与雷达集成系统

Omar Mansour, Pietro Martinello, Ethan Milon, YingFu Xu, Manolis Sifalakis, Guangzhi Tang, Amirreza Yousefzadeh

机构 * 1University of Twente, Netherlands 2University of Modena 3University of Strasbourg, France 4IMEC the Netherlands, Netherlands 5Innatera, Netherlands 6Maastricht University, Netherlands

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 NERVE包含257分钟同步记录的多传感器数据,用于评估多模态融合,通过DVS与雷达结合提升人体检测和距离估计性能。

Comments To be published in ICJNN 2026 Maastricht

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17170 2026-05-19 cs.LG 50%

TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks

TriAxialKV: 向极低精度KV缓存量化迈进以应对代理推理任务

Hanzhang Shen, Haoran Wu, Yiren Zhao, Robert Mullins

机构 * University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出TriAxialKV,一种混合精度的KV缓存量化方案,通过为每个token分配三轴标签,校准每种标签的敏感性,并在固定内存预算下分配INT2/INT4位宽,以提高代理推理任务的效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16610 2026-05-19 cs.LG cs.GL 50%

Tensor Cookbook: Mastering Tensors through Diagrams

张量烹饪书:通过图表掌握张量

Beheshteh T. Rakhshan, Guillaume Rabusseau

机构 * Mila & DIRO(Mila与DIRO) Université de Montréal(蒙特利尔大学) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文通过图表语言阐述张量网络及其在张量代数中的应用,展示如何用图形化方法简化高维数据处理和梯度推导。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 12 篇

2605.18044 2026-05-19 cs.IR cs.MM 83%

Modality-Aware Identity Construction and Counterfactual Structure Learning for ID-Free Multimodal Recommendation

模态感知的身份构建与反事实结构学习用于无ID多模态推荐

Hongjian Ma, Wenxin Huang, Yan Zhang, Zhifei Li, Zheng Wang

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出了一种名为MAIL的新型方法,通过模态感知的身份构建模块和反事实结构学习范式,解决无ID多模态推荐中身份表示静态和图学习不足的问题,提升了推荐准确率。

Comments 11 pages, 5 figures, submitted to IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04872 2026-05-19 stat.ML cs.AI cs.LG 79%

Multi-layer Cross-attention is Provably Optimal for Multi-modal In-context Learning

多层交叉注意力是多模态上下文学习中可证明最优的

Nicholas Barnfield, Subhabrata Sen, Pragya Sur

机构 * Harvard University(哈佛大学)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文研究了多模态上下文学习中多层交叉注意力机制的理论最优性,证明了在多模态数据下,交叉注意力机制在梯度流优化下可达到贝叶斯最优,同时指出单层线性自注意力无法在任务分布下统一恢复贝叶斯最优预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16397 2026-05-19 cs.CV cs.AI 62%

Trajectory-Aware Adaptive Inference in Object Detection Models

轨迹感知的自适应推理在目标检测模型中

Grigorios Papanikolaou, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

机构 * Department of Electrical and Computer Engineering, National Technical University of Athens, Greece(电子与计算机工程系,国家技术大学亚历山大学院,希腊) Department of Product and Systems Design Engineering, University of the Aegean, Syros, Greece(产品与系统设计工程系,爱琴海大学,西罗斯,希腊)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用GPS轨迹数据优化目标检测模型的推理过程,通过引入早退机制减少计算成本,提升实时感知效率。

Comments Accepted to the MuseKDE workshop of the IEEE MDM 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16414 2026-05-19 cs.LG cs.AI 57%

PyHealth 2.0: A Comprehensive Open-Source Toolkit for Accessible and Reproducible Clinical Deep Learning

PyHealth 2.0: 一个全面的开源工具包,用于可访问和可重复的临床深度学习

John Wu, Yongda Fan, Zhenbang Wu, Paul Landes, Eric Schrock, Sayeed Sajjad Razin, Arjun Chatterjee, Naveen Baskaran, Joshua Steier, Andrea Fitzpatrick, Bilal Arif, Rian Atri, Jathurshan Pradeepkumar, Siddhartha Laghuvarapu, Junyi Gao, Adam R. Cross, Jimeng Sun

机构 * University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校) PyHealth Research Initiative(PyHealth研究计划) University of Illinois College of Medicine, Chicago, IL, USA(伊利诺伊大学医学院) The University of Edinburgh, Edinburgh, UK(爱丁堡大学) Health Data Research UK, London, UK(英国健康数据研究) Department of Biomedical Engineering, Bangladesh University of Engineering(孟加拉国工程大学生物医学工程系)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PyHealth 2.0,一个全面的开源工具包,旨在解决临床AI研究中的可重复性和可访问性问题,通过统一15+数据集、20+临床任务、25+模型、5+可解释性方法和不确定性量化方法,实现7行代码即可完成预测建模。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17021 2026-05-19 cs.AI 57%

A Conflict-aware Evidential Framework for Reliable Sleep Stage Classification

一种考虑冲突的证据框架用于可靠的睡眠阶段分类

Yunzhi Tian, Dekui Wang, Qirong Bu, Wei Zhou, Xingxing Hao, Jun Feng

机构 * College of Computer Science, Northwest University, Xi'an, China(西北大学计算机科学学院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种考虑冲突的证据框架ConfSleepNet,用于可靠地进行睡眠阶段分类,通过动态解决不同视图之间的冲突,提高分类的可靠性。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16880 2026-05-19 cs.AI 57%

Virtual Nodes Guided Dynamic Graph Neural Network for Brain Tumor Segmentation with Missing Modalities

虚拟节点引导的动态图神经网络用于缺失模态的脑肿瘤分割

Sha Tao, Jiao Pan, Yu Guo, Chao Yao

机构 * University of Science and Technology Beijing(科学技术大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于图的单阶段框架,通过引入模态特定的虚拟节点来补偿缺失模态,利用图网络的灵活性设计动态连接策略,提升模型对任意模态组合的鲁棒性,并在BRATS-2018和BRATS-2020数据集上验证了方法在不完整模态下的优越性能。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16392 2026-05-19 q-bio.QM cs.CV cs.LG 57%

Bridging the Modality Bottleneck in Pathology MIL through Virtual Molecular Staining

弥合病理MIL中的模态瓶颈:通过虚拟分子染色

Yucheng Xing, Pei Liu, Jingying Ma, Ruping Hong, Jiangdong Qiu, Tianyu Liu, Kai He, Ling Huang, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Hunan University(湖南大学) Peking Union Medical College Hospital (PUMCH)(北京协和医学院附属阜外医院) Imperial College London(伦敦帝国理工学院)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出MIST方法,通过虚拟分子染色提升病理MIL中投影层性能,改进240/256配置,平均提升3.5%,在生存预测、组织分型和生物标志物预测中分别提升5.2%、3.3%和2.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18698 2026-05-19 cs.HC 50%

Contextualized Dynamic Explanations: A Vision

上下文化动态解释:一种愿景

Zhicheng Liu, Jason H Li, Greg Briskin

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于动态受众模型和预定义沟通意图的上下文化动态解释(CODEX)方法,旨在通过自主代理生成多模态信息界面,提升数据驱动解释的效果。

Comments 1st Workshop on GenAI, Agents, and the Future of VIS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18311 2026-05-19 cs.HC 50%

Distorted Perspectives of LLM-Simulated Preferences: Can AI Mislead Design?

LLM模拟偏好中的扭曲视角:AI是否能误导设计?

Eduard Kuric, Peter Demcak, Matus Krajcovic

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究探讨了LLM驱动的模拟方法所表达的设计偏好与真实用户偏好的一致性,发现LLM模拟在多个操纵下均存在系统性差异,其合成解释缺乏真实深度和细微差别,主要通过关注通用属性、特定元素、详述和过度赞扬等模式来替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17808 2026-05-19 cs.LG stat.ML 50%

A Unified Framework for Data-Free One-Step Sampling via Wasserstein Gradient Flows

通过Wasserstein梯度流构建数据免费一步采样的统一框架

Chenguang Wang, Tianshu Yu

机构 * School of Data Science(数据科学学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种基于Wasserstein梯度流的数据免费一步采样的统一理论框架,展示了f-分歧度目标下诱导速度场的通用形式,并通过软欠覆盖功能理论推导了分歧度选择与质量运输几何之间的压缩-弹性恒等式,进一步扩展到Log-Variance分歧度,并通过KDE实现和归一化流路线实现了一步推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21426 2026-05-19 cs.LG stat.CO 50%

Proximal-IMH: Proximal Posterior Proposals for Independent Metropolis-Hastings with Approximate Operators

Proximal-IMH: 用于独立Metropolis-Hastings的近端后验提议

Youguang Chen, George Biros

机构 * Oden Institute for Computational Engineering and Sciences(奥登计算工程与科学研究所)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种改进的独立Metropolis-Hastings算法,通过引入辅助优化问题来消除近似后验分布中的偏差,从而在保持精确模型的同时提高稳定性和采样效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16645 2026-05-19 math.ST cs.IT cs.LG math.IT stat.ML stat.TH 50%

Statistical Unlearning of Distributions: A Hypothesis Testing Approach

分布统计遗忘:一种假设检验方法

Aaradhya Pandey, Sanjeev Kulkarni

机构 * Princeton University(普林斯顿大学)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种分布统计遗忘框架,通过假设检验选择样本以减少不需要的分布影响,同时保持所需分布的性能,并分析了允许的编辑数据分布区域和帕累托前沿。

Comments Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏