arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6872 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6872 篇

2607.22408 2026-07-27 cs.LG 新提交 82%

LunarFM: A Shared Multimodal Representation of the Moon's Surface

LunarFM:月球表面的共享多模态表示

Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-Pollán

机构 * University of Cambridge(剑桥大学) German Aerospace Center (DLR)(德国航空航天中心) SPAIDER SPACE(斯派德太空公司) Mines Paris - PSL University(巴黎矿业学院 - 巴黎文理研究大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) European Space Resources Innovation Center (ESRIC)(欧洲空间资源创新中心) Universidad de Antioquia(安蒂奥基亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 因月球探索需求,针对多源观测致月球表面分析碎片化问题,提出LunarFM多模态基础模型,融合多仪器观测学习通用表示,支持多种下游应用,还提供相关数据集、预训练模型等,助力月球表面高效分析。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22035 2026-07-27 cs.LG 新提交 82%

DCS: A Unified Conditional Sensitivity Framework for Cross-Modal Copyright Infringement Detection

DCS:用于跨模态版权侵权检测的统一条件敏感度框架

Xiafeng Man

机构 * Fudan University(复旦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 研究针对基础模型版权侵权检测问题,提出统一的DCS框架,将侵权证据视为反事实条件分布转移,通过条件差分隐私形式化,创建双分支并结合多种因素界定敏感度,还定义校准统计量,适用于多种模型并以不同方式评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21058 2026-07-24 cs.RO 新提交 82%

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

用于机器人开颅手术的受人类启发框架:集成多模态融合与自适应轨迹调整

Renzhen Le, Xiao Zhang, Di Wu, Yuanyu Wei, Jiachen Zhu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) The University of Tokyo(东京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究针对机器人开颅手术问题,提出受人类启发的闭环框架,集成术前规划与术中执行。采用自适应双轮廓融合算法生成轨迹,利用多模态网络融合信号实现突破检测,通过原位投影策略调整轨迹,实验验证该框架能实现安全自主且高效闭环控制的开颅手术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20906 2026-07-24 cond-mat.mtrl-sci cond-mat.dis-nn physics.app-ph physics.data-an 新提交 82%

Uni-XAS: Alignment-Driven Bidirectional Multimodal Learning for X-ray Absorption Spectroscopy

Uni-XAS:用于X射线吸收光谱的对齐驱动双向多模态学习

Suyang Zhong, Yuhao Zhao, Boying Huang, Fanjie Xu, Pengwei Xu, Haoyi Tao, Xi Fang, Jun Cheng, Fujie Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对X射线吸收光谱建模中异构模态学习难题,提出Uni-XAS框架。通过XASLip解决元素内配位变化,用检索增强解码防尺度崩溃等,还引入排列校正流匹配解决逆问题,在多方面表现出色,为多模态学习和评估奠定基础。

Comments 48 pages, 7 figures, 11 tables. Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 82%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14410 2026-07-21 cs.LG q-bio.GN 版本更新 82%

LATTICE: Graph Self-Supervised Learning for Multimodal Spatial Omics Integration

LATTICE:用于多模态空间组学整合的图自监督学习

Jagan Mohan Reddy Dwarampudi, Veena Kochat, Suresh Satpati, Hien Van Nguyen, Kunal Rai, Tania Banerjee

机构 * University of Houston(休斯顿大学) MD Anderson Cancer Center(MD安德森癌症中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对多模态空间组学整合下游分析常采用单模态管道的问题,提出LATTICE框架,通过构建空间邻域图并训练TransformerConv编码器,在黑色素瘤队列实验中实现多模态整合,提升相关指标,为该领域提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15687 2026-07-20 cs.LG 新提交 82%

Toward Federated Multimodal Graph Foundation Models: A Topology-Aware Multimodal Alignment Framework

迈向联邦多模态图基础模型:一种拓扑感知多模态对齐框架

Xunkai Li, Guohao Fu, Yuming Ai, Zhengyu Wu, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对多模态属性图分散在不同隐私受限孤岛的问题,提出FedGAMMA框架,将联邦多模态图基础学习视为两阶段语义结构对齐问题,经实验验证该框架在下游任务中表现出色,超越诸多基线,在少样本学习场景下也有优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09982 2026-07-14 cs.LG 新提交 82%

Multimodal Routing for Interpretable, Robust, and Auditable Clinical Prediction

用于可解释、稳健且可审计的临床预测的多模态路由

Nikkie Hooman, Zhongjie Wu, Eric C. Larson, Mehak Gupta

机构 * Southern Methodist University(南卫理公会大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对EHR数据多模态预测中现有方法缺乏可解释性的问题,提出显式多模态路由框架,通过构建不同模态路由及引入推理时路由掩码实现可解释、稳健且可审计的推理,经实验评估揭示了临床状况组模态依赖差异。

Comments Accepted at CHASE 2026. 12 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05252 2026-07-07 cs.LG 新提交 82%

FUSE: FK-Steered Multi-Modal Flow Matching for Efficient Simulation-Based Posterior Estimation

FUSE:用于高效基于模拟后验估计的费曼-卡茨引导多模态流匹配

Weichen Qin, Yufan Xie, Peihao Wang, Chia-Jui Chou, Minghui Du, Peng Xu, Ziren Luo, Yi Yang, Jingyi Yu, Bo Liang, Jiakai Zhang

机构 * ShanghaiTech University(上海科技大学) Cellverse, Co., Ltd.(Cellverse公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract)

AI总结 针对现有基于模拟推理方法多模态建模效果差的问题,提出双架构FUSE结合FK引导采样,提升后验估计精度,在基准测试和系外行星任务上性能优于现有方法。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02928 2026-07-07 cs.LG 新提交 82%

CoFEND: A Cross-Modal Fusion End-to-End Network for Cold-Start Drug-Drug Interaction Prediction

CoFEND:用于冷启动药物-药物相互作用预测的跨模态融合端到端网络

Di Wu, Hongyi Sun, Haichao Xu, Jia Chen, Zhong Chen, Jie Yang

机构 * College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) Beihang University(北京航空航天大学) School of Computing, Southern Illinois University Carbondale(南伊利诺伊大学卡本代尔分校计算机学院) School of Physics and Electronic Science, Zunyi Normal University(遵义师范学院物理与电子科学学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 针对新药冷启动药物-药物相互作用预测难题,提出CMF-ELN。利用多模态信息构建知识图谱,设计图自动编码器融合跨模态相似性,采用两阶段可解释性方案,提升预测准确性与机制解释性。

Comments 11 pages, 2 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL 82%

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08668 2026-06-29 eess.SP 版本更新 82%

Beyond Information Redundancy: Expanding Cross-Modal Knowledge Representation for Power Load Time Series Forecasting

PrismNet:通过多模态棱镜解读时间序列以实现可解释的电力负荷预测

Yuxuan Chen, Shuo Dai, Ruoyi Xu, Haipeng Xie

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 PrismNet通过多模态增强模块和PID引导的多模态对比学习,提升电力负荷预测的可解释性与少样本学习能力,在实际数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26629 2026-06-29 cs.LG 版本更新 82%

Context-specific Credibility-aware Multimodal Fusion with Conditional Probabilistic Circuits

基于条件概率电路的上下文特定可信感知多模态融合

Pranuthi Tenali, Sahil Sidheekh, Saurabh Mathur, Erik Blasch, Kristian Kersting, Sriraam Natarajan

机构 * Department of Computer Science , TU Darmstadt(德累斯顿技术大学计算机科学系) Air Force Research Lab(空军研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出C$^2$MF框架,利用条件概率电路建模实例级源可靠性,通过KL散度度量上下文特定信息可信度,在跨模态冲突下提升预测准确率高达29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10386 2026-06-25 cs.CV cs.AI cs.MM 82%

Handling Missing Modalities in Multimodal Survival Prediction for Non-Small Cell Lung Cancer

多模态生存预测中缺失模态的处理:非小细胞肺癌的应用

Filippo Ruffini, Camillo Maria Caruso, Claudia Tacconi, Lorenzo Nibid, Francesca Miccolis, Marta Lovino, Carlo Greco, Edy Ippolito, Michele Fiore, Alessio Cortellini, Bruno Beomonte Zobel, Giuseppe Perrone, Bruno Vincenzi, Claudio Marrocco, Alessandro Bria, Elisa Ficarra, Sara Ramella, Valerio Guarrasi, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering(人工智能与计算机系统单位,工程系) Università Campus Bio-Medico di Roma(罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入部门,辐射物理,生物医学工程) Umeå University(乌梅学院) Research Unit of Radiation Oncology, Department of Medicine and Surgery(放射肿瘤研究单位,医学与外科部门) Fondazione Policlinico Universitario Campus Bio-Medico(生物医学大学附属医院基金会) Anatomical Pathology Operative Research Unit(解剖病理学操作研究单位) Research Unit of Anatomical Pathology, Department of Medicine and Surgery(解剖病理学研究单位,医学与外科部门) Department of Medicine and Surgery(医学与外科部门)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出一种缺失感知的多模态生存框架,结合CT、WSI和临床数据,通过基础模型提取特征并融合,提升NSCLC生存预测的准确性与临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20696 2026-06-23 cs.CL cs.AI eess.AS 新提交 82%

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida

机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12867 2026-06-17 cs.LG 新提交 82%

SMGFM: Spectral Multimodal Graph Pretraining for Multimodal-Attributed Graphs

SMGFM: 面向多模态属性图的谱多模态图预训练

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出SMGFM框架,利用图频谱分解区分结构诱导语义与模态特有语义,通过频带路由实现跨模态融合,在图级和模态级任务上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11190 2026-06-12 cs.LG 新提交 82%

When to Align, When to Predict: A Phase Diagram for Multimodal Learning

何时对齐,何时预测:多模态学习的相图

Ilay Kamai, Hugues Van Assel, Aviv Regev, Hagai B. Perets, Randall Balestriero

机构 * Technion(以色列理工学院) Genentech(基因泰克公司) Brown University(布朗大学) Meta AI, FAIR

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出统一线性框架,通过信噪比模型揭示跨模态对齐与预测的互补失效模式,构建四区域相图指导多模态学习目标选择,并在非线性实验中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09131 2026-06-09 cs.AI cs.CL cs.CV cs.LG 新提交 82%

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由

Siyuan Liu, Jinyang Wu

机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。

Comments 18 pages, 4 figures. Submitted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09082 2026-06-09 cs.IR 新提交 82%

Teach Multimodal Recommendation Model to See via Personalized Visual Extraction and Adaptive Learning

教多模态推荐模型通过个性化视觉提取和自适应学习来观察

Yutong Li, Xinyi Zhang, Ziyi Ye, Daoguo Dong, Yu-gang Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出REVEAL框架,通过反馈引导的视觉提取和自适应视觉学习,增强视觉特征利用和跨模态优化,提升多模态序列推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00647 2026-06-09 cs.LG 版本更新 82%

Label-Conditioned Cross-Modal Fusion for Adult-to-Pediatric ECG Transfer via Curriculum-Gated Contrastive Alignment

基于标签的跨模态融合用于成人到儿童ECG转移 via 课程门控对比对齐

Xinran Liu, Yuwen Li, Hongxiang Gao, Heyang Xu, Jianqing Li, Zongmin Wang, Chengyu Liu

机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) Nanjing Medical University(南京医科大学) Zhengzhou University(郑州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本文提出PEACE框架,通过预训练和适应性融合提升儿童ECG诊断,采用对比学习和课程适应策略,在有限标注下实现高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03370 2026-06-03 eess.IV 82%

SMAC: Spatial-Modal Joint Modeling and Adaptive Representation Collapse for Multimodal Object Tracking

SMAC: 空间-模态联合建模与自适应表示崩溃的多模态目标跟踪

Meijing Gao, Qitai Sun, Huanyu Sun, Bingxuan Yang, Bingzhou Sun, Xu Chen, Yonghao Yan, Yuxuan Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对复杂光照下多模态多目标跟踪中空间与模态特征联合建模不足及固定融合策略适应性有限的问题,提出基于空间-模态卷积融合和蒸馏提示的多模态跟踪框架,通过解耦3D卷积、幅相分解和表示崩溃网络实现自适应融合,在UniRTL数据集上取得领先性能。

Comments 12 pages, 16 figures. Code and pretrained models are available at https://github.com/QitaiSun/SMAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05249 2026-06-03 cs.IR 82%

TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation

TriAlignGR:面向生成式推荐的多模态深度兴趣挖掘与三角多任务对齐

Yangchen Zeng, Hao Peng, Rongfeng Guo, Zhenyu Yu, Zhiyuan Hu, Jinze Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出TriAlignGR统一多任务多模态框架,通过两阶段语义传播和三角多任务对齐,解决语义ID中的内容退化与语义不透明问题,实现生成式推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01837 2026-06-02 cs.CR 82%

Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition

良性输入,有害输出:通过分布式语义重组的跨模态越狱

Yani Wang, Yilong Yang, Yang Liu, Zhuzhu Wang, Zuobin Ying, Zhuo Ma

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 提出分布式语义重组(DSR)框架,将有害意图分解为良性文本和视觉基元,利用多模态大模型的推理能力在跨模态推理阶段融合为有害输出,实现高攻击成功率且输入毒性极低。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01047 2026-06-02 cs.RO 82%

Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation

学习多模态轨迹策略以实现数据高效的机器人操作

Zijia Chen, Yuenan Hou, Xinhua Jiang, Yu Li, Weijie Li, Li Liu

机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学学院,国防科技大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 针对机器人操作中数据稀缺导致的多模态干扰问题,提出基于混合专家模型的多模态轨迹预测框架MATE,通过细粒度子令牌特征解耦和跨模态余弦路由器实现稳定专家分配,在LIBERO基准和真实乒乓球实验中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10012 2026-05-26 cs.LG 82%

PID-Guided Partial Alignment for Multimodal Decentralized Federated Learning

PID引导的多模态去中心化联邦学习部分对齐

Yanhang Shi, Xiaoyu Wang, Houwei Cao, Jian Li, Yong Liu

机构 * Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Applied Mathematics and Statistics and the Department of Computer Science, Stony Brook University(石溪大学应用数学与统计系和计算机科学系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系) Department of Computer Science, New York Institute of Technology(纽约理工学院计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对多模态去中心化联邦学习中异构代理间更新不兼容的问题,提出基于部分信息分解的PARSE框架,通过特征分裂和部分对齐实现高效通信与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22868 2026-05-25 cs.LG 82%

FusionSense: Tri-Stage Near-Sensor Learning for Runtime-Adaptive Multimodal Edge Intelligence

FusionSense: 用于运行时自适应多模态边缘智能的三阶段近传感器学习

Sanggeon Yun, Ryozo Masukawa, Minhyoung Na, Hyunwoo Oh, Yoshiki Yamaguchi, Wenjun Huang, SungHeon Jeong, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Kookmin University(韩国国民大学) Shibaura Institute of Technology(武藏技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出FusionSense框架,通过三阶段训练(服务器端融合模型学习、过滤安全标签量化模态必要性、边缘融合模型压缩)实现近传感器分类器,在保持任务质量的同时大幅降低能耗和数据传输。

Comments Accepted to ISLPED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14650 2026-05-15 eess.SP 82%

Multimodal Learning for MIMO Beam Prediction Based on Variational Inference

基于变分推断的多模态学习用于MIMO波束预测

Zijian Zheng, Wenqiang Yi, Hyundong Shin, Arumugam Nallanathan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于变分推断的多模态框架,通过模块化特征提取和跨模态语义对齐提升MIMO波束预测精度,实验表明其在仅使用20%多模态数据的情况下表现优异。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03800 2026-05-14 q-bio.BM 82%

STELLA: A Multimodal LLM for Protein Functional Annotation via Unified Sequence-Structure Encoding

STELLA:一种通过统一序列-结构编码进行蛋白质功能注释的多模态大语言模型

Hongwang Xiao, Wenjun Lin, Xi Chen, Hui Wang, Kai Chen, Jiashan Li, Yuancheng Sun, Sicheng Dai, Boya Wu, Qiwei Ye

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract)

AI总结 STELLA通过统一序列-结构编码与文本模态协同,提升蛋白质功能注释的准确性,实现功能描述预测和酶促反应预测的最新成果。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07817 2026-05-11 cs.CV cs.AI cs.CL 82%

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) TU Wien(维也纳技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06460 2026-05-08 cs.LG 82%

MINER: Mining Multimodal Internal Representation for Efficient Retrieval

MINER:挖掘多模态内部表示以实现高效检索

Weien Li, Rui Song, Zeyu Li, Haochen Liu, Gonghao Zhang, Difan Jiao, Zhenwei Tang, Bowei He, Haolun Wu, Xue Liu, Ye Yuan

机构 * McGill University(麦吉尔大学) MIT - Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩洛哥 bin Zayed 大学人工智能学院) Mila - Quebec AI Institute(Mila - 加拿大魁北克人工智能研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出MINER,通过挖掘Transformer各层内部表示,融合多模态信号生成紧凑嵌入,提升检索性能,优于现有单向量检索器并在部分设置中缩小与晚交互基线的差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏