arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3020 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 530 篇

2607.10798 2026-07-14 cs.CL 新提交 79%

Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG

融合前的信任:用于受污染多模态RAG的QIMG-7和源感知分辨率

Saadeldine Eletter, Owais Aijaz, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 研究多模态检索增强生成中受污染内容问题,提出QIMG-7基准。针对朴素多模态融合脆弱问题,提出源感知信任分辨率(SATR),Field-Selector变体效果最佳,结果支持选择性信任,显式文本可靠性建模是收益主要驱动因素。

Comments 23 pages, 6 figures, 23 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10599 2026-07-14 cs.AI eess.SP 新提交 79%

MRUF: Multi-granularity Routing with Uncertainty-Aware Fusion for Robust Multimodal Sentiment Analysis

MRUF:用于鲁棒多模态情感分析的具有不确定性感知融合的多粒度路由

Haoran Ma, Yinfeng Yu, Liejun Wang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语言认知计算国际联合研究实验室) Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术研究中心) Pengcheng Laboratory Xinjiang Network Node(鹏城实验室新疆网络节点) Embodied Intelligence Joint Laboratory(具身智能联合实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态情感分析中模态质量不一问题,提出MRUF方法,结合多粒度路由与不确定性感知校准,总结情感表示、进行路由并监督模态重要性估计,预测模态不确定性并细化模态门,实验显示相比基线有改进,验证了高不确定性模态获低融合权重。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems and Man and and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09777 2026-07-14 cs.CV 新提交 79%

Time Imprint: Learning Time-Aware Representations in Multi-Modal Knowledge Graphs

时间印记:在多模态知识图谱中学习时间感知表示

Pengyu Zhang, Klim Zaporojets, Congfeng Cao, Jia-Hong Huang, Paul Groth

机构 * University of Amsterdam(阿姆斯特丹大学) Aarhus University(奥胡斯大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 研究多模态知识图谱中难以区分相似实体的问题,提出Time Imprint框架将时间视为实体级模态,通过三视图对比目标联合对齐多模态表示,还研究时间戳选择与聚合,实验表明该方法提升了链接预测性能,明确了时间作为模态的优势及条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07016 2026-07-09 cs.LG cs.AI 新提交 79%

Multimodal Spatiotemporal-Frequency Fusion with Peak Enhancement for Cellular Traffic Forecasting

用于蜂窝流量预测的具有峰值增强的多模态时空频率融合

Qingzhong Li, Yue Hu, Hui Ma, Yajun Zhang, Xinjun Pei, Ming Yan, Fei Xing

机构 * Xinjiang University(新疆大学) College of Geography and Remote Sensing Sciences, Xinjiang University(新疆大学地理与遥感科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对蜂窝网络流量预测难题,提出MSPF-Net框架,它集成外部上下文信息,含时空频率流量编码器、峰值增强模块等,能联合建模流量动态、突发模式和新闻上下文信号,实验证明可有效提升预测性能。

Comments Accepted in the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06943 2026-07-09 cs.CV 新提交 79%

General Incomplete Multimodal Learning via Dynamic Quality Perception

通过动态质量感知进行通用不完全多模态学习

Xiangyu Meng, Shicai Wei

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态学习中模态间缺失和模态内退化共存问题,提出通用不完全多模态学习框架GIML,通过动态质量感知处理上述问题,引入噪声感知质量估计器和噪声语义解耦模块,经实验验证其有效性和通用性。

Comments Accepted by ECCV 2026. Corresponding author: Shicai Wei

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08336 2026-07-09 cs.CV 新提交 79%

Synesthesia via Direct Latent Augmentation:Bypassing the Decode-Encode Loop for Cross-Modal Distillation

超越原始信号:作为特权合成数据的未解码生成潜变量

Cristian Sbrolli, Nicolas Michel, Matteo Matteucci, Toshihiko Yamasaki

机构 * Politecnico di Milano(米兰理工大学) The University of Tokyo(东京大学)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 提出直接潜变量增强(DLA)方法,利用未解码的生成潜变量作为特权信息,并通过多层显式模拟联觉(MESSy)将密集知识迁移到纯视觉学生模型,避免了解码-编码循环的低效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05019 2026-07-08 cs.LG cs.CV 新提交 79%

Beyond Modality Fusion: Deep Ensembles for Multimodal Classification

超越模态融合:用于多模态分类的深度集成

Ilya Burenko, Dmitry Vetrov

机构 * ScaDS.AI, Technische Universität Dresden(ScaDS.AI,德累斯顿工业大学) Constructor University Bremen(不来梅建造者大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究多模态分类,对比深度集成与模态融合网络,证明单模态网络深度集成可有效分类,提出选模型数量方法,还给出合成框架探索优化挑战,估计集成渐近性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03959 2026-07-07 eess.IV cs.CV cs.LG 新提交 79%

Cross-Modal Fusion of OCT and OCT angiography enface for Improved Diagnostics of Diabetic Retinopathy

用于改善糖尿病视网膜病变诊断的OCT与OCT血管造影en face跨模态融合

Rashadul Hasan Badhon, Atalie Carina Thompson, Jennifer I. Lim, Theodore Leng, Minhaj Nur Alam

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对糖尿病视网膜病变精准筛查需求,提出双向跨模态注意力网络融合OCT与en face OCTA实现自动分类,实验验证该方案性能优于单模态模型,生成式OCTA可降低硬件依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05311 2026-07-07 cs.CV 新提交 79%

Deep Learning for Semen Analysis in Male Infertility: Computer Vision, Multimodal Fusion, and Clinical Translation

男性不育症精液分析深度学习技术:计算机视觉、多模态融合与临床转化

Runwei Guan, Shaofeng Liang, Jiacheng Weng, Xiaoyi Gu, Jia Weng, Daizong Liu, Duo Pan, Qingxin Zhang, Xiao Liang, Weiping Ding, Suoyu Zhu, Ming Yuan, Yanhua Fei

机构 * Department of Gynaecology and Obstetrics, The Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院妇产科) Department of Oncology, the Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院肿瘤科) Thrust of AI, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能推力实验室) FertiTech AI(生殖科技人工智能公司) Department of Oncology, Suzhou Xiangcheng People’s Hospital(苏州市相城区人民医院肿瘤科) Department of Biological Sciences and Bioinformatics, School of Science, Xi’an Jiaotong-Liverpool University(西交利物浦大学理学院生物科学与生物信息学系) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对传统精液分析的主观性强等缺陷,综述聚焦计算机视觉与深度学习驱动的精子分析技术,梳理方法、数据集与落地障碍,提出分阶段临床转化路线。

Comments 46 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03817 2026-07-07 cs.CV 新提交 79%

Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection

全局逻辑与局部搜索:用于可验证工业异常检测的双流多模态上下文学习

Runzhi Deng, Yundi Hu, Yiming Zhong, Zhao Wang, Xixi Liu, Hongsong Wang, Caifeng Shan, Fang Zhao

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Southeast University(东南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对工业异常检测难题,提出无训练框架GLLS,利用视觉逻辑图谱组织参考和规范,结合全局逻辑流与细粒度动作流,实验表明其优于基线且决策可追溯

Comments Accepted by ECCV 2026. 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02372 2026-07-03 cs.CV 新提交 79%

Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis

学习光谱和偏振线索用于一对多模态新视角合成

Federico Lincetto, Gianluca Agresti, Mattia Rossi, Piergiorgio Sartor, Pietro Zanuttigh

机构 * MEDIA Lab(媒体实验室) University of Padova(帕多瓦大学) Sony EUISPC(索尼欧洲影像处理中心) Sony Semiconductor Solutions Europe(索尼半导体解决方案欧洲分公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出SPoILeR方法,通过多模态预训练学习模态间相关性,在仅RGB监督下实现未见场景的多模态新视角渲染。

Comments Accepted at ECCV 2026. Project page: https://medialab.dei.unipd.it/paper_data/SPoILeR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01627 2026-07-03 cs.LG cs.AI 新提交 79%

MKGR: Multimodal Knowledge-Graph Representation Learning for Cold-Start Protein-Protein Interaction Prediction

MKGR: 面向冷启动蛋白质-蛋白质相互作用预测的多模态知识图谱表示学习

Wenbo Zhang

机构 * College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出MKGR框架,结合区域感知蛋白质序列编码与四个生物医学知识图谱,通过桥接重建目标和成对门控模块,在冷启动场景下显著提升PPI预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00974 2026-07-02 cs.IT cs.CV math.IT 新提交 79%

QuaMoE-DRF: Proactive Beam and Rate Adaptation via Multimodal Dynamic Radio Map Forecasting in ISAC Networks

QuaMoE-DRF:ISAC网络中通过多模态动态无线电地图预测实现主动波束和速率自适应

Zhihan Zeng, Kaihe Wang, Zhongpei Zhang, Chongwen Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对静态无线电地图无法捕捉移动物体短时遮挡的问题,提出QuaMoE-DRF框架,通过质量感知的多模态动态无线电地图预测未来波束SINR场,联合优化波束、MCS和速率,在动态城市基准上实现402.5 Mbps有效速率和0.0417中断概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31383 2026-07-01 cs.CV 新提交 79%

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

MS-Resampler: 用于高效多模态大语言模型的多范围视觉重采样

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * Li Auto Inc.(理想汽车) East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出MS-Resampler,通过多范围视觉重采样框架,注入显式空间范围先验,使模型在固定令牌预算内同时捕获局部细节和全局上下文,提升多模态理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27484 2026-06-29 cs.CV 新提交 79%

Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos

微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分

Mohammadmahdi Honarmand, Parnian Azizian, Aaron Kline, Kae Nurge, Zerin Nasrin Tumpa, Saimourya Surabhi, Kaitlyn Dunlap, Yang Qian, Ali Kargarandehkordi, Sameer Neupane, Peter Washington, Dennis P. Wall

机构 * Stanford University(斯坦福大学) University of Hawaii at Manoa(夏威夷大学马诺阿分校) University of California San Francisco(加利福尼亚大学旧金山分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27317 2026-06-26 cs.CV cs.RO 新提交 79%

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

OctoSense: 多模态机器人感知的自监督学习

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26416 2026-06-26 cs.CV 新提交 79%

Methane-Plume Segmentation From Hyperspectral Satellite Imagery Via Multimodal Deep Learning

基于多模态深度学习的高光谱卫星图像甲烷羽流分割

Brayan Quintero, Jeferson Acevedo, Samuel Traslaviña, Hoover Rueda-Chacón

机构 * Department of Computer Science, Universidad Industrial de Santander(计算机科学系,圣安德烈斯工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种多模态深度学习模型,集成特征引导的甲烷增强机制,在MPDataset上取得优于现有方法的性能,实现高精度与高效率的甲烷羽流分割。

Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24156 2026-06-24 cs.CV 新提交 79%

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

利用先验校正的令牌缩减加速多模态大语言模型

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出PriorTR方法,通过分离任务条件注意力与模型先验注意力,在单次前向传播中估计先验并校正令牌重要性,实现无训练令牌缩减,提升多模态大语言模型效率与准确性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21892 2026-06-23 cs.LG cs.CV 新提交 79%

AgroSense 2.0: Cross-Modal Transformer Fusion with Geospatial Raster Integration and Interpretable Multi-Task Learning for Precision Crop Recommendation

AgroSense 2.0:基于跨模态Transformer融合、地理空间栅格集成与可解释多任务学习的精准作物推荐

Vishal Pandey, Rishav Tewari, Ruzina Haque Laskar

机构 * Research Engineer London, UK(英国伦敦研究工程师) Independent Researcher Kolkata, IN(印度加尔各答独立研究员) Centre for Development of Telematics(电信发展中心)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出AgroSense 2.0,通过跨模态Transformer融合、地理空间栅格集成和多任务学习,解决精准农业中作物推荐系统的模态鸿沟问题,实现可解释的作物推荐。

Comments 14 Pages, 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13007 2026-06-23 cs.LG cs.AI 新提交 79%

scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing

scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序

Ping Xu, Pengjiang Li, Tian Du, Zaitian Wang, Jiawei Gu, Zhiyuan Ning, Ziyue Qiao, Pengfei Wang, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15573 2026-06-17 cs.AI cs.CR 新提交 79%

QoS-Aware Token Scheduling and Private Data Valuation for Multi-Modal Agentic Networks

面向多模态代理网络的QoS感知令牌调度与私有数据估值

Yao Du, Jing Liu, Pengfei Xu, Zehua Wang, Victor C. M. Leung, Cyril Leung, Victoria Lemieux

机构 * University of British Columbia(不列颠哥伦比亚大学) Lazai Network(Lazai网络)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 针对去中心化代理系统中数据异构和资源受限问题,提出基于差分隐私的多模态表示与公平令牌分配方案,在保障服务质量的同时提升数据隐私和贡献公平性。

Comments Accepted to IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16067 2026-06-16 cs.CV 新提交 79%

Stepwise Token Selection for Efficient Multimodal Large Language Models

逐步令牌选择用于高效多模态大语言模型

Landi He, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种基于指针机制的逐步视觉令牌选择方法,通过可微松弛实现端到端训练,动态决定保留令牌数量,在去除88.9%令牌时保持94.6%准确率并加速1.88倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15597 2026-06-16 cs.CV 新提交 79%

Fusion-E2Pulse: A Multimodal Event-RGB Fusion Network for Non-contact Pulse Wave Reconstruction

Fusion-E2Pulse:一种用于非接触式脉搏波重建的多模态事件-RGB融合网络

Qian Feng, Hao Guo, Yan Niu, Zhenhuan Xu, Yidi Li

机构 * College of Computer Science and Technology(计算机科学与技术学院) Taiyuan University of Technology(太原科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Fusion-E2Pulse多模态融合网络,利用RGB信号结构先验抑制运动伪影,结合事件流高灵敏度恢复细粒度形态细节,在脉搏波重建中实现噪声抑制与形态保真度的最佳平衡。

Comments Accepted by MICCAI 2026. The final version will appear in the official MICCAI proceedings published by Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14691 2026-06-15 cs.CL 新提交 79%

CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距

Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12942 2026-06-12 cs.AI 新提交 79%

PRISMR: Overcoming Parse Collapse in Multimodal Listwise Ranking via Parameterized Representation Internalization

PRISMR: 通过参数化表示内化克服多模态列表排序中的解析崩溃

Hao Jiang, Xin Li, Annan Wang, Zhi Yang, Haoxiang Zhang, Yichi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Independent Researcher(独立研究员)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态长上下文场景中生成式列表排序的解析崩溃问题,提出PRISMR框架,用参数化结构条件替代临时上下文列表处理,通过轻量级超网络并行编码候选并生成LoRA权重,显著减少解析崩溃并提升排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12362 2026-06-11 cs.LG cs.AI 新提交 79%

Latent World Recovery for Multimodal Learning with Missing Modalities

缺失模态下的多模态学习中的潜在世界恢复

Hui Wang, Tianyu Ren, Joseph Butler, Christopher Baker, Karen Rafferty, Simon McDade

机构 * Queen's University Belfast(贝尔法斯特女王大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出潜在世界恢复(LWR)框架,通过邻居潜在对齐和可用性感知融合,在缺失模态下实现鲁棒的多模态预测,避免显式重构误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12303 2026-06-11 cs.CV 新提交 79%

From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion

从二维网格到一维标记:重塑多模态图像融合的共享表示

Yuchen Xian, Yunqiu Xu, Yang He, Yi Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出基于冻结预训练图像标记器的紧凑一维标记接口,通过选择性标记编辑(STE)稀疏更新关键标记,在保持融合骨干网络不变的同时引导全局外观一致性,实现全局连贯与局部保真的最佳平衡。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11682 2026-06-11 cs.CV cs.LG 新提交 79%

Parameter-Efficient Adapter Tuning for Tabular-Image Multimodal Learning

面向表格-图像多模态学习的参数高效适配器微调

Jiaqi Luo

机构 * School of Mathematical Sciences, Soochow University(苏州大学数学科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出TI-Adapter框架,通过冻结表格编码器并添加适配器,以及图像分支的嵌入层和瓶颈层适配器,实现高效多模态微调,在20个数据集上以更少参数达到或超越全微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11572 2026-06-11 cs.CV 新提交 79%

FreqKD: Frequency-Decoupled Cross-Modal Knowledge Distillation for Infrared Object Detection

FreqKD: 面向红外目标检测的频率解耦跨模态知识蒸馏

Keval Thaker, Venkatraman Narayanan, Abdalmalek Aburaddaha, Samir A. Rawashdeh

机构 * University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对RGB与红外图像模态差异,提出频率解耦蒸馏框架FreqKD,对低频和高频成分分别施加严格MSE和松弛log-MSE损失,在KAIST数据集上提升DINOv2基线2.4 mAP50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11188 2026-06-10 cs.CV 新提交 79%

ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

ARM: 一种具有统一离散表示的自回归大型多模态模型

Junke Wang, Xiao Wang, Jiacheng Pan, Xuefeng Hu, Feng Li, Jingxiang Sun, Chaorui Deng, Zilong Chen, Yunpeng Chen, Kaibin Tian, Matthew Gwilliam, Hao Chen, Danhui Guan, Kun Xu, Weilin Huang, Zuxuan Wu, Haoqi Fan, Yu-Gang Jiang, Zhenheng Yang

机构 * Shanghai Key Lab of Intelligent Information Processing, Fudan University(复旦大学上海智能信息处理重点实验室) School of Computer Science, Fudan University(复旦大学计算机科学技术学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Youtu Lab, Tencent(腾讯优图实验室) Meta AI Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ARM模型,通过离散语义视觉分词器将图像映射为紧凑token序列,结合自回归建模和强化学习,统一实现图像理解、生成和编辑,并提升任务性能与跨任务协同。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏