arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-01 至 2026-06-01 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 14 篇

2601.06453 2026-06-01 cs.AI 85%

ConSensus: Multi-Agent Collaboration for Multimodal Sensing

ConSensus:面向多模态感知的多智能体协作

Hyungjun Yoon, Mohammad Malekzadeh, Sung-Ju Lee, Fahim Kawsar, Lorena Qendro

机构 * KAIST(韩国科学技术院) Nokia Bell Labs(诺基亚贝尔实验室) University of Glasgow(格拉斯哥大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出ConSensus,一种无需训练的多智能体协作框架,通过将多模态感知任务分解为专用智能体并采用混合融合机制,在五个基准上平均准确率提升7.1%,融合token成本降低12.7倍。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30968 2026-06-01 cs.CV cs.AI 84%

Variational Adapter for Cross-modal Similarity Representation

变分适配器用于跨模态相似性表示

WenZhang Wei, Zhipeng Gui, Dehua Peng, Tiandi Ye, Huayi Wu

机构 * School of Remote Sensing and Information Engineering(遥感与信息工程学院) Wuhan University(武汉大学) School of Data Science and Engineering(数据科学与工程学院) East China Normal University(华东师范大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对跨模态匹配中细粒度标注稀缺导致二元分类边界压缩和假负样本问题,提出变分适配器VACSR,将匹配任务重构为变分推断问题,通过构建潜在相似性空间和正则化缓解过拟合,在图像-文本检索、域泛化和基类到新类泛化任务上验证了有效性。

Comments Accepted by the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15475 2026-06-01 cs.CV 83%

Multimodal Fusion via Self-Consistent Task-Gradient Fields

通过自洽任务梯度场的多模态融合

Jiayu Xiong, Jing Wang, Jun Xue, Wanlong Wang, Jianlong Kwan, Xiaosen Lyu, Zhouqiang Jiang

机构 * Xiamen Key Laboratory of Computer Vision and Pattern Recognition, Huaqiao University, Xiamen, Fujian, China(厦门计算机视觉与模式识别重点实验室,华侨大学,厦门,福建,中国) Huaqiao University, Xiamen, Fujian, China(华侨大学,厦门,福建,中国) Wuhan University, Wuhan, Hubei, China(武汉大学,武汉,湖北,中国) Nakashima Lab, SANKEN, The University of Osaka, Osaka, Japan(Nakashima实验室,SANKEN,大阪大学,大阪,日本)

专题命中 多模态训练与对齐 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出自洽场自编码器(SCFAE),利用自洽场原理平衡任务学习与特征组织,通过任务损失和重构损失在互补子空间中分离特征,从而鲁棒处理缺失数据和不均匀输入。

Comments ICML 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31457 2026-06-01 cs.CV 79%

VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning

VisionPulse: 用于高效多模态推理的动态视觉稀疏性

Hengbo Xu, Shengjie Jin, Yanbiao Ma, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出VisionPulse框架,通过步骤级视觉令牌剪枝,利用视觉注意力质量估计保留预算,仅保留关键令牌,在几乎不损失准确率的情况下减少推理开销和推理轨迹长度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31068 2026-06-01 cs.CV 79%

HQ-JEPA: Hybrid Quantum Joint-Embedding Predictive Architecture for Cross-Modal Remote Sensing Representation Learning

HQ-JEPA: 用于跨模态遥感表示学习的混合量子联合嵌入预测架构

Md Aminur Hossain, Ayush V. Patel, Sanjay K. Singh, Biplab Banerjee

机构 * Space Applications Centre, Indian Space Research Organisation(印度空间研究组织空间应用中心) Centre of Studies in Resources Engineering, Indian Institute of Technology Bombay(印度理工学院孟买资源工程研究中心)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出HQ-JEPA混合量子-经典架构,通过联合嵌入预测、跨模态对齐、SIGReg高斯正则化和量子保真度损失,在Sentinel-1/2图像上学习语义表示,在GeoBench分类和分割任务上取得优于强基线的性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22867 2026-06-01 cs.AR cs.AI cs.LG 79%

TRINE: A Token-Aware, Runtime-Adaptive FPGA Inference Engine for Multimodal AI

TRINE: 一种面向多模态AI的令牌感知、运行时自适应FPGA推理引擎

Hyunwoo Oh, Hanning Chen, Sanggeon Yun, Yang Ni, Suyeon Jang, Behnam Khaleghi, Fei Wen, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Purdue University Northwest(北达科他州立大学) Qualcomm(高通) Samsung(三星)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态AI中不同计算/内存模式导致嵌入式平台实时性不足的问题,提出TRINE,一种无需重配置的单比特流FPGA加速器与编译器,通过统一层映射、运行时模式切换、令牌剪枝和依赖感知层卸载,实现端到端多模态推理,在Alveo U50和ZCU104上相比RTX 4090和Jetson Orin Nano分别降低延迟22.57倍和6.86倍,功耗仅20-21W。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22067 2026-06-01 cs.CV 79%

Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation

捕捉注视转移以引导:跨模态融合增强用于VLM幻觉缓解

Zheng Qi, Chao Shang, Evangelia Spiliopoulou, Nikolaos Pappas

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出GIFT方法,通过预计算视觉显著性图并跟踪注视转移,在解码时增强对显著视觉信息和用户查询的注意力,以缓解视觉语言模型中的幻觉问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31193 2026-06-01 cs.LG 78%

Geometry-based Schrödinger Bridges for Trustworthy Multimodal Fusion

基于几何的薛定谔桥用于可信多模态融合

Jiayu Xiong, Jing Wang, Qi Zhang, Wanlong Wang, Jun Xue

机构 * Department of Computer Science(计算机科学系) Techonology, Huaqiao University(技术学系,华侨大学) Xiamen Key Laboratory of Computer Vision(厦门计算机视觉实验室) Pattern Recognition, Huaqiao University(模式识别,华侨大学) Tongji University(同济大学) School of Cyber Science(网络科学学院) Engineering, Wuhan University(工程学院,武汉大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出基于几何的多模态融合方法GMF,利用扩散薛定谔桥的初始速度平方作为独立于预测的可靠性信号,以提升对低质量数据的鲁棒性。

Comments ICML 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21007 2026-06-01 cs.CV cs.RO 70%

LiteViLNet: Lightweight Vision-LiDAR Fusion Network for Efficient Road Segmentation

LiteViLNet: 轻量级视觉-激光雷达融合网络用于高效道路分割

Daojie Peng, Bingtao Wang, Fulong Ma, Liang Zhang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Shandong University(山东大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出轻量级多模态网络LiteViLNet,通过双流编码器、深度可分离卷积和多尺度特征融合模块,在KITTI数据集上以14.04M参数达到96.36% MaxF,实现精度与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30991 2026-06-01 cs.LG cs.CV 57%

Parallel Tempering Initial Sampling in Inference-Time Reward Alignment

推理时奖励对齐中的并行回火初始采样

Myeongjun Oh, Gwangho Kim, Sungyoon Lee

机构 * Department of Artificial Intelligence(人工智能系) Department of Computer Science(计算机科学系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 针对推理时奖励对齐中标准SMC方法因初始采样陷入局部模式的问题,提出基于并行回火的PATHS方法,通过耦合多条回火链实现高效探索,提升对齐质量。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30939 2026-06-01 cs.CV 57%

IAF-Net: Illumination-Adaptive Fusion for Low-Light Urban Road Segmentation

IAF-Net:用于低光照城市道路分割的照明自适应融合网络

Bingtao Wang, Daojie Peng, Fulong Ma, Jun Ma, Liang Zhang

机构 * The Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出IAF-Net,通过照明自适应融合模块动态调整RGB与几何特征的融合权重,并利用亮度调制注意力解码器增强低光照特征选择,实现不同光照条件下鲁棒的道路分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14441 2026-06-01 cs.CV 57%

D-SECURE: Dual-Source Evidence Combination for Unified Reasoning in Misinformation Detection

D-SECURE:用于虚假信息检测中统一推理的双源证据融合

Samudi Amarasinghe, Gagandeep Singh, Priyanka Singh

机构 * School of Information Technology(信息科技学院) Electrical Engineering The University of Queensland, Brisbane, Australia(电气工程学院,昆士兰大学,布里斯班,澳大利亚)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出D-SECURE框架,通过融合内部篡改检测(HAMMER)和外部证据检索(DEFAME)实现多模态虚假新闻的统一推理与可解释报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31040 2026-06-01 cs.LG 50%

UniRTL: Unifying Code and Graph for Robust RTL Representation Learning

UniRTL:统一代码和图以实现稳健的RTL表示学习

Yi Liu, Hongji Zhang, Lei Chen, Mingxuan Yuan, Qiang Xu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong SAR(计算机科学与工程系,香港中文大学,香港特别行政区) Noah's Ark Lab, Huawei, Hong Kong SAR(华为诺亚实验室,香港特别行政区)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出UniRTL多模态预训练框架,通过互掩码建模和分层训练策略联合利用RTL代码与控制数据流图,实现细粒度对齐,在性能预测和代码检索任务上优于现有方法。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30652 2026-06-01 cs.LG 50%

Bridging the Gap Between Natural Language and Market Dynamics via High-Dimensional Representation Learning

弥合自然语言与市场动态之间的差距:基于高维表示学习

Yujin Jeong, Noelle Jung, Brian Y. C. Leung

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文通过用密集FinBERT嵌入替代离散情感评分,在Transformer架构中探索高维表示学习,以提升金融新闻对短期股价预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏