arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-10 至 2026-03-10 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 20 篇

2603.07572 2026-03-10 cs.LG 89%

TS-MLLM: A Multi-Modal Large Language Model-based Framework for Industrial Time-Series Big Data Analysis

TS-MLLM:一种基于多模态大语言模型的工业时间序列大数据分析框架

Haiteng Wang, Yikang Li, Yunfei Zhu, Jingheng Yan, Lei Ren, Laurence T. Yang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Department of Computer Science, St. Francis Xavier University(圣弗朗西斯科大学计算机科学系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(title,abstract);cross-modal(abstract)

AI总结 TS-MLLM通过多模态大语言模型联合建模时序信号、频域图像和文本知识,提升工业时间序列预测的鲁棒性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08459 2026-03-10 cs.LG 82%

Data-Driven Priors for Uncertainty-Aware Deterioration Risk Prediction with Multimodal Data

数据驱动先验用于多模态数据的不确定性感知退化风险预测

L. Julián Lechuga López, Tim G. J. Rudner, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) University of Toronto(多伦多大学) Tandon School of Engineering, New York University(纽约大学工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出MedCertAIn框架,通过数据驱动的先验方法提升多模态临床数据中风险预测的准确性和不确定性量化能力。

Comments 24 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07134 2026-03-10 cs.HC 82%

More Than 1v1: Human-AI Alignment in Early Developmental Communities with Multimodal LLMs

多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。

Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08208 2026-03-10 cs.CV cs.AI 81%

Alignment-Aware and Reliability-Gated Multimodal Fusion for Unmanned Aerial Vehicle Detection Across Heterogeneous Thermal-Visual Sensors

具有对齐意识和可靠性门控的多模态融合用于跨异质热视觉传感器的无人机检测

Ishrat Jahan, Molla E Majid, M Murugappan, Muhammad E. H. Chowdhury, N. B. Prakash, Saad Bin Abul Kashem, Balamurugan Balusamy, Amith Khandakar

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出RGIF和RGMAF两种融合策略,通过注册意识和可靠性门控提升跨异质热视觉传感器的无人机检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07874 2026-03-10 cs.CV cs.LG 79%

Toward Unified Multimodal Representation Learning for Autonomous Driving

迈向自动驾驶的统一多模态表示学习

Ximeng Tao, Dimitar Filev, Gaurav Pandey

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA(德克萨斯大学机械工程系,德克萨斯农工大学,学院站,德克萨斯,77843,美国) The Department of Engineering Technology and Industrial Distribution Texas A&M University, College Station, TX 77843, USA(工程技术与工业分布系,德克萨斯农工大学,学院站,德克萨斯,77843,美国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CTP框架,通过统一多模态张量对齐提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02767 2026-03-10 cs.CV cs.AI 79%

ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion

通过协同多模态对齐和训练时融合实现图像与文本一体化:ITO

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zonglin Zhao, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Li Auto Inc.(力汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究院,中国科学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 ITO通过协同多模态对齐与训练时融合机制,提升图像与文本表示的一致性,有效解决模态间结构化交互问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05143 2026-03-10 cs.CV cs.CL 73%

A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering

一种用于可解释作物疾病视觉问答的双阶段多任务视觉-语言框架

Md. Zahid Hossain, Most. Sharmin Sultana Samu, Md. Rakibul Islam, Md. Siam Ansary

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种轻量且可解释的双阶段多任务视觉-语言框架,用于作物疾病视觉问答,实现了高准确率和良好的可解释性。

Comments Preprint, manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07023 2026-03-10 cs.CL cs.AI 62%

Hit-RAG: Learning to Reason with Long Contexts via Preference Alignment

通过偏好对齐学习长上下文的推理

Junming Liu, Yuqi Li, Shiping Wen, Zhigang Zeng, Tingwen Huang

机构 * Tongji University(同济大学) The City University of New York(纽约城市大学) University of Technology Sydney(悉尼大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Hit-RAG通过多阶段偏好对齐框架解决长上下文推理中的注意力稀释和幻觉问题,提升模型在长上下文场景下的推理能力。

Comments 21 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06750 2026-03-10 cs.CV cs.AI 62%

XMACNet: An Explainable Lightweight Attention based CNN with Multi Modal Fusion for Chili Disease Classification

XMACNet:一种具有多模态融合的轻量级可解释注意力CNN用于辣椒疾病分类

Tapon Kumer Ray, Rajkumar Y, Shalini R, Srigayathri K, Jayashree S, Lokeswari P

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 XMACNet通过结合自注意力和多模态融合,实现轻量级且可解释的辣椒疾病分类,优于现有基线模型。

Comments 14 pages, 8 figures, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06670 2026-03-10 cs.CV cs.AI 62%

calibfusion: Transformer-Based Differentiable Calibration for Radar-Camera Fusion Detection in Water-Surface Environments

calibfusion: 基于Transformer的可微校准方法用于水表面环境的雷达-摄像头融合检测

Yuting Wan, Liguo Sun, Jiuwu Hao, Pin LV

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CalibFusion通过端到端学习隐式外校准,提升水表面环境下雷达-摄像头融合检测的鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18775 2026-03-10 eess.IV cs.AI cs.CV cs.LG 62%

Subclass Classification of Gliomas Using MRI Fusion Technique

使用MRI融合技术对胶质瘤进行亚类分类

Kiranmayee Janardhan, Christy Bobby Thomas

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出一种基于MRI融合技术的胶质瘤亚类分类方法,通过融合多模态MRI图像提升分类精度,达到99.25%的准确率。

Comments 15 pages, 7 figures, 1 algorithm, 4 tables, journal paper

Journal ref SN Computer Science, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08611 2026-03-10 cs.CV cs.RO 57%

FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection

FOMO-3D:利用视觉基础模型进行长尾3D目标检测

Anqi Joyce Yang, James Tu, Nikita Dvornik, Enxu Li, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 FOMO-3D通过利用视觉基础模型的丰富先验知识和多模态融合设计,提升长尾3D目标检测的性能。

Comments Published at 9th Annual Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07895 2026-03-10 cs.CV 57%

MINT: Molecularly Informed Training with Spatial Transcriptomics Supervision for Pathology Foundation Models

MINT: 通过空间转录组监督进行病理基础模型的分子引导训练

Minsoo Lee, Jonghyun Kim, Juseung Yun, Sunwoo Yu, Jongseong Jang

机构 * LG AI Research(LG人工智能研究)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 MINT通过整合空间转录组监督提升病理基础模型的分子信息捕捉能力,实现基因表达预测和病理任务的性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 57%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04989 2026-03-10 cs.CV 57%

TAPFormer: Robust Arbitrary Point Tracking via Transient Asynchronous Fusion of Frames and Events

TAPFormer: 通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪

Jiaxiong Liu, Zhen Tan, Jinpu Zhang, Yi Zhou, Hui Shen, Xieyuanli Chen, Dewen Hu

机构 * National University of Defense Technology(国防科技大学) Hunan University(湖南大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 TAPFormer通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪,提升跟踪精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI 57%

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07272 2026-03-10 cs.AI 57%

VisualDeltas: Learning Preferences from Visual Quality Perturbations

VisualDeltas: 从视觉质量扰动中学习偏好

Hailiang Huang, Yihao Liu, Shengyue Guan, Haoze Li, Sujian Li

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 VisualDeltas通过利用视觉质量变化影响视觉感知,无需人工标注即可学习偏好,提升多模态数据的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07098 2026-03-10 cs.CV 57%

NuNext: Reframing Nucleus Detection as Next-Point Detection

NuNext:将核检测重新表述为下一个点检测

Zhongyi Shui, Honglin Li, Xiaozhong Ji, Ye Zhang, Zijiang Yang, Chenglu Zhu, Yuxuan Sun, Kai Yao, Conghui He, Cheng Tan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 NuNext通过多模态大语言模型直接输出核质心,采用空间感知软监督和强化微调策略提升检测性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06925 2026-03-10 cs.CV 57%

Small Target Detection Based on Mask-Enhanced Attention Fusion of Visible and Infrared Remote Sensing Images

基于可见与红外遥感图像的掩码增强注意力融合的小目标检测

Qianqian Zhang, Xiaolong Jia, Ahmed M. Abdelmoniem, Li Zhou, Junshe An

机构 * National Space Science Center, Chinese Academy of Sciences(中国科学院国家空间科学中心) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦大学玛丽女王学院电子工程与计算机科学学院) School of Astronomy and Space Science, University of Chinese Academy of Sciences(中国科学院大学天文学与空间科学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ESM-YOLO+,通过掩码增强注意力融合和结构表示增强方法,实现可见与红外图像中小目标的高效检测,提升检测精度并降低模型复杂度。

Comments The manuscript has been submitted to the journal and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07348 2026-03-10 cs.LG 50%

Learning Clinical Representations Under Systematic Distribution Shift

在系统分布偏移下学习临床表示

Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出了一种实践不变的多模态临床预测框架,通过联合优化预测性能与抑制环境信息,提升模型在分布外情况下的鲁棒性和可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏