arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-17 至 2026-04-17 共收录 73 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2604.15309 2026-04-17 cs.CV cs.AI cs.CL 82%

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

MM-WebAgent:一种用于网页生成的分层多模态网络代理

Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu, Mingxi Cheng, Qi Dai, Zhendong Wang, Zhengyuan Yang, Xue Yang, Ji Li, Lijuan Wang, Chong Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Tongji University(同济大学) Microsoft Corporation(微软公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14661 2026-04-17 cs.SE cs.AI cs.LG 57%

AIPC: Agent-Based Automation for AI Model Deployment with Qualcomm AI Runtime

AIPC:基于代理的AI模型部署自动化方法

Jianhao Su, Zhanwei Wu, ShengTing Huang, Weidong Feng

机构 * Qualcomm Technologies, Inc(高通技术公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出AIPC,一种基于代理的AI模型部署自动化方法,通过标准化阶段和验证循环减少部署难度,适用于Qualcomm AI Runtime的AI模型部署。

Comments 19 pages, 1 figure, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05541 2026-04-17 cs.CV 57%

EchoAgent: Towards Reliable Echocardiography Interpretation with "Eyes","Hands" and "Minds"

EchoAgent:迈向可靠超声心动图解读的“眼、手、脑”系统

Qin Wang, Zhiqing He, Yu Liu, Bowen Guo, Zeju Li, Miao Zhao, Wenhao Ju, Zhiling Luo, Xianhong Shu, Yi Guo, Yuanyuan Wang

机构 * Fudan University(复旦大学) Fudan Zhongshan Hospital(复旦中山医院) Fuwai Yunnan Hospital(阜外云南医院) Fuwai Beijing Hospital(阜外北京医院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EchoAgent,通过整合视觉、手动操作与专家知识,实现端到端的超声心动图解读,提升临床可靠性与实用性。

Comments Accepted by CVPR 2026 CV4Clinical, 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 8 篇

2604.14218 2026-04-17 cs.CL cs.AI 84%

MEME-Fusion@CHiPSAL 2026: Multimodal Ablation Study of Hate Detection and Sentiment Analysis on Nepali Memes

MEME-Fusion@CHiPSAL 2026: 多模态消融研究:尼泊尔表情包中的仇恨检测与情感分析

Samir Wagle, Reewaj Khanal, Abiral Adhikari

机构 * Department of Computer Science and Engineering, Kathmandu University(加德满都大学计算机科学与工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文针对尼泊尔表情包中的仇恨检测与情感分析,提出融合CLIP与BGE-M3的多模态注意力融合架构,通过消融研究发现英文中心视觉模型在尼泊尔语 script 上表现不佳,且数据稀缺时传统集成方法效果下降。

Comments PrePrint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17417 2026-04-17 cs.LG cs.AI 83%

Generative Modeling of Class Probability for Multi-Modal Representation Learning

多模态表示学习中的类别概率生成建模

Jungkyoo Shin, Bumsoo Kim, Eunwoo Kim

机构 * Department of AI(人工智能系) School of CSE(计算机科学与工程学院) Chung-Ang University(Chung-Ang 大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于类别概率分布的多模态表示学习方法CALM,通过生成和对齐类别概率分布提升多模态对齐效果,并引入跨模态概率变分自编码器以增强模态间关系的建模能力。

Comments To appear in CVPR 2025 (Highlight)

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2025, pp. 20737-20746

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22185 2026-04-17 cs.CV 79%

Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening

超越增强:基于双向注意力的跨模态Transformer融合用于低数据动脉瘤筛查

Antara Titikhsha, Divyanshu Tak

机构 * Carnegie Mellon University(卡内基梅隆大学) Artificial Intelligence in Medicine (AIM) Program(医学人工智能(AIM)项目) Mass General Brigham(马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology(放射肿瘤科) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Brigham and Women’s Hospital(布里洛妇产科医院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出CMTF-Net,通过跨模态目标融合框架实现解剖结构化的动脉瘤筛查,采用14个血管区域独立监督,提升低数据场景下的检测精度与可解释性。

Comments We had major improvements in this second draft. Please refer to this version only

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14839 2026-04-17 cs.IR 78%

Well Begun is Half Done: Training-Free and Model-Agnostic Semantically Guaranteed User Representation Initialization for Multimodal Recommendation

万事开头难:免训练 且模型无关的语义保证用户表示初始化方法用于多模态推荐

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Jianheng Tang, Wei Wang, Xiping Hu, Edith C. H. Ngai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SG-URInit方法,通过整合用户交互物品的模态特征和全局聚类特征,实现免训练且模型无关的用户表示初始化,有效提升多模态推荐性能并缓解物品冷启动问题。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11066 2026-04-17 cs.IR 78%

Decoupled Multimodal Fusion for User Interest Modeling in Click-Through Rate Prediction

解耦多模态融合用于点击通过率预测中的用户兴趣建模

Alin Fan, Hanqing Li, Sihan Lu, Jingsong Yuan, Jiandong Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出解耦多模态融合方法,通过构建目标感知特征和优化注意力机制,提升用户兴趣建模效果,实验表明在公开和工业数据集上均取得显著提升。

Comments Accepted by ICDE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14520 2026-04-17 cs.CV 70%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14568 2026-04-17 cs.CV cs.CL 62%

Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

学习高效的视觉推理路径

Yixu Huang, Tinghui Zhu, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出AVR框架,通过分解视觉推理为三个认知功能,动态选择响应格式,减少推理冗余,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14168 2026-04-17 cs.CL cs.AI 62%

SAGE Celer 2.6 Technical Card

SAGE Celer 2.6 技术卡片

SAGEA Research Team, Basab Jha, Firoj Paudel, Ujjwal Puri, Adrian Liu, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(维达斯学院) Madan Bhandari Memorial College(马达恩·巴恩迪纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 SAGE Celer 2.6 通过逆向推理管道优化逻辑路径,支持多模态功能,并针对南亚语言进行优化,在数学、编程和一般智能基准测试中表现优异。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 2 篇

2604.03307 2026-04-17 cs.CV cs.AI 79%

V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators

V-Reflection:将多模态大语言模型从被动观察者转变为主动提问者

Jiazhou Zhou, Yucheng Chen, Hongyang Li, Qing Jiang, Hu Zhou, Ying-Cong Chen, Lei Zhang

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向) International Digital Economy Academy(国际数字经济学院) MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University, and Centre of AI in Medicine(医学视觉人工智能实验室,南洋理工大学Lee Kong Chian医学院,以及人工智能在医学中的中心) South China University of Technology(华南理工大学) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出V-Reflection框架,通过'思考后再观察'的视觉反思机制,使多模态大语言模型能主动提问视觉特征空间,提升细粒度任务的感知能力。

Comments Main paper 14 pages with supplementary 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14270 2026-04-17 gr-qc astro-ph.HE astro-ph.IM 71%

Fast neural network surrogate for multimodal effective-one-body gravitational waveforms from generically precessing compact binaries

快速神经网络替代模型用于多模态有效一体引力波形:从一般预旋紧凑二体系统

Christopher Whittall, Geraint Pratten

专题命中 其他多模态 :multimodal(title)

AI总结 本文提出一种快速神经网络替代模型,用于生成多模态引力波形,提升计算效率,适用于预旋准圆二体系统,验证了模型的准确性,并在贝叶斯参数推断中应用。

Comments 37 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏