arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-11 至 2026-03-11 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 14 篇

2603.09877 2026-03-11 cs.CV 83%

InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing

InternVL-U: 使统一多模态模型在理解、推理、生成和编辑方面更加普及

Changyao Tian, Danni Yang, Guanzhou Chen, Erfei Cui, Zhaokai Wang, Yuchen Duan, Penghao Yin, Sitao Chen, Ganlin Yang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Leyao Gu, Haomin Wang, Qi Wei, Jinhui Yin, Xue Yang, Zhihang Zhong, Qi Qin, Yi Xin, Bin Fu, Yihao Liu, Jiaye Ge, Qipeng Guo, Gen Luo, Hongsheng Li, Yu Qiao, Kai Chen, Hongjie Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Xiamen University(厦门大学) CUHK MMLab(香港中文大学MMLab)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 InternVL-U通过轻量级统一多模态模型,在保持强大生成能力的同时,实现了在理解、推理、生成和编辑方面的高效平衡。

Comments technical report, 61 pages, https://github.com/OpenGVLab/InternVL-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09931 2026-03-11 cs.CV cs.AI 81%

Adaptive Clinical-Aware Latent Diffusion for Multimodal Brain Image Generation and Missing Modality Imputation

自适应临床感知潜在扩散用于多模态脑图像生成与缺失模态插值

Rong Zhou, Houliang Zhou, Yao Su, Brian Y. Chen, Yu Zhang, Lifang He, Alzheimer's Disease Neuroimaging Initiative

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ACADiff通过自适应临床感知扩散模型,实现多模态脑图像生成与缺失模态插值,提升阿尔茨海默病诊断的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 79%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09536 2026-03-11 cs.HC cs.MM 79%

Dynamic Multimodal Expression Generation for LLM-Driven Pedagogical Agents: From User Experience Perspective

动态多模态表达生成用于基于大语言模型的教育代理:从用户体验视角

Ninghao Wan, Jiarun Song, Fuzheng Yang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于大语言模型的动态多模态表达生成方法,通过生成协调的语音和手势指令,提升教育代理的沉浸感和自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12130 2026-03-11 cs.CL 79%

PRISM of Opinions: A Persona-Reasoned Multimodal Framework for User-centric Conversational Stance Detection

观点PRISM:一种基于人设的多模态框架用于以用户为中心的对话立场检测

Bingbing Wang, Zhixin Bai, Zhengda Jin, Zihan Wang, Xintong Song, Jingjie Lin, Sixuan Li, Jing Li, Ruifeng Xu

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东省新型安全智能技术重点实验室) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) Macau University of Science and Technology, Hong Kong, China(澳门科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 PRISM通过多模态和用户人设分析,提升对话立场检测的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05433 2026-03-11 cs.LG cs.NE 78%

Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies

多模态大语言模型辅助进化搜索用于程序化控制策略

Qinglong Hu, Xialiang Tong, Mingxuan Yuan, Fei Liu, Zhichao Lu, Qingfu Zhang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本研究提出多模态大语言模型辅助进化搜索方法,用于生成透明且可验证的程序化控制策略,通过结合视觉反馈与进化搜索提高策略发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01479 2026-03-11 cs.RO 78%

Multimodal Adversarial Quality Policy for Safe Grasping

多模态对抗质量策略用于安全抓取

Kunlin Xie, Chenghao Li, Haolan Zhang, Nak Young Chong

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出多模态对抗质量策略,通过双补丁优化和梯度平衡策略实现安全抓取,提升多模态环境下机器人抓取的安全性和鲁棒性。

Comments submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08998 2026-03-11 cs.CV 74%

Diffusion-Based Authentication of Copy Detection Patterns: A Multimodal Framework with Printer Signature Conditioning

基于扩散的复制检测模式认证:一种多模态框架与打印机签名条件化

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior

机构 * Université Lumière Lyon 2, CNRS, INSA Lyon, Universite Claude Bernard Lyon 1, LIRIS UMR5205(里摩日大学里昂2分校、法国国家科学研究中心、里昂国立应用科学学院、里昂大学克莱尔-贝尔纳分校、LIRIS UMR5205)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 本文提出基于扩散的多模态认证框架,利用打印机签名条件化技术,实现对复制检测模式的高效认证,优于传统方法和深度学习方法。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09125 2026-03-11 cs.CV cs.AI 73%

QUSR: Quality-Aware and Uncertainty-Guided Image Super-Resolution Diffusion Model

QUSR: 一种基于质量感知和不确定性引导的图像超分辨率扩散模型

Junjie Yin, Jiaju Li, Hanfa Xing

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 QUSR通过引入质量感知先验和不确定性引导噪声生成模块,提升图像超分辨率在复杂场景下的真实感和细节还原能力。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13756 2026-03-11 cs.CV cs.AI cs.LG 62%

RECODE: Reasoning Through Code Generation for Visual Question Answering

RECODE: 通过代码生成进行视觉问答的推理

Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza Fathi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RECODE通过代码生成实现视觉问答的可验证推理,优于传统方法。

Comments The authors are withdrawing this manuscript temporarily to conduct additional checks of the experimental setup and implementation. We plan to post an updated version after completing these checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09759 2026-03-11 cs.CV 57%

LogoDiffuser: Training-Free Multilingual Logo Generation and Stylization via Letter-Aware Attention Control

LogoDiffuser: 无需训练的多语言标志生成与风格化通过字母感知注意力控制

Mingyu Kang, Hyein Seo, Yuna Jeong, Junhyeong Park, Yong Suk Choi

机构 * Department of Artificial Intelligence, Hanyang University(翰阳大学人工智能系) Department of Computer Science, Hanyang University(翰阳大学计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LogoDiffuser通过字母感知注意力控制,无需训练实现多语言标志生成与风格化,通过多模态扩散变换器整合字符结构与视觉设计,提升多语言标志生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24417 2026-03-11 cs.CV 57%

EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering

EasyText: 用于多语言文本渲染的可控扩散变换器

Runnan Lu, Yuxuan Zhang, Jiaming Liu, Haofan Wang, Yiren Song

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 EasyText提出了一种基于DiT的可控扩散变换器,用于多语言文本渲染,通过字符位置编码和插值技术实现精确生成,并利用大规模数据集提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08387 2026-03-11 cs.CV 57%

Recognition-Synergistic Scene Text Editing

识别协同场景文本编辑

Zhengyao Fang, Pengyuan Lyu, Jingjing Wu, Chengquan Zhang, Jun Yu, Guangming Lu, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Tencent(腾讯) Department of Computer Vision Technology, Baidu Inc.(百度公司计算机视觉技术部门)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 RS-STE通过整合文本识别与编辑的协同效应,提出了一种统一框架,实现高效且一致的场景文本编辑,提升了复杂场景下的性能。

Comments accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09075 2026-03-11 eess.IV 50%

M2Diff: Multi-Modality Multi-Task Enhanced Diffusion Model for MRI-Guided Low-Dose PET Enhancement

M2Diff:多模态多任务增强扩散模型用于MRI引导的低剂量PET增强

Ghulam Nabi Ahmad Hassan Yar, Himashi Peiris, Victoria Mar, Cameron Dennis Pain, Zhaolin Chen

专题命中 多模态生成 :multi-modal(abstract)

AI总结 M2Diff通过多模态多任务扩散模型,利用MRI和低剂量PET扫描分别学习模态特定特征,并通过层次化特征融合重建标准剂量PET,从而提升重建保真度。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏