arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-28 至 2026-05-28 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 15 篇

2605.27374 2026-05-28 cs.CL 89%

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27993 2026-05-28 cs.CL 87%

Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation

重新思考视觉忽视:通过上下文偏好引导缓解MLLM幻觉

Jingwen Wu, Xijun Zhang, Ge Song

机构 * School of Computer and Electronic Information, Nanjing Normal University(计算机与电子信息学院,南京师范大学)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 针对多模态大语言模型的物体幻觉问题,提出无需训练的上下文偏好激活引导框架(CAS),通过提取上下文偏好向量并在中间早期MLP层注入符号残差来控制信息依赖,有效缓解幻觉且不增加解码延迟。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28733 2026-05-28 cs.AI 83%

Utility-Aware Multimodal Contrastive Learning for Product Image Generation

效用感知的多模态对比学习用于产品图像生成

Xiaohang Feng, Yiling Xie

机构 * City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 提出一种效用感知的多模态对比学习框架,通过引入效用感知InfoNCE损失优化产品图像生成,使图像在语义对齐的同时提升市场需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28678 2026-05-28 cs.AI 79%

DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution

DREAM-R: 基于强化学习的精炼草稿、精确验证与完全并行执行的多模态推测推理

Yunhai Hu, Zining Liu, Xiangyang Yin, Tianhua Xia, Bo Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang

机构 * New York University(纽约大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出DREAM-R框架,通过强化学习优化草稿生成、阈值验证机制和完全并行执行,加速多模态模型的推理密集型任务,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27545 2026-05-28 cs.CL 79%

PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI

PAST2HARM:一种用于越狱多模态AI的简单自适应过去时攻击

Snehasis Mukhopadhyay

机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡利安)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 提出PAST2HARM框架,通过过去时态改写和迭代升级策略,系统性地利用多模态文本到图像模型的安全漏洞,实现黑盒、无梯度的高成功率越狱攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27595 2026-05-28 cs.CV cs.AI 76%

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

多模态大语言模型在农业图像解释与生成任务中的幻觉行为

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

机构 * Texas A&M University System(德克萨斯大学系统)

专题命中 多模态生成 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28035 2026-05-28 cs.AI cs.MM cs.SD 62%

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

MTAVG-Bench 2.0:诊断多说话人音视频生成中电影表现力的失败模式

Haitian Li, Yanghao Zhou, Heyan Huang, Liangji Chen, YiMing Cheng, Xu Liu, Dian Jin, Jiajun Xu, Jingyun Liao, Tian Lan, Ziqin Zhou, Yueying Liu, Yu Bai, Changsen Yuan, Jinxing Zhou, Xian-Ling Mao, Xuefeng Chen, Yousheng Feng

机构 * Shanghai University(上海大学) Beijing Institute of Technology(北京理工大学) Shanghai Film Academy(上海电影学院) Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) Inkeverse Group Limited(Inkeverse集团有限公司) The University of Adelaide(阿德莱德大学) Beijing University of Technology(北京工业大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenNLP Lab(OpenNLP实验室)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.AI、cs.MM

AI总结 针对多说话人音视频生成中电影表现力评估不足的问题,提出MTAVG-Bench 2.0基准,通过构建涵盖表演、叙事、氛围和视听语言的高层次失败分类体系及超过1万个问答实例,系统评估全模态大语言模型诊断复杂视听失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17737 2026-05-28 cs.CV cs.AI 62%

The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation

脚本即一切:一个用于长程对话到电影视频生成的智能体框架

Chenyu Mu, Xin He, Qu Yang, Wanshun Chen, Jiadi Yao, Huang Liu, Zihao Yi, Bo Zhao, Xingyu Chen, Ruotian Ma, Fanghua Ye, Erkun Yang, Cheng Deng, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出一个端到端智能体框架,通过训练ScripterAgent将对话转化为精细脚本,并利用DirectorAgent跨场景连续生成策略,实现长程对话到电影视频的连贯生成,显著提升脚本忠实度和时间保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27924 2026-05-28 cs.CV 57%

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization

SIGMA: 基于语义差异的指令引导掩码标注器用于文本驱动图像操作定位

Peiyu Zhuang, Jianquan Yang, Haodong Li, Zhuoying Cai, Ruitao Xie, Jishen Zeng, Baoying Chen, Jiwu Huang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Guangdong Provincial Key Laboratory of Intelligent Information Processing and Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室和深圳媒体安全重点实验室) Shenzhen University of Advanced Technology and Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术大学和深圳先进技术研究所,中国科学院) Alibaba Group(阿里巴巴集团) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出SIGMA方法,通过视觉基础模型中的语义特征差异和指令引导的空间先验,自动从公开编辑数据集中生成像素级掩码,用于训练图像操作定位模型,在五个基准上F1提升12.20%,并生成约110万训练集使六个检测器平均F1提升18.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27417 2026-05-28 quant-ph cs.AI cs.LG 57%

Quantum Machine Learning-based 6G edge Network: Enabling Adaptive Communication and Model Aggregation

基于量子机器学习的6G边缘网络:实现自适应通信与模型聚合

Wenjing Xiao, Jiatai Yan, Chenglong Shi, Shixin Chen, Miaojiang Chen, Min Chen, Saif Al-Kuwari, Ahmed Farouk

机构 * School of Computer, Electronics and Information, Guangxi University(广西大学计算机电子信息学院) Guangxi Key Laboratory of Multimedia Communications and Network Technology(广西多媒体通信与网络技术重点实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Pazhou Laboratory(琶洲实验室) Qatar Center for Quantum Computing, College of Science and Engineering, Hamad Bin Khalifa University(卡塔尔量子计算中心,哈马德·本·哈利法大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对6G V2X通信中的高维状态空间、异构节点和动态环境挑战,提出量子增强框架,包含信道自适应语义通信、多模态融合、模型迁移和联邦聚合四个模块,利用量子卷积神经网络、量子注意力、量子强化学习和量子张量分解提升效率、泛化能力和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15523 2026-05-28 cs.CV 57%

Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning

自提示扩散变压器用于开放词汇场景文本编辑的上下文学习

Hongxi Li, Tong Wang, Chengjing Wu, Tianbao Liu, Jiangtao Yao, Xiaochao Qu, Xinxiao Wu, Luoqi Liu, Ting Liu

机构 * MT Lab, Meitu Inc., Beijing, China School of Computer Science \& Technology, Beijing Institute of Technology, Beijing, China

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出一种自提示场景文本编辑方法,通过构建风格和字形提示,利用多模态扩散变压器的上下文学习能力,实现开放词汇和风格一致的文本编辑。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02028 2026-05-28 cs.CL 57%

Why Gaussian Diffusion Models Fail on Discrete Data and How to Prevent It?

为什么高斯扩散模型在离散数据上失败以及如何防止?

Alexander Shabalin, Simon Elistratov, Viacheslav Meshchaninov, Ildus Sadrtdinov, Dmitry Vetrov

机构 * Constructor University(Constructor大学) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文研究高斯扩散模型在离散数据上采样质量差的原因,发现关键采样区间内噪声数据密度呈多峰分布导致DDPM进入低密度区域,并提出自条件化和q采样结合的方法来改善生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02019 2026-05-28 cs.LG cs.AI stat.ML 57%

Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning

扩散增强马尔可夫决策过程用于最大熵强化学习

Sebastian Sanokowski, Kaustubh Patil

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University Munich(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑) Practical Project Student Exchange Program, Technical University Munich(技术大学慕尼黑实践项目学生交换计划) MIT World Peace University(MIT和平大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文通过将最大熵强化学习扩展到扩散过程,提出扩散增强马尔可夫决策过程(DA-MDPs),以最小化反向KL散度的上界来学习最优策略轨迹分布,并成功将PPO、WPO和REPPO适配为扩散变体,在连续控制和多模态基准上取得与基线相当或更优的性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28226 2026-05-28 cs.LG 50%

PhAME: Phenotype-Aware Molecular Editing via Latent Diffusion

PhAME: 基于表型感知的潜在扩散分子编辑

Łukasz Janisiów, Sebastian Musiał, Bartosz Zieliński, Dawid Rymarczyk, Tomasz Danel

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(杰洛内夫斯基大学数学与计算机科学学院) Doctoral School of Exact and Natural Sciences, Jagiellonian University(杰洛内夫斯基大学精确与自然科学博士学院) Jagiellonian Center for Artificial Intelligence, Jagiellonian University(杰洛内夫斯基人工智能中心) Faculty of Chemistry, Jagiellonian University(杰洛内夫斯基大学化学系) Ardigen SA(Ardigen公司)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出PhAME框架,利用潜在扩散模型在预训练图VAE的潜在空间中进行分子编辑,通过组合无分类器引导机制同时优化表型条件和结构相似性,实现高化学有效性和新颖性的多目标分子优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13177 2026-05-28 cs.RO 50%

ROOM: A Physics-Based Continuum Robot Simulator for Photorealistic Medical Datasets Generation

ROOM: 基于物理的连续体机器人模拟器,用于生成逼真的医学数据集

Salvatore Esposito, Matías Mattamala, Daniel Rebain, Francis Xiatian Zhang, Kevin Dhaliwal, Mohsen Khadem, Subramanian Ramamoorthy

机构 * University of Edinburgh, UK(爱丁堡大学,英国) University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出ROOM模拟框架,利用患者CT扫描生成多模态支气管镜训练数据,验证其在姿态估计和深度估计任务中的有效性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏