arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-19 至 2026-05-19 共收录 25 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 25 篇

2601.16527 2026-05-19 cs.LG cs.AI cs.CL cs.CV 82%

Beyond Superficial Unlearning: Sharpness-Aware Robust Erasure of Hallucinations in Multimodal LLMs

超越表面遗忘:多模态大语言模型中Hallucinations的锐度感知鲁棒擦除

Xianya Fang, Feiyang Ren, Xiang Chen, Yu Tian, Zhen Bi, Haiyang Yu, Sheng-Jun Huang

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Institute for AI, Tsinghua University(清华大学人工智能研究院) Huzhou University(湖州大学) Institute of Dataspace, Hefei Comprehensive National Science Center(合肥综合性国家科学中心数据空间研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出SARE方法,通过目标导向的min-max优化和Targeted-SAM机制,解决多模态大语言模型中 hallucinations 的鲁棒擦除问题,提升模型稳定性与擦除效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17907 2026-05-19 cs.CV cs.AI 81%

One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译

Yang Li, Weize Li, Quan Yuan, Congzhang Shao, Guiyang Luo, Yunqi Ba, Xuanhan Zhu, Xinyuan Ding, Xiaoyuan Fu, Jinglin Li

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。

Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01593 2026-05-19 cs.CV cs.MM 81%

Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation

超越补丁:面向多模态少样本字体生成的全局感知自回归模型

Haonan Cai, Yuxuan Luo, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学轩计算机技术研究所) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出GAR-Font,一种多模态少样本字体生成的自回归框架,通过全局感知分词器、多模态风格编码器和后处理流程,提升了字体生成的全局风格一致性和质量。

Comments 28 pages, Accepted as CVPR 2026 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24763 2026-05-19 cs.CV 79%

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

Tuna-2:像素嵌入在多模态理解和生成中优于视觉编码器

Zhiheng Liu, Weiming Ren, Xiaoke Huang, Shoufa Chen, Tianhong Li, Mengzhao Chen, Yatai Ji, Sen He, Jonas Schult, Belinda Zeng, Tao Xiang, Wenhu Chen, Ping Luo, Luke Zettlemoyer, Yuren Cong

机构 * Meta AI The University of Hong Kong(香港大学) University of Waterloo(滑铁卢大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Tuna-2,一种基于像素嵌入的统一多模态模型,通过直接使用像素嵌入进行多模态理解和生成,展示了统一像素空间建模在高质量图像生成中可以与潜在空间方法竞争,并证明了预训练视觉编码器在多模态建模中并非必要。

Comments Project page: https://tuna-ai.org/tuna-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16842 2026-05-19 cs.AI 79%

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

草图然后绘画:用于扩散多模态大语言模型的分层强化学习

Siqi Luo, Jianghan Shen, Yi Xin, Huayu Zheng, Haoxing Chen, Yan Tai, Yue Li, Junjun He, Yihao Liu, Guangtao Zhai, Yuewen Cao, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出了一种分层强化学习方法HT-GRPO,通过Sketch-Then-Paint训练方案和分层信用分配机制,解决扩散多模态大语言模型在强化学习优化中的关键问题,提升图像质量和审美效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23180 2026-05-19 cs.CV 79%

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM: 基于3D高斯场景表示的统一场景理解和多模态生成驱动世界模型

Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MEGVII Technology(商汤科技) Mach Drive

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出基于3D高斯表示的统一驱动世界模型框架,实现3D场景理解和多模态生成,并通过语言引导采样策略和双条件生成模型提升生成效果,实验验证其在nuScenes和NuInteract数据集上的优越性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16745 2026-05-19 cs.CV 77%

EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers

EVA01: 通过混合变换器实现统一的原生3D理解和生成

Zongyuan Yang, Mingjing Yi, Wanli Ma, Chenzhuo Fan, Bocheng Li, Baolin Liu, Yuke Lou, Yingde Song, Yongping Xiong, Zhengdong Guo, Shimu Wang

机构 * SeeleAI Team(SeeleAI团队)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出EVA01框架,通过混合变换器架构扩展多模态大语言模型的模态边界,实现原生的3D网格理解和生成以及上下文感知编辑,提升文本到3D生成的保真度和多轮几何编辑能力。

Comments 28 pages, 10 figures, 6 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16473 2026-05-19 stat.ML cs.LG cs.NA math.NA math.PR 71%

Dimension-Uniform Discretization Analysis of Preconditioned Annealed Langevin Dynamics for Multimodal Gaussian Mixtures

预处理退火 Langevin 动力学在多模高斯混合中的维度均匀离散化分析

Lorenzo Baldassari, Josselin Garnier, Knut Solna, Maarten V. de Hoop

机构 * University of Basel(巴塞尔大学) Ecole Polytechnique, IP Paris(巴黎高等理工学院) University of California Irvine(加州大学尔湾分校) Rice University(里德大学)

专题命中 多模态生成 :multimodal(title)

AI总结 本文研究了预处理退火 Langevin 动力学在高斯混合中的稳定性问题,通过 Euler-Maruyama 离散化和指数积分方案,证明了在满足特定谱条件时,KL 散度具有维度均匀的上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17042 2026-05-19 cs.CV 70%

Thermal-Only Crowd Counting with Deployment-Time Privacy Protection

仅热成像的人群计数与部署时隐私保护

Yifei Qian, Zhongliang Guo, Chun Tong Lei, Bowen Deng, Chun Pong Lau, Xiaopeng Hong, Michael P. Pound

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science, University of St Andrews(斯特灵大学计算机科学学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种仅使用热成像数据的人群计数框架,通过消除RGB数据依赖,减少公共监控中隐私暴露风险,并利用深度到RGB扩散模型来缓解热成像的模糊性,提升计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16603 2026-05-19 cs.CV 70%

Controlla: Learning Controllability via Graph-Constrained Latent Geometry

Controlla:通过图约束潜在几何学习可控性

Jamuna S. Murthy, Amin Karimi Monsefi, Rajiv Ramnath

机构 * Ramaiah Institute of Technology(拉马亚院技术学院) The Ohio State University(俄亥俄州立大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Controlla通过图约束潜在几何学习可控性,结合图约束最优传输对多模态输入的语义属性和身份因子进行对齐,提升可控性、身份保持和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16295 2026-05-19 cs.CY cs.AI cs.CL cs.GR cs.HC cs.MM 67%

ANVIL: Analogies and Videos for Lecturers

ANVIL:为讲师提供类比和视频

Yuri Noviello, Anastasiia Birillo, Gosia Migut

机构 * Delft University of Technology(代尔夫特理工大学) JetBrains Research(JetBrains研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 ANVIL是一种多模态生成系统,可自动生成基于类比的计算机科学教学动画。通过生成文本类比、结构化视觉剧本和可执行代码,提升教学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16961 2026-05-19 cs.CV cs.AI 62%

Latent Action Control for Reasoning-Guided Unified Image Generation

潜在动作控制用于推理引导的统一图像生成

Fuxiang Zhai, Sixiang Chen, Yingjin Li, Shuaibo Li, Jianyu Lai, Tengjun Huang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Latent Action Control (LAC),通过将推理表示为隐藏的连续动作,使推理过程可操作,从而在统一生成器中实现推理引导的图像生成。LAC通过角色结构化的潜在轨迹进行规划、内部视觉草图、诊断和细化,并将这些动作注入到条件流生成的隐藏流中,从而提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18733 2026-05-19 cs.CV 57%

Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory

通过无训练的身份感知记忆推进叙事长视频生成

Jinzhuo Liu, Jiangning Zhang, Wencan Jiang, Yabiao Wang, Dingkang Liang, Zhucun Xue, Ran Yi, Yong Liu

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯云智实验室) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种无训练的身份感知记忆框架IAMFlow,通过显式建模和跟踪持久实体身份,实现一致的生成,同时引入NarraStream-Bench基准测试,在叙事流视频生成中取得最佳性能。

Comments Project page: https://eddie0521.github.io/projects/iamflow/ Code: https://github.com/Eddie0521/IAMFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18641 2026-05-19 cs.CV 57%

Leveraging Latent Visual Reasoning in Silence

利用沉默中的潜在视觉推理

Dongyao Zhu, Zhen Wang, Xi Xiao, Han Jiang, Saeed Vahidian, Wei-Lun Chao, Tanya Berger-Wolf, Yu Su, Raju Vatsavai, Jianyang Gu

机构 * North Carolina State University(北卡罗来纳州立大学) UC, San Diego(加州大学圣地亚哥分校) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Johns Hopkins University(约翰霍普金斯大学) Duke University(杜克大学) Boston University(波士顿大学) The Ohio State University(俄亥俄州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了在推理过程中是否需要持续的潜在令牌,发现即使移除这些令牌或用随机噪声替代,性能影响较小,提出了一种基于注意力的奖励机制以促进潜在令牌与后续文本令牌的交互,从而提升视觉感知和视觉推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17527 2026-05-19 cs.CV 57%

Designing streetscapes from street-view imagery using diffusion models

利用扩散模型从街景图像中设计街道景观

Yuzhou Chen, Yuebing Liang, Lingqian Hu, Kailai Sun, Qingqi Song, Chang Zhao, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(城市与区域规划系,佛罗里达大学) Singapore-MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工联合研究中心(SMART)) Department of Landscape Architecture and Urban Planning, Texas A&M University(景观建筑与城市规划系,德克萨斯大学安德森分校) Department of Agronomy, University of Florida(农业系,佛罗里达大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种生成多模态AI框架,通过目标视觉指标生成替代的街道景观,提升了城市规划和设计中的视觉探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01030 2026-05-19 cs.CV 57%

Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model

Lotus-2: 通过强大的图像生成模型推进几何密集预测

Jing He, Haodong Li, Mingzhi Sheng, Ying-Cong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出Lotus-2,一种两阶段确定性框架,用于稳定、准确和精细的几何密集预测,通过充分利用预训练生成先验,实现了单目深度估计和表面法线预测的新状态-of-the-art结果。

Comments v3: Fixed some typos. Project page: https://lotus-2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17357 2026-05-19 cs.IR cs.MM 57%

Dual-Diffusional Generative Fashion Recommendation

双扩散生成式时尚推荐

Mingzhe Yu, Lei Wu, Qianru Sun, Yunshan Ma

专题命中 多模态生成 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出DualFashion,一种联合建模图像和文本模态的双扩散生成式时尚推荐架构,通过结构化属性级描述和视觉装扮信息共同作为条件信号,实现个性化和可解释的推荐,同时引入文本增强微调策略提升生成多样性与跨模态知识迁移能力。

Comments Accepted by SIGIR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17294 2026-05-19 cs.CV 57%

HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing

HierEdit: 基于区域的分层扩散用于高效的高分辨率编辑

Yuyao Zhang, Alexander Huang-Menders, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HierEdit,一种区域感知的分层扩散框架,用于高效可扩展的高分辨率图像编辑。通过低分辨率代理生成参考并定位修改区域,结合分层局部窗口扩散模型和推理加速机制,实现无需高分辨率训练数据的快速高保真编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06037 2026-05-19 cs.CV 57%

Thinking with Geometry: Active Geometry Integration for Spatial Reasoning

基于几何的思考:用于空间推理的主动几何整合

Haoyuan Li, Qihang Cao, Tao Tang, Kun Xiang, Zihan Guo, Jianhua Han, JiaWang Bian, Hang Xu, Xiaodan Liang

机构 * Shenzhen campus of Sun Yet-sen University(中山大学深圳校区) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司) Shanghai Jiao Tong University(上海交通大学) Shanghai innovation institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GeoThinker框架,通过主动感知机制改进空间推理,通过空间接地融合和重要性门控实现几何与语义的精准整合,提升空间智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01705 2026-05-19 cs.LG cs.AI 57%

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

LaDi-RL:潜在扩散推理防止强化学习中的熵崩溃

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

机构 * UC San Diego(斯克利普斯海洋研究所) Apple(苹果公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出LaDi-RL方法,通过潜在扩散模型生成潜在推理轨迹,解决强化学习中熵崩溃问题,提升代码生成和数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16469 2026-05-19 eess.IV cs.CV 57%

Flow Matching with Optimized Subclass Priors for Medical Image Augmentation

利用优化子类先验的流匹配用于医学图像增强

Felix Nützel, Mischa Dombrowski, Bernhard Kainz

机构 * Department of Artificial Intelligence in Biomedical Engineering, Friedrich-Alexander-Universität Erlangen-Nürnberg, 91052 Erlangen, Germany(生物医学工程人工智能系,弗里德里希-亚历山大-厄林根-纽伦堡大学) Department of Computing, Imperial College London, London SW7 2AZ, UK(计算系,帝国理工学院伦敦分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通过优化子类先验来提升医学图像增强中罕见疾病的生成质量,通过生成模型的潜在空间进行子类模式划分,并学习子类条件源分布以提高生成效果和多样性。

Comments 11 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16429 2026-05-19 cs.LG cs.AI 57%

QuantFPFlow: Quantum Amplitude Estimation for Fokker--Planck Policy Optimisation in Continuous Reinforcement Learning

QuantFPFlow:用于连续强化学习中Fokker-Planck策略优化的量子振幅估计

Abraham Itzhak Weinberg

机构 * AI-WEINBERG, AI Experts(AI-WEINBERG人工智能专家)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 QuantFPFlow通过量子振幅估计提升连续强化学习中Fokker-Planck策略优化的效率,实现算法复杂度从O(1/ε²)到O(1/ε)的平方加速,并在多模态奖励景观中发现全局最优解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17352 2026-05-19 cs.CV 57%

Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey

通过强化学习和奖励建模对扩散模型的对齐与安全性:综述

Preeti Lamba, Kiran Ravish, Ankita Kushwaha, Pawan Kumar

机构 * International Institute of Information Technology(国际信息科技学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了通过强化学习、奖励建模等方法对文本到图像扩散模型进行对齐和安全性的最新进展,探讨了反馈来源、奖励信号形式、优化机制等五个维度,并提出了多目标对齐、反馈高效偏好学习等开放性挑战。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14757 2026-05-19 eess.SP 50%

ChannelAgent-Empowered Electromagnetic Space World Model: A Case Study on Agent-Driven Channel Generation for 6G AI-Native Air Interface

ChannelAgent-empowered Electromagnetic Space World Model: A Case Study on Agent-Driven Channel Generation for 6G AI-Native Air Interface

Mingyue Li, Li Yu, Yuxiang Zhang, Heng Wang, Jianhua Zhang, Ping Zhang, Guangyi Liu

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种基于ChannelAgent的电磁空间世界模型,用于6G AI原生空气接口中的智能体驱动信道生成,通过多模感知、ChannelAgent智能核心和反馈更新的闭环过程,实现任务感知决策和自主适应。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18442 2026-05-19 cs.RO 50%

SG-CADVLM: A Context-Aware Decoding Powered Vision Language Model for Safety-Critical Scenario Generation

SG-CADVLM: 一种基于上下文感知解码的视觉语言模型,用于安全关键场景生成

Hongyi Zhao, Shuo Wang, Qijie He, Ziyuan Pu

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出SG-CADVLM,一种结合上下文感知解码的多模态输入处理框架,用于从事故报告中生成高保真的安全关键场景,通过减少视觉语言模型的幻觉并同时生成道路几何和车辆轨迹,提升了生成场景的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏