arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-18 至 2026-03-18 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 15 篇

2603.16576 2026-03-18 cs.CV cs.AI cs.CR cs.LG 81%

REFORGE: Multi-modal Attacks Reveal Vulnerable Concept Unlearning in Image Generation Models

REFORGE:多模态攻击揭示图像生成模型中的脆弱概念反向学习

Yong Zou, Haoran Li, Fanxiao Li, Shenyang Wei, Yunyun Dong, Li Tang, Wei Zhou, Renyang Liu

机构 * Yunnan University(云南大学) Northeastern University(东北大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 REFORGE通过对抗性图像提示评估图像生成模型反向学习的鲁棒性,揭示现有方法的持续漏洞,提出更高效的多模态对抗攻击策略。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15228 2026-03-18 cs.CV 79%

HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization

HYDRA:通过表征协调的标记化统一多模态生成与理解

Xuerui Qiu, Yutao Cui, Guozhen Zhang, Junzhe Li, JiaKui Hu, Xiao Zhang, Yang Li, Songtao Liu, Miles Yang, Yu Shi, Zhao Zhong, Liefeng Bo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文英) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Peking University(北京大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 HYDRA通过表征协调的标记化统一多模态生成与理解,提出了一种新的统一框架,在单一参数空间内整合感知与生成,实验表明其在视觉重建和生成任务中均取得新突破。

Comments Work in progress: We are actively scaling up the models. More updates coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19117 2026-03-18 cs.CV physics.optics 79%

3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion

3M-TI: 通过无校准多相机跨模态扩散实现高质量移动热成像

Minchong Chen, Xiaoyun Yuan, Junzhe Wan, Jianing Zhang, Jun Zhang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出3M-TI,一种无需校准的多相机跨模态扩散框架,通过跨模态自注意力模块提升热成像的分辨率和细节,验证其在实际应用中的优越性能。

Comments Accepted by CVPR 2026, Code: https://github.com/work-submit/3MTI, Project page: https://lab.xiaoyunyuan.net/index.html?project=3m-ti

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15724 2026-03-18 cs.LG cs.AI 79%

Meta-TTRL: A Metacognitive Framework for Self-Improving Test-Time Reinforcement Learning in Unified Multimodal Models

Meta-TTRL:一种用于统一多模态模型中自改进测试时间强化学习的元认知框架

Lit Sin Tan, Junzhe Chen, Xiaolong Fu, Lichen Ma, Junshi Huang, Jianzhong Shi, Yan Li, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 Meta-TTRL通过元认知信号实现测试时间参数优化,提升统一多模态模型的自改进能力,在文本到图像生成任务中取得显著成果。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16093 2026-03-18 cs.SD cs.AI cs.CV cs.MM 67%

Diffusion Models for Joint Audio-Video Generation

用于联合音频视频生成的扩散模型

Alejandro Paredes La Torre

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14837 2026-03-18 cs.CV cs.AI 62%

Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction

改进的图表到代码生成的迭代细化方法:基于结构化指令

Chengzhi Xu, Yuyang Wang, Lai Wei, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学) MIFA Lab(MIFA实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于结构化指令的ChartIR方法,通过区分视觉理解和代码翻译任务,提升图表到代码生成的性能,实验显示在Qwen2-VL和GPT-4o上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16392 2026-03-18 cs.CV 57%

DermaFlux: Synthetic Skin Lesion Generation with Rectified Flows for Enhanced Image Classification

DermaFlux:基于修正流的合成皮肤病变生成用于增强图像分类

Stathis Galanakis, Alexandros Koliousis, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) Northeastern University London, UK(伦敦东北大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 DermaFlux通过生成临床相关的皮肤病变图像,提升二分类性能,实验表明其在小数据集上提升6%,在合成数据上提升9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16373 2026-03-18 cs.CV 57%

Semantic One-Dimensional Tokenizer for Image Reconstruction and Generation

语义一维分词器用于图像重建与生成

Yunpeng Qu, Kaidong Zhang, Yukang Ding, Ying Chen, Jian Wang

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。

Comments 18 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16372 2026-03-18 cs.CV 57%

InViC: Intent-aware Visual Cues for Medical Visual Question Answering

InViC:面向医疗视觉问答的意图感知视觉线索

Zhisong Wang, Ziyang Chen, Zanting Ye, Hongze Zhu, Yefeng Zheng, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University, Xi’an 710072, China(集成空天地海大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学,西安710072,中国) Westlake University(西湖大学) Southern Medical University(南方医科大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出InViC框架,通过引入Cue Tokens Extraction模块和两阶段微调策略,提升医疗视觉问答中意图对齐的视觉证据利用,验证了瓶颈化训练在提高可信度上的有效性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16139 2026-03-18 cs.CV 57%

Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

重新思考UMM视觉生成:面向高效图像-only预训练的掩码建模

Peng Sun, Jun Xie, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出IOMM框架,通过两阶段训练提升UMM视觉生成效率与性能,实验显示其在GenEval和WISE上优于现有基线。

Comments https://github.com/LINs-lab/IOMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15975 2026-03-18 cs.CV 57%

UMO: Unified In-Context Learning Unlocks Motion Foundation Model Priors

UMO:统一上下文学习解锁运动基础模型先验

Xiaoyan Cong, Zekun Li, Zhiyang Dou, Hongyu Li, Omid Taheri, Chuan Guo, Abhay Mittal, Sizhe An, Taku Komura, Wojciech Matusik, Michael J. Black, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta Reality Lab(Meta现实实验室) Max-Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Hong Kong(香港大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 UMO通过统一框架解锁运动基础模型先验,支持多种跨模态和上下文生成任务,提升文本到运动合成性能。

Comments Project Page: https://oliver-cong02.github.io/UMO.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21435 2026-03-18 cs.CV 57%

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

融合理解与生成的交错分析-草稿思维

Shengqiong Wu, Bobo Li, Xinkai Wang, Xiangtai Li, Lei Cui, Furu Wei, Shuicheng Yan, Hao Fei, Tat-seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。

Comments 28 pages, 17 figures, 6 tables, ICLR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16612 2026-03-18 cs.GR 50%

Retrieval-Augmented Sketch-Guided 3D Building Generation

增强检索的草图引导3D建筑生成

Zhengyang Wang, Nuttapong Rochanavibhata, Yuxiao Ren, Xusheng Du, Ye Zhang, Haoran Xie

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出多阶段3D生成框架,通过结合生成与检索方法实现组件级编辑与个性化定制,解决日本独栋房屋早期设计阶段因缺乏统一表示导致的设计漂移问题。

Comments 10 pages, 4 figures, Proceeding of CAADRIA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16550 2026-03-18 cs.RO 50%

ASCENT: Transformer-Based Aircraft Trajectory Prediction in Non-Towered Terminal Airspace

ASCENT:基于Transformer的非塔台终端空域飞机轨迹预测

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,格拉茨技术大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出ASCENT模型,通过轻量级Transformer架构实现多模态3D飞机轨迹预测,结合领域感知的3D坐标归一化和参数化预测,实验表明其在TrajAir和TartanAviation数据集上优于现有方法。

Comments ICRA 2026. Project Page at https://a-pru.github.io/ascent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16116 2026-03-18 eess.SP 50%

Knowledge Distillation for Collaborative Learning in Distributed Communications and Sensing

知识蒸馏在分布式通信与感知中的协同学习

Nhan Thanh Nguyen, Mengyuan Ma, Nir Shlezinger, Junil Choi, Yonina C. Eldar, A. Lee Swindlehurst, Markku Juntti

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文探讨了知识蒸馏和协同学习在6G分布式通信与感知节点中部署轻量级AI模型的有效性,通过系统性数值研究证明其在多模态感知辅助波束跟踪中的性能提升与复杂度降低。

Comments This paper has been submitted to IEEE Communications Magazine and under review for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏