arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-30 至 2026-06-30 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 17 篇

2606.29689 2026-06-30 cs.CL 89%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 多模态生成 :MLLM(title_cn,abstract);multimodal(title,abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19679 2026-06-30 cs.CV 83%

MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation

MMControl: 多模态控制用于联合音频视频生成

Liyang Li, Wen Wang, Canyu Zhao, Tianjian Feng, Zhiyue Zhao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MMControl,通过双流条件注入机制实现联合音频视频生成的多模态控制,支持视觉和听觉信号的精细控制,提升跨模态对齐效果。

Comments Accepted to ECCV 2026. Project page: https://aim-uofa.github.io/MMControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06728 2026-06-30 cs.CV 83%

Multimodal Large Language Model driven Radiology Report Generation with Clinical Knowledge Enhancement

基于多模态大语言模型的放射科报告生成与临床知识增强

Miaojing Shi, Tianyu Cen, Zijie Yue, Meng Wei, Oluwatosin Alabi, Tom Vercauteren

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种融合多模态大语言模型与临床知识的放射科报告生成方法,通过解剖学特征提取、多模态报告生成及多任务学习提升报告的临床相关性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30054 2026-06-30 cs.CV 79%

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

照亮统一多模态模型以实现自由形式交错文本-图像生成

Chonghuinan Wang, Zhikai Chen, Chunwei Wang, Yecong Wan, Junwei Yang, Zhixin Wang, Wei Zhang, Jiaqi Xu, Renjing Pei, Xiaohe Wu, Fan Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Nankai University(南开大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ILLUME-X统一多模态模型,通过改进数据效率和稳定训练,实现高质量自由形式交错文本-图像生成,在风格迁移等任务上超越先前模型。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30019 2026-06-30 cs.CV 79%

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29812 2026-06-30 cs.CV 79%

Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning

一致性作为归纳偏置:学习跨视角不变性以实现鲁棒多模态推理

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Kening Zheng, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO人工智能中心) UIC(美国国际大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ConsistRoll方法,通过将原始视图与语义不变变换视图置于同一生成组并联合奖励,将跨视角一致性注入强化学习训练,提升多模态推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28406 2026-06-30 cs.LG cs.CV cs.GR 79%

Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models

AI能绘制科学吗?评估文本到图像和多模态模型生成科学图形的基准

Davie Chen

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出SciDraw-Bench基准,通过32个结构化任务和四维评估协议(文本保真度、语义正确性、结构质量、惯例遵循),评估文本到图像模型生成科学图形的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06344 2026-06-30 cs.CV 79%

SDGIC: A Semantic Disambiguation-Guided Generative Image Compression Method for Ultra-Low Bitrates

SDGIC: 一种基于语义消歧的生成图像压缩方法,用于超低比特率

Kaile Wang, Lijun He, Haisheng Fu, Haixia Bi, Fan Li

机构 * School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) Department of Electrical and Computer Engineering, Faculty of Applied Science, The University of British Columbia(不列颠哥伦比亚大学应用科学学院电气与计算机工程系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SDGIC框架,通过三种互补的指导流约束扩散重建,提升超低比特率下的语义一致性与感知质量,减少23.4%的AFINE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12159 2026-06-30 cs.SE cs.AI 79%

EfficientUICoder: A Bidirectional Token Compression Framework for Efficient MLLM-Based UI Code Generation

EfficientUICoder: 一种用于高效基于多模态大语言模型的UI代码生成的双向标记压缩框架

Jingyu Xiao, Zhongyi Zhang, Yuxuan Wan, Yintong Huo, Yang Liu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Huazhong University of Science and Technology(华中科技大学) Singapore Management University(新加坡管理大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出EfficientUICoder,通过元素和布局感知标记压缩、区域感知标记精炼和自适应重复标记抑制,有效压缩UI代码生成的标记数量,提升生成效率和代码质量。

Comments Published in the Proceedings of the 2026 ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07753 2026-06-30 cs.CV cs.CL cs.LG 73%

Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding

共生MoE:解构生成与理解之间的协同效应

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出Symbiotic-MoE框架,通过模态感知专家解缠绕和渐进训练策略,解决生成与理解任务间的冲突,提升多模态协同能力,在MMLU和OCRBench上取得显著提升。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22282 2026-06-30 cs.CV cs.AI 73%

UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation

UniMotion: 一种用于运动-文本-视觉理解和生成的统一框架

Ziyi Wang, Xinshun Wang, Shuang Chen, Yang Cong, Mengyuan Liu

机构 * Peking University(北京大学) Donghua University(东华大学) South China University of Technology(华南理工大学)

专题命中 多模态生成 :cross-modal(abstract);any-to-any(abstract);分类 cs.CV、cs.AI

AI总结 UniMotion首次提出统一框架,同时处理人类运动、自然语言和RGB图像的理解与生成,通过连续模态处理和自监督预训练解决传统模型的局限性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30319 2026-06-30 cs.CV cs.LG 70%

BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language

BrainJanus:一个统一的大脑、视觉与语言理解与生成模型

Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin Wu

专题命中 多模态生成 :multimodal(abstract);any-to-any(abstract);分类 cs.CV

AI总结 提出首个统一大脑模型BrainJanus,通过统一大脑分词器和全能自回归架构,实现脑信号与视觉、语言之间的双向编码与解码,在多个基准上取得优异性能并具备零样本泛化能力。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30001 2026-06-30 cs.CV cs.GR cs.HC cs.SD 57%

SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset

SICAGE: 使用TED4C-L数据集的说话人无关文化感知手势生成

Ariel Gjaci, Antonio Sgorbissa, Vittorio Murino

机构 * Italian Institute of Technology(意大利理工学院) University of Genoa(热那亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出SICAGE框架,通过域泛化学习说话人无关的文化表征,结合ALaDiT扩散模型生成文化适切手势,在TED4C-L数据集上验证了运动真实性、多样性和文化一致性提升。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29013 2026-06-30 cs.CV 57%

Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers

Mural: 通过混合Transformer将LLM知识迁移到图像生成

Achin Jain, Jie An, Siddharth Chaudhary, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Mixture-of-Transformers架构,将冻结的LLM与扩散图像生成器结合,仅用文本-图像对训练,在多个基准上取得优异性能,并涌现出跨语言生成、颜色引导构图等新能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28643 2026-06-30 cs.CV 57%

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

Obliviate: 从自回归图像生成模型中擦除概念

Hossein Shakibania, Jonas Henry Grebe, Tobias Braun, Ege Aktemur, Saleh Aslani, Mehmet Görkem Yiğit, Marcus Rohrbach

机构 * TU Darmstadt, Germany(图宾根大学) Multimodal AI Lab, TU Darmstadt, Germany(多模态人工智能实验室) Zuse School ELIZA(祖斯学院ELIZA) hessian.AI, Germany(海西斯.AI)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Obliviate方法,通过KL散度监督视觉token分布、轨迹级更新和对齐视觉前缀,有效擦除自回归文生图模型中的有害概念,在保持模型效用同时大幅降低不当内容生成。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25743 2026-06-30 cs.CV 57%

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28922 2026-06-30 eess.IV 50%

Cross-Sensor SAR Data Generation Using Diffusion Models and Feature Migration

基于扩散模型和特征迁移的跨传感器SAR数据生成

Xuanting Wu, Fan Zhang, Fei Ma, Qiang Yin, Yongsheng Zhou

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出融合稳定扩散模型与注意力蒸馏的框架,利用历史SAR数据生成适配新传感器特性的训练数据,缓解数据稀缺问题。

Journal ref Transactions of Nanjing University of Aeronautics and Astronautics, 2025, 42(4): 509-524

详情

展开后加载摘要…

URL PDF HTML 收藏