arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4932 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4932 篇

2508.13587 2026-03-17 cs.AI cs.CV 81%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12793 2026-03-16 cs.CV cs.AI 81%

Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation

Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成

Yichen Zhang, Da Peng, Zonghao Guo, Zijian Zhang, Xuesong Yang, Tong Sun, Shichu Sun, Yidan Zhang, Yanghao Li, Haiyan Zhao, Wang Xu, Qi Shi, Yangang Sun, Chi Chen, Shuo Wang, Yukun Yan, Xu Han, Qiang Ma, Wei Ke, Liang Wang, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12581 2026-03-16 eess.IV cs.AI cs.CV 81%

Multiscale Structure-Guided Latent Diffusion for Multimodal MRI Translation

多尺度结构引导的潜在扩散模型用于多模态MRI翻译

Jianqiang Lin, Zhiqiang Shen, Peng Cao, Jinzhu Yang, Osmar R. Zaiane, Xiaoli Liu

机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,沈阳,中国) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,沈阳,中国) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,沈阳,中国) Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学阿米人工智能研究所,埃德蒙顿,阿尔伯塔,加拿大) AiShiWeiLai AI Research, Beijing, China(人工智能研究(北京)有限公司,北京,中国)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MSG-LDM框架,通过多尺度特征空间分离风格与结构信息,提升多模态MRI翻译的结构一致性与纹理细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI 81%

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09931 2026-03-11 cs.CV cs.AI 81%

Adaptive Clinical-Aware Latent Diffusion for Multimodal Brain Image Generation and Missing Modality Imputation

自适应临床感知潜在扩散用于多模态脑图像生成与缺失模态插值

Rong Zhou, Houliang Zhou, Yao Su, Brian Y. Chen, Yu Zhang, Lifang He, Alzheimer's Disease Neuroimaging Initiative

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ACADiff通过自适应临床感知扩散模型,实现多模态脑图像生成与缺失模态插值,提升阿尔茨海默病诊断的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07540 2026-03-10 cs.CV cs.AI 81%

How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation

统一多模态模型能可靠生成图像多长?通过上下文筛选驯服长周期交错图像生成

Haoyu Chen, Qing Liu, Yuqian Zhou, He Zhang, Zhaowen Wang, Mengwei Ren, Jingjing Ren, Xiang Wang, Zhe Lin, Lei Zhu

机构 * The Hong Kong University of Science(香港科学与技术大学) Adobe Research(Adobe研究) Huazhong University of Science(华中科技大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出UniLongGen,通过动态筛选模型记忆以提升长周期图像生成的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00507 2026-03-06 cs.CL cs.AI 81%

Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

Graph2Eval: 通过知识图谱实现自动多模态任务生成

Yurun Chen, Xavier Hu, Yuhan Liu, Ziqi Wang, Zeyi Liao, Lin Chen, Feng Wei, Yuxi Qian, Bo Zheng, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Xiameng University(Xmeng大学) The Ohio State University(俄亥俄州立大学) Ant Group(蚂蚁集团)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 Graph2Eval通过知识图谱生成多模态任务,提升智能体任务的语义一致性和可解性,提供新的评估视角。

Comments Accepted at CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11190 2026-03-06 cs.AI cs.CL 81%

Enhancing multimodal analogical reasoning with Logic Augmented Generation

通过逻辑增强生成增强多模态类比推理

Anna Sofia Lippolis, Andrea Giovanni Nuzzolese, Aldo Gangemi

机构 * University of Bologna(博洛尼亚大学) ISTC-CNR(意大利国家研究 council 信息与系统技术研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出逻辑增强生成框架,通过结合语义知识图谱和提示启发法,提升多模态类比推理能力,在隐喻检测和理解任务中优于基线和人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24365 2026-03-03 cs.CV cs.AI 81%

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型

Jitai Hao, Hao Liu, Xinyan Xiao, Qiang Huang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Baidu Inc.(百度公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00207 2026-03-03 cs.CV cs.AI 81%

VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models

VisRef: 通过思考进行视觉再聚焦以提高多模态大推理模型的测试时间扩展

Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Amazon(亚马逊) Physion Labs(Physion实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 VisRef通过视觉再聚焦提升多模态大推理模型测试时间扩展性能,有效解决视觉依赖任务中推理性能下降问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19822 2026-02-24 cs.CV cs.AI 81%

Efficient endometrial carcinoma screening via cross-modal synthesis and gradient distillation

通过跨模态合成与梯度蒸馏实现高效的子宫内膜癌筛查

Dongjing Shan, Yamei Luo, Jiqing Xuan, Lu Huang, Jin Li, Mengchu Yang, Zeyu Chen, Fajin Lv, Yong Tang, Chunxiang Zhang

机构 * School of Medical Information and Engineering, Southwest Medical University(西南医科大学医学信息与工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Ultrasound, Affiliated Hospital of Southwest Medical University(西南医科大学附属医院超声科) Department of Functional Examination Unit, Zibo Hospital of Traditional Chinese Medicine(淄博中医药医院功能检查科) Key Laboratory of Medical Electrophysiology, Ministry of Education& Medical Electrophysiological Key Laboratory of Sichuan Province, Institute of Cardiovascular Research, Southwest Medical University(教育部医学电生理重点实验室、四川省医学电生理重点实验室、西南医科大学心血管研究所) Department of Radiology, the First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院放射科) Department of Cardiology, Affiliated Hospital of Southwest Medical University(西南医科大学附属医院心内科) International Research Center for Complexity Sciences, Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院复杂科学研究中心) Institute of Intelligent Chinese Medicine, Chongqing University of Chinese Medicine(重庆中医药大学智能中药研究院) Basic Medicine Research Innovation Center for Cardiometabolic Diseases, Ministry of Education, Southwest Medical University(教育部心脑血管疾病基础医学研究创新中心、西南医科大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种高效的两阶段深度学习框架,通过跨模态合成与梯度蒸馏技术,在低计算成本下实现高灵敏度和特异度的子宫内膜癌筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15758 2026-02-18 cs.CL cs.AI 81%

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: 评估多轮视觉引导图表编辑在多模态语言模型中的表现

Manav Nitin Kapadnis, Lawanya Baghel, Atharva Naik, Carolyn Rosé

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 ChartEditBench通过代码进行多轮视觉引导图表编辑,评估多模态语言模型在持续、上下文感知编辑中的表现,揭示了多轮交互中错误累积和共享上下文失效的问题。

Comments 16 pages, 13 figures including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20630 2026-02-17 eess.AS cs.MM cs.SD 81%

ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting

ISDrama: 通过多模态提示生成沉浸式空间戏剧

Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Tao Jin, Zhou Zhao

机构 * Zhejiang University, Shanghai AI Lab(浙江大学上海人工智能实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.MM、eess.AS

AI总结 ISDrama通过多模态提示生成沉浸式空间戏剧,首次结合多模态数据建模和戏剧语调生成。

Comments Accepted by ACM Multimedia 2025

Journal ref MM '2025: Proceedings of the 33rd ACM International Conference on Multimedia Pages 9618 - 9627

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09131 2026-02-04 cs.GR cs.AI cs.CV 81%

Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer

无需训练的文本引导颜色编辑与多模态扩散变换器

Zixin Yin, Xili Dai, Ling-Hao Chen, Deyu Zhou, Jianan Wang, Duomin Wang, Gang Yu, Lionel M. Ni, Lei Zhang, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学) Astribot StepFun

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 ColorCtrl通过多模态扩散变换器实现无需训练的文本引导颜色编辑,精准控制颜色属性并保持一致性,优于现有方法和商业模型。

Comments https://zxyin.github.io/ColorCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12728 2026-02-04 cs.CV cs.MM 81%

SpecFLASH: A Latent-Guided Semi-autoregressive Speculative Decoding Framework for Efficient Multimodal Generation

SpecFLASH: 一种基于潜在引导的半自回归推测解码框架,用于高效多模态生成

Zihua Wang, Ruibo Li, Haozhe Du, Joey Tianyi Zhou, Yu Zhang, Xu Yang

机构 * Southeast University, Nanjing, China(东南大学) Nanyang Technological University, Singapore(南洋理工大学) A STAR Centre for Frontier AI Research (CFAR), Singapore(A STAR前沿人工智能研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 SpecFLASH是一种针对多模态生成的高效推测解码框架,通过潜在引导的token压缩和半自回归解码方案,显著提升视觉任务的解码速度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25178 2026-02-03 cs.CV cs.AI cs.LG 81%

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

GHOST:诱导幻觉的多模态大语言模型图像生成

Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) University of Maryland(马里兰大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GHOST通过优化隐蔽令牌生成诱导幻觉的图像,评估多模态大语言模型的可靠性,并发现高幻觉成功率及可转移漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13993 2026-01-30 eess.IV cs.AI cs.CV 81%

OrthoInsight: Rib Fracture Diagnosis and Report Generation Based on Multi-Modal Large Models

OrthoInsight:基于多模态大模型的肋骨骨折诊断与报告生成

Ningyong Wu, Jiangbo Zhang, Wenhong Zhao, Jinzhi Wang, Chenzhan Yu, Zhigang Xiu, Duwei Dai, Ziyu Xu, Yongli Yang

机构 * Organizational Management Department, School of Management, Xi’an Jiaotong University(管理学院组织管理部,西安交通大学) West China Longquan Hospital, Sichuan University(四川大学西部临床医学院) School of Electronic Science and Engineering, Xi’an Jiaotong University(西安交通大学电子科学与工程学院) Systems Engineering Institute, Xi’an Jiaotong University(西安交通大学系统工程研究院) Institute of Medical Artificial Intelligence, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学第二附属医院医学人工智能研究所) School of Human Settlements and Civil Engineering, Xi’an Jiaotong University(西安交通大学人居环境与土木工程学院) School of Life Science and Technology, Xi’an Jiaotong University(西安交通大学生命科学与技术学院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 OrthoInsight通过多模态大模型实现肋骨骨折的自动诊断与报告生成,结合CT图像分析与医学知识图谱,提升诊断效率和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16899 2026-01-21 cs.CL cs.CV 81%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09145 2026-01-19 cs.LG cs.CL cs.CV 81%

MoLAN: A Unified Modality-Aware Noise Dynamic Editing Framework for Multimodal Sentiment Analysis

MoLAN: 一种统一的多模态感知噪声动态编辑框架用于多模态情感分析

Xingle Xu, Yongkang Liu, Dexian Cai, Shi Feng, Xiaocui Yang, Daling Wang, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MoLAN提出了一种统一的多模态感知噪声动态编辑框架,通过动态分配去噪强度以提升多模态情感分析的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00568 2026-01-14 cs.CV cs.AI cs.LG 81%

Generating crossmodal gene expression from cancer histopathology improves multimodal AI predictions

从癌症组织病理学生成跨模态基因表达以提高多模态AI预测

Samiran Dey, Christopher R. S. Banerji, Partha Basuchowdhuri, Sanjoy K. Saha, Deepak Parashar, Tapabrata Chakraborti

机构 * School of Mathematical & Computational Sciences, Indian Association for the Cultivation of Science(数学与计算科学学院,印度科学培养协会) The Alan Turing Institute(艾伦·图灵研究所) Comprehensive Cancer Center, King’s College London(国王学院综合癌症中心) Department of Computer Science and Engineering, Jadavpur University(计算机科学与工程系,贾瓦德pur大学) MRC Biostatistics Unit, University of Cambridge(剑桥大学医学研究委员会生物统计学单位) Department of Biostatistics, Bioinformatics and Biomathematics, Georgetown University(生物统计学、生物信息学与生物数学系,杰斐逊大学) UCL Cancer Institute, Dept of Medical Physics & Biomedical Engineering, University College London(伦敦大学学院癌症研究所,医学物理与生物医学工程系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 PathGen通过生成跨模态基因表达提升癌症分级和生存风险预测的多模态AI性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02204 2026-01-06 cs.CV cs.AI 81%

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20436 2025-12-24 eess.IV cs.AI cs.CV 81%

Dual-Encoder Transformer-Based Multimodal Learning for Ischemic Stroke Lesion Segmentation Using Diffusion MRI

基于双编码变压器的多模态学习用于扩散磁共振成像的缺血性中风病变分割

Muhammad Usman, Azka Rehman, Muhammad Mutti Ur Rehman, Abd Ur Rehman, Muhammad Umar Farooq

机构 * Department of Anesthesiology, Perioperative and Pain Medicine, Stanford University(麻醉学、围术期与疼痛医学系,斯坦福大学) Department of Biomedical Sciences, Seoul National University(生物医学科学系,首尔国立大学) Department of Computer Engineering, National University of Sciences and Technology (NUST)(计算机工程系,国立科学与技术大学(NUST)) Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学) Department of Computer Science, Hanyang University(计算机科学系,翰阳大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出双编码变压器架构,利用多模态扩散MRI实现缺血性中风病变分割,达到85.4%的Dice分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01298 2025-12-23 cs.CV cs.AI 81%

Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models

通过统一生成模型中的多模态推理链提升图像生成

Yi Wang, Mushui Liu, Wanggui He, Hanyang Yuan, Longxiang Zhang, Ziwei Huang, Guanghao Zhang, Wenkai Fang, Haoze Jiang, Shengxuming Zhang, Dong She, Jinlong Liu, Weilong Dai, Mingli Song, Hao Jiang, Jie Song

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过引入多模态推理链提升统一生成模型的复杂图像生成能力,提出FoXperts架构和MCoT方法,实现更高效的多模态生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14862 2025-12-22 cs.LG cs.CL cs.CV 81%

LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models

LatentExplainer: 通过多模态大语言模型解释深度生成模型中的潜在表示

Mengdan Zhu, Raasikh Kanjiani, Jiahui Lu, Andrew Choi, Qirui Ye, Liang Zhao

机构 * Emory University(埃默里大学) University College London(伦敦大学学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 LatentExplainer通过多模态大语言模型为深度生成模型的潜在变量生成语义解释,提升模型可解释性。

Comments Accepted to CIKM 2025 Full Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15069 2025-12-18 cs.CV cs.AI 81%

PMMD: A pose-guided multi-view multi-modal diffusion for person generation

PMMD: 一种基于姿态的多视角多模态扩散用于人物生成

Ziyu Shang, Haoran Liu, Rongchao Zhang, Zhiqian Wei, Tongtong Feng

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Hong Kong, Hong Kong, China(香港城市大学) Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PMMD通过多视角多模态扩散框架,实现可控姿态和外观的人像生成,提升一致性、细节保留和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13752 2025-12-17 cs.CV cs.AI 81%

STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning

STAR:用于统一多模态学习的堆叠自回归方案

Jie Qin, Jiancheng Huang, Limeng Qiao, Lin Ma

机构 * Meituan Inc(美团公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11464 2025-12-15 cs.CV cs.AI cs.LG 81%

Exploring MLLM-Diffusion Information Transfer with MetaCanvas

探索MLLM-扩散信息传输与MetaCanvas

Han Lin, Xichen Pan, Ziqi Huang, Ji Hou, Jialiang Wang, Weifeng Chen, Zecheng He, Felix Juefei-Xu, Junzhe Sun, Zhipeng Fan, Ali Thabet, Mohit Bansal, Chu Wang

机构 * Meta Superintelligence Labs(Meta 超智能实验室) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MetaCanvas通过使MLLMs在潜在空间中推理和规划,提升多模态生成的精确度和结构化控制。

Comments Project page: https://metacanvas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09610 2025-12-11 cs.HC cs.AI cs.CV 81%

ImageTalk: Designing a Multimodal AAC Text Generation System Driven by Image Recognition and Natural Language Generation

ImageTalk: 设计一种由图像识别和自然语言生成驱动的多模态AAC文本生成系统

Boyin Yang, Puming Jiang, Per Ola Kristensson

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ImageTalk通过图像识别和自然语言生成设计多模态AAC文本生成系统,实现95.6%的按键节省率和高用户满意度。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09854 2025-12-04 cs.CL cs.AI cs.LG 81%

Scaling Multimodal Search and Recommendation with Small Language Models via Upside-Down Reinforcement Learning

通过倒置强化学习扩展小语言模型以支持多模态搜索与推荐

Yu-Chen Lin, Sanat Sharma, Hari Manikandan, Jayant Kumar, Tracy Holloway King, Jing Zheng

机构 * Adobe(Adobe公司) Meta

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过倒置强化学习和合成数据蒸馏,利用小语言模型实现高效多模态搜索与推荐,显著降低推理延迟和内存开销。

Comments Accepted by ICDM 2025 MMSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02351 2025-12-03 cs.CV cs.AI 81%

Understanding and Harnessing Sparsity in Unified Multimodal Models

理解并利用统一多模态模型中的稀疏性

Shwai He, Chaorui Deng, Ang Li, Shen Yan

机构 * ByteDance Seed(字节跳动种子) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究通过MoE适应方法,利用稀疏激活提升统一多模态模型的效率,使模型在激活约一半参数的情况下达到与完整模型相当的性能。

Comments 13 pages, 13 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏