arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4932 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4932 篇

2507.01908 2026-05-14 cs.CV 81%

Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning

基于推理的编辑:基于假设指令的图像编辑与视觉推理

Qingdong He, Xueqin Chen, Chaoyi Wang, Yanjie Pan, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Tencent Youtu Lab(腾讯云图实验室) Sichuan University(四川大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26341 2026-04-30 cs.CV 81%

SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness

SpatialFusion:赋予统一图像生成内在三维几何意识

Haiyi Qiu, Kaihang Pan, Jiacheng Li, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究院)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出SpatialFusion框架,通过引入混合变压器增强MLLM的三维几何建模能力,并利用深度适配器将显式几何约束注入扩散模型,提升空间感知任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14138 2026-08-17 cs.CV cs.AI 新提交 81%

SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

SPARGen:通过原生多模态生成统一空间感知与推理

Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SPARGen是统一多模态框架,将3D重建等空间任务转为指令条件生成任务,在单一框架内实现异构空间任务的竞争力性能,突破现有方法的知识迁移限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10291 2026-08-12 cs.CV cs.AI cs.LG 新提交 81%

MRIComp4Flow: Compression of 3D Brain MRI for Training Multi-Modal Generative Models

MRIComp4Flow:用于训练多模态生成模型的三维脑部MRI压缩

Lisa K. Fischer, Mykhailo Riabets, Daniel Rueckert, Benedikt Wiestler, Anke Meyer-Baese, Sandeep Nagar

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Imperial College London(帝国理工学院) Florida State University(佛罗里达州立大学) Institute for Advanced Study, TUM (TUM-IAS)(慕尼黑工业大学高等研究院) TUM University Hospital(慕尼黑工业大学医院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对大规模多模态MRI的存储与I/O问题,采用JPEG2000或JPEG-LS压缩三维脑肿瘤MRI,在20:1压缩率下训练Wavelet Flow Matching模型,证实其合成质量与未压缩数据训练的模型相当,为可扩展三维MRI生成建模提供了实用方案。

Comments Accepted: MICCAI 2026 SASHIMI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10129 2026-08-12 cs.CV cs.AI 版本更新 81%

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

LaViT:对齐潜在视觉思维以进行多模态推理

Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Utrecht University(乌特勒支大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04203 2026-08-11 cs.CL cs.CV cs.LG cs.SE 版本更新 81%

FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback

FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试

Xueqing Wu, Zihan Xue, Da Yin, Shuyan Zhou, Kai-Wei Chang, Nanyun Peng, Yeming Wen

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of California, Los Angeles(加州大学洛杉矶分校) Duke University(杜克大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。

Comments CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 81%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04655 2026-08-06 cs.CV cs.AI 新提交 81%

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

机构 * Hainan University(海南大学) Guangdong Ocean University(广东海洋大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16898 2026-08-04 cs.CV cs.CL cs.CR 版本更新 81%

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份

Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。

Comments 14 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17151 2026-07-31 cs.CV cs.CL 版本更新 81%

Scaling medical imaging report generation with multimodal reinforcement learning

通过多模态强化学习扩展医学影像报告生成

Qianchu Liu, Sheng Zhang, Guanghui Qin, Yu Gu, Ying Jin, Sam Preston, Yanbo Xu, Sid Kiblawi, Wen-wai Yim, Timothy Ossowski, Tristan Naumann, Mu Wei, Hoifung Poon

机构 * Microsoft Research(微软研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出UniRG框架,通过多模态强化学习提升医学影像报告生成的性能和泛化能力,在CXR报告生成中取得新的SOTA成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05607 2026-07-28 cs.CV cs.AI 版本更新 81%

DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces

DreamCAD: 通过可微参数曲面实现多模态CAD生成的扩展

Mohammad Sadil Khan, Muhammad Usama, Rolandos Alexandros Potamias, Didier Stricker, Muhammad Zeshan Afzal, Jiankang Deng, Ismail Elezi

机构 * DFKI RPTU Imperial College London(帝国理工学院伦敦分校) Huawei London Research Center(华为伦敦研究中心)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 DreamCAD通过可微参数曲面直接生成可编辑的BRep,无需CAD特定注释,实现多模态CAD生成的扩展,并在多个基准测试中取得最佳性能。

Comments For Caption Dataset: https://huggingface.co/datasets/SadilKhan/CADCap-1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21343 2026-07-24 cs.LG cs.AI cs.CV 新提交 81%

M$^3$-Gen: Interpretable Multimodal Generation of Gene Expression Profiles Using Clinical and Imaging Data

M$^3$-Gen:利用临床和影像数据对基因表达谱进行可解释的多模态生成

Francesca Pia Panaccione, Carlo Sgaravatti, Marco Venere

机构 * DEIB - Dipartimento Elettronica, Informazione e Bioingegneria, Politecnico di Milano(米兰理工大学电子、信息与生物工程系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究旨在解决基因表达数据获取受限问题,提出M$^3$-Gen框架,通过对比学习从临床变量和图像中学习潜在表示,以生成生物学连贯的基因表达谱,在TCGA数据集上验证有效性,且具有内在可解释性。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08792 2026-07-24 cs.CV cs.AI cs.LG 版本更新 81%

Multimodal Learning for Arcing Detection in Pantograph-Catenary Systems

接触网-受电弓系统中弧光检测的多模态学习

Hao Dong, Eleni Chatzi, Olga Fink

机构 * Chair of Structural Mechanics & Monitoring, ETH Zürich(苏黎世联邦理工学院结构力学与监测教授职位) Intelligent Maintenance and Operations Systems Lab, EPFL(洛桑联邦理工学院智能维护与运营系统实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态学习框架,结合图像与力数据,有效检测接触网-受电弓系统中的弧光事件,提升检测鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19344 2026-07-22 cs.CV cs.AI cs.GR 新提交 81%

Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

外观指针——扩散变压器的多模态区域控制

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha

机构 * Brown University(布朗大学) Adobe Research(Adobe 研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对可控图像生成难题,提出外观指针方法,通过区域对应网络和空间聚合机制生成并细化指针,为扩散变压器引入模态无关的局部多模态控制接口,单一模型性能达或超现有技术。

Comments 38 Pages, Preprint with supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13125 2026-07-21 cs.CV cs.AI 版本更新 81%

Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

Boogu-Image-0.1:提升开源统一多模态理解与生成能力

Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 81%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11919 2026-07-15 cs.NE cs.AI cs.CV cs.LG 新提交 81%

Do You Remember? Toward Memory-Centric Multimodal AI

你还记得吗?迈向以记忆为中心的多模态人工智能

Xuguang Yu, Weigang Zheng, Minyue Yu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。

Comments 43 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11364 2026-07-14 cs.LG cs.AI cs.MM 新提交 81%

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架

Ajitesh Jamulkar, Aritra Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10915 2026-07-13 cs.CV cs.AI cs.LG 版本更新 81%

M4V: Multimodal Mamba for Efficient Text-to-Video Generation

M4V:用于高效文本到视频生成的多模态曼巴

Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma

机构 * Meituan(美团) University of Technology Sydney(技术大学悉尼分校) Beijing Jiaotong University(北京交通大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07027 2026-07-09 cs.LG cs.AI cs.CV 新提交 81%

Latent graph encoding of multimodal neuroimaging features with generative AI architectures

基于生成式人工智能架构的多模态神经影像特征的潜在图编码

Ishaan Batta, Meenu Ajith, Vince Calhoun

机构 * Center for Translational Research in Neuroimaging and Data Science (TReNDS)(转化神经影像与数据科学研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究旨在设计多模态生成框架用于神经影像特征分析,通过评估多种策略和模型,利用GMV和sFNC特征分析多个生成框架,提出的gMMVAE在多指标上超替代变体,有潜力用于稳健的多模态神经影像分析。

Comments 6 pages, accepted in IEEE International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04423 2026-07-08 cs.CV cs.AI 新提交 81%

Transferability Between Understanding and Generation in Unified Multimodal Models

统一多模态模型中理解与生成之间的可迁移性

Jiwon Kang, Heeji Yoon, Jaewoo Jung, Jaewon Min, Minkyeong Jeon, Biyeon Hwang, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Blynx(布林克斯公司) Trillionlabs(万亿实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究统一多模态模型中理解与生成任务间的可迁移性,通过实验发现其依赖架构,据此提出实用训练策略,训练对应理解任务迁移至生成可提升性能并减少分布偏移。

Comments Accepted at ECCV 2026. Project Page: https://cvlab-kaist.github.io/UMM_Transferability/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-07-01 cs.AI cs.CV 新提交 81%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18714 2026-06-26 cs.CV cs.AI 版本更新 81%

Semantic Generative Tuning for Unified Multimodal Models

语义生成微调用于统一多模态模型

Songsong Yu, Yuxin Chen, Ying Shan, Yanwei Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent ARCLab(腾讯ARCLab)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21384 2026-06-23 cs.CV cs.AI 新提交 81%

EnTrust: Modeling Inter-Modal Conflict for Trustworthy Multimodal Medical Image Analysis

EnTrust: 建模模态间冲突以实现可信的多模态医学图像分析

Dwarikanath Mahapatra, Abhijit Das, Behzad Bozorgtabar, Zongyuan Ge, Sudipta Roy, Deepak Nayak, Mauricio Reyes, Imran Razzak

机构 * Khalifa University(哈利法大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Aarhus University(奥胡斯大学) Monash University(莫纳什大学) Jio University(Jio大学) NIT Jaipur(斋浦尔国立理工学院) University of Bern(伯尔尼大学) MedOS

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出EnTrust框架,通过解耦模态特征中的共享共识、特定线索和冲突信号,利用扩散模型生成假设并校准像素级不确定性,在多个医学图像分割基准上达到SOTA,校准误差降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04704 2026-06-17 q-bio.QM cs.AI cs.CV 版本更新 81%

SPATIA: Multimodal Generation and Prediction of Spatial Cell Phenotypes

SPATIA: 空间细胞表型的多模态生成与预测

Zhenglun Kong, Mufan Qiu, John Boesen, Xiang Lin, Sukwon Yun, Tianlong Chen, Manolis Kellis, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学学校生物医学信息学系) Department of Computer Science, University of North Carolina(北卡罗来纳大学计算机科学系) Department of Computer Science, Massachusetts Institute of Technology(麻省理工学院计算机科学系)

专题命中 多模态生成 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出SPATIA模型,融合细胞形态、基因表达和空间上下文,通过置信感知流匹配和形态-谱对齐实现多尺度生成与预测,在12项任务中优于18个基线模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01022 2026-06-02 cs.CV cs.AI 81%

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

ProductWebGen: 多模态产品网页生成基准测试

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00477 2026-06-02 cs.CL cs.CV 81%

Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs

文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准

Xin Gao, Cheng Yang, Chufan Shi, Taylor Berg-Kirkpatrick

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Washington(华盛顿大学)

专题命中 多模态生成 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出跨模态知识编辑基准UniKE,发现文本编辑在图像生成中效果显著下降(VQA准确率仅18.5%),并提出推理增强参数编辑方法提升跨模态迁移效果。

Comments Published at ICML 2026; Code and data available at https://github.com/gxx27/UniKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00153 2026-06-02 cs.CV cs.AI 81%

DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion

DiffCrossGait:基于潜在扩散的2D-3D跨模态步态识别轨迹级对齐

Zhiyang Lu, Ming Cheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对2D-3D跨模态步态识别中的域差异问题,提出DiffCrossGait,通过潜在扩散空间中的轨迹级对齐实现连续模态对齐,并引入三阶段对齐策略确保身份锚定、动态一致性和跨模态结构可恢复性,在SUSTech1K和FreeGait基准上达到最优性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29826 2026-05-29 cs.CL cs.AI 81%

Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models

面向多模态大语言模型的局部化与解耦知识编辑

Leijiang Gu, Zhen Zeng, Feng Li, Xinjian Gao, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Tongji University(同济大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态知识编辑中因果错位和特征纠缠问题,提出LDKE框架,通过快速定位关键层和解耦分类器实现精准泛化编辑并保持高局部性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18678 2026-05-21 cs.CV cs.AI 81%

Lance: Unified Multimodal Modeling by Multi-Task Synergy

Lance:通过多任务协同实现统一多模态建模

Fengyi Fu, Mengqi Huang, Shaojin Wu, Yunsheng Jiang, Yufei Huo, Hao Li, Yinghang Song, Fei Ding, Jianzhu Guo, Qian He, Zheren Fu, Zhendong Mao, Yongdong Zhang

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Lance,一种轻量级的原生统一模型,支持图像和视频的多模态理解、生成和编辑。该模型通过协同多任务训练的实用范式实现统一多模态建模,基于统一上下文建模和解耦能力路径两个核心原则,通过双流混合专家架构实现联合上下文学习并解耦理解和生成路径。

Comments 34 pages, 14 figures, 10 tables, homepage url: https://lance-project.github.io , code url: https://github.com/bytedance/Lance

详情

展开后加载摘要…

URL PDF HTML 收藏