arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-18 至 2026-05-18 共收录 77 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 14 篇

2601.21798 2026-05-18 cs.CV 93%

CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models

CG-MLLM:通过多模态大语言模型实现图像描述与3D内容生成

Junming Huang, Chi Wang, Letian Li, Guangkai Xu, Donglin Huang, Hao Chen, Qiang Dai, Weiwei Xu

机构 * Zhejiang University, China(浙江大学)

专题命中 图文多模态 :MLLM(title,title_cn);multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出CG-MLLM,一种能实现3D描述和高分辨率3D生成的多模态大语言模型,通过混合Transformer架构分离不同建模需求,结合预训练视觉语言模型与专用3D VAE潜在空间,提升3D生成质量与感知能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02597 2026-05-18 cs.CV cs.AI 88%

Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs

视觉即理解:解锁因果注意力以实现模态互注意力用于多模态大语言模型

Wei-Yao Wang, Zhao Wang, Helen Suzuki, Yoshiyuki Kobayashi

机构 * Sony Group Corporation, Tokyo, Japan(索尼集团,日本东京)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出模态互注意力机制,通过解锁因果注意力,提升多模态理解性能,无需额外参数,在12个基准测试中平均提升6.2%。

Comments ICML 2026. Code is available at https://github.com/sony/aki

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13805 2026-05-18 cs.CV cs.AI cs.LG 87%

RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition

RAR:用于视觉识别的检索与排序增强多模态大语言模型

Ziyu Liu, Zeyi Sun, Yuhang Zang, Wei Li, Pan Zhang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) MThreads, Inc.(MThreads公司) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);multi-modal(abstract);image-text(abstract)

AI总结 RAR结合CLIP的检索与MLLM的排序,提升细粒度识别精度,增强少样本和零样本任务表现。

Comments Project: https://github.com/Liuziyu77/RAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15723 2026-05-18 cs.LG cs.CV 85%

GOMA: Toward Structure-Driven Multimodal Alignment from a Graph Signal Smoothing Perspective

GOMA:从图信号平滑视角迈向结构驱动的多模态对齐

Xu Wang, Xunkai Li, Yinlin Zhu, Rong-Hua Li, Guoren Wang

机构 * School of Airspace Science and Engineering, Shandong University(山东大学 airspace 科学与工程学院) Department of Computer Science, Beijing Institute of Technology(北京理工大学计算机学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 GOMA通过统一设计解决多模态对齐中的拓扑障碍、平滑控制与信息保留问题,在七个多模态图基准上取得最佳检索性能并保持稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16090 2026-05-18 cs.CR cs.CV 83%

A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation

针对大视觉-语言模型的跨模态提示注入攻击:仅图像扰动

Hao Yang, Zhuo Ma, Yang Liu, Yilong Yang, Guancheng Wang, JianFeng Ma

机构 * Xidian University(西安电子科技大学)

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出CrossMPI攻击,通过仅图像扰动实现跨模态提示注入,改进模型隐藏状态空间优化并采用层选择策略与距离递减扰动策略,有效提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14309 2026-05-18 cs.CV cs.AI cs.LG 73%

ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition

ICED: 通过可解释的概念分解实现概念级机器去学习

Shen Lin, Jing Lin, Junhao Dong, Piotr Koniusz, Li Xu

机构 * Fujian Normal University(福建师范大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ICED框架,通过多模态大语言模型构建任务特定概念词汇,实现VLMs中概念级去学习,有效去除目标知识并保留非目标语义,实验表明其在目标遗忘和模型效用方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15672 2026-05-18 cs.CV cs.AI 62%

VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

VLMs 跟踪无需跟踪:诊断视觉路径跟随中的失败

Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No

机构 * Yonsei University(延世大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究VLMs在视觉路径跟随任务中的表现,发现其在面对局部相似干扰时易切换路径,揭示局部竞争导致的失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16171 2026-05-18 cs.CV 57%

Res$^2$CLIP: Few-Shot Generalist Anomaly Detection with Residual-to-Residual Alignment

Res²CLIP:基于残差到残差对齐的少样本通用异常检测

Xinyue Liu, Jianyuan Wang, Biao Leng, Shuo Zhang

机构 * Beihang University(北航) University of Science and Technology Beijing(北京科技大学) Beijing Jiaotong University(北京交通大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 Res²CLIP通过残差到残差对齐解决少样本下类别泛化问题,消除细粒度特征差异和类特定偏差,提升跨类别泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16127 2026-05-18 cs.CV 57%

WeatherOcc3D: VLM-Assisted Adverse Weather Aware 3D Semantic Occupancy Prediction

WeatherOcc3D: 借助VLM的恶劣天气感知3D语义占用预测

A. Enes Doruk, Abdelaziz Hussein, Hasan F. Ates

机构 * Department of Artificial Intelligence(人工智能系) Data Engineering Ozyegin University Istanbul, Türkiye(数据工程奥祖根大学伊斯坦布尔,土耳其)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种借助预训练CLIP隐空间的框架,通过语言环境线索指导多传感器融合,解决恶劣天气下传感器可靠性问题,提升3D语义占用预测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13108 2026-05-18 cs.CV 57%

DGS-Net: Distillation-Guided Gradient Surgery for CLIP Fine-Tuning in AI-Generated Image Detection

DGS-Net:基于知识蒸馏的梯度手术用于AI生成图像检测中的CLIP微调

Jiazhen Yan, Ziqiang Li, Fan Wang, Boyu Wang, Ziwen He, Zhangjie Fu

机构 * School of Computer Science, Nanjing University of Information Science(南京信息工程大学计算机学院) University of Macau(澳门大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DGS-Net,通过梯度空间分解分离有害和有益的下降方向,提升CLIP在AI生成图像检测中的微调效果,实验表明其在检测性能和泛化能力上优于现有方法。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15711 2026-05-18 cs.CV 57%

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

EntropyScan: 向通过视觉注意力熵实现LVLMs的模型级后门检测

Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * China University of Geosciences(中国地质大学) University of the Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EntropyScan,一种轻量且不依赖触发器的模型级后门检测方法,通过量化视觉注意力分布的结构扭曲来检测后门模型,实验显示其在两个LVLM架构和三种高级攻击场景中达到98.5%的F1分数和96.6%的AUC。

Comments 20 pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15584 2026-05-18 cs.CV 57%

AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models

AGC:面向视觉-语言模型对抗鲁棒性的自适应测地修正

Zhiwei Li, Jiacheng Xue, Weining Wang, Ajian Liu, Xingyu Gao, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所国家工程研究中心与人工智能院,中国科学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AGC,一种无需训练的防御机制,通过自适应步长修正输入特征,提升视觉-语言模型的对抗鲁棒性,实测在八个细粒度数据集上提升44.4%的鲁棒准确率,同时降低10倍推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21850 2026-05-18 cs.CV 57%

Visual Compositional Tuning

视觉组合调谐

Xindi Wu, Hee Seung Hwang, Polina Kirichenko, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Meta AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出COMPACT方法,通过组合多个基本视觉能力提升视觉指令调谐数据效率,减少训练样本数量并提升多模态任务性能。

Comments See the project website at this [URL](https://princetonvisualai.github.io/compact/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02812 2026-05-18 cs.RO 50%

Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision

通过合成神经符号监督学习结构化机器人策略

Alessandro Adami, Tommaso Tubaldo, Marco Todescato, Ruggero Carli, Pietro Falco

机构 * University of Padova, Dept. of Information Engineering(帕多瓦大学信息工程系) Fraunhofer Italia Research(弗劳恩霍夫意大利研究所) Polytechnic of Bari Dept. of Electrical and Information Engineering(巴里理工学院电气与信息工程系)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出通过合成神经符号监督方法,利用视觉语言模型生成结构化机器人策略,结合多模态感知与符号控制,实现高维学习与符号控制的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2605.14736 2026-05-18 cs.SD cs.LG 82%

IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments

IsoNet:在复杂声学环境中具有空间意识的音频视觉目标语音提取

Dinanath Padhya, Sajen Maharjan, Binita Adhikari, Ishwor Raj Pokharel

机构 * Department of Electronics and Computer Engineering, Thapathali Campus, Institute of Engineering, Tribhuvan University(电子与计算机工程系,Thapathali校区,工程学院,塔波胡万大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 IsoNet通过结合多通道STFT特征、GCC-PHAT空间线索和面部条件视觉嵌入,实现了在紧凑麦克风阵列上的目标语音提取,其在复杂声学环境中的性能优于传统方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23552 2026-05-18 cs.CV cs.SD eess.AS 79%

JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching

JAM-Flow:联合音频-运动合成与流匹配

Mingi Kwon, Joonghyuk Shin, Jaeseok Jung, Jaesik Park, Youngjung Uh

机构 * Yonsei University(延世大学) CineLingo Seoul National University(首尔国立大学)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 本文提出JAM-Flow框架,通过流匹配和多模态扩散变压器架构,实现面部运动与语音的联合合成与条件生成,支持文本到说话人生成、音频驱动动画等多种任务。

Comments project page: https://joonghyuk.com/jamflow-web Under review. Preprint published on arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15307 2026-05-18 cs.GR cs.CV cs.MM cs.SD 73%

Sound Sparks Motion: Audio and Text Tuning for Video Editing

声音激发动作:用于视频编辑的音频和文本微调

AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri, Daniel Cohen-Or, Yiorgos Chrysanthou

机构 * University of Cyprus(塞浦路斯大学) Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) CYENS Center Of Excellence(CYENS卓越中心)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Sound Sparks Motion框架,通过测试时调整音频视觉生成模型的多模态条件信号,实现视频动作编辑,无需训练,通过音频潜在和文本条件残差扰动促进动作修改,同时利用视觉语言模型反馈提升编辑效果。

Comments Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2605.16120 2026-05-18 cs.IR 78%

MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos

MERVIN:一种用于越南新闻视频多模态事件检索的统一框架

Anh-Tai Pham-Nguyen, Tung-Duong Le-Duc, Anh-Duy Le, Trung-Hieu Truong-Le

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MERVIN框架,整合关键帧、转录文本和视频摘要,通过Gemini 1.5 Flash提升转录质量,利用Perception Encoder提取视觉特征,并结合越南语言模型生成文本嵌入,实现高效的多模态事件检索。

Comments Accepted to SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15693 2026-05-18 cs.CV 70%

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

Skyra:通过 grounded artifact reasoning 实现 AI 生成视频检测

Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出 Skyra,一种专门用于识别 AI 生成视频中人类可感知的视觉瑕疵的多模态大语言模型,通过这些瑕疵作为基础证据进行检测和解释,同时构建了首个大规模 AI 生成视频瑕疵数据集并提出两阶段训练策略。

Comments Camera Ready Version. Project Page: https://github.com/JoeLeelyf/Skyra

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15298 2026-05-18 cs.RO cs.AI cs.CL cs.CV 67%

PhysBrain 1.0 Technical Report

PhysBrain 1.0 技术报告

Shijie Lian, Bin Yu, Xiaopeng Lin, Changti Wu, Hang Yuan, Xiaolin Hu, Zhaolong Shen, Yuzhuo Miao, Haishan Liu, Yuxuan Tian, Yukun Shi, Cong Huang, Kai Chen

机构 * PhysBrain Team(PhysBrain团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 PhysBrain 1.0 通过将大规模人类自体视频转化为结构化的物理常识监督,提升机器人适应能力,在多模态问答和具身控制基准测试中取得SOTA结果,尤其在SimplerEnv中表现突出。

Comments Project Page: https://phys-brain.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23410 2026-05-18 cs.LG cs.AI eess.SP q-bio.NC 57%

Brain-OF: An Omnifunctional Foundation Model for fMRI, EEG and MEG

Brain-OF:一种适用于fMRI、EEG和MEG的多功能基础模型

Hanning Guo, Hanwen Bi, Farah Abdellatif, Andrei Galbenus, Jon. N. Shah, Abigail Morrison, Jürgen Dammers

机构 * INM-4, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-4 实验室,德国) Department of Computer Science(计算机科学系) Software Engineering, RWTH Aachen University, Germany(软件工程,亚琛工业大学,德国) INM-7, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-7 实验室,德国) Institute of Systems Neuroscience, Heinrich Heine University, Germany(系统神经科学研究所,海因里希·海涅大学,德国) Department of Neurology, RWTH Aachen University, Germany(神经病学系,亚琛工业大学,德国) JARA-BRAIN-Translational Medicine, Germany(JARA-BRAIN 转化医学,德国) INM–11, JARA, Forschungszentrum Jülich, Germany(JARA-INM-11 实验室,Jülich 研究中心,德国) IAS-6, Forschungszentrum Jülich, Germany(IAS-6 实验室,Jülich 研究中心,德国) Department of Psychiatry, Psychotherapy and Psychosomatics, RWTH Aachen University, Germany(精神病学、心理治疗和精神病理学系,亚琛工业大学,德国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 Brain-OF通过联合预训练fMRI、EEG和MEG数据,解决多模态数据语义异质性和分辨率差异问题,提升跨模态数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15342 2026-05-18 cs.CV cs.LG 57%

Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding

Minerva-Ego:眼动视频理解的空间时间提示

Arsha Nagrani, Jasper Uijilings, Shyamal Buch, Tobias Weyand, Sudheendra Vijayanarasimhan, Bo Hu, Ramin Mehran, David A Ross, Cordelia Schmid

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Minerva-Ego基准,通过多步骤多模态问题和密集标注的时空推理轨迹评估眼动视频理解模型,发现提示'何时何地'显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15952 2026-05-18 cs.HC cs.RO 50%

Driving Through the Network: Performance and Workload Under Latency and Video Impairment

通过网络驾驶:延迟和视频失真下的性能与负载

Ines Trautmannsheimer, Ahmed Azab, Frank Diermeyer

机构 * Technical University of Munich, School of Engineering and Design, Institute of Automotive Technology and Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑工业大学,工程学院,汽车技术研究所,慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究通过驾驶模拟器探讨网络延迟和视频质量对驾驶员性能和负载的影响,发现延迟和带宽增加会提升操作负荷,但生理指标显示亚加性交互作用,而性能和眼动指标交互作用较小。

Comments Preprint of VEHITS 2026 : 12th International Conference on Vehicle Technology and Intelligent Transport Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15356 2026-05-18 math.NA cs.NA stat.ML 50%

Proposal-Guided Greedy Surrogate Refinement for PDE-Driven High-Dimensional Rare-Event Estimation

基于提案的贪心替代模型细化用于PDE驱动的高维稀有事件估计

Zhiwei Gao, George Karniadakis

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种替代模型辅助的自适应重要采样框架,通过局部细化替代模型提升高维稀有事件模拟的准确性,减少高保真评估次数。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2605.15203 2026-05-18 cs.IR cs.AI cs.MA 83%

Agent4POI: Agentic Context-Conditioned Affordance Reasoning for Multimodal Point-of-Interest Recommendation

Agent4POI: 基于代理的上下文条件化 affordance 推理用于多模态兴趣点推荐

Jinze Wang, Yangchen Zeng, Tiehua Zhang, Lu Zhang, Yuze Liu, Yongchao Liu, Xingjun Ma, Zhu Sun

机构 * Tongji University(同济大学) Swinburne University of Technology(斯威本理工大学) Southeast University(东南大学) Chengdu University of Information Technology(成都信息工程大学) Fudan University(复旦大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 Agent4POI 提出一种新的兴趣点推荐框架,通过在推荐时生成上下文条件化的多模态表示,而非依赖静态兴趣点嵌入。该方法通过代理生成动态 affordance 查询并执行跨模态推理,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09544 2026-05-18 cs.LG cs.CE cs.CV 57%

Integrating chemical structures as treatments improves representations of microscopy images for morphological profiling

将化学结构作为治疗手段提高显微镜图像的表示以进行形态学分析

Yemin Yu, Emre Hayir, Neil Tenenholtz, Lester Mackey, Ying Wei, David Alvarez-Melis, Ava P. Amini, Alex X. Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Microsoft Research(微软研究院) Department of Computer Science, Zhejiang University(浙江大学计算机科学系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MICON框架,通过整合化学结构信息提升显微镜图像的表示能力,改进了形态学分析中的特征学习。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 13 篇

2605.16165 2026-05-18 cs.CV cs.AI 84%

Second-Order Multi-Level Variance Correction for Modality Competition in Multimodal Models

二阶多级方差校正用于多模态模型中的模态竞争

Yishun Lu, Wes Armour

机构 * University of Oxford, Oxford, United Kingdom(牛津大学,英国)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ML-FOP-SOAP框架,通过多级方差校正提升多模态对齐稳定性,实验显示在Janus和Emu3数据集上,该方法提高了样本效率和训练速度,适用于大规模多模态基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22151 2026-05-18 cs.CV cs.CL 81%

MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models

MultiMat: 多模态程序合成用于基于过程的材料生成

Jonas Belouadi, Tamy Boubekeur, Adrien Kaiser

机构 * University of Mannheim(曼海姆大学) Adobe Research(Adobe研究)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MultiMat利用大规模多模态模型实现多模态程序合成,提升生成过程材料图的效率与视觉质量,优于纯文本基线方法。

Comments Accepted at ICLR 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15792 2026-05-18 cs.CV 79%

Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models

反向流动:大型多模态模型中的生成到理解协同效应

Yujun Tong, Dongliang Chang, Zijin Yin, Xintong Liu, Yuanchen Fang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出生成到理解协同效应,通过生成过程作为中间推理步骤提升多模态理解,揭示生成与理解的双向关系及模型自我反思的不足。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12309 2026-05-18 cs.CV 79%

G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models

G$^2$TR: 基于生成的视觉标记减少方法用于分离编码统一多模态模型

Junxian Li, Kai Liu, Zizhong Ding, Zhixin Wang, Zhikai Chen, Renjing Pei, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出G$^2$TR方法,通过生成分支信号减少多模态模型的视觉标记,提升效率并保持性能,实验显示在图像理解和编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏