arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-31 至 2026-03-31 共收录 27 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 27 篇

2511.13719 2026-03-31 cs.CV cs.AI cs.LG cs.MM cs.RO 89%

Scaling Spatial Intelligence with Multimodal Foundation Models

通过多模态基础模型提升空间智能

Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun, Tongxi Zhou, Jiaqi Li, Hui En Pang, Oscar Qian, Yukun Wei, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。

Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19413 2026-03-31 cs.LG cs.AI cs.CV 86%

UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

UniGame: 将统一多模态模型转变为自身对手

Zhaolong Su, Wang Lu, Hao Chen, Sharon Li, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 UniGame通过自对抗框架提升多模态模型的一致性与鲁棒性,显著增强理解、生成和对抗鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28333 2026-03-31 cs.CV cs.AI 84%

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25706 2026-03-31 cs.CV 83%

Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training

Wan-Weaver:通过解耦训练实现交错多模态生成

Jinbo Xing, Zeyinzi Jiang, Yuxiang Tuo, Chaojie Mao, Xiaotang Gai, Xi Chen, Jingfeng Zhang, Yulin Pan, Zhen Han, Jie Xiao, Keyu Yan, Chenwei Xie, Chongyang Zhong, Kai Zhu, Tong Shen, Lianghua Huang, Yu Liu, Yujiu Yang

机构 * Tongyi Lab(通义实验室) Tsinghua University(清华大学)

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Wan-Weaver,通过解耦训练实现交错多模态生成,利用文本规划和视觉一致性建模,生成长文本连贯性和视觉一致性。

Comments CVPR 2026 Camera-ready, Webpage: https://doubiiu.github.io/projects/WanWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21643 2026-03-31 cs.CV 83%

Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation

Omni-Weather: 一种统一的多模态模型用于天气雷达理解和生成

Zhiwang Zhou, Yuandong Pu, Xuming He, Yidi Liu, Yixin Chen, Junchao Gong, Xiang Zhuang, Wanghan Xu, Qinglong Cao, Shixiang Tang, Yihao Liu, Wenlong Zhang, Lei Bai

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) UCLA(加州大学洛杉矶分校)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 Omni-Weather通过统一架构整合天气生成与理解,采用共享自注意力机制和因果推理数据集提升生成质量与可解释性,实验显示其在天气生成和理解上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27135 2026-03-31 cs.LG stat.ML 82%

Spectral-Aware Text-to-Time Series Generation with Billion-Scale Multimodal Meteorological Data

具有十亿级多模态气象数据的频谱感知文本到时间序列生成

Shijie Zhang

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出MTransformer模型,通过频谱提示生成器实现文本到时间序列的精确语义控制,利用大规模气象数据提升生成质量与跨模态对齐精度。

Comments Accepted By IJCNN 2026 (WCCI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11483 2026-03-31 cs.CV cs.AI 81%

ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation

ImAgent:一种统一的多模态代理框架,用于测试时间可扩展的图像生成

Kaishen Wang, Ruibo Chen, Tong Zheng, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ImAgent通过统一的多模态代理框架,在测试时间实现高效的图像生成扩展,通过内部推理、生成和自评估模块提升图像质量和语义一致性。

Comments 8 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 79%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28088 2026-03-31 cs.CV 79%

GEMS: Agent-Native Multimodal Generation with Memory and Skills

GEMS:基于记忆与技能的代理原生多模态生成

Zefeng He, Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Yu Cheng, Yang Yang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) CUHK(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 GEMS通过引入代理循环、记忆和技能组件,提升多模态生成在复杂指令和专业任务中的性能,使轻量级模型在GenEval2中超越现有最佳模型。

Comments Project Page: https://gems-gen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23165 2026-03-31 cs.CV 79%

DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

DyaDiT:一种多模态扩散变换器,用于生成社会有利的双人手势

Yichen Peng, Jyun-Ting Song, Siyeol Jung, Ruofan Liu, Haiyang Liu, Xuangeng Chu, Ruicong Liu, Erwin Wu, Hideki Koike, Kris Kitani

机构 * Institute of Science Tokyo(东京科学大学) UNIST(蔚山科学技术院) Shanda AI Research Tokyo(盛大人工智能研究院东京) The University of Tokyo(东京大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 DyaDiT通过多模态扩散变换器生成适合社会互动的双人手势,利用双人音频信号和社交上下文令牌,融合双方信息并编码运动先验,实现更自然的交互。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08673 2026-03-31 cs.CV 79%

Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation

通过摄像头思考:一个统一的多模态模型用于以摄像头为中心的理解与生成

Kang Liao, Size Wu, Zhonghua Wu, Linyi Jin, Chao Wang, Yikai Wang, Fei Wang, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) SenseTime Research(商汤科技研究院) University of Michigan(密歇根大学) Max-Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Puffin模型,通过将摄像头视为语言,实现以摄像头为中心的多模态理解与生成,结合语言回归和扩散生成,提升空间感知能力,实验表明其在跨视角任务中表现优异。

Comments Accepted by ICLR2026. Project Page: https://kangliao929.github.io/projects/puffin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12554 2026-03-31 cs.CV 79%

Multimodal Graph Network Modeling for Human-Object Interaction Detection with PDE Graph Diffusion

基于PDE图扩散的多模态图网络建模用于人-物交互检测

Wenxuan Ji, Haichao Shi, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于PDE图扩散的多模态图网络模型,通过四阶段图结构建模人-物交互任务,利用白盒PDE扩散方程实现信息传播,并引入变分信息挤压机制优化CLIP提取的多模态特征,实验表明在HICO-DET和V-COCO基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27332 2026-03-31 cs.CV 79%

Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models

因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性

Kaishen Wang, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05422 2026-03-31 cs.CV 79%

ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

ParaUni: 通过强化驱动的分层并行信息交互增强统一多模态模型的生成

Jiangtong Tan, Lin Liu, Jie Huanng, Xiaopeng Zhang, Qi Tian, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部类脑智能感知与认知重点实验室) Huawei Inc.(华为技术有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 ParaUni通过并行提取多层视觉语言模型特征并结合强化学习动态调整机制,提升统一多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07297 2026-03-31 cs.LG q-bio.QM 78%

MM-DADM: Multimodal Drug-Aware Diffusion Model for Virtual Clinical Trials

MM-DADM:多模态药物感知扩散模型用于虚拟临床试验

Qian Shao, Bang Du, Zepeng Li, Qiyuan Chen, Jiahe Chen, Hongxia Xu, Jimeng Sun, Jian Wu, Jintai Chen

机构 * Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出MM-DADM,一种多模态药物感知扩散模型,用于生成个性化药物诱导ECG。通过动态交叉注意模块融合外部物理知识,解决形态真实性和病理灵活性的平衡问题,并利用因果特征编码器提取纯药理表示,提升模拟准确性和召回率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14139 2026-03-31 cs.RO 78%

FlexiCup: Wireless Multimodal Suction Cup with Dual-Zone Vision-Tactile Sensing

FlexiCup: 无线多模态吸盘 with 双区视觉-触觉感知

Junhao Gong, Shoujie Li, Kit-Wa Sou, Changqing Guo, Hourong Huang, Tong Wu, Yifan Xie, Chenxin Liang, Chuqiao Lyu, Xiaojun Liang, Wenbo Ding

机构 * Shenzhen Ubiquitous Data Enabling Key Lab, Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,深圳泛在数据赋能重点实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 FlexiCup通过无线电子集成双区视觉-触觉传感,实现接触感知操控,验证了传感与驱动解耦的有效性,同时在不同气动原理下均表现出色。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27666 2026-03-31 cs.CV 74%

Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

门控条件注入无需多模态注意:迈向可控的线性注意变换器

Yuhe Liu, Zhenxiong Tan, Yujia Hu, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 本文提出基于线性注意架构的可控扩散模型,解决现有方法在多类型条件输入灵活性和收敛速度上的不足,通过统一门控条件模块实现高效可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08021 2026-03-31 cs.RO cs.CV 74%

AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

AffordGrasp:跨模态扩散用于感知意识抓取合成

Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :cross-modal(title);分类 cs.CV

AI总结 本文提出AffordGrasp,通过跨模态扩散模型生成准确反映物体几何和用户指令的抓取姿态,提升AR/VR和具身AI中的手-物交互质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11967 2026-03-31 cs.CV cs.AI cs.RO 62%

Securing the Skies: A Comprehensive Survey on Anti-UAV Methods, Benchmarking, and Future Directions

守护天空:反无人机方法的全面调查、基准测试与未来方向

Yifei Dong, Fengyi Wu, Sanjian Zhang, Guangyu Chen, Yuzhi Hu, Masumi Yano, Jingdong Sun, Siyu Huang, Feng Liu, Qi Dai, Zhi-Qi Cheng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。

Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28508 2026-03-31 cs.CV 57%

Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree

基于大模型和模糊决策树的AI生成图像通用检测

Fei Wu, Guanghao Ding, Zijian Niu, Zhenrui Wang, Lei Yang, Zhuosheng Zhang, Shilin Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出结合轻量级特征感知检测器与大模型的模糊决策树框架,提升AI生成图像检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28082 2026-03-31 cs.CV cs.MA 57%

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

LogiStory: 一个多图像故事可视化逻辑感知框架

Chutian Meng, Fan Ma, Chi Zhang, Jiaxu Miao, Yi Yang, Yueting Zhuang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LogiStory框架,通过显式建模视觉逻辑提升多图像故事可视化中的叙事逻辑与视觉质量,引入多智能体系统和LogicTale基准测试集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09094 2026-03-31 cs.CV 57%

Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

基于事件中心因果推理的物理合理视频生成

Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于事件链的因果推理和跨模态提示模块,用于生成物理合理视频,通过物理公式约束和时间对齐提示提升视频生成的因果连贯性与物理合理性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26794 2026-03-31 cs.CV 57%

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

可泛化动作生成的探索:数据、模型与评估

Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Research(英伟达研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。

Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21545 2026-03-31 cs.CV cs.LG 57%

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。

Comments ICLR 2026 ReALM-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27058 2026-03-31 cs.LG cs.RO 50%

Liquid Networks with Mixture Density Heads for Efficient Imitation Learning

具有混合密度头的液体网络用于高效模仿学习

Nikolaus Correll

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文比较了具有混合密度头的液体网络与扩散策略在多个任务中的性能,发现液体网络参数更少、预测误差更低且推理更快,且在样本效率实验中表现更稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26981 2026-03-31 stat.ME math.ST stat.AP stat.TH 50%

Boosting multi-view association testing via devariation

通过去变异提升多视图关联检验

Ruyi Pan, Yinqiu He, Jun Young Park

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出去变异方法,通过惩罚低秩因子模型捕捉视图内依赖,提升统计功效,验证了其在多模态神经影像数据中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26696 2026-03-31 cs.RO 50%

Topological Motion Planning Diffusion: Generative Tangle-Free Path Planning for Tethered Robots in Obstacle-Rich Environments

拓扑运动规划扩散:用于缆绳机器人在障碍密集环境中的生成无纠缠路径规划

Yifu Tian, Xinhang Xu, Thien-Minh Nguyen, Muqing Cao

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出TMPD框架,结合终身拓扑记忆,通过扩散模型生成可行轨迹候选,并利用拓扑后端过滤优化,实现无碰撞和无纠缠的高效路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏