arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-09 至 2026-04-09 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2604.05584 2026-04-09 cs.CV 84%

Purify-then-Align: Towards Robust Human Sensing under Modality Missing with Knowledge Distillation from Noisy Multimodal Teacher

在模态缺失情况下通过知识蒸馏从噪声多模态教师中实现鲁棒的人体感知:Purify-then-Align

Pengcheng Weng, Yanyu Qian, Yangxin Xu, Fei Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Institute of Computer Science, Universität Bern(伯尔尼大学计算机科学研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV;any-to-any(comments)

AI总结 本文提出PTA框架,通过元学习和知识扩散解决多模态人体感知中模态缺失问题,通过净化知识源和对齐模态提升单模态模型鲁棒性。

Comments Accepted by CVPR 2026 Workshop On Any-to-Any Multimodal Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01986 2026-04-09 cs.CV cs.AI 84%

Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing

Draw-In-Mind: 在统一多模态模型中重新平衡设计师-画家角色有助于图像编辑

Ziyun Zeng, David Junhao Zhang, Wei Li, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) TikTok

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Draw-In-Mind模型,通过重新分配设计职责提升图像编辑性能,展示了在统一多模态模型中平衡理解与生成模块的重要性。

Comments ICLR 2026 Camera Ready Version; Add more discussions and fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06725 2026-04-09 cs.CV 83%

Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning

通过主动3D场景探索增强MLLM空间理解以实现多视角推理

Jiahua Chen, Qihong Tang, Weinong Wang, Qi Fan

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Tencent(腾讯)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的框架,通过显式3D重建机制提升MLLM的空间理解能力,通过主动探索生成新视角,优于专门空间模型和通用MLLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06489 2026-04-09 cs.HC cs.MM 83%

Language-Guided Multimodal Texture Authoring via Generative Models

基于生成模型的语言引导多模态纹理创作

Wanli Qian, Aiden Chang, Shihan Lu, Michael Gu, Heather Culbertson

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出一种语言驱动的多模态纹理创作系统,通过生成模型将自然语言提示转化为触觉和视觉纹理,实现触觉与视觉信号的语义一致性,提升创作效率与可解释性。

Comments 14 pages, 13 figures, accepted to IEEE Haptics Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06870 2026-04-09 cs.CV 79%

RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details

RefineAnything: 多模态区域特定细化以实现完美局部细节

Dewei Zhou, You Li, Zongxin Yang, Yi Yang

机构 * RELER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室、人工智能研究所) DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出区域特定图像细化方法,通过多模态扩散模型实现局部细节恢复,同时保持非编辑区域不变,引入边界一致性损失和Focus-and-Refine策略提升效果。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 79%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22177 2026-04-09 cs.HC cs.AI 74%

Analyzing Multimodal Interaction Strategies for LLM-Assisted Manipulation of 3D Scenes

分析用于LLM辅助3D场景操作的多模态交互策略

Junlong Chen, Jens Grubert, Per Ola Kristensson

机构 * University of Cambridge(剑桥大学) Coburg University of Applied Sciences(科堡应用科学大学)

专题命中 多模态生成 :multimodal(title);分类 cs.AI

AI总结 本文通过实证研究揭示LLM辅助3D场景编辑系统中的交互模式与关键障碍,提出改进自然语言界面的设计建议,证明LLM辅助交互系统在沉浸环境中的有效性。

Comments Published in the IEEE VR (IEEE Conference on Virtual Reality and 3D User Interfaces) 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06339 2026-04-09 cs.CV 57%

Evolution of Video Generative Foundations

视频生成基础的演变

Teng Hu, Jiangning Zhang, Hongrui Huang, Ran Yi, Zihan Su, Jieyu Weng, Zhucun Xue, Lizhuang Ma, Ming-Hsuan Yang, Dacheng Tao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了视频生成技术的发展,从早期GAN到扩散模型,再到AR和多模态技术,探讨了核心原理、关键进展及未来趋势,旨在为视频生成及其应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04746 2026-04-09 cs.CV 57%

Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning

以笔触而非像素思考:通过交错推理实现过程驱动的图像生成

Lei Zhang, Junjiao Tian, Zhipeng Fan, Kunpeng Li, Jialiang Wang, Weifeng Chen, Markos Georgopoulos, Felix Juefei-Xu, Yuxiang Bao, Julian McAuley, Manling Li, Zecheng He

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of California, San Diego(加州大学圣迭戈分校) Worcester Polytechnic Institute(伍斯特理工学院) Northwestern University(西北大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出过程驱动的图像生成方法,通过交错推理轨迹分解合成过程,通过文本规划、视觉草图、文本反思和视觉细化四个阶段,使生成过程显式、可解释且可监督。

详情

展开后加载摘要…

URL PDF HTML 收藏