arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-13 至 2026-07-13 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2506.10915 2026-07-13 cs.CV cs.AI cs.LG 版本更新 81%

M4V: Multimodal Mamba for Efficient Text-to-Video Generation

M4V:用于高效文本到视频生成的多模态曼巴

Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma

机构 * Meituan(美团) University of Technology Sydney(技术大学悉尼分校) Beijing Jiaotong University(北京交通大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09146 2026-07-13 cs.SE 新提交 78%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20730 2026-07-13 cs.CV 版本更新 70%

Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

循环渲染:通过视觉自反馈生成矢量图形

Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北航软件学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Paradigm(4Paradigm)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08879 2026-07-13 cs.CV 新提交 57%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09587 2026-07-13 cs.RO 新提交 50%

CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination

CoDiMAD:基于扩散的特权蒸馏用于无通信多机器人协调

Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang

机构 * Peking University(北京大学) National Innovation Institute of Defense Technology(国防科技创新研究院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 研究无通信多机器人协调问题,提出CoDiMAD三阶段框架,先训练特权预言机,再构建数据集,最后将预言机蒸馏到学生智能体中,通过扩散反向过程采样动作,实验证明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09039 2026-07-13 cs.LG q-bio.QM 新提交 50%

Variable-Length Generative Protein Design via Generalized Poisson Flow

通过广义泊松流进行可变长度生成蛋白质设计

Chaoran Cheng, Zhanghan Ni, Yanru Qu, Yuxin Chen, Ruihan Guo, Jiajun Fan, Ge Liu

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究针对蛋白质设计中可变长度生成的关键问题,引入广义泊松流(GPFlow)框架,通过最小化负对数似然学习速率函数,经多模态评估验证其可变长度生成质量,在多种设计任务中表现出色,提升了蛋白质设计的灵活性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏