arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 14 篇

2504.14145 2026-03-24 cs.DC cs.AI 79%

DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline

DIP: 一种高效的大规模多模态模型训练方法,采用动态交错流水线

Zhenliang Xue, Hanpeng Hu, Xing Chen, Yimin Jiang, Yixin Song, Zeyu Mi, Yibo Zhu, Daxin Jiang, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DIP框架,通过分离不同模态计算和动态分割输入数据,提升大规模多模态模型训练效率,实验显示吞吐量提升达97.3%。

Comments To be published in ASPLOS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20781 2026-03-24 cs.CL 79%

Code-MIE: A Code-style Model for Multimodal Information Extraction with Scene Graph and Entity Attribute Knowledge Enhancement

Code-MIE: 一种基于代码风格的多模态信息提取模型,结合场景图和实体属性知识增强

Jiang Liu, Ge Qiu, Hao Fei, Dongdong Xie, Jinbo Li, Fei Li, Chong Teng, Donghong Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部与可信计算重点实验室,教育部,武汉大学计算机科学与工程学院) University of Oxford(牛津大学) Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) China United Network Communications Co., Ltd. Research Institute(中国联合网络通信有限公司研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Code-MIE框架,通过统一代码理解和生成解决多模态信息提取问题,引入实体属性、场景图和文本参数,提升结构化信息提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12015 2026-03-24 cs.GR 78%

M^3ashy: Multi-Modal Material Synthesis via Hyperdiffusion

M^3ashy:基于超扩散的多模态材料合成

Chenliang Zhou, Zheyuan Hu, Alejandro Sztrajman, Yancheng Cai, Yaru Liu, Cengiz Oztireli

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出M^3ashy框架,通过超扩散和神经场实现复杂真实材料的高质量重建,支持多种条件下的材料合成,并贡献了新的材料数据集和BRDF评估指标。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 40, No. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22187 2026-03-24 cs.CV cs.AI 62%

Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement

视觉反馈提升布局:用于迭代文本布局优化的视觉反馈

Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04317 2026-03-24 cs.CV cs.CL 62%

WiFi-GEN: High-Resolution Indoor Imaging from WiFi Signals Using Generative AI

WiFi-GEN:利用生成式人工智能进行高分辨率室内成像

Jianyang Shi, Bowen Zhang, Amartansh Dubey, Ross Murch, Liwen Jing

机构 * Pengcheng Laboratory(鹏城实验室) College of Big Data and Internet(大数据与互联网学院) Shenzhen Technology University(深圳技术大学) Department of Electrical Engineering(电子工程系) Indian Institute of Technology Delhi(印度理工学院德里分校) Department of Electronic and Computer Engineering(电子与计算机工程系) HKUST(香港科技大学) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出WiFi-GEN,通过生成式人工智能将测量到的WiFi功率转换为高分辨率室内图像,其形状重建精度比物理模型方法高275%,且Frechet Inception Distance得分降低82%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22027 2026-03-24 cs.CV 57%

Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models

在推理过程中调整现实世界图像恢复:一种适用于流匹配模型的测试时间缩放范式

Purui Bai, Junxian Duan, Pin Wang, Jinhua Hao, Ming Sun, Chao Zhou, Huaibo Huang

机构 * MAIS \& NLPR, Institute of Automation, Chinese Academy of Sciences, China Kuaishou Tech, China

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ResFlow-Tuner框架,基于FLUX.1-dev模型,结合多模态融合与测试时间缩放,实现高质量图像恢复。通过奖励模型动态调整去噪方向,提升性能并控制计算开销,实验表明其在多个基准上达到最优。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV 57%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21295 2026-03-24 cs.CV 57%

Text-Image Conditioned 3D Generation

文本-图像条件的3D生成

Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室、人工智能学院、计算机科学学院、上海交通大学) Huawei Inc.(华为公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出结合文本和图像条件的3D生成方法,通过跨模态互补性提升生成质量,引入TIGON模型实现高效融合。

Comments CVPR 2026. Project page: https://jumpat.github.io/tigon-page Code: https://github.com/Jumpat/tigon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21176 2026-03-24 cs.CV 57%

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

GIDE: 解锁扩散大语言模型用于精确无训练图像编辑

Zifeng Zhu, Jiaming Han, Jiaxiang Zhao, Minnan Luo, Xiangyu Yue

机构 * Xi'an Jiaotong University MMLab, The Chinese University of Hong Kong(西安交通大学MMLab,香港中文大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GIDE框架,通过离散噪声逆向机制实现无训练图像编辑,支持多种指令并保持背景不变,实验表明其在语义正确性和感知质量上显著优于现有方法。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13733 2026-03-24 cs.RO cs.AI cs.LG 57%

Implicit Maximum Likelihood Estimation for Real-time Generative Model Predictive Control

隐式最大似然估计用于实时生成模型预测控制

Grayson Lee, Minh Bui, Shuzi Zhou, Yankai Li, Mo Chen, Ke Li

机构 * School of Computing Science, Simon Fraser University(计算科学系,西蒙弗雷泽大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出隐式最大似然估计(IMLE)作为生成模型的替代方法,实现快速推理和强模式覆盖,适用于实时MPC任务。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22160 2026-03-24 stat.AP cs.LG 50%

Data Curation for Machine Learning Interatomic Potentials by Determinantal Point Processes

通过确定性点过程数据筛选机器学习互原子势

Joanna Zou, Youssef Marzouk

机构 * Computational Science & Engineering Massachusetts Institute of Technology(计算科学与工程 马萨诸塞理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出利用确定性点过程筛选原子构型子集,以生成高质量训练集,提升分子系统机器学习表示的准确性与鲁棒性。

Comments Original publication at https://openreview.net/forum?id=PKGP7tg65A

Journal ref ICLR AI4MAT Workshop (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21481 2026-03-24 cs.IR 50%

TagLLM: A Fine-Grained Tag Generation Approach for Note Recommendation

TagLLM: 一种用于笔记推荐的细粒度标签生成方法

Zhijian Chen, Likai Wang, Lei Chen, Yaguang Dou, Jialiang Shi, Tian Qi, Dongdong Hao, Mengying Lu, Cheng Ye, Chao Wei

专题命中 多模态生成 :multimodal(abstract)

AI总结 TagLLM通过用户兴趣手册和多模态CoT提取构建细粒度标签数据,采用标签知识蒸馏提升小模型生成能力,有效提升笔记推荐的点击率和用户停留时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01192 2026-03-24 cs.RO 50%

Unified Generation-Refinement Planning: Bridging Guided Flow Matching and Sampling-Based MPC for Social Navigation

统一的生成-细化规划:连接引导流匹配与基于模型的预测控制以实现社交导航

Kazuki Mizuta, Karen Leung

机构 * University of Washington(华盛顿大学) NVIDIA(英伟达)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种结合奖励引导条件流匹配与模型预测路径积分的统一生成-细化框架,以提升社交导航中安全、任务性能和计算时间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21861 2026-03-24 cs.LG 50%

SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning

SpecMol:一种基于光谱的多任务分子学习基础模型

Shuaike Shen, Jiaqing Xie, Zhuo Yang, Antong Zhang, Shuzhou Sun, Ben Gao, Tianfan Fu, Biqing Qi, Yuqiang Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Brown University(布朗大学) Nanjing University(南京大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 SpecMol提出一种统一框架,整合光谱解释、分子表示学习和三维结构生成,通过SpecMol-Bench评估协议实现光谱驱动的结构解析和分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏