arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4951 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4951 篇

2404.17912 2024-07-19 cs.CL cs.AI cs.LG 79%

SERPENT-VLM : Self-Refining Radiology Report Generation Using Vision Language Models

Manav Nitin Kapadnis, Sohan Patnaik, Abhilash Nandy, Sourjyadip Ray, Pawan Goyal, Debdoot Sheet

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 3 figures, 4 tables, Accepted as oral at Clinical NLP workshop at NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09273 2022-10-24 cs.CV cs.AI 79%

Sound-Guided Semantic Video Generation

Seung Hyun Lee, Gyeongrok Oh, Wonmin Byeon, Chanyoung Kim, Won Jeong Ryoo, Sang Ho Yoon, Hyunjun Cho, Jihyun Bae, Jinkyu Kim, Sangpil Kim

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12592 2026-08-18 cs.LG 版本更新 78%

Represent, Then Generate: Multimodal-Conditioned Time-Series Generation under Irregular Missingness

先表征,再生成:不规则缺失下的多模态条件时间序列生成

Haochen Zhang, Jiaheng Guo, Yu-Chao Huang, Nicholas Konz, Tianlong Chen

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出ReCoGen两阶段框架,将多模态条件表征与生成分离,在三个生理基准的16项任务中超越6种生成器,可合成缺失生理信号以实现低侵入性临床监测。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新 78%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09241 2026-08-06 cs.IR 版本更新 78%

Closing the Indexing-Decoding Gap in Multimodal Generative Retrieval via Prefix Retention Optimization

通过前缀保留优化缩小多模态生成式检索中的索引-解码差距

Yufei Chen, Zihan Wang, Yubao Tang, Yukun Zhao, Maarten de Rijke, Zhaochun Ren

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出前缀保留优化(PRO)框架,通过前缀排序蒸馏、词汇调度和几何分数融合三种机制,缩小多模态生成式检索中索引与解码之间的差距,提升目标标识符前缀的保留率,在九个多模态检索任务上超越现有基线。

Comments 29 pages, 5 figures; code: https://github.com/layingfish/MGR_PRO

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16555 2026-08-03 cs.IR 版本更新 78%

MMGRec: Multimodal Generative Recommendation with Transformer Model

MMGRec: 基于Transformer模型的多模态生成推荐

Han Liu, Yinwei Wei, Xuemeng Song, Weili Guan, Yuan-Fang Li, Liqiang Nie

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 MMGRec通过生成范式引入多模态推荐,利用分层量化和Transformer模型生成用户偏好的项目标识符,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23523 2026-07-28 cs.AR 新提交 78%

CircuitWeave: Topology-Behavior Alignment for Executable Multimodal RTL Generation

CircuitWeave:用于可执行多模态RTL生成的拓扑-行为对齐

Jiahao Feng, Haiyan Qin, Zhiwei Xie, Wang Kang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究如何从自然语言规范生成RTL,提出CircuitWeave合同介导多模态框架,从原理图和文本提取合同并融合,通过联合目标监督相关过程,在生成可执行RTL上取得较好效果,部分指标高于无原理图的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01257 2026-07-24 physics.app-ph cond-mat.mes-hall 78%

Trion Engineered Multimodal Transistors in Two dimensional Bilayer Semiconductor Lateral Heterostructures

三重态工程多模态晶体管在二维双层半导体横向异质结中的应用

Baisali Kundu, Poulomi Chakrabarty, Avijit Dhara, Roberto Rosati, Chandan Samanta, Suman K. Chakraborty, Srilagna Sahoo, Sajal Dhara, Saroj P. Dash, Ermin Malic, Saurabh Lodha, Prasana K. Sahoo

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本研究通过二维双层半导体横向异质结实现多模态晶体管,利用内在能级分离调控三重态生成与传输,为光电和量子技术发展提供新路径。

Journal ref Adv. Funct. Mater. 36, no. 26 (2026): e17486

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12923 2026-07-21 eess.SY cs.SY 版本更新 78%

Information-Optimal Formation Geometry Design for Multimodal UAV Cooperative Perception

多模态无人机协同感知的信息最优编队几何设计

Kai Xiong, Xingyu Wu, Anna Duan, Gang Li, Yongjun Huang, Supeng Leng, Jianhua He

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对多模态无人机协同感知,提出信息最优优化框架,通过最大化Fisher信息矩阵行列式优化分配与控制,引入等效编队转换策略及稳定飞行控制方案,相比传统方法,视场覆盖、通信信号强度和能耗等方面有显著提升,验证了任务驱动几何分配的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12965 2026-07-15 cs.RO 新提交 78%

MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality

MAMMOTH:一种对缺失模态具有鲁棒性的越野移动多模态端到端策略

Ahaan Kotian, Shivani Subramanyan, Suresh Sundaram

机构 * Indian Institute of Science(印度科学研究所)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 研究针对非结构化越野环境自主导航难题,提出MAMMOTH多模态端到端策略。它融合多模态观测,用模态丢弃训练,还采用扩散策略学习联合概率分布,经实验验证性能优越,能提升避撞等能力及对缺失模态的泛化。

Comments Accepted to IROS 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09146 2026-07-13 cs.SE 新提交 78%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07439 2026-07-03 cs.AR 新提交 78%

A 65 nm Multi-Modal Bayesian Inference Engine with 16.3 fJ/Sample Calibration-Free GRNG for Risk-Aware At-Home Skin Lesion Screening

65 nm 多模态贝叶斯推理引擎,具有 16.3 fJ/样本免校准 GRNG,用于风险感知的家庭皮肤病变筛查

Steven Davis, Likai Pei, Jianbo Liu, Zephan M. Enciso, Boyang Cheng, Xueji Zhao, Danny Z. Chen, Ningyuan Cao

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出一种65 nm风险感知多模态贝叶斯推理引擎,通过存内计算架构实现词内混合高斯采样,提升不确定性建模能力,在鲁棒性和精度上超越现有单模态贝叶斯神经网络。

Comments This paper is accepted by IEEE Transactions on Circuits and Systems - Regular Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05503 2026-06-29 cs.CE 版本更新 78%

MolFORM: Multi-modal Flow Matching for Structure-Based Drug Design

MolFORM:基于多模态流匹配的结构药物设计

Jie Huang, Daiheng Zhang

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 提出MolFORM框架,利用多流匹配联合建模离散原子类型和连续3D坐标,并通过基于直接偏好优化的偏好引导微调提升生成质量,在多个评估指标上取得一致改进。

Comments Accepted to ICML 2025 genbio workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22774 2026-06-23 physics.optics 新提交 78%

Autonomous Generation of Metamaterial Databases Based on Multimodal Agents

基于多模态代理的元材料数据库自主生成

Shilong Qin, Zhicai Yu, Xuan Zheng, Yan Zhang, Aodi Yang, Kezhan Zhao, Qi Cheng Chen, Jian Wei You, Tie Jun Cui

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出MetaDataGenAgent多模态多代理框架,通过文献到仿真的自动化流程,从非结构化科学文献中提取并生成元材料结构-响应数据库,实现远场波束偏转、近场全息成像等功能。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14267 2026-06-15 cs.RO 新提交 78%

FloVerse: Floor Plan-Guided Multi-Modal Navigation

FloVerse:基于楼层平面图的多模态导航

Weiqi Huang, Shuangyi Dong, Jiaxin Li, Yifei Guo, Zan Wang, Wei Liang

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出FloVerse任务统一PointNav、ObjectNav和ImageNav,构建FloVerse-1.6K数据集,并设计ThreeDiff两阶段模仿学习策略,利用楼层平面图先验提升导航性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25820 2026-06-11 cs.LG 版本更新 78%

Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models

基于扩散的多模态大语言模型的视觉冗余控制并行解码

Yulin Yuan, Hongshuo Zhao, Xiangming Meng

机构 * Zhejiang University(浙江大学) ZJUI-UIUC Institute(ZJUI-UIUC研究院)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对扩散型多模态大语言模型并行解码中视觉冗余问题,提出视觉冗余指数(VRI)和无需训练的视觉冗余控制解码(VRCD)方法,通过令牌到图像的注意力优先选择视觉互补位置,在多个基准上提升准确率。

Comments 18 pages, 5 figures, preprint. Code is available at https://github.com/infiniteYuanyl/VRCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23965 2026-06-04 math.NA cs.NA 78%

Multimodal sampling via Schrödinger-Föllmer samplers with temperatures

基于带温度参数的薛定谔-弗尔默采样的多模态采样

Xiaojie Wang, Xiaoyan Zhang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文通过引入温度参数并基于薛定谔-弗尔默扩散的欧拉离散化提出新采样器,在L^2-Wasserstein距离下获得O(h)的改进收敛率,数值实验表明高温对多模态分布采样至关重要且性能优于Langevin采样器。

Journal ref J. Complexity 96 (2026), Paper No. 102052

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02507 2026-06-02 cond-mat.mtrl-sci cs.ET cs.LG physics.app-ph physics.comp-ph 78%

Towards Automated Discovery: A Review of Generative Models, Multimodal Learning and Closed-Loop Workflows in Inverse Materials Design

迈向自动发现:逆向材料设计中生成模型、多模态学习与闭环工作流综述

Anand Babu, Rogério Almeida Gouvêa, Gian-Marco Rignanese

机构 * Institute of Condensed Matter and Nanosciences, Université Catholique de Louvain(凝聚态与纳米科学研究所,比利时列日-努瓦尔桑大学) WEL Research Institute(WEL研究机构)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文综述了逆向材料设计中生成晶体结构建模、多模态学习和闭环设计管道的最新进展,重点讨论了可行性约束与物理先验的施加方式、多模态融合策略以及多种逆向设计策略(如条件生成与潜在优化、贝叶斯优化、强化学习和主动学习),并指出了常见失败模式及基于分阶段报告的评估实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30153 2026-05-29 stat.ML cs.IT cs.LG math.IT math.ST stat.TH 78%

Diffusion Models Are Statistically Optimal for Learning Low-Dimensional Multi-Modal Distributions

扩散模型在学习低维多模态分布时具有统计最优性

Jingda Wu, Changxiao Cai

机构 * Department of Industrial and Operations Engineering, University of Michigan, Ann Arbor, USA(工业与运营工程系,密歇根大学,安娜堡,美国)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文证明扩散模型在学习支撑在低维子空间并集上的分布时,样本复杂度仅依赖于内在维度,达到近最优的1-Wasserstein误差率,无需光滑性或有界密度假设。

Comments accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00944 2026-05-27 cs.CY 78%

Auditing the Reliability of Multimodal Generative Search

审计多模态生成式搜索的可靠性

Erfan Samieyan Sahneh, Luca Maria Aiello

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 通过大规模审计Gemini 2.5 Pro系统,发现3.7%至18.7%的基于视频的生成式搜索声明未被引用来源支持,主要失败模式为不可验证的特异性与夸大声明。

Comments 14 pages, LaTeX, typos corrected, adding Data Availability section + examples in appendix, New plot(overview)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18979 2026-05-26 cs.LG 78%

Dynamic Optimization and Safety Indicator Injection for Jailbreaking Text-to-Image Models with Multimodal Safety Filters

动态优化与安全指示注入:针对多模态安全过滤器的文本到图像模型越狱方法

Zixuan Chen, Hao Lin, Ke Xu, Xinghao Jiang, Tanfeng Sun

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出OptJail框架,通过动态提示优化与自适应安全指示注入,绕过文本和图像过滤器,实现高成功率越狱,并揭示多模态防御的系统性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16104 2026-05-18 q-bio.GN q-bio.QM 78%

StateXDiff: Cell State-Contextualized Multimodal Diffusion for Single-Cell Perturbation Prediction

StateXDiff: 单细胞扰动预测的细胞状态-上下文化多模态扩散框架

Peiting Shi, Ningfeng Que, Xianzhe Huang, Xiaofei Wang, Jianzhong Jeff Xi

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 StateXDiff通过整合转录组与蛋白质特征,构建多模态细胞状态表示,并利用条件扩散模型生成药物扰动特异性变化,提升单细胞扰动预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24550 2026-05-18 cs.LG cs.SD 78%

Training-Free Multimodal Guidance for Video to Audio Generation

无需训练的多模态引导用于视频到音频生成

Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti, Aurelio Uncini, Fabio Antonacci, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecomm., Sapienza University of Rome, Italy(信息工程、电子与电信系,罗马大学萨皮恩扎)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出无需训练的多模态引导机制,用于视频到音频扩散生成,通过模态嵌入跨度强制视频、音频和文本的一致对齐,提升生成质量与多模态对齐效果。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14159 2026-05-15 cs.RO 78%

MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies

MIMIC-D: 多模态模仿用于多智能体协调的去中心化扩散策略

Dayi Dong, Maulik Bhatt, Seoyeon Choi, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(加州大学伯克利分校机械工程系)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出MIMIC-D,通过去中心化扩散策略实现多智能体多模态模仿学习,解决了传统方法在多模态任务中协调效率低的问题。

Comments 8 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13309 2026-05-14 eess.SP 78%

SimART: A Unified and Open Real-world Multimodal Simulation Platform for 6G Integrated Sensing and Communication

SimART:一个统一的开放现实多模态仿真平台用于6G集成感知与通信

Kang Yan, Yuqi Cao, Jiaqi Li, Luping Xiang, Kun Yang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 SimART通过整合机器人学、光线追踪和无线评估引擎,提供一个可重复的多模态仿真平台,支持6G集成感知与通信的多方面需求,包括场景构建和信道知识图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11387 2026-05-13 cs.LG cs.RO 78%

Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies

多模态生成策略细调中的行为模式发现

Alberta Longhini, David Emukpere, Jean-Michel Renders, Seungsu Kim

机构 * Naver Labs Europe(纳维尔实验室欧洲分部) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出一种无监督的行为模式发现框架,用于在强化学习细调多模态生成策略时保持行为多样性,通过互信息作为内在奖励提升任务成功率。

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08138 2026-05-12 cs.LG 78%

DataArc-SynData-Toolkit: A Unified Closed-Loop Framework for Multi-Path, Multimodal, and Multilingual Data Synthesis

DataArc-SynData-Toolkit:多路径、多模态和多语言数据合成的统一闭环框架

Zhichao Shi, Cehao Yang, Hao Zhou, Xiaojun Wu, Huajie Li, Xuhui Jiang, Chengjin Xu, Yuanzhuo Wang, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research(IDEA研究院) International Digital Economy Academy(国际数字经济学院) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院) Institute of Computing Technology, CAS(中国科学院计算技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出DataArc-SynData-Toolkit,通过统一的合成范式和模块化架构,解决现有合成数据工具在流程复杂、标准碎片化和多模态扩展性方面的不足,提升数据生成效率和质量。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10647 2026-04-23 cs.RO 78%

OmniUMI: Towards Physically Grounded Robot Learning via Human-Aligned Multimodal Interaction

OmniUMI: 通过人对齐的多模态交互实现物理基础的机器人学习

Shaqi Luo, Yuanyuan Li, Youhao Hu, Chenhao Yu, Chaoran Xu, Jiachen Zhang, Guocai Yao, Tiejun Huang, Ran He, Zhongyuan Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) MAIS & NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 OmniUMI通过人对齐的多模态交互实现物理基础的机器人学习,整合视觉、触觉和力觉数据,提升接触密集操作的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11931 2026-04-23 cs.RO 78%

MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy

MATT-Diff:基于扩散策略的多模态主动目标跟踪

Saida Liu, Nikolay Atanasov, Shumon Koga

机构 * Department of Computer Science and Systems Engineering, Kobe University(神户大学计算机科学与系统工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电子与计算机工程系)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出MATT-Diff,一种基于扩散策略的多模态主动多目标跟踪控制策略,通过视觉Transformer和注意力机制实现多目标跟踪与再获取。

Comments Camera-ready version for L4DC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16558 2026-04-21 cs.LG 78%

Cross-Modal Generation: From Commodity WiFi to High-Fidelity mmWave and RFID Sensing

跨模态生成:从商品WiFi到高保真毫米波和RFID传感

Zhixiong Yang, Long Jing, Yao Li, Shuli Cheng, Guoxuan Chi, Chenyu Wen

机构 * Xinjiang University(新疆大学) Northwest University(西北大学) Tsinghua University(清华大学)

专题命中 多模态生成 :cross-modal(title,abstract)

AI总结 本文提出RF-CMG方法,利用丰富的WiFi数据生成高保真毫米波和RFID数据,通过高频指导与低频约束解耦生成过程,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏