arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4951 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4951 篇

2601.12277 2026-01-21 cs.RO 78%

An Efficient and Multi-Modal Navigation System with One-Step World Model

一种高效且多模态的导航系统与一步世界模型

Wangtian Shen, Ziyang Meng, Jinming Ma, Mingliang Zhou, Diyun Xiang

机构 * Tsinghua University(清华大学) Xiaomi (China)(小米(中国))

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种高效多模态导航系统,通过一步世界模型和3D U-Net骨干网络,提升导航效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11540 2026-01-21 cs.HC 78%

Exploring General-Purpose Autonomous Multimodal Agents for Pathology Report Generation

探索通用型自主多模态代理用于病理报告生成

Marc Aubreville, Taryn A. Donovan, Christof A. Bertram

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究探索通用型自主多模态代理在病理报告生成中的应用,发现其在无额外信息时诊断准确率较低,但提供形态学描述时表现更佳,但仍不及人类专家。

Comments 6 pages, 1 figure, accepted paper for BVM 2026

Journal ref BVM 2026, https://bvm-conf.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02766 2026-01-07 cs.RO cs.AR 78%

Advancing Assistive Robotics: Multi-Modal Navigation and Biophysical Monitoring for Next-Generation Wheelchairs

推动辅助机器人:多模态导航与生物物理监测用于下一代轮椅

Md. Anowar Hossain, Mohd. Ehsanul Hoque

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种多模态轮椅控制系统,结合多种输入接口与生物物理监测,提升患者独立性并实现护理人员实时监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01475 2026-01-06 cs.LG 78%

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

多子空间多模态建模用于扩散模型:估计、收敛与专家混合

Ruofeng Yang, Yongcan Li, Bo Jiang, Cheng Chen, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出基于多子空间多模态建模的扩散模型,通过引入低秩混合高斯混合结构,有效捕捉多模态信息并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04000 2026-01-01 cs.IT cs.LG math.IT 78%

Distributed Information Bottleneck Theory for Multi-Modal Task-Aware Semantic Communication

多模态任务感知语义通信的分布式信息瓶颈理论

Yujie Zhou, Cheng Peng, Rulong Wang, Yong Xiao, Yingyu Li, Guangming Shi, Ping Zhang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(电子信息与通信学院,华中科技大学) Peng Cheng Laboratory(鹏城实验室) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔)) School of Mechanical Engineering and Electronic Information, China University of Geosciences(机械工程与电子信息学院,中国地质大学) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种多模态任务感知语义通信的分布式信息瓶颈框架,通过量化模态贡献来优化资源利用,提升通信效率与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19983 2025-12-24 cs.IR 78%

IGDMRec: Behavior Conditioned Item Graph Diffusion for Multimodal Recommendation

IGDMRec: 基于行为的物品图扩散用于多模态推荐

Ziyuan Guo, Jie Guo, Zhenghao Chen, Bin Song, Fei Richard Yu

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 IGDMRec通过行为条件图扩散和条件去噪网络,利用用户行为信息去噪多模态推荐的语义物品图,提升推荐性能。

Comments 12 pages, 6 figures. This paper has been accepted for publication in IEEE Transactions on Multimedia. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04359 2025-12-15 eess.SP 78%

Efficient Domain Generalization in Wireless Networks with Scarce Multi-Modal Data

在稀缺多模态数据下实现无线网络高效领域泛化

Minsu Kim, Walid Saad, Doru Calin

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种两阶段学习框架,通过基于物理的损失函数和协作域适应方法,在稀缺多模态数据下提升无线网络的领域泛化性能。

Comments Submitted to IEEE TWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15365 2025-12-12 eess.SY cs.LG cs.MA cs.SY 78%

TranSimHub:A Unified Air-Ground Simulation Platform for Multi-Modal Perception and Decision-Making

TranSimHub:一个多模态感知与决策的空地协同仿真平台

Maonan Wang, Yirong Chen, Yuxin Cai, Aoyu Pang, Yuejiao Xie, Zian Ma, Chengcheng Xu, Kemou Jiang, Ding Wang, Laurent Roullet, Chung Shue Chen, Zhiyong Cui, Yuheng Kan, Michael Lepech, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) SenseTime Group Ltd(商汤科技有限公司) Beihang University(北京航空航天大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 TranSimHub是一个用于空地协同智能的统一仿真平台,支持多模态感知与决策研究,提供同步渲染和可控场景编辑功能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03375 2025-12-04 cs.LG 78%

MAGE-ID: A Multimodal Generative Framework for Intrusion Detection Systems

MAGE-ID:一种多模态生成框架用于入侵检测系统

Mahdi Arab Loodaricheh, Mohammad Hossein Manshaei, Anita Raja

机构 * Department of Computer Science, Hunter College and The Graduate Center, City University of New York(计算机科学系,亨特学院和研究生中心,纽约市立大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 MAGE-ID通过多模态生成框架提升入侵检测系统的数据增强效果,实现更平衡和一致的多模态合成,显著提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12770 2025-12-01 cs.LG cs.CE 78%

MolEdit: Knowledge Editing for Multimodal Molecule Language Models

MolEdit: 多模态分子语言模型的知识编辑

Zhenyu Lei, Patrick Soga, Yaochen Zhu, Yinhan He, Yushun Dong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) Florida State University(佛罗里达州立大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 MolEdit通过多专家知识适配器和专家意识编辑切换器,提升多模态分子语言模型的编辑可靠性与局部性,实现分子与描述词的高效互转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14631 2025-11-12 cs.DB 78%

Towards a Multimodal Stream Processing System

Uélison Jean Lopes dos Santos, Alessandro Ferri, Szilard Nistor, Riccardo Tommasini, Carsten Binnig, Manisha Luthra

专题命中 多模态生成 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01374 2025-11-04 cs.LG 78%

Learning Intractable Multimodal Policies with Reparameterization and Diversity Regularization

Ziqi Wang, Jiashun Liu, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 多模态生成 :multimodal(title,abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01074 2025-10-31 cs.LG 78%

Omni-Mol: Multitask Molecular Model for Any-to-any Modalities

Chengxin Hu, Hao Li, Yihe Yuan, Zezheng Song, Chenyang Zhao, Haixin Wang

机构 * National University of Singapore(新加坡国立大学) University of Maryland, College Park(马里兰大学 College Park 分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态生成 :any-to-any(title);multimodal(abstract)

Comments 44 pages, 9 figures, 13 tables, paper accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20637 2025-10-24 cs.LG 78%

Large Multimodal Models-Empowered Task-Oriented Autonomous Communications: Design Methodology and Implementation Challenges

Hyun Jong Yang, Hyunsoo Kim, Hyeonho Noh, Seungnyun Kim, Byonghyo Shim

机构 * Seoul National University(首尔国立大学) Hanbat National University(翰baum国立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态生成 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20595 2025-10-24 stat.ML cs.LG 78%

Diffusion Autoencoders with Perceivers for Long, Irregular and Multimodal Astronomical Sequences

Yunyi Shen, Alexander Gagliano

机构 * EECS, MIT(麻省理工学院电子工程与计算机科学系) IAIFI, MIT(麻省理工学院天文研究所) CfA, Harvard(哈佛大学天文台)

专题命中 多模态生成 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00565 2025-10-24 stat.CO cs.LG math.ST stat.TH 78%

Sampling from multi-modal distributions with polynomial query complexity in fixed dimension via reverse diffusion

Adrien Vacher, Omar Chehab, Anna Korba

机构 * CREST, ENSAE Institut Polytechnique de Paris(CREST,ENSAE 巴黎高等理工学院)

专题命中 多模态生成 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18879 2025-10-23 cs.HC 78%

FIRETWIN: Digital Twin Advancing Multi-Modal Sensing, Interactive Analytics for Wildfire Response

Mayamin Hamid Raha, Ali Reza Tavakkoli, Chris Webb, Mobin Habibpour, Janice Coen, Eric Rowell, Fatemeh Afghah

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

Comments 8 pages, 6 figures, accepted in IEEE International Workshop on Computer-Aided Modeling and Design of Communication Links and Networks (CAMAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10914 2025-10-14 eess.SY cs.SY 78%

Optimal Multi-Modal Transportation and Electric Power Flow: The Value of Coordinated Dynamic Operation

Jiajie Qiu, Dakota Thompson, Kamal Youcef-Toumi, Amro M. Farid

专题命中 多模态生成 :multi-modal(title,abstract)

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24840 2025-10-13 cs.LG cs.CE 78%

Cell2Text: Multimodal LLM for Generating Single-Cell Descriptions from RNA-Seq Data

Oussama Kharouiche, Aris Markogiannakis, Xiao Fei, Michail Chatzianastasis, Michalis Vazirgiannis

机构 * École Polytechnique, IP Paris(巴黎理工学院,IP巴黎)

专题命中 多模态生成 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21874 2025-09-29 cs.LG 78%

Abductive Logical Rule Induction by Bridging Inductive Logic Programming and Multimodal Large Language Models

Yifei Peng, Yaoli Liu, Enbo Xia, Yu Jin, Wang-Zhou Dai, Zhong Ren, Yao-Xiang Ding, Kun Zhou

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) National Key Laboratory for Novel Software Technology(新型软件技术国家实验室)

专题命中 多模态生成 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02518 2025-09-03 cs.LG 78%

AnalogCoder-Pro: Unifying Analog Circuit Generation and Optimization via Multi-modal LLMs

Yao Lai, Souradip Poddar, Sungyoung Lee, Guojin Chen, Mengkang Hu, Bei Yu, Ping Luo, David Z. Pan

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15695 2025-09-01 cs.LG 78%

SimuGen: Multi-modal Agentic Framework for Constructing Block Diagram-Based Simulation Models

Xinxing Ren, Qianbo Zang, Zekun Guo

机构 * Brunel University of London(伦敦布鲁内尔大学) SnT, Université du Luxembourg(卢森堡大学SnT分校) University of Hull(霍尔姆斯大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11159 2025-08-18 cs.LG 78%

Mitigating Modality Quantity and Quality Imbalance in Multimodal Online Federated Learning

Heqiang Wang, Weihong Yang, Xiaoxiong Zhong, Jia Zhou, Fangming Liu, Weizhe Zhang

机构 * Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态生成 :multimodal(title,abstract)

Comments arXiv admin note: text overlap with arXiv:2505.16138

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21349 2025-08-13 cs.CE 78%

Out of the Past: An AI-Enabled Pipeline for Traffic Simulation from Noisy, Multimodal Detector Data and Stakeholder Feedback

Rex Chen, Karen Wu, John McCartney, Norman Sadeh, Fei Fang

专题命中 多模态生成 :multimodal(title,abstract)

Comments 17 pages; 1 table; 6 figures; extended version of accepted version, published at the 2025 Winter Simulation Conference (WSC '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06888 2025-08-12 cs.SE 78%

Multi-Modal Requirements Data-based Acceptance Criteria Generation using LLMs

Fanyu Wang, Chetan Arora, Yonghui Liu, Kaicheng Huang, Chakkrit Tantithamthavorn, Aldeida Aleti, Dishan Sambathkumar, David Lo

专题命中 多模态生成 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06054 2025-08-11 eess.SP 78%

Multi-Modal Neural Radio Radiance Field for Localized Statistical Channel Modelling

Yiheng Wang, Shutao Zhang, Ye Xue, Tsung-Hui Chang

专题命中 多模态生成 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04271 2025-08-07 cs.DC 78%

S2M3: Split-and-Share Multi-Modal Models for Distributed Multi-Task Inference on the Edge

JinYi Yoon, JiHo Lee, Ting He, Nakjung Choi, Bo Ji

专题命中 多模态生成 :multi-modal(title,abstract)

Comments Accepted at IEEE International Conference on Distributed Computing Systems (ICDCS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00303 2025-08-04 cs.RO 78%

TopoDiffuser: A Diffusion-Based Multimodal Trajectory Prediction Model with Topometric Maps

Zehui Xu, Junhui Wang, Yongliang Shi, Chao Gao, Guyue Zhou

机构 * School of Astronautics, Harbin Institute of Technology(哈尔滨工业大学航天学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Systems Engineering and Collaborative Laboratory for Intelligent Science and Systems, Macau University of Science and Technology(澳门科学大学系统工程研究所) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 多模态生成 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20132 2025-07-31 cs.LG 78%

High-Resolution Live Fuel Moisture Content (LFMC) Maps for Wildfire Risk from Multimodal Earth Observation Data

Patrick Alan Johnson, Gabriel Tseng, Yawen Zhang, Heather Heward, Virginia Sjahli, Favyen Bastani, Joseph Redmon, Patrick Beukema

机构 * Mila -- Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Allen Institute for AI (Ai2)(人工智能研究所) University of Idaho(爱达荷大学)

专题命中 多模态生成 :multimodal(title,abstract)

Comments 10 pages, ICML 2025 (TerraBytes)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21430 2025-07-30 cs.AR 78%

Automated HEMT Model Construction from Datasheets via Multi-Modal Intelligence and Prior-Knowledge-Free Optimization

Yuang Peng, Jiarui Zhong, Yang Zhang, Hong Cai Chen

专题命中 多模态生成 :multi-modal(title,abstract)

Comments 12 pages, 12 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏