arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-04 至 2026-03-04 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2510.00438 2026-03-04 cs.CV 85%

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

BindWeave:通过跨模态整合实现主体一致的视频生成

Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance(字节跳动) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 BindWeave通过跨模态整合解决主体一致视频生成难题,利用MLLM-DiT框架提升生成视频的主体一致性和自然度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02273 2026-03-04 cs.LG 82%

Graph Attention Based Prioritization of Disease Responsible Genes from Multimodal Alzheimer's Network

基于图注意力的多模态阿尔茨海默病相关基因优先级排序

Binon Teji, Subhajit Bandyopadhyay, Swarup Roy

机构 * Network Reconstruction & Analysis Lab and Department of Computer Applications, Sikkim University(网络重建与分析实验室和计算机应用系,西西米大学) Network Reconstruction & Analysis Lab, Department of Computer Applications, Sikkim University(网络重建与分析实验室,计算机应用系,西西米大学) Department of Computer Science & Engineering, Tezpur University(计算机科学与工程系,泰朱大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 NETRA通过多模态图变换器框架,利用注意力机制优先排序阿尔茨海默病相关基因,显著提升疾病通路富集分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21628 2026-03-04 cs.CL 79%

RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning

RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理

Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 RuCL通过分层评分标准课程学习提升多模态大语言模型的推理能力,实现7.83%的准确率提升。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26127 2026-03-04 cs.CV 57%

EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model

EchoGen: 通过前馈主体驱动自回归模型在任意场景中生成视觉回声

Ruixiao Dong, Zhendong Wang, Keli Liu, Li Li, Ying Chen, Kai Li, Daowen Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 EchoGen通过前馈主体驱动自回归模型在任意场景中生成高质量视觉回声,实现高效生成与高保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02778 2026-03-04 cond-mat.mtrl-sci 50%

Unlocking the Potential of Ni2+ and Ni2+-Cr3+ Synergy for Bifunctional Pressure and Temperature Optical Sensing

解锁Ni²+和Ni²⁺-Cr³+协同作用在双功能压力和温度光学传感中的潜力

M. Szymczak, L. Marciniak

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过Ni²+和Cr³+协同发光实现高灵敏度双功能压力温度传感,首次展示其在近红外测压中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16733 2026-03-04 eess.SP 50%

Generative Diffusion Models for Wireless Networks: Fundamental, Architecture, and State-of-the-Art

生成扩散模型用于无线网络:基础、架构与最新进展

Dayu Fan, Rui Meng, Xiaodong Xu, Yiming Liu, Guoshun Nan, Chenyuan Feng, Shujun Han, Song Gao, Bingxuan Xu, Dusit Niyato, Tony Q. S. Quek, Ping Zhang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文综述了生成扩散模型在无线网络中的应用,分析了其在感知、传输和应用领域的技术演进,探讨了核心挑战与潜在解决方案。

Comments 46 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏