arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-05 至 2026-03-05 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2602.22227 2026-03-05 cs.LG cs.AI 83%

Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models

动态对抗强化学习用于鲁棒多模态大语言模型

Yicheng Bao, Xuhong Wang, Qiaosheng Zhang, Chaochao Lu, Xia Hu, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出AOT方法,通过对抗训练提升多模态大语言模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04307 2026-03-05 cs.CV 79%

Dual Diffusion Models for Multi-modal Guided 3D Avatar Generation

多模态引导的3D人像生成双扩散模型

Hong Li, Yutang Feng, Minqi Meng, Yichen Yang, Xuhui Liu, Baochang Zhang

机构 * Beihang University(北航大学) KAUST(卡塔尔科技大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出PromptAvatar,通过双扩散模型实现多模态引导的3D人像生成,提升生成质量与效率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08714 2026-03-05 cs.CV cs.CL cs.LG 73%

Generating Fine Details of Entity Interactions

生成实体交互的细节

Xinyi Gu, Jiayuan Mao

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种基于多模态大语言模型的方法,通过分解和细化过程提升图像中实体交互细节的生成质量。

Comments EMNLP 2025. Project Page: https://detailscribe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03657 2026-03-05 cs.CV cs.AI 62%

InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models

InEdit-Bench:智能图像编辑模型中间逻辑路径的基准测试

Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao

机构 * State Key Laboratory of Optical Field Manipulation Science and Technology, Institute of Optics and Electronics, Chinese Academy of Sciences(光学场操控科学与技术国家重点实验室,光学电子研究所,中国科学院) National Laboratory on Adaptive Optics(自适应光学国家实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 InEdit-Bench通过评估图像编辑模型在中间逻辑路径推理中的表现,揭示了现有模型在动态推理和多步骤演变建模方面的不足,推动更智能的多模态生成模型发展。

Comments CVPR findings. Project page: https://github.com/SZStrong1/InEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV 57%

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03731 2026-03-05 cs.DC 50%

HyperParallel: A Supernode-Affinity AI Framework

HyperParallel:一种超节点亲和性AI框架

Xin Zhang, Beilei Sun, Teng Su, Qinghua Zhang, Chong Bao, Lei Chen, Xuefeng Jin

专题命中 多模态生成 :multimodal(abstract)

AI总结 HyperParallel框架通过超节点亲和性设计,提升AI训练和推理效率,降低编程复杂度和系统调优开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21150 2026-03-05 cs.LG 50%

CAD-Tokenizer: Towards Text-based CAD Prototyping via Modality-Specific Tokenization

CAD-Tokenizer: 向基于文本的CAD原型设计迈进:通过模态特定的分词

Ruiyu Wang, Shizhao Sun, Weijian Ma, Jiang Bian

机构 * University of Toronto(多伦多大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 CAD-Tokenizer通过模态特定的分词策略,提升文本引导的CAD原型设计效率与生成质量。

Comments ICLR2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏