arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-13 至 2026-03-13 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2603.03964 2026-03-13 cs.CV cs.AI 84%

BLOCK: An Open-Source Bi-Stage MLLM Character-to-Skin Pipeline for Minecraft

BLOCK:一个开源的双阶段MLLM字符到皮肤生成Minecraft pipeline

Hengquan Guo

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BLOCK通过双阶段流程生成Minecraft皮肤,结合MLLM和FLUX.2模型,提出EvolveLoRA提升生成稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI 81%

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11556 2026-03-13 cs.CV 79%

Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception

通过多模态感知引导的双条件扩散模型增强图像美学

Xinyu Nan, Ning Wang, Yuyao Zhai, Mei Yang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出双监督图像美学增强模型DIAE,通过多模态感知和双分支监督框架提升图像美学质量与内容一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06214 2026-03-13 cs.CL cs.AI math-ph math.MP quant-ph 62%

Can Theoretical Physics Research Benefit from Language Agents?

理论物理研究能否从语言代理中受益?

Sirui Lu, Zhijing Jin, Terry Jingchen Zhang, Pavel Kos, J. Ignacio Cirac, Bernhard Schölkopf

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言代理在理论物理研究中的潜力,指出需专门训练和工具支持,以实现多模态数据处理、物理假设提出和理论验证的AI代理。

Comments 8+2 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12264 2026-03-13 cs.CV 57%

GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing

GRADE: 图像编辑中学科引导推理的基准测试

Mingxin Liu, Ziqian Fan, Zhaokai Wang, Leyao Gu, Zirun Zhu, Yiguo He, Yuchen Yang, Changyao Tian, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Qibing Ren, Zhihang Zhong, Xuanhe Zhou, Junchi Yan, Xue Yang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 GRADE是首个评估图像编辑中学科引导推理能力的基准测试,通过多领域样本和多维评估协议揭示当前模型在知识密集型编辑任务中的局限性。

Comments 49 pages, 23 figures, 10 tables; Project Page: https://grade-bench.github.io/, Code: https://github.com/VisionXLab/GRADE, Dataset: https://huggingface.co/datasets/VisionXLab/GRADE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12126 2026-03-13 cs.CV cs.LG 57%

Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D

Hoi3DGen:生成高质量的人-物交互的3D模型

Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Technische Universität Nürnberg(纽伦堡技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Hoi3DGen通过多模态大语言模型生成高质量3D人-物交互模型,显著提升交互保真度和3D生成质量,实现文本到3D的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 57%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11984 2026-03-13 cs.CV 57%

Ada3Drift: Adaptive Training-Time Drifting for One-Step 3D Visuomotor Robotic Manipulation

Ada3Drift: 适应性训练时间漂移用于一步式三维视觉-运动机器人操作

Chongyang Xu, Yixian Zou, Ziliang Feng, Fanman Meng, Shuaicheng Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Ada3Drift通过将迭代细化从推理时间转移到训练时间,实现高保真的单步三维视觉-运动机器人操作生成,同时在少样本条件下提升性能并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11675 2026-03-13 cs.CV 57%

PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

PROMO: 可提示的高效高保真虚拟试衣

Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏