arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-30 至 2026-04-30 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2506.02494 2026-04-30 cs.CL cs.AI cs.CV 82%

MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text

MINOS:一种用于图像与文本双向生成的多模态评估模型

Junzhe Zhang, Huixuan Zhang, Xinyu Hu, Li Lin, Mingqi Gao, Shi Qiu, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) School of Physics, Peking University(北京大学物理学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MINOS模型,通过严格质量控制策略构建Minos-57K多模态评估数据集,结合SFT和偏好对齐训练策略,在16个跨领域数据集中取得最佳性能。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26341 2026-04-30 cs.CV 81%

SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness

SpatialFusion:赋予统一图像生成内在三维几何意识

Haiyi Qiu, Kaihang Pan, Jiacheng Li, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究院)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出SpatialFusion框架,通过引入混合变压器增强MLLM的三维几何建模能力,并利用深度适配器将显式几何约束注入扩散模型,提升空间感知任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09547 2026-04-30 cs.CV cs.AI 81%

GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning

GoViG:通过多模态推理实现目标条件视觉导航指令生成

Fengyi Wu, Yifei Dong, Yilong Dai, Guangyu Chen, Qifeng Wu, Huiting Huang, Hang Wang, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GoViG任务,通过多模态推理生成基于初始和目标状态的视觉导航指令,采用自回归多模态大语言模型提升空间准确性和语言清晰度,提出两种多模态推理策略并构建R2R-Goal数据集验证方法有效性。

Comments Accepted to ACL 2026 Findings. 22 pages, 12 figures, Code: https://github.com/F1y1113/GoViG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16552 2026-04-30 cs.CV cs.AI 62%

Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion

通过自回归3D扩散模型生成布局和形状

Zhenggang Tang, Yuehao Wang, Yuchen Fan, Jun-Kun Chen, Yu-Ying Yeh, Kihyuk Sohn, Zhangyang Wang, Qixing Huang, Alexander Schwing, Rakesh Ranjan, Dilin Wang, Zhicheng Yan

机构 * Meta Reality Labs(Meta现实实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种新的文本到场景生成方法,通过自回归3D扩散模型生成布局和形状,解决文本描述与生成场景不一致的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19216 2026-04-30 cs.NI cs.AI cs.CV cs.LG 62%

Bridging Visual and Wireless Sensing via a Unified Radiation Field for 3D Radio Map Construction

通过统一的辐射场桥接视觉与无线传感以实现3D无线电地图构建

Chaozheng Wen, Jingwen Tong, Zehong Lin, Chenghong Bian, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出URF-GS框架,结合3D高斯散射和反渲染技术,融合多模态数据以提升3D无线电地图的空间频谱精度和样本效率。

Comments The code for this work will be publicly available at: https://github.com/wenchaozheng/URF-GS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL 57%

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14082 2026-04-30 cond-mat.mtrl-sci 50%

Generative design of inorganic materials

无机材料的生成设计

Jose Recatala-Gomez, Haiwen Dai, Zhu Ruiming, Nikita Kazeev, Nong Wei, Gang Wu, Maciej Koperski, Tan Teck Leong, Andrey Ustyuzhanin, Gerbrand Ceder, Kostya Novoselov, Kedar Hippalgaonkar

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文探讨了生成设计在无机材料中的应用,结合多模态学习与高通量实验验证,解决功能材料的数据驱动逆向设计难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26065 2026-04-30 cs.RO 50%

FlowS: One-Step Motion Prediction via Local Transport Conditioning

FlowS: 通过局部传输条件实现一步运动预测

Leandro Di Bella, Adrian Munteanu, Bruno Cornelis

机构 * Department of Electronics and Informatics, Vrije Universiteit Brussel(弗拉芒布鲁塞尔自由大学电子与信息系) IMEC

专题命中 多模态生成 :multimodal(abstract)

AI总结 FlowS通过局部传输条件实现一步运动预测,结合在线场景条件学习先验和步一致位移场,提升预测精度与效率,达到SOTA性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏