arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-02 至 2026-06-02 共收录 26 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 26 篇

2606.00232 2026-06-02 cs.AI cs.LG 83%

TIGER: Traceable Inference with Graph-Based Evidence Routing for Mitigating Hallucinations in Multimodal Generation

TIGER: 基于图证据路由的可追踪推理用于减轻多模态生成中的幻觉

Kaixiang Zhao, Tianrun Yu, Shawn Huang, Porter Jenkins, Yushun Dong, Amanda Hughes

机构 * Brigham Young University Florida State University

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出TIGER框架,通过从输入和输出中独立提取观测图与声明图,并基于图条件风险评分修复高风险声明,以减轻多模态生成中的事实级幻觉。

Comments 25 pages, 7 figures, 16 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00154 2026-06-02 cs.SE cs.AI 83%

Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages

多模态大语言模型在复杂交互网页代码生成上的基准测试

Fan Wu, Lishuai Dong, Cuiyun Gao, Yujia Chen, Yiming Huang, Yang Xiao, Qing Liao

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 针对现有基准忽略复杂交互行为的问题,提出WebIGBench基准,包含103个真实复杂网页和871个交互动作,并设计新评估流程,测试多模态大语言模型在交互式网页代码生成上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01022 2026-06-02 cs.CV cs.AI 81%

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

ProductWebGen: 多模态产品网页生成基准测试

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00477 2026-06-02 cs.CL cs.CV 81%

Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs

文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准

Xin Gao, Cheng Yang, Chufan Shi, Taylor Berg-Kirkpatrick

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Washington(华盛顿大学)

专题命中 多模态生成 :cross-modal(title);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出跨模态知识编辑基准UniKE,发现文本编辑在图像生成中效果显著下降(VQA准确率仅18.5%),并提出推理增强参数编辑方法提升跨模态迁移效果。

Comments Published at ICML 2026; Code and data available at https://github.com/gxx27/UniKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00153 2026-06-02 cs.CV cs.AI 81%

DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion

DiffCrossGait:基于潜在扩散的2D-3D跨模态步态识别轨迹级对齐

Zhiyang Lu, Ming Cheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对2D-3D跨模态步态识别中的域差异问题,提出DiffCrossGait,通过潜在扩散空间中的轨迹级对齐实现连续模态对齐,并引入三阶段对齐策略确保身份锚定、动态一致性和跨模态结构可恢复性,在SUSTech1K和FreeGait基准上达到最优性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07061 2026-06-02 cs.SD cs.AI cs.CV cs.MM 80%

Do Joint Audio-Video Generation Models Understand Physics?

联合音视频生成模型是否理解物理?

Zijun Cui, Xiulong Liu, Hao Fang, Mingwei Xu, Jiageng Liu, Zexin Xu, Weiguo Pian, Shijian Deng, Feiyu Du, Chenming Ge, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。

Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00689 2026-06-02 cs.CV 79%

Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning

小波融合扩散模型用于多模态脑MRI合成,具有模态和元数据条件

Muhammad Nabi Yasinzai, Remika Mito, Mangor Pedersen

机构 * Department of Psychology & Neuroscience, Auckland University of Technology(心理学与神经科学系,奥克兰技术大学) Department of Psychiatry, University of Melbourne(精神病学系,墨尔本大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种小波融合扩散模型(WFDM),结合小波融合变分自编码器(WF-VAE)和条件3D U-Net扩散模型,通过显式模态和元数据条件实现多模态脑MRI合成,解决了数据集模态覆盖不均和异质性问题,在分布对齐上优于现有方法。

Comments 51 pages, 7 figures, including supplementary material. Submitted to Imaging Neuroscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14709 2026-06-02 cs.CV 79%

Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners

打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器

Qingyang Liu, Bingjie Gao, Canmiao Fu, Zhipeng Huang, Chen Li, Feng Wang, Shuochen Chang, Shaobo Wang, Yali Wang, Keming Ye, Jiangtong Li, Li Niu

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03893 2026-06-02 cs.AI 79%

FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning

FeynmanBench:多模态大语言模型在图解物理推理上的基准测试

Zeyu Wang, Jingye Xu, Xiaogang Li, Peiyao Xiao, Qinhao Kong, Ben Wang, Chengliang Xu, Zichao Chen, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Skylenage

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出FeynmanBench基准,包含2000多个费曼图任务,评估多模态大模型在拓扑结构、守恒约束和视觉-代数映射等全局结构推理上的能力,发现模型在局部识别上表现良好但在拓扑重建和代数推导上严重不足。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02507 2026-06-02 cond-mat.mtrl-sci cs.ET cs.LG physics.app-ph physics.comp-ph 78%

Towards Automated Discovery: A Review of Generative Models, Multimodal Learning and Closed-Loop Workflows in Inverse Materials Design

迈向自动发现:逆向材料设计中生成模型、多模态学习与闭环工作流综述

Anand Babu, Rogério Almeida Gouvêa, Gian-Marco Rignanese

机构 * Institute of Condensed Matter and Nanosciences, Université Catholique de Louvain(凝聚态与纳米科学研究所,比利时列日-努瓦尔桑大学) WEL Research Institute(WEL研究机构)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文综述了逆向材料设计中生成晶体结构建模、多模态学习和闭环设计管道的最新进展,重点讨论了可行性约束与物理先验的施加方式、多模态融合策略以及多种逆向设计策略(如条件生成与潜在优化、贝叶斯优化、强化学习和主动学习),并指出了常见失败模式及基于分阶段报告的评估实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01513 2026-06-02 cs.DC cs.AI cs.CL cs.LG 77%

Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense

基于合规评分的Best-of-N护栏编排用于支付争议防御中的多模态文档生成

Nataraj Agaram Sundar, Tejas Morabia

机构 * eBay Inc.(eBay公司)

专题命中 多模态生成 :multimodal(title,comments);分类 cs.CL、cs.AI

AI总结 提出一种结合多候选生成与合规评分早退机制的护栏编排层,通过并行生成、加权评分和最佳输出选择,在支付争议防御场景中实现高合规率与低延迟。

Comments 8 pages, 7 figures, 4 tables. Preprint. Applied systems paper on compliance-scored guardrail orchestration for multimodal LLM document generation. Contains aggregate operational readouts; not a randomized A/B test

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20861 2026-06-02 cs.IR cs.AI 74%

Deep Interest Mining for Intent-Enriched Semantic IDs in Multimodal Generative Recommendation

面向多模态生成式推荐中意图增强语义ID的深度兴趣挖掘

Yangchen Zeng, Jinze Wang

机构 * Amazon(亚马逊)

专题命中 多模态生成 :multimodal(title);分类 cs.AI

AI总结 提出DeepInterestGR框架,通过视觉线索和意图描述符丰富量化前的物品表示,并结合相关性门控语义奖励,提升基于语义ID的生成式推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29488 2026-06-02 cs.CV cs.AI 73%

AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling

AnyMo: 基于掩码建模的任意模态条件运动生成

Yiheng Li, Zhuo Li, Ruibing Hou, Yingjie Chen, Hong Chang, Hao Liu, Shiguang Shan

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院计算技术研究所,中国)) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出AnyMo框架,结合残差FSQ运动分词器和可扩展掩码建模Transformer,利用大规模多模态对齐数据集OmniHuMo实现任意模态组合下的高质量人体运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00535 2026-06-02 cs.LG 71%

DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation

DREAM-S: 基于可搜索草稿与目标感知精炼的推测解码用于多模态生成

Zining Liu, Yunhai Hu, Tianhua Xia, Bo Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang

机构 * New York University(纽约大学) Cerebras Systems Inc.(Cerebras Systems公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态生成 :multimodal(title)

AI总结 提出DREAM-S框架,通过神经架构搜索和目标感知超网训练自动优化草稿模型架构与交互策略,结合注意力熵引导的自适应中间特征蒸馏,实现视觉语言模型的高效推测解码,加速比达3.85倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28995 2026-06-02 cs.CV 70%

GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation

GAP3D: 将VLM潜在表示与补丁级嵌入进行生成式对齐以实现3D生成

Polytimi Anna Gkotsi, Andrii Zadaianchuk, Mohammad Mahdi Derakhshani

机构 * Polytimi Anna Gkotsi Andrii Zadaianchuk Mohammad Mahdi Derakhshani

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出GAP3D,一种基于扩散的模块化方法,将VLM生成的潜在表示直接对齐到预训练图像编码器的完整补丁级特征空间,使冻结的下游生成模型能够利用VLM作为提示编码器,同时保持空间结构化的条件信号,在3D资产生成中无需大规模3D数据训练,并展现出多模态提示的零样本能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00664 2026-06-02 cs.LG cs.AI cs.CV cs.HC cs.MM 67%

Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

Avatar Forcing:用于自然对话的实时交互式头部化身生成

Taekyung Ki, Sangwon Jang, Jaehyeong Jo, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡国立大学) DeepAuto.ai

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出Avatar Forcing框架,通过扩散强制实现实时交互式头部化身生成,利用直接偏好优化进行无标签学习,在低延迟(约500ms)下生成富有表现力的反应动作。

Comments CVPR 2026. Project page: https://taekyungki.github.io/AvatarForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01599 2026-06-02 cs.AI 57%

TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL

TRON:面向视觉推理强化学习的目标化规则可验证在线环境

Tianze Yang, Yucheng Shi, Ruitong Sun, Jingyuan Huang, Ninghao Liu, Jin Sun

机构 * University of Georgia(佐治亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出TRON在线环境框架,通过可控生成-验证程序产生无限训练实例,支持视觉推理强化学习,在多个多模态基准上提升性能。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00336 2026-06-02 cs.AI cs.LG 57%

From Noise to Control: Parameterized Diffusion Policies

从噪声到控制:参数化扩散策略

Renhao Zhang, Haotian Fu, Mingxi Jia, George Konidaris, Yilun Du, Bruno Castro da Silva

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出参数化扩散策略(PDP),通过学习行为流形上的低维连续参数条件化扩散策略,将扩散从随机多样性机制转化为精确可优化的行为引导工具,实现策略间的平滑插值和新约束下的高效适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06453 2026-06-02 cs.CV 57%

Pinterest Canvas: Large-Scale Image Generation at Pinterest

Pinterest Canvas: Pinterest 的大规模图像生成系统

Yu Wang, Eric Tzeng, Raymond Shiau, Jie Yang, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 Pinterest Canvas,一个基于扩散模型的大规模图像生成系统,通过基础模型微调为特定任务(如背景增强和宽高比外扩)生成专用模型,并在线上实验中分别获得18.0%和12.5%的参与度提升。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06442 2026-06-02 cs.CV 57%

ChatUMM: Robust Context Tracking for Conversational Interleaved Generation

ChatUMM: 面向对话式交错生成的鲁棒上下文追踪

Wenxun Dai, Zhiyuan Zhao, Yule Zhong, Yiji Cheng, Jianwei Zhang, Linqing Wang, Shiyi Zhang, Yunlong Lin, Runze He, Fellix Song, Wayne Zhuang, Yong Liu, Haoji Zhang, Yansong Tang, Chunyu Wang

机构 * Tsinghua University(清华大学) Tencent Hunyuan Project lead(腾讯文心一言项目负责人)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出ChatUMM,一种通过交错多轮训练策略和系统化对话数据合成流水线实现鲁棒上下文追踪的对话式统一多模态模型,在视觉理解和指令引导编辑基准上达到开源模型最优性能。

Comments ChatUMM Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18439 2026-06-02 cs.CL 57%

Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation

基于视觉线索检测手语翻译中的幻觉:是依据视觉信息还是猜测?

Yasser Hamidullah, Koel Dutta Chowdhury, Yusser Al Ghussin, Shakib Yazdani, Cennet Oguz, Josef van Genabith, Cristina España-Bonet

机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Saarland Informatics Campus(萨尔兰州信息学校园) Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 针对手语翻译中模型依赖语言先验而非视觉输入导致幻觉的问题,提出一种基于特征敏感性和反事实信号的令牌级可靠性度量,用于量化视觉信息利用程度,并在两个基准上验证其预测幻觉率、跨数据集泛化及与文本信号结合提升风险评估的效果。

Comments Published at ICLR2026 Code available at \url{https://github.com/yhamidullah/hallucination-slt}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02370 2026-06-02 cs.RO 50%

A Simulation Platform for Flapping-Wing Vehicles

扑翼飞行器仿真平台

Haichuan Li, Tomi Westerlund

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对扑翼飞行器仿真与现实差距大的问题,提出FWAV-Sim高保真仿真平台,集成复合气动模型、湍流生成和真实传感器模拟,提升自主系统开发效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00133 2026-06-02 cs.LG cs.ET 50%

World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications

世界模型:架构、方法论、推理范式与应用的全面综述

Arif Hassan Zidan, Yi Pan, Hanqi Jiang, Ruiyu Yan, Wei Ruan, Zihao Wu, Lifeng Chen, Weihang You, Xinliang Li, Bowen Chen, Huawen Hu, Peilong Wang, Sizhuang Liu, Jing Zhang, Siyuan Li, Zhengliang Liu, Yu Bao, Lin Zhao, Lichao Sun, Dajiang Zhu, Xiang Li, Jinglei Lv, Quanzheng Li, Wei Liu, Tianming Liu, Wei Zhang

机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) Tandon School of Engineering, New York University(纽约大学泰坦工程学院) Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00086 2026-06-02 cs.RO 50%

Whole-Body Inverse Kinematics with Graph Diffusion

基于图扩散的全身逆运动学

Helong Huang, Kai Tan, Feng Wen, Guowei Huang, Xingyue Quan

机构 * Large Model Algorithm Lab, Huawei(华为大模型算法实验室)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出GraphDiff-IK,一种结构感知的图扩散逆运动学框架,通过将机器人表示为运动学图并引入分层消息传递和躯干感知条件,实现了多分支机器人的准确稳定IK求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00470 2026-06-02 cs.RO 50%

LAP: Fast LAtent Diffusion Planner for Autonomous Driving

LAP:面向自动驾驶的快速潜在扩散规划器

Jinhao Zhang, Wenlong Xia, Zhexuan Zhou, Haoming Song, Youmin Gong, Jie Mei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出LAP框架,在VAE学习的潜在空间中进行规划,通过单步去噪实现高质量规划,在nuPlan基准上达到学习型规划方法的最优闭环性能,推理速度提升高达10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22965 2026-06-02 cs.RO 50%

Self-Imitated Diffusion Policy for Efficient and Robust Visual Navigation

自模仿扩散策略用于高效鲁棒的视觉导航

Runhua Zhang, Junyi Hou, Changxu Cheng, Qiyi Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi Technology Co., Ltd.(Uni-Ubi技术有限公司) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出自模仿扩散策略(SIDP),通过奖励引导的自模仿机制和课程学习范式,减少对大量采样和后过滤的依赖,实现高效鲁棒的视觉导航。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏