arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-26 至 2026-06-26 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 14 篇

2606.18974 2026-06-26 cs.CV 新提交 86%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(title);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22284 2026-06-26 cs.LG 版本更新 85%

BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型

Mingi Kim, Yongjun Kim, Jungwoo Kang, Hyungki Kim

机构 * Chungnam National University(全南国立大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07295 2026-06-26 cs.CV cs.AI cs.LG 版本更新 84%

Reconstruction Alignment Improves Unified Multimodal Models

重建对齐改进统一多模态模型

Ji Xie, Trevor Darrell, Luke Zettlemoyer, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。

Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18714 2026-06-26 cs.CV cs.AI 版本更新 81%

Semantic Generative Tuning for Unified Multimodal Models

语义生成微调用于统一多模态模型

Songsong Yu, Yuxin Chen, Ying Shan, Yanwei Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent ARCLab(腾讯ARCLab)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 79%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26631 2026-06-26 cs.CV 新提交 79%

Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

位置重绑定缓存复用:交错多模态推理中无重放的视觉重访

Mengzhao Wang, Yanli Ji, Wangmeng Zuo, Peng Ye, Chongjun Tu

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Harbin Institute of Technology (HIT)(哈尔滨工业大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出位置重绑定缓存复用(PRCR)框架,通过重绑历史视觉KV缓存的位置坐标,实现无重放的高效视觉重访,在多个多模态推理基准上平均准确率提升5%,计算量减少数万倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15283 2026-06-26 cs.CV 版本更新 74%

TF-TI2I: Training-Free Text-and-Image-to-Image Generation via Multi-Modal Implicit-Context Learning in Text-to-Image Models

TF-TI2I:通过文本到图像模型中的多模态隐式上下文学习实现无需训练的文本与图像到图像生成

Teng-Fang Hsiao, Bo-Kai Ruan, Yi-Lun Wu, Tzu-Ling Lin, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

AI总结 提出无需训练的TF-TI2I方法,利用MM-DiT架构中文本标记隐式学习视觉信息,通过参考上下文掩码和胜者全取模块实现选择性信息共享,并引入FG-TI2I基准,在复杂图像生成任务中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27147 2026-06-26 cs.CV cs.AI 新提交 73%

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

安全自回归图像生成与迭代自改进码本

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。

Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27123 2026-06-26 cs.RO cs.CV 新提交 57%

Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation

基于提议条件的闭环交通场景生成潜扩散模型

Shubham Vaijanath Phoolari, Aleyna Kara, Christoph Lauer, Steven Peters

机构 * CARIAD SE Technical University of Munich(慕尼黑工业大学) Institute of Automotive Engineering (FZD), TU Darmstadt(达姆施塔特工业大学汽车工程研究所(FZD))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出一种基于实例场景上下文和多模态提议先验的扩散框架,通过紧凑动作潜表示和提议初始化提升采样效率,实现闭环交通场景的逼真、安全且可控生成。

Comments Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26874 2026-06-26 cs.AI 新提交 57%

TAVR-VLM: Risk-Conditioned Causal Grounding for Hallucination-Resistant Report Generation

TAVR-VLM:面向抗幻觉报告生成的风险条件因果基础

Zhixiang Lu, Xiwei Liu, Sifan Song, Changkai Ji, Anh Nguyen, Jionglong Su, Imran Razzak, Jinfeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学) University of Liverpool(利物浦大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出TAVR-VLM框架,通过风险条件因果注意力(R-CGA)建立“风险→区域→词”的结构化基础路径,在TAVR规划中减少诊断幻觉,实现新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21581 2026-06-26 cs.RO cs.CV 版本更新 57%

CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving

CogAD: 认知层次引导的端到端自动驾驶

Zhennan Wang, Jianing Teng, Canqun Xiang, Kangliang Chen, Xing Pan, Lu Deng, Weihao Gu

机构 * HAOMO.AI Technology Co., Ltd(HAOMO.AI技术有限公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出CogAD模型,通过全局到局部的层次感知和意图条件多模态轨迹生成,模拟人类驾驶员的认知层次机制,在nuScenes和Bench2Drive上实现端到端规划的最优性能,尤其在长尾场景和复杂真实驾驶条件下表现优异。

Comments CVPR2026 Workshop on Autonomous Driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27367 2026-06-26 physics.optics cond-mat.mes-hall physics.chem-ph 新提交 50%

Accessing both electrochemical SEIRA and SERS with ultrasensitive metamaterials for enhanced molecular identification

利用超灵敏超材料同时实现电化学SEIRA和SERS以增强分子识别

Nicolas Spiesshofer, Tabitha Jones, Sarah May Sibug Torres, Zoltan Sztranyovszky, Caleb Todd, Shijie Zhu, Yeeun Roh, Rakesh Arul, Alexander Squires, Ivana Qianqi Lin, Angela Demtriadou, David O. Scanlon, Viv Lindo, Jeremy J. Baumberg

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出一种电化学可清洁的超材料,实现流动中实时联合SEIRA和SERS,通过纳米间隙折射率变化(1400 nm/RIU)实现超灵敏检测,并追踪分子电化学转化和对称性破缺。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11656 2026-06-26 cs.GR 新提交 50%

MoGeFlow: Flowing Through Motion Codebook Geometry for Text-to-Motion Generation

MoGeFlow: 通过运动码本几何流动实现文本到运动生成

Pengcheng Fang, Tengjiao Sun, Xiaoyu Zhan, Xiaohao Cai, Dongjie Fu

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出MoGeFlow模型,利用运动码本的几何结构,通过连续流生成运动码帧,替代离散码预测,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09832 2026-06-26 astro-ph.GA astro-ph.CO astro-ph.IM 版本更新 50%

LITMUS: Bayesian Lag Recovery in Reverberation Mapping with Fast Differentiable Models

LITMUS:基于快速可微模型的贝叶斯滞后恢复在回波测绘中的应用

Hugh McDougall, Tamara M. Davis, Benjamin J. S. Pope

专题命中 多模态生成 :multimodal(abstract)

AI总结 LITMUS利用快速可微模型实现回波测绘中滞后恢复,通过处理季节观测窗口的多模态混叠问题,提高滞后验证的准确性,显著优于现有方法JAVELIN。

Comments 17 Pages, 10 Figures

Journal ref pasa.2026.10149

详情

展开后加载摘要…

URL PDF HTML 收藏