arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-21 至 2026-08-21 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2506.18779 2026-08-21 cs.RO 版本更新 78%

DiffDef: A Diffusion Model for Generating Multimodal Goal Shapes From Demonstrations for Deformable Object Manipulation

DiffDef:一种用于从演示中生成可变形物体操纵的多模态目标形状的扩散模型

Bao Thach, Tanner Watts, Siyeon Kim, Britton Jordan, Mohanraj Shanthi, Shing-Hei Ho, James M. Ferguson, Tucker Hermans, Alan Kuntz

机构 * Robotics Center and Kahlert School of Computing, University of Utah(大学计算机学院和机器人中心,犹他大学) NVIDIA Corporation(英伟达公司)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对现有可变形物体操纵方法依赖不切实际的目标获取方式、无法处理多模态目标的问题,提出DiffDef扩散模型,学习可行目标形状分布,在仿真和两种物理机器人平台上验证其可提升任务性能。

Comments Published and presented at ICRA 2026. 8 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20331 2026-08-21 cs.CL cs.AI cs.CV 新提交 67%

G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

G-CARL:面向患者的医学报告解读的基于 grounded 核对清单对齐的奖励学习

Shiao Xie, Siyu Chen, Jianwei Lv, Bo Yuan, Yujin Wang, Xiandong Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文针对现有医学视觉-语言任务无法兼顾医学事实性与患者语境沟通的问题,提出PMRI任务及G-CARL框架,构建MMedReport基准,实验证实其解读更贴合患者需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00140 2026-08-21 cs.LG cs.AI 版本更新 57%

GEM: Geometric Erasure by Contrastive Velocity Matching in Rectified Flows

整流流中对比速度匹配的几何擦除

Jonas Henry Grebe, Tobias Braun, Anna Rohrbach, Marcus Rohrbach

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出GEM框架,通过对比速度匹配实现整流流模型中的概念擦除,结合生成流网络与教师引导的流匹配,有效抑制有害内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05853 2026-08-21 cs.CV 版本更新 57%

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击

Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18400 2026-08-21 eess.IV cs.CV 版本更新 57%

Exploiting Completeness Perception with Diffusion Transformer for Unified 3D MRI Synthesis

利用扩散变换器的完整性感知实现统一的3D MRI合成

Junkai Liu, Nay Aung, Theodoros N. Arvanitis, Joao A. C. Lima, Steffen E. Petersen, Le Zhang

机构 * School of Engineering, University of Birmingham, UK(伯明翰大学工程学院) William Harvey Research Institute, Queen Mary University London, UK(女王玛丽大学伦敦威廉·哈里维研究所) Barts Heart Centre, St Bartholomew’s Hospital, Barts Health NHS Trust, UK(巴特勒心脏中心,圣巴塞洛缪医院,巴特勒健康 NHS信托) Division of Cardiology, Johns Hopkins University School of Medicine, US(约翰霍普金斯大学医学院心脏病科)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CoPeDiT模型,通过完整性感知机制提升3D MRI合成的语义一致性与鲁棒性。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15648 2026-08-21 cs.LG cs.CE cs.CV 版本更新 57%

Guided Diffusion by Optimized Loss Functions on Relaxed Parameters for Inverse Material Design

通过放松参数优化损失函数引导扩散用于逆材料设计

Jens U. Kreber, Christian Weißenfels, Joerg Stueckler

机构 * Intelligent Perception in Technical Systems Group, University of Augsburg, Germany(技术系统智能感知组,乌尔姆大学,德国) Faculty of Mathematics, Natural Science and Engineering, University of Augsburg, Germany(数学、自然科学与工程学院,乌尔姆大学,德国) Centre for Advanced Analytics and Predictive Sciences, University of Augsburg, Germany(高级分析与预测科学中心,乌尔姆大学,德国)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 通过优化损失函数引导扩散模型,用于逆材料设计,实现高效且多样化的设计生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19590 2026-08-21 eess.IV 新提交 50%

Loss-Resilient Semantic Communication over Packet-Loss Networks at Extreme-Low Bandwidth

极端低带宽丢包网络下的抗丢包语义通信

Shengshi Yao, Jincheng Dai, Sixian Wang, Guo Lu, Kai Niu, Wenjun Xu, Wenjun Zhang, Ping Zhang

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对极端低带宽丢包网络的语义通信问题,提出ResiGLC框架,结合语言模型上下文预测与掩码学习,通过渐进式解码提升抗丢包性,可在低带宽下改善通信的感知质量。

Comments Accepted to appear in IEEE TMC. 14 pages, 15 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19809 2026-08-21 cs.SI 新提交 50%

From Latent Influence to Language: Diffusion-Oriented Content Generation via Audience-Susceptible Features

从潜在影响到语言:面向扩散的受众易感特征内容生成

Jiaying Lei, Shengqi Dang, Runqian Bai, Ziqing Qian, Nan Cao

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对现有面向扩散的内容生成方法难以转化扩散影响信号的问题,提出三阶段框架DOCG-AS,实验显示其在预测扩散影响上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19709 2026-08-21 cs.NI 新提交 50%

RFWM: Physics-Guided World Model for Dynamic Wireless Radiance Field Generation

RFWM:用于生成动态无线辐射场的物理引导世界模型

Zijiu Yang, Qianqian Yang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本研究针对动态未知环境下RF场建模泛化难的问题,提出物理引导的RF世界模型RFWM,采用两阶段训练策略,在新构建的基准上实现了优于现有最优方法的RF场生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22950 2026-08-21 stat.ML cs.LG math.ST stat.ME 版本更新 50%

Diffusion-based Denoising Beats Vanilla Score Matching in Parameter Estimation: A Theoretical Explanation

基于扩散的去噪在参数估计中优于普通得分匹配:一个理论解释

Benedikt Lütke Schwienhorst, Nadja Klein, Johannes Lederer

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过理论分析证明,对于具有分离模态的多峰分布,基于扩散的去噪得分匹配估计器(DDSME)相比普通得分匹配估计器(SME)具有更优的误差界,并解释了扩散方法优越性的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏