arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-16 至 2026-07-16 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2601.18798 2026-07-16 cs.MM cs.AI 版本更新 62%

ELF: A Family of Encoder-Free ECG-Language Models

ELF:无编码器心电图语言模型家族

William Han, Tony Chen, Chaojing Duan, Xiaoyu Song, Yihang Yao, Yuzhe Yang, Michael A. Rosenberg, Emerson Liu, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Allegheny Health Network(阿勒格尼医疗网络) University of California Los Angeles(加州大学洛杉矶分校) University of Colorado(科罗拉多大学) Allergy and Immunology(过敏与免疫学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 提出三种无编码器架构的ECG语言模型ELF,简化架构和训练流程,在两个数据集上达到或超越现有最优模型。

Comments 34 pages, 12 figures; Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13660 2026-07-16 cs.LG 新提交 50%

The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model

CLIP 潜在空间的超球面几何:一种语义混合模型

Zijie Yu, Gaowen Liu, Ramana Rao Kompella, Philip S. Yu, Yue Song

机构 * Tsinghua University(清华大学) Cisco Research(思科研究院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究 CLIP 潜在空间,提出基于冯·米塞斯-费舍尔分布混合的密度模型,用期望最大化算法学习,实现准确可解释的密度估计,改善长尾和分布外检测,建立几何一致的概率框架。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2607.13110 2026-07-16 cs.LG cs.AI eess.SP 新提交 83%

A Hybrid Mamba for Audio-Visual Navigation

用于视听导航的混合曼巴

Yi Wang, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究针对视听导航骨干网络多年未变的问题,提出Samba,用曼巴状态编码器取代传统GRU,构建音频曼巴编码器,实验表明其泛化性能出色,能提升导航成功率,以低成本解锁更强能力,为范式演进提供途径。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems and Man and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13952 2026-07-16 cs.SD cs.AI eess.AS 版本更新 81%

LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement

基于大语言模型的强化学习音频视觉语音增强

Chih-Ning Chen, Jen-Cheng Hou, Hsin-Min Wang, Shao-Yi Chien, Yu Tsao, Fan-Gang Zeng

机构 * Department of Electrical Engineering, National Taiwan University, Taiwan(台湾大学电子工程系) Research Center for Information Technology Innovation, Academia Sinica, Taiwan(中央研究院资讯科技创新研究中心) Center for Hearing Research, University of California Irvine, USA(加州大学尔湾分校听力研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出基于大语言模型的可解释奖励模型的音频视觉语音增强框架,利用语言模型生成语音增强的自然语言描述,并通过情感分析模型转换为评分作为PPO奖励,提升语音质量评估效果。

Comments 6 pages, 4 figures, Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13614 2026-07-16 cs.HC cs.MM 新提交 79%

VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement

VIP-MINGLE:用于群体语言交流中视频会议和面对面多模态交互的语料库

Andrew Chang, Abhinay K Bodi, Wenxin Deng, Junrui Huang, Venu G Kadamba, Sumanth B H Karanam, Dhiwahar A Kennady, David Poeppel, Dustin Freeman

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 介绍VIP-MINGLE多模态数据集,含59小时录音等,有两种环境下配对会话,涵盖多种数据。分析发现不同环境多模态行为分布有变化,该数据集是跨环境群体对话模型开发的关键资源。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06405 2026-07-16 cs.MM cs.SD 版本更新 79%

Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

在潜在空间中通过跨模态对齐实现精确的视频到音频生成

Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran, Long-Khanh Pham, Paarth Neekhara, Shehzeen Hussain, Van Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) NVIDIA Corporation(NVIDIA公司)

专题命中 音频语音多模态 :cross-modal(title);audio-visual(abstract);分类 cs.MM

AI总结 研究视频到音频生成问题,提出Flowley架构,结合视觉特征与文本提示,通过渐进软掩码交叉注意力实现视听同步,无额外计算成本,还提出SoundCap字幕,该方法在多个指标及零样本音频质量上达先进水平。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15886 2026-07-16 cs.CL 版本更新 79%

Linked Multi-Modal Data on Russian Domestic and Foreign Policy Speeches

连接多模型数据:俄罗斯国内与对外政策演讲

Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

机构 * University of Delaware, Department of Political Science & International Relations(德克萨斯大学,政治科学与国际关系系) University of Delaware, Masters of Science in Data Science Program(德克萨斯大学,数据科学硕士项目) University of Delaware, Department of Computer & Information Sciences(德克萨斯大学,计算机与信息科学系) University of Pennsylvania, Department of Political Science(宾夕法尼亚大学,政治科学系)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文介绍了一个连接多模态政治通讯的数据集,涵盖俄罗斯政府多个 decades 的官方演讲,提供俄语和英语文本、图像及注释,并通过 transformer 多模态模型进行主题标注,支持政治通讯的多模态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13669 2026-07-16 cs.CV 新提交 70%

Learning Speaker Identity Beyond Language and Modality Constraints: Insights from the POLY-SIM 2026 Challenge

超越语言和模态限制学习说话者身份:来自POLY-SIM 2026挑战赛的见解

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yassin Terraf, Yufang Hou, Elisabeth Andre, Khalid Mahmood Malik, Markus Schedl, Shah Nawaz

机构 * Institute of Computational Perception, Johannes Kepler University(约翰内斯·开普勒大学计算感知研究所) University of Michigan-Flint(密歇根大学弗林特分校) BDO DIGITAL Gmbh(BDO数字有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Fortemedia(富特媒体公司) College of Computing, Mohammed VI Polytechnic University(穆罕默德六世理工大学计算学院) IT:U Interdisciplinary Transformation University(IT:U跨学科转型大学) University of Augsburg(奥格斯堡大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 POLY-SIM 2026挑战赛旨在解决多模态说话者识别中语言和模态限制问题,针对实际应用中信息缺失、多语言等挑战,为比较解决方案提供标准化设置。

Comments Accepted at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16496 2026-07-16 eess.SY cs.AI cs.LG cs.SY 57%

Synergies between Federated Foundation Models and Smart Power Grids

联邦基础模型与智能电力电网的协同作用

Seyyedali Hosseinalipour, Shimiao Li, Adedoyin Inaolaji, Filippo Malandra, Luis Herrera, Nicholas Mastronarde

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出联邦基础模型与智能电网的协同方法,通过双向视角探讨M3T FedFMs在电网功能增强和模型设计优化中的应用。

Journal ref IEEE Electrification Magazine, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2607.13984 2026-07-16 stat.ML cs.LG 新提交 71%

Multimodal Empirical Bayes Variational Autoencoders for Joint Longitudinal and Time-to-Event Modeling

用于联合纵向和事件发生时间建模的多模态经验贝叶斯变分自编码器

Anders Sjöberg, Nils Olsson, Marcus Baaz, Mats Jirstrand

机构 * Fraunhofer-Chalmers Centre(弗劳恩霍夫-查尔默斯中心) Department of Electrical Engineering(电气工程系) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 视频多模态 :multimodal(title)

AI总结 研究针对纵向肿瘤测量等多源数据整合难的问题,扩展EB-VAE框架用于联合纵向和事件发生时间建模,比较不同解码器公式,纳入基因组协变量,实现肿瘤生长等联合预测,确定相关基因指标,提供了灵活概率框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23620 2026-07-16 cs.RO 版本更新 67%

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

移动-然后-操作:用于类人机器人操作的行为相位

Haoming Xu, Lei Lei, Jie Gu, Chu Tang, Jingmin Chen, Ruiqi Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)

专题命中 视频多模态 :MLLM(abstract,abstract_cn)

AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13421 2026-07-16 cs.CV cs.AI 新提交 62%

ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding

ScanFocus:一种用于时空视频定位的从粗到细框架

Kai Chen, Ming Dai, Wenxuan Cheng, Wankou Yang

机构 * Southeast University(东南大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究时空视频定位问题,提出ScanFocus从粗到细框架,利用统一融合编码器和轻量级模块生成粗略提议,再用语义引导时间聚合器恢复细节,实验表明该方法性能优于以往方法。

Comments this paper has already been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24602 2026-07-16 cs.CV cs.AI 版本更新 62%

Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory

纠正注意力分散引起的视觉模糊以减少幻觉:算法与理论

Quanjiang Li, Zhiming Liu, Wei Luo, Tingjin Luo, Chenping Hou

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文揭示多模态大语言模型中的物体幻觉与类人注意力分散现象相关,并提出一种无需额外训练的注意力聚焦方法(AFIP)通过跨头注意力增强和动态历史注意力强化来纠正视觉模糊,从而减少幻觉。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13802 2026-07-16 cs.CV 新提交 57%

RainDancer: RGB-Event Video Deraining with Rain-Oriented Spiking Dynamics

RainDancer:基于面向降雨的脉冲动力学的RGB-事件视频去雨

Kui Jiang, Runzhe Li, Zhaocheng Yu, Guanglu Sun, Junjun Jiang, Xianming Liu

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Science and Technology, Harbin University of Science and Technology(哈尔滨理工大学计算机科学与技术学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对视频去雨问题,提出RainDancer框架,基于分解-交互范式,在RGB和事件分支分别处理,分离雨和背景成分,进行组件级融合,并引入事件域监督,实验表明该方法在多方面性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交 57%

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13506 2026-07-16 cs.CV 新提交 57%

TRACE-PCa: Predicting Prostate Cancer Progression from Longitudinal MRI During Active Surveillance

TRACE-PCa:在主动监测期间从纵向MRI预测前列腺癌进展

Hongye Zeng, Shreeram Athreya, Dingyuan Dai, Steve Raman, Leonard Marks, William Speier, Corey Arnold

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究提出TRACE-PCa模型,无需病变分割,通过预训练3D MRI模型编码序列扫描,引入时间注意力门,融合临床变量,在纵向AS队列验证中表现出色,能减少不必要活检,有预测前列腺癌进展的潜力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13095 2026-07-16 cs.AR cs.AI 新提交 57%

Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit

MiMo-V2.5系列的全流程推理优化:将混合滑动窗口注意力效率推向极限

Xiaomi MiMo Team, Anqi Liu, Aoxin Ma, Bo Chen, Bo Yang, Chen Wang, Chen Zhang, Chengda Tang, Chengwei Wang, Chiheng Lou, Depeng Yan, Fuli Luo, Gang Wang, Hailin Zhang, Jiale Sun, Kang Zhou, Rui Huang, Shaohui Liu, Shen Huang, Shijie Cao, Shuaishuai Fan, Tianling Zhou, Xiangwei Deng, Xueyang Xie, Xuli Wang, Yingchun Lai, Yu Yang, Yuan Zhang, Zhen Tang, Zhonghua Deng, Zihan Jiang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对MiMo-V2.5模型家族,结合Hybrid SWA、MoE和多模态编码器进行全流程推理优化。通过多种策略优化KVCache系统,构建GCache并开发路由器,还优化多模态输入,构成首个有效涵盖该复合架构的大规模LLM生产服务系统。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27792 2026-07-16 cs.RO 版本更新 50%

Motubrain: An Advanced World Action Model for Robot Control

MotuBrain: 一种先进的世界动作模型用于机器人控制

Motubrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, Jun Zhu

机构 * MotuBrain Team(MotuBrain团队)

专题命中 视频多模态 :multimodal(abstract)

AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2607.13522 2026-07-16 cs.RO cs.CV 新提交 83%

Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots

开普勒编码器v0.1:迈向机器人的多模态嵌入模型

Ishneet Sukhvinder Singh, Dhanoosh Pooranakumaran, Alex Nguyen, Jia Qi Yip

机构 * Menlo Research(门洛研究公司)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究针对机器人理解自身状态问题,提出开普勒编码器v0.1,通过学习查询交叉注意力层融合多模态信息,经自监督训练。实验表明其仅视觉潜空间能恢复末端执行器状态,优于其他方法,单个编码器涵盖多个机器人,冻结潜空间有多种用途。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-07-16 cs.CV 版本更新 79%

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20683 2026-07-16 eess.IV cs.AI cs.CV eess.SP 62%

Global and Local Contrastive Learning for Joint Representations from Cardiac MRI and ECG

用于心脏MRI和ECG联合表示的全局和局部对比学习

Alexander Selivanov, Philip Müller, Özgün Turgut, Nil Stolt-Ansó, Daniel Rückert

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital, Munich, Germany(人工智能在医疗与医学中的研究中心,技术大学慕尼黑(TUM)及慕尼黑技术大学医院) School of Medicine, Klinikum rechts der Isar, TUM, Germany(医学院,右岸克里克医院,TUM,德国) Department of Computing, Imperial College London, UK(计算学院,伦敦帝国学院,英国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PTACL通过结合心脏MRI的时空信息提升ECG表示,实现患者级和时间级对比学习,提高心脏表型检索和功能参数预测的性能。

Comments accepted to MICCAI 2025 (Springer LNCS)

Journal ref Medical Image Computing and Computer Assisted Intervention - MICCAI 2025, Lecture Notes in Computer Science, vol. 15960, pp. 217-227, Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2606.05981 2026-07-16 cs.CV cs.LG 版本更新 89%

Inverting the Streaming-Diffusion Bottleneck: Video-Rate MLLM-Conditioned Edit Diffusion on a Consumer GPU

基于视觉感知的多模态大语言模型条件编辑扩散的视频率流式风格化:蒸馏UNet + MLLM文本编码器上的非对称批处理推理

Yoshiyuki Ootani

机构 * Independent researcher(独立研究员)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 针对蒸馏扩散模型中文本编码器成为瓶颈的问题,提出一种结合非对称CUDA流水线、编译友好的ControlNet-LLLite重构和周期性条件刷新调度的流式管线,在消费级GPU上实现视频率实时风格化编辑。

Comments 14 pages, 4 figures, 13 tables. Code, evaluation harness, and the released Temporal LLLite adapter weights are at https://github.com/otanl/dreamlite-stream (also mirrored to Hugging Face and Zenodo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 81%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14005 2026-07-16 cs.CV cs.RO 新提交 79%

M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming

M$^\text{4}$World:用于交互式对象操纵和分钟级流的多视图多模态驾驶世界模型

Ke Cheng, Hanqiao Ye, Lei Shi, Yahui Liu, Yunhan Shen, Jingtao Dong, Zhenke Wang, Wenxuan Ao, Weixiang Xu, Kaining Huang, Shuhan Shen

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有驾驶世界生成方法局限,提出M$^\text{4}$World模型,通过灵活接口与多阶段训练实现对象操纵及长时流稳定,引入后训练与生成模型,并用新管道评估,实验证明其在驾驶模拟中有高质量、可控性与稳定性。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13936 2026-07-16 cs.CV cs.LG physics.med-ph 新提交 79%

A novel unsupervised machine learning strategy to handle multimodal cardiac PET/MRI data

一种处理多模态心脏PET/MRI数据的新型无监督机器学习策略

Brunnhilde Ponsi, Thomas Carlier, Lara Marteau, Aurélien Monnet, Thomas Eugène, Jean-Michel Serfaty, Nicolas Piriou, Hatem Necib

机构 * Nantes Université, CHU Nantes(南特大学,南特大学医院中心) Siemens Healthineers France(西门子医疗法国公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对致心律失常性左心室心肌病诊断难题,利用PET/MRI数据,采用两步聚类等方法,对患者图像进行处理分析,生成健康报告,经交叉验证和在更大队列上验证,能准确识别异常,有助于表征心肌异质性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13188 2026-07-16 cs.LG 新提交 67%

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

并发图像理解与生成:自校正耦合马尔可夫跳跃过程

Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro Vélez, Amit Raj, Aaron Germuth, Thabo Beeler, Dimitris Samaras, Di Qiu

机构 * Stony Brook University(纽约州立大学石溪分校) Google DeepMind(谷歌DeepMind)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)

AI总结 研究针对人类认知中理解与生成的耦合循环,引入自校正耦合马尔可夫跳跃过程框架及$\texttt{CO}_\texttt{2}\texttt{Jump}$采样器,解决掩码扩散模型跨模态矛盾问题,创建多模态语料库,该方法在图像相关任务中性能优异,且性能随去噪步骤数提升。

Comments Project page: https://coupled-jump.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13927 2026-07-16 cs.CV 新提交 57%

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data

Cyclone:基于未配对驱动数据的循环一致天气编辑扩散模型

Thang-Anh-Quan Nguyen, Moussab Bennehar, Luis Guillermo Roldao Jimenez, Nathan Piasco, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond

机构 * Huawei Paris Research Center(华为巴黎研究中心) Gustave Eiffel University(古斯塔夫·埃菲尔大学) IGN-ENSG(法国国家地理信息与森林和环境信息研究所)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 针对自动驾驶系统在不同天气条件下可靠感知的挑战,提出Cyclone框架,基于潜在扩散,利用循环一致约束和图像-文本模型知识,无需配对数据生成多种天气条件,实验表明其输出更优,还可提炼为视频扩散模型。

Comments Project page: https://ntaquan0125.github.io/weather-cyclone/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 15 篇

2603.00546 2026-07-16 cs.AI cs.CV 版本更新 86%

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 83%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 83%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏