arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-23 至 2026-06-23 共收录 198 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 20 篇

2601.20904 2026-06-23 eess.IV cs.LG 版本更新 50%

ECGFlowCMR: Pretraining with ECG-Generated Cine CMR Helps Cardiac Disease Classification and Phenotype Prediction

ECGFlowCMR: 利用心电图生成电影心脏磁共振的预训练助力心脏病分类和表型预测

Xiaocheng Fang, Zhengyao Ding, Guangkun Nie, Jieyi Cai, Yujie Xiao, Bo Liu, Jiarui Jin, Haoyu Wang, Shun Huang, Ting Chen, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Polytechnic Institute of Zhejiang University, Zhejiang University(浙江大学 polytechnic 院) Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院计算技术研究所) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) Institute of Microelectronics, University of the Chinese Academy of Sciences(中国科学院微电子研究所) Department of Cardiology, Zhejiang University(浙江大学心内科部)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出ECGFlowCMR框架,通过相位感知掩码自编码器和解剖运动解耦流解决ECG与CMR的跨模态时序错配和解剖可观测性差距,生成逼真电影CMR序列,提升下游心脏病分类和表型预测性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 17 篇

2606.22565 2026-06-23 cs.CL cs.AI cs.CV 新提交 82%

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

轻看,重思:多模态思维链推理能做什么和不能做什么

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文系统探究多模态思维链推理在12个感知与推理任务上的表现,发现CoT对感知任务有副作用,但对数学、科学等多图像推理有效,且现有开源多模态推理模型提升有限,视觉推理仍是瓶颈。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13018 2026-06-23 cs.CY cs.AI cs.CV cs.SI 81%

GeoLocator: a location-integrated large multimodal model for inferring geo-privacy

GeoLocator:一种集成位置的大型多模态模型,用于推断地理隐私

Yifan Yang, Siqin Wang, Daoyang Li, Yixian Zhang, Shuju Sun, Junzhou He

机构 * Spatial Sciences Institute, University of Southern California(南加州大学空间科学研究所) Evolutionary Assets(进化资产) Viterbi school of engineering, University of Southern California(南加州大学维特比工程学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GeoLocator模型,用于推断输入影像和社会媒体中的地理位置信息,揭示了模型在地理隐私保护中的潜在风险。

Comments 16pages, 2 figures

Journal ref Appl. Sci. 14(16), 7091 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22195 2026-06-23 cs.CV eess.SP 新提交 79%

Resolving Multi-Target Association in OFDM-based ISAC via Vision-aided Multi-Modal Learning

基于OFDM的ISAC中通过视觉辅助多模态学习解决多目标关联

Meng Hua, Chenghong Bian, Deniz Gunduz

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院电气与电子工程系) Department of Electrical and Computer Engineering, Hong Kong University of Science and Technology(香港科技大学电气与计算机工程系)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出视觉辅助OFDM-ISAC框架,融合无线与视觉模态,通过深度联合源信道编码传输图像、YOLOv5检测目标特征,并利用多模态网络与延迟-多普勒图关联,解决多目标模糊和分辨率限制,实现16cm定位RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22046 2026-06-23 cs.RO 新提交 71%

A Multimodal Tiltwing Framework for Bioinspired Aerial Robots

一种用于仿生空中机器人的多模态倾转机翼框架

Krispin C. V. Broers, Sophie F. Armanini

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 其他多模态 :multimodal(title)

AI总结 提出一种可切换悬停、高速前飞和高效滑翔的多模态倾转机翼框架,通过双独立扑翼推力矢量控制增强机动性,并采用混合苏格兰轭扑动机构实现宽扑动角度以利用拍合效应。

Comments 18 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23356 2026-06-23 cs.CV cs.LG 新提交 70%

Changing Modalities: Adapting Remote Sensing Models to New Satellites and Sensors

改变模态:将遥感模型适应新卫星和传感器

Tim G. Zhou, Anthony Fuller, Geoff Pleiss, Evan Shelhamer

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Carleton University(卡尔顿大学)

专题命中 其他多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 针对遥感模型在新卫星和传感器上的部署问题,提出DeluluNet架构,通过模态幻觉实现模态迁移、添加和子集三种场景下的模型适应,无需重新标注。

Comments 17 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00143 2026-06-23 cs.LG cs.CV 版本更新 70%

Is Oracle Pruning the True Oracle?

Oracle剪枝真的是真正的Oracle吗?

Sicheng Feng, Keda Tao, Huan Wang

机构 * Westlake University(西湖大学) Nankai University(南开大学) ENCODE Lab, Westlake University(西湖大学ENCODE实验室)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过大规模实验(37K模型)发现,对于中等规模以上的深度学习模型,Oracle剪枝选择的权重在重训练后性能与重训练前几乎无关,质疑了Oracle剪枝作为剪枝方法基础的有效性。

Comments TMLR, Webpage: https://fscdc.github.io/Oracle-Pruning-Sanity-Check/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22101 2026-06-23 cs.LG cs.CV 新提交 57%

OphthaDT: Generative Digital Twins for Forecasting Visual Acuity Trajectories in Ophthalmology

OphthaDT:用于眼科视力轨迹预测的生成式数字孪生

Pietro Belligoli, Nikita Makarov, Sayedali Shetab Boushehri, Fabian Schmich, Raul Rodriguez-Esteban, Michael Menden

机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(计算科学卓越中心,罗氏,彭茨贝格,德国) Computational Health Center, Helmholtz Munich, Munich, Germany(计算健康中心,亥姆霍兹慕尼黑,慕尼黑,德国) Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(生物学系,路德维希-马克西米利安-慕尼黑大学,慕尼黑,德国) Computational Sciences Center of Excellence, Roche, Basel, Switzerland(计算科学卓越中心,罗氏,巴塞尔,瑞士) Department of Biochemistry and Pharmacology, Bio21 Molecular Science and Biotechnology Institute, The University of Melbourne, Parkville, Australia(生物化学与药理学系,Bio21分子科学与生物技术研究所,墨尔本大学,帕克维尔,澳大利亚) Technical University of Munich, Munich, Germany(慕尼黑工业大学,慕尼黑,德国)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于LLM的数字孪生OphthaDT,通过序列化纵向患者历史预测最佳矫正视力,在nAMD和DME数据集上分别降低MAE 6.0%和2.6-6.9%,尤其擅长处理高变异性轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20609 2026-06-23 cs.CY cs.AI 新提交 57%

Understanding Privacy by Formalizing It

通过形式化理解隐私

Réka Markovich, Truls Pedersen, Marija Slavkovik

机构 * University of Luxembourg(卢森堡大学) University of Bergen(卑尔根大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文使用多模态逻辑形式化不同隐私理论及其原则,探讨作为认知权利的隐私权在规范位置理论中的含义。

Comments Published in Proceedings of the 17th International Conference on Juris-informatics, JURISIN 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.06836 2026-06-23 cs.CV 57%

Using Deep Convolutional Networks for Gesture Recognition in American Sign Language

使用深度卷积网络进行美国手语手势识别

Vivek Bheda, Nelu Radpour

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用深度卷积网络对美国手语中的字母和数字图像进行分类,探索神经网络在手语识别中的应用。

Comments 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21390 2026-06-23 cs.CY cs.GT 新提交 50%

Distance-based subsidy rate design to incentivize ride-hail access to advanced air mobility hubs

基于距离的补贴率设计以激励网约车接入先进空中交通枢纽

Zhenglei Ji, Hai Yang, Joseph Y. J. Chow

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出基于距离的补贴率设计,激励网约车接入先进空中交通枢纽,结合运营商盈利与乘客路径选择,以纽约机场为例验证了补贴对客流和利润的影响。

Journal ref Journal of Air Transport Management 137 (2026), 103090

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21220 2026-06-23 cs.RO 新提交 50%

A UAV-Mounted Sensor Network for Close-Range Inspection of Wind Turbine Rotor Blades

一种用于风力涡轮机转子叶片近距离检测的无人机载传感器网络

Jost Wittmann, Ahmed Abdullahi Hassan, Nils Kömpe, Andreas Nüchter

机构 * Department of Computer Science XVII: Robotics Julius-Maximilians Universit\" a t W\" u rzburg W\" u rzburg, Germany Research Elektronik-Entwicklung Oktopus GmbH Kiel, Germany

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出一种无人机载多模态传感器网络,结合RGB相机、热红外相机和3D扫描仪,通过共校准实现几何、颜色和热数据的空间叠加,解决近距离检测中的平台运动、大视场和毫米级精度问题。

Comments The Aerial Inspection for Marine Infrastructures (AIMI) workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21154 2026-06-23 cs.CY cs.SY eess.SY stat.AP 新提交 50%

Virginia Tech Transportation Safety Index (VTTSI)

弗吉尼亚理工大学交通安全指数 (VTTSI)

Jason Cusati, Cheng-Shun Chuang

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出VTTSI实时云原生框架,融合经验贝叶斯、速度冲突行为提升因子和CRITIC加权多准则决策模块,每15分钟生成0-100分安全评分,实现长期碰撞风险与短期行为动态的集成监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23059 2026-06-23 physics.flu-dyn math.DS 新提交 50%

Non-normal weakly nonlinear analysis: asymptotic consistency and non-universality

非正规弱非线性分析:渐近一致性与非普适性

Matthew McCormack, Gregory P. Chini, Rich R. Kerswell

专题命中 其他多模态 :multi-modal(abstract)

AI总结 针对线性稳定但非正规的系统,提出一种弱非线性理论,通过定义小参数确保渐近一致性,揭示非正规性驱动的多模态多频率响应,并捕获亚临界转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21858 2026-06-23 physics.soc-ph cs.CY 新提交 50%

Perceiving exposure segregation with open urban imagery

利用开放城市影像感知暴露隔离

Yunke Zhang, Ruolong Ma, Xin Zhang, Yu Shang, Fengli Xu, Tong Xia, Yong Li

专题命中 其他多模态 :multi-modal(abstract)

AI总结 提出VISAGE框架,利用卫星和街景图像识别建筑环境特征(如防御性建筑、混合功能区)与社会经济隔离的关联,解释流动性隔离模式(Pearson r=0.770)。

Comments 34 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22929 2026-06-23 stat.CO astro-ph.IM 新提交 50%

Mode Collapse in Nested Sampling

嵌套采样中的模式坍缩

Johannes Buchner

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文通过遗传学中的中性Moran过程,将嵌套采样中模式意外丢失建模为活点占用的对称随机游走,并给出了避免模式消亡的最小活点数规则。

Comments submitted to Statistics & Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02762 2026-06-23 gr-qc 版本更新 50%

Adding higher-order spherical harmonics in non-spinning eccentric binary black hole merger waveform models

在非自旋偏心双黑洞并合波形模型中添加高阶球谐函数

Tousif Islam, Gaurav Khanna, Scott E. Field

专题命中 其他多模态 :multi-modal(abstract)

AI总结 利用gwNRHME框架将多模态准圆形波形模型与四极偏心波形模型结合,构建多模态非自旋偏心模型,并通过数值相对论模拟验证其准确性。

Comments 14 pages, 11 figures, framework is available at https://github.com/tousifislam/gwModels

Journal ref Phys. Rev. D 111, 124023 - Published 17 June, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14654 2026-06-23 gr-qc 版本更新 50%

Universal phenomenological relations between spherical harmonic modes in non-precessing eccentric binary black hole merger waveforms

非进动偏心双黑洞合并波形中球谐模态之间的普适唯象关系

Tousif Islam, Tejaswi Venumadhav

专题命中 其他多模态 :multi-modal(abstract)

AI总结 基于数值相对论模拟,发现非进动偏心双黑洞合并中不同球谐模态的振幅和频率调制由单一时间序列决定,并建立框架gwNRXHME利用四极偏心波形和多模态准环形非进动波形计算多模态偏心波形。

Comments 9 pages, 6 figures, framework is available at https://github.com/tousifislam/gwModels

Journal ref Phys. Rev. D 111, L081503, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏