arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-14 至 2026-04-14 共收录 24 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 24 篇

2604.10233 2026-04-14 cs.CV cs.AI 86%

Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis

将2D多模态大语言模型适应于3DCT图像分析

Yang Yu, Dunyuan Xu, Yaoqian Li, Xiaomeng Li, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子及计算机工程学系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所) Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);MLLM(abstract);cross-modal(abstract)

AI总结 本文提出将2D多模态大语言模型适应于3DCT图像分析,设计Text-Guided Hierarchical MoE框架,采用两阶段训练策略提升医学报告生成和视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11097 2026-04-14 cs.CV 83%

CDPR: Cross-modal Diffusion with Polarization for Reliable Monocular Depth Estimation

CDPR:基于极化交叉模态扩散的可靠单目深度估计

Rongjia Yu, Tong Jia, Hao Wang, Xiaofang Li, Xiao Yang, Zinuo Zhang, Cuiwei Liu

专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出CDPR框架,通过融合RGB和极化图像信息提升单目深度估计鲁棒性,尤其在复杂场景中表现优异。

Comments preprint version of IEEE TMM 2026 Regular Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04812 2026-04-14 cs.RO cs.AI cs.LG 83%

Multimodal Diffusion Forcing for Forceful Manipulation

多模态扩散强迫用于强力操控

Zixuan Huang, Huaidian Hou, Dmitry Berenson

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出多模态扩散强迫框架,通过随机部分遮蔽和扩散模型重建轨迹,学习机器人多模态轨迹,提升对动作与力信号的依赖性,实验证明其在模拟和现实环境中的强性能和鲁棒性。

Comments Project website: https://unified-df.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15420 2026-04-14 cs.LG 82%

FlowBind: Efficient Any-to-Any Generation with Bidirectional Flows

FlowBind: 任意到任意生成的高效方法

Yeonwoo Cha, Semin Kim, Jinhyeon Kwon, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 多模态生成 :any-to-any(title,abstract);cross-modal(abstract)

AI总结 本文提出FlowBind框架,通过共享潜在空间和双向流实现高效任意模态生成,减少数据和计算成本,实验显示生成质量与传统方法相当。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10949 2026-04-14 cs.CV cs.AI 81%

Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

伪统一:熵探测揭示统一多模态模型中分歧的信息模式

Songlin Yang, Xianghao Kong, Anyi Rao

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究揭示统一多模态模型中伪统一现象的根源,通过信息论方法分析输入编码和输出生成,发现模态不对称编码和响应模式分裂是导致分歧的主要原因,强调信息流一致性对真实多模态协同的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11334 2026-04-14 cs.AI 79%

Dynamic Summary Generation for Interpretable Multimodal Depression Detection

动态摘要生成用于可解释的多模态抑郁症检测

Shiyu Teng, Jiaqing Liu, Hao Sun, Yu Li, Shurong Chai, Ruibo Hou, Tomoko Tateyama, Lanfen Lin, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Faculty of Engineering, University of the Ryukyus(琉球大学工学部)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种粗到细的多阶段框架,利用大语言模型实现准确且可解释的多模态抑郁症检测,通过生成临床摘要指导多模态融合模块,提升诊断准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM 79%

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

专题命中 多模态生成 :MLLM(title);分类 cs.CV、cs.CL、cs.AI

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10084 2026-04-14 cs.CV 79%

Active Diffusion Matching: Score-based Iterative Alignment of Cross-Modal Retinal Images

主动扩散匹配:基于分数模型的跨模态视网膜图像迭代对齐

Kanggeon Lee, Su Jeong Song, Soochahn Lee, Kyoung Mu Lee

机构 * ASRI, Dept. of ECE, Seoul National University(首尔大学电子与计算机工程系ASRI) Dept. of Ophthalmology, Kangbuk Samsung Hospital, Sungkyunkwan University(成均馆大学三星首尔医院眼科) School of Electrical Engineering, Kookmin University(国民大学电气工程学院)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出主动扩散匹配方法,通过迭代 Langevin 马尔可夫链联合估计全局和局部变换,实现视网膜图像的跨模态对齐,实验表明其在对齐精度上达到最先进的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09999 2026-04-14 cs.CV 79%

GIF: A Conditional Multimodal Generative Framework for IR Drop Imaging in Chip Layouts

GIF:一种用于芯片布局中IR降成像的条件多模生成框架

Kiran Thorat, Nicole Meng, Mostafa Karami, Caiwen Ding, Yingjie Lao, Zhijie Jerry Shi

机构 * University of Connecticut(康涅狄格大学) Tufts University(塔夫茨大学) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GIF框架,通过融合几何和拓扑信息生成高质量IR降图像,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14477 2026-04-14 cs.CV cs.AI eess.IV 76%

XD-MAP: Cross-Modal Domain Adaptation via Semantic Parametric Maps for Scalable Training Data Generation

XD-MAP:通过语义参数地图实现跨模态领域适应以实现可扩展的训练数据生成

Frank Bieder, Hendrik Königshof, Haohao Hu, Fabian Immel, Yinzhe Shen, Jan-Hendrik Pauls, Christoph Stiller

机构 * KIT Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心)

专题命中 多模态生成 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出XD-MAP,通过语义参数地图将图像数据集中的传感器特定知识转移到LiDAR领域,无需手动标注即可提升多模态领域适应性能。

Comments 10 pages, 7 figures, 3 tables, accepted at CVPRW

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10172 2026-04-14 eess.SP 67%

Wearable AI in the Era of Large Sensor Models

在大规模传感器模型时代的人工智能可穿戴技术

Yize Cai, Baoshen Guo, Guobin Shen, Zhiqing Hong

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文探讨了大规模传感器模型在可穿戴AI中的应用,提出通过整合多模态数据提升系统泛化能力,并讨论了无语言能力和有语言能力的两种模型方向。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17596 2026-04-14 cs.CV cs.AI cs.LG cs.RO 62%

PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving

PRIX:从原始像素学习计划以实现端到端自动驾驶

Maciej K. Wozniak, Lianhang Liu, Yixi Cai, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) SCANIA(斯堪尼亚)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PRIX通过使用仅需摄像头数据的端到端驾驶架构,无需BEV表示和LiDAR,直接从原始像素预测安全轨迹,实现了高效且实用的自动驾驶解决方案。

Comments Accepted for Robotics and Automation Letters (RA-L) and will be presented at iROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09700 2026-04-14 cs.CV cs.AI 62%

Attention-Guided Flow-Matching for Sparse 3D Geological Generation

基于注意力的流匹配用于稀疏3D地质生成

Zhixiang Lu, Mengqi Han, Peixin Guo, Tianming Bai, Jionglong Su, Fei Fang, Sifan Song

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-GeoFlow框架,通过将离散类别生成转化为连续向量场回归,解决稀疏多模态地质建模中的非线性拓扑断点问题,实现稳定确定性最优传输路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11792 2026-04-14 cs.CV 57%

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

LottieGPT:为自回归生成设计向量动画的标记化

Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。

Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04849 2026-04-14 physics.chem-ph cs.AI cs.MA 57%

El Agente Estructural: An Artificially Intelligent Molecular Editor

结构代理:一种人工智能分子编辑器

Changhyeok Choi, Yunheng Zou, Marcel Müller, Han Hao, Yeonghun Kang, Juan B. Pérez-Sánchez, Ignacio Gustin, Hanyong Xu, Andrew Wang, Mohammad Ghazi Vakili, Chris Crebolder, Alán Aspuru-Guzik, Varinia Bernales

机构 * University of Toronto(多伦多大学) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) NVIDIA(英伟达)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出El Agente Estructural,一种多模态、自然语言驱动的几何生成与操控代理,用于自主化学和分子建模。该代理通过整合领域知识工具和视觉语言模型,实现对分子结构的精确操控,无需重建核心分子框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11005 2026-04-14 cs.AI 57%

Diffusion-CAM: Faithful Visual Explanations for dMLLMs

扩散-CAM:面向dMLLMs的可信视觉解释

Haomin Zuo, Yidi Li, Luoxiao Yang, Xiaofeng Zhang

机构 * Department of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知系) Sun Yat-sen University(中山大学) Northwestern University(西北大学) Technion - Israel Institute of Technology(以色列理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Diffusion-CAM,一种专为扩散多模态大语言模型设计的可解释性方法,通过可微探针获取中间表示,捕捉潜在特征及其类别梯度,解决空间模糊和图像内部混淆问题,提升定位准确性和视觉保真度。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-04-14 cs.AI 57%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20725 2026-04-14 cs.CV 57%

Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation

Premier: 基于可学习用户嵌入的个性化偏好调节在文本到图像生成中

Zihao Wang, Yuxiang Wei, Xinpeng Zhou, Tianyu Zhang, Tao Liang, Yalong Bai, Hongzhi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Duxiaoman(度小满)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Premier通过可学习用户嵌入和偏好适配器实现个性化图像生成,引入分散损失提升用户偏好区分度,实验显示其在偏好对齐和文本一致性上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10085 2026-04-14 cs.CV 57%

Particle Diffusion Matching: Random Walk Correspondence Search for the Alignment of Standard and Ultra-Widefield Fundus Images

粒子扩散匹配:用于标准和超宽场视网膜图像对齐的随机游走对应搜索

Kanggeon Lee, Soochahn Lee, Kyoung Mu Lee

机构 * ASRI, Dept. of ECE, Seoul National University(首尔大学电气与计算机工程系ASRI) School of Electrical Engineering, Kookmin University(国民大学电气工程学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种稳健的对齐技术,通过扩散模型引导的迭代随机游走对应搜索(RWCS)实现标准视网膜图像(SFIs)和超宽场视网膜图像(UWFIs)的对齐,解决了尺度、外观差异和特征稀少的问题,展示了在多个视网膜图像对齐基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07512 2026-04-14 cs.AI cs.LG 57%

Rhizome OS-1: Rhizome's Semi-Autonomous Operating System for Small Molecule Drug Discovery

Rhizome OS-1:Rhizome的半自主操作系统用于小分子药物发现

Yiwen Wang, Gregory Sinenka, Xhuliano Brace

机构 * Rhizome Research Inc.

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 Rhizome OS-1通过多模态AI代理实现小分子药物发现的半自动化,结合计算化学、医药化学和专利代理功能,生成新颖分子并评估专利自由度,利用图扩散模型生成化学物质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06313 2026-04-14 cs.CV cs.CY 57%

Text-to-Image Models and Their Representation of People from Different Nationalities Engaging in Activities

文本到图像模型及其对不同民族参与活动的人的表示

Abdulkareem Alsudais

机构 * Prince Sattam bin Abdulaziz University(沙特王子萨塔姆·本·阿卜杜勒阿齐兹大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 研究分析了DALL-E 3和Gemini 3 Pro Preview在生成日常活动图像时对206个民族的表示,发现传统服饰在某些活动中不适用,且与地区和收入组相关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11793 2026-04-14 cs.RO 50%

Disentangled Point Diffusion for Precise Object Placement

解耦点扩散用于精确物体放置

Lyuxing He, Eric Cai, Shobhit Aggarwal, Jianjun Wang, David Held

机构 * Carnegie Mellon University(卡内基梅隆大学) ABB Inc.(ABB公司)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出TAX-DPD框架,通过解耦点扩散模型实现高精度物体放置,提升多模态覆盖与几何变化适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10566 2026-04-14 cs.SI cs.CY 50%

Israel-Hamas War on X: A Case Study of Coordinated Campaigns and Information Integrity

X平台上的以色列-哈马斯战争:协调行动与信息完整性案例研究

Tuğrulcan Elmas, Filipi Nascimento Silva, Manita Pote, Priyanka Dey, Keng-Chi Chang, Jinyi Ye, Luca Luceri, Cody Buntain, Emilio Ferrara, Alessandro Flammini, Fil Menczer

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过分析2023年以色列-哈马斯战争期间的推文,研究协调行动与信息完整性之间的关系,发现协调行动主要依赖低复杂度策略,且信息完整性、毒性及情绪信号互不相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09817 2026-04-14 cs.LG 50%

NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity

NeuroFlow:迈向从神经活动统一的视觉编码和解码

Weijian Mai, Mu Nan, Yu Zhu, Jiahang Cao, Rui Zhang, Yuqin Dai, Chunfeng Song, Andrew F. Luo, Jiamin Wu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学) Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 NeuroFlow首次提出统一框架,通过单一流模型联合建模视觉和神经活动的编码解码,提升效率与一致性。

Comments Accepted to CVPR 2026. Project page: https://michaelmaiii.github.io/NeuroFlow-S

详情

展开后加载摘要…

URL PDF HTML 收藏