arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-23 至 2026-06-23 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 19 篇

2606.23643 2026-06-23 cs.AI 新提交 83%

TailorMind: Towards Preference-Aligned Multimodal Content Generation

TailorMind: 面向偏好对齐的多模态内容生成

Hengji Zhou, Ye Liu, Yufeng Liu, Si Wu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出TailorMind框架,通过超图协同过滤和文本梯度下降建模用户偏好,结合检索增强风格控制和跨模态一致性反射,实现无候选池的个性化多模态内容生成,在TailorBench上优于基线。

Comments 18 pages, 13 figures, 6 tables. Code available at https://github.com/iLearn-Lab/TailorMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18123 2026-06-23 cs.CV 新提交 83%

Predicting Immune Biomarkers with MultiModal Mixture-of-Expert Pathology Foundation Models Empowers Precision Oncology

使用多模态混合专家病理基础模型预测免疫生物标志物,赋能精准肿瘤学

Tianyu Liu, Ziqing Wang, Zhaokang Liang, Tong Ding, Peter Humphrey, Lorraine Colón-Cartagena, Emily Ling-Lin Pai, Kenneth Tou En Chang, Mohamed Kahila, Jonathan Chong Kai Liew, Tinglin Huang, Rex Ying, Kaize Ding, Faisal Mahmood, Wengong Jin

机构 * Program of Computational Biology and Bioinforamtics, Yale University(耶鲁大学计算生物学与生物信息学项目) Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所) Department of Statistics and Data Science, Northwestern University(西北大学统计与数据科学系) Department of Computer Science, Northeastern University(东北大学计算机科学系) Department of Computer Science, Harvard University(哈佛大学计算机科学系) Department of Pathology, Yale University(耶鲁大学病理学系) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(宾夕法尼亚大学医院解剖病理学与检验医学系) Department of Pathology and Laboratory Medicine, University of California, San Francisco(加州大学旧金山分校病理学与检验医学系) Department of Pathology and Laboratory Medicine, KK Women’s and Children’s Hospital(竹脚妇幼医院病理学与检验医学系) Department of Biostatistics, Epidemiology and Informatics, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院生物统计学、流行病学与信息学系)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出MixTIME多模态基础模型,采用混合专家架构整合不同模态的病理基础模型,从HE全切片图像预测多重免疫荧光蛋白表达,在17个蛋白标记物上达到最优性能,并增强空间域识别、生存预测等下游任务。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21384 2026-06-23 cs.CV cs.AI 新提交 81%

EnTrust: Modeling Inter-Modal Conflict for Trustworthy Multimodal Medical Image Analysis

EnTrust: 建模模态间冲突以实现可信的多模态医学图像分析

Dwarikanath Mahapatra, Abhijit Das, Behzad Bozorgtabar, Zongyuan Ge, Sudipta Roy, Deepak Nayak, Mauricio Reyes, Imran Razzak

机构 * Khalifa University(哈利法大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Aarhus University(奥胡斯大学) Monash University(莫纳什大学) Jio University(Jio大学) NIT Jaipur(斋浦尔国立理工学院) University of Bern(伯尔尼大学) MedOS

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出EnTrust框架,通过解耦模态特征中的共享共识、特定线索和冲突信号,利用扩散模型生成假设并校准像素级不确定性,在多个医学图像分割基准上达到SOTA,校准误差降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21135 2026-06-23 cs.CV cs.GR cs.RO 新提交 79%

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion

Odoriko: 一种形状感知的多模态人体运动扩散框架

Dongseok Shim, Julian Tanke, Kengo Uchida, Christian Simon, Koichi Saito, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出首个统一的多模态运动生成框架Odoriko,通过扩散模型将主体生物形态信息融入运动合成,支持文本、音乐、视频输入,并在形态缺失时联合估计与生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06356 2026-06-23 cs.AI 版本更新 79%

Where Should Knowledge Enter? A Layered Framework for Knowledge Infusion in Multimodal Iterative Generative Model

知识应从哪里注入?多模态迭代生成模型中知识注入的分层框架

Renjith Prasad, Chathurangi Shyalika, Anushka Pawar, Aahan Rathod, Amit Sheth

机构 * University of South Carolina(南卡罗来纳大学) Indian AI Research Organization(印度人工智能研究组织)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一个分层框架,将多模态迭代生成模型中的知识注入分为表面层、轨迹层、潜在层和参数层四个干预层,并通过扩散模型实验证明多层组合可互补地减少知识违规输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新 79%

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22774 2026-06-23 physics.optics 新提交 78%

Autonomous Generation of Metamaterial Databases Based on Multimodal Agents

基于多模态代理的元材料数据库自主生成

Shilong Qin, Zhicai Yu, Xuan Zheng, Yan Zhang, Aodi Yang, Kezhan Zhao, Qi Cheng Chen, Jian Wei You, Tie Jun Cui

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出MetaDataGenAgent多模态多代理框架,通过文献到仿真的自动化流程,从非结构化科学文献中提取并生成元材料结构-响应数据库,实现远场波束偏转、近场全息成像等功能。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23124 2026-06-23 cs.CL cs.AI 新提交 62%

PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation

PRIDE: 特权信息增强的共情对话生成蒸馏方法

Jiaqiang Wu, Zhouan Zhu, Shangfei Wang

机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20774 2026-06-23 cs.CV cs.AI cs.RO 新提交 62%

TriMotion: Modality-Agnostic Camera Control for Video Generation

TriMotion: 模态无关的摄像机控制用于视频生成

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng

机构 * GIST(光州科学技术院) Huawei Noah's Ark Lab(华为诺亚方舟实验室) Yonsei University(延世大学) Imperial College London(伦敦帝国理工学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出TriMotion框架,通过将视频、姿态和文本输入映射到共享运动嵌入空间,实现模态无关的摄像机控制视频生成,并引入潜在运动一致性目标,无需像素级解码即可准确跟随目标轨迹。

Comments ECCV Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20707 2026-06-23 cs.CV cs.AI 新提交 62%

GEOPHYS: The Geometry of Physical Plausibility

GEOPHYS: 物理合理性的几何学

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip Torr, Eero P. Simoncelli, Barbara Hammer, David Klindt

机构 * Bielefeld University(比勒费尔德大学) University of Oxford(牛津大学) Cold Spring Harbor Laboratory(冷泉港实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Independent(独立作者) Honda Research Institute EU(本田欧洲研究院) New York University(纽约大学) Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02230 2026-06-23 cs.CV cs.LG 版本更新 57%

InfiltrNet: Dual-Branch CNN-Transformer Architecture for Brain Tumor Infiltration Risk Prediction

InfiltrNet: 用于脑肿瘤浸润风险预测的双分支CNN-Transformer架构

S M Asif Hossain, Shruti Kshirsagar

机构 * School of Computing, Wichita State University(维斯科萨大学计算学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出InfiltrNet,结合CNN和Swin Transformer编码器及交叉注意力融合模块,从多模态MRI预测三区浸润风险图,利用距离变换生成标签,在BraTS数据集上优于五个基线模型。

Comments This work will be extended for a future journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 57%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23270 2026-06-23 cs.CV 新提交 57%

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

BoxCtrl: 面向几何图像编辑的3D感知视觉提示

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20689 2026-06-23 cs.CV cs.LG 新提交 57%

NeoJaundice-AI: Smartphone-Based Neonatal Jaundice Detection Using Dual-Input Deep Learning and Synthetic Augmentation

NeoJaundice-AI: 基于智能手机的新生儿黄疸检测,采用双输入深度学习与合成增强

Rahul Patel, Nirjala Jarpula

机构 * Indian Institute of Information Technology Surat(印度信息技术学院苏拉特分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出NeoJaundice-AI系统,通过双分支EfficientNet-B0处理皮肤和巩膜图像,融合手工YCbCr颜色特征,实现四类严重度分类和胆红素回归,采用合成黄疸生成和肤色归一化,在印度新生儿数据集上达到91.8%准确率。

Comments 7 pages, 10 figures, 8 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21036 2026-06-23 stat.ML cs.LG 新提交 50%

Diffusion-Driven State Space Models

扩散驱动的状态空间模型

Jack Ruder, Michael Wojnowicz

机构 * Montana State University(蒙塔纳州立大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出扩散驱动状态空间模型(DDSSM),用扩散模型替代高斯转移分布,联合训练自编码器和扩散模型,提升时间序列拟合与预测能力。

Comments Accepted to ProbML 2026 Workshop Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21935 2026-06-23 cs.RO 新提交 50%

CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation

CoRDE:面向机器人操作结构泛化的概念先验路由扩散专家

Haidong Huang, Xixin Zhao, Yaohua Zhou, Jiayu Song, Jiayi Zhang, Jun Ma, Haiyue Zhu, Xiaocong Li

机构 * College of Information Science and Technology, Eastern Institute of Technology, Ningbo(宁波东方理工大学(暂名)信息科学与技术学院) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology, Ningbo(浙江省工业智能与数字孪生重点实验室,宁波东方理工大学(暂名)) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统学域) Faculty of Science and Engineering, University of Nottingham Ningbo China(宁波诺丁汉大学理工学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出CoRDE框架,通过概念先验引导路由和低秩专家池,解决扩散模型在多任务长时程操作中的结构泛化不足和路由崩溃问题。

Comments 8 pages, 3 figures, Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20607 2026-06-23 cs.HC 新提交 50%

LLM4CAD-Editor: An Intent-Aware Large Language Model Framework for Multi-Level Computer-Aided Design Editing

LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架

Yuewan Sun, Zhenghui Sha

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18457 2026-06-23 eess.SP 版本更新 50%

Sense Smarter, Think Better: A Survey on Edge Perception for Next-Generation Networks

智能感知,更优思考:面向下一代网络的边缘感知

Zhonghao Lyu, Xiaowen Cao, Xianxin Song, Yuchen Li, Jiacheng Wang, Shuoyao Wang, Yuanhao Cui, Weijie Yuan, Xianghao Yu, Guangxu Zhu, Hai Liu, Jie Xu, Derrick Wing Kwan Ng, Shuguang Cui

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文综述了边缘感知的核心方法与贡献,涵盖传感模态、边缘AI技术及其协同作用,分析了边缘AI如何增强感知能力,并探讨了任务驱动感知在边缘AI中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02581 2026-06-23 cs.LG 版本更新 50%

Training Diffusion Policies via Prior-Mapping Co-Evolution

通过先验映射协同进化训练扩散策略

Chubin Zhang, Zhenglin Wan, Feng Chen, Fuchao Yang, Lang Feng, Yaxin Zhou, Xingrui Yu, Yang You, Ivor Tsang, Bo An

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Carnegie Mellon University(卡内基梅隆大学) CFAR Agency for Science Technology and Research(科技研究局(CFAR)) IHPC Agency for Science Technology and Research(科技研究局(IHPC))

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出GoRL框架,通过将策略优化限制在易处理的潜空间,同时用条件生成解码器合成动作,解耦优化与生成,实现稳定优化与表达力提升,在连续控制任务上显著超越基线。

Comments Ver 3 (Accepted as a conference paper by ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏