arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-29 至 2026-05-29 共收录 100 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 9 篇

2605.29628 2026-05-29 cs.SD cs.AI cs.CL cs.LG eess.AS 82%

COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings

COMET:音频-文本多模态对比嵌入中模态间隙的概念空间剖析

Yonggang Zhu, Liting Gao, Aidong Men, Wenwu Wang

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Centre for Vision, Speech, and Signal Processing (CVSSP), University of Surrey(Surrey 大学视觉、语音和信号处理中心)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出COMET框架,通过PLS-SVD分解揭示CLAP模型中模态间隙主要由少数共享概念轴贡献,并基于谱截断方法无训练地缓解间隙,实现零样本音频字幕接近全监督性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14113 2026-05-29 cs.CV cs.AI cs.LG cs.MA 81%

ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows

ProtoMedAgent: 通过隐私感知的智能体工作流实现多模态临床可解释性

Alvaro Lopez Pellicer, Plamen Angelov, Marwan Bukhari, Yi Li, Eduardo Soares, Jemma Kerns

机构 * School of Computing and Communications(计算与通信学校) Lancaster University(兰卡斯特大学) Lancaster Medical School(兰卡斯特医学院) PUC-Rio(里约热内卢联邦大学) Puc-Behring Institute for AI(人工智能皮克林研究所)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ProtoMedAgent框架,通过神经符号瓶颈和反射性Scribe-Critic循环约束生成过程,解决原型网络在临床报告中的语义结构缺失和检索谄媚问题,并引入k-匿名和ℓ-多样性隐私门控。

Comments CVR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29606 2026-05-29 cs.AI cs.IR 79%

HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering

HiKEY: 面向开放域文档问答的分层多模态检索

Joongmin Shin, Gyuho Shim, Jeongbae Park, Jaehyung Seo, Heuiseok Lim

机构 * Human-inspired AI Research, Korea University(韩国大学人机智能研究部) Computer Science and Engineering, Konkuk University(韩国康科大学计算机科学与工程系) Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出基于文档层次结构的分层多模态检索框架HiKEY,通过文档层次解析和粗到细的检索策略解决大规模工业语料中的路由失败和证据碎片化问题,在ODQA基准上检索召回率提升达12.9%,端到端QA性能提升达6.8%。

Comments Accepted to ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29956 2026-05-29 cs.IR 78%

Uncertainty Quantification for Multimodal Retrieval Augmented Generation

多模态检索增强生成的不确定性量化

Simon Binz, Heydar Soudani, Faegheh Hasibi

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出 LeMUQ 方法,通过多模态和检索感知的概率信号建模不确定性,提升多模态 RAG 系统的可靠性,AUROC 平均提升 3.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29980 2026-05-29 cs.CV cs.AI cs.LG 62%

Genetically Aligned Patient Representations Improve Hematological Diagnosis

基因对齐的患者表示改善血液学诊断

Muhammed Furkan Dasdelen, Fatih Ozlugedik, Ilaria Looser, Rao Muhammad Umer, Christian Pohlkamp, Carsten Marr

机构 * Institute of AI for Health, Helmholtz Munich, Germany International School of Medicine, Istanbul Medipol University, T\"urkiye Munich Leukemia Laboratory, Germany Department of Medicine III, Ludwig-Maximilian-University Hospital, Germany Department of Physics, University of Munich, Germany Munich Center for Machine Learning (MCML), Germany DKTK, German Cancer Consortium, Germany

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种两阶段框架,通过自监督视觉预训练和监督对比学习对齐白细胞图像与染色体畸变及体细胞突变,提升血液学诊断性能。

Comments Accepted for publication at the 29th International Conference on Medical Image Computing and Computer Assisted Intervention - MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29926 2026-05-29 cs.LG 50%

A Triple-Modal Contrastive Learning Framework with Sequence, Graph, and 3D Features for Drug-Target Interaction Prediction

一种融合序列、图和3D特征的三模态对比学习框架用于药物-靶标相互作用预测

Le Xu, Xi Zhang, Dan Luo, Ting Wang, Xuan Lin

机构 * School of Computer Science, Xiangtan University, Xiangtan 411105, China(湘潭大学计算机科学学院)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 提出TriMod-DTI框架,通过融合药物和蛋白质的1D序列、2D图和3D结构,并采用三模态对比学习策略对齐潜在空间表示,从而提升药物-靶标相互作用预测性能。

Comments 12 pages, 5 figures, ISBRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 16 篇

2605.30311 2026-05-29 cs.CV cs.AI 84%

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

Archon:面向整体数字人生成的统一多模态模型

Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出Archon,一个完全预训练的以人为中心的统一多模态模型,通过模态特定分词器、语义视频重参数化和“模态思维”策略,实现文本、音频、动作和视觉等七种模态的整体数字人生成。

Comments Accepted to CVPR 2026. Project Page: https://zju3dv.github.io/archon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09574 2026-05-29 cs.CV cs.AI cs.CL 82%

MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models

MENTOR: 面向自回归视觉生成模型的高效多模态条件微调

Haozhe Zhao, Zefan Cai, Shuzheng Si, Liang Chen, Jiuxiang Gu, Wen Xiao, Minjia Zhang, Junjie Hu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) Peking University(北京大学) Microsoft(微软公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MENTOR框架,通过两阶段训练范式实现自回归图像生成器与多模态输入的细粒度token级对齐,无需辅助适配器或交叉注意力模块,在DreamBench++上取得优异性能。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29826 2026-05-29 cs.CL cs.AI 81%

Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models

面向多模态大语言模型的局部化与解耦知识编辑

Leijiang Gu, Zhen Zeng, Feng Li, Xinjian Gao, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Tongji University(同济大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态知识编辑中因果错位和特征纠缠问题,提出LDKE框架,通过快速定位关键层和解耦分类器实现精准泛化编辑并保持高局部性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10219 2026-05-29 cs.AI 79%

Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models

认知支点与视觉锚定:揭示并纠正多模态推理模型中的幻觉

Zhe Qian, Yanbiao Ma, Zhuohan Ouyang, Zhonghua Wang, Zhongxing Xu, Fei Luo, Xinyu Liu, Zongyuan Ge, Yike Guo, Jungong Han

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 龙城人工智能学院) South China Agricultural University(华南农业大学) South China Normal University(华南师范大学) Monash University(莫纳什大学) Jishou University(吉首大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大推理模型在长链推理中易产生幻觉的问题,提出V-STAR训练范式,通过分层视觉注意力奖励和强制反思机制,将视觉锚定引入推理过程以减轻幻觉。

Comments TPAMI under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30131 2026-05-29 cs.CL cs.CV 79%

CCS: Clinical Consensus Selection for Radiology Report Generation

CCS:放射学报告生成的临床共识选择

Xi Zhang, Yingshu Li, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出CCS框架,通过采样多个候选报告并选择临床共识最高的一个,以改进放射学报告生成在推理时的质量。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30153 2026-05-29 stat.ML cs.IT cs.LG math.IT math.ST stat.TH 78%

Diffusion Models Are Statistically Optimal for Learning Low-Dimensional Multi-Modal Distributions

扩散模型在学习低维多模态分布时具有统计最优性

Jingda Wu, Changxiao Cai

机构 * Department of Industrial and Operations Engineering, University of Michigan, Ann Arbor, USA(工业与运营工程系,密歇根大学,安娜堡,美国)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文证明扩散模型在学习支撑在低维子空间并集上的分布时,样本复杂度仅依赖于内在维度,达到近最优的1-Wasserstein误差率,无需光滑性或有界密度假设。

Comments accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27607 2026-05-29 cs.CV cs.RO 70%

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

双流扩散用于世界模型增强的视觉-语言-动作模型

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Technology, Seoul, Republic of Korea(金 Jaechul 人工智能研究生院,韩国科学技术院,首尔,大韩民国)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出DUST框架,通过双流扩散Transformer和异步采样方法,解决世界模型增强的视觉-语言-动作模型中的模态差距问题,在模拟和真实任务中取得显著性能提升。

Comments Accepted at ICML 2026. Project page at https://periphanes.github.io/dust (20 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30090 2026-05-29 cs.CL cs.CV 62%

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation

DirectorBench: 通过个性化多智能体评估诊断长视频生成

Jiamin Chen, Qianben Chen, Jiawen Zhang, Yidi Wu, Yuchen Li, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma

机构 * ByteDance Inc.(字节跳动公司) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出DirectorBench,一种基于多智能体的诊断基准,通过80个结构化元数据、7个用户画像和40个检查点标准,在脚本、视觉、音频、跨模态和稳定性五个维度上评估长视频生成,并定位瓶颈和用户偏好依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30049 2026-05-29 cs.AI 57%

Robust and Generalizable Safety Steering for Text-to-Image Diffusion Transformers

面向文本到图像扩散Transformer的鲁棒且可泛化的安全引导

Zihao Xue, Yan Wang, Zhen Bi, Long Ma, Zhonglong Zheng, Zeyu Yang, Bingyu Zhu, Longtao Huang, Jie Xiao, Jungang Lou

机构 * Huzhou Normal University(湖州师范学院) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Zhejiang Normal University(浙江师范大学) Zhejiang University of Technology(浙江工业大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 提出SafeDIG框架,通过位置感知稀疏特征迁移实现扩散Transformer的安全引导,在保持源域安全性和图像质量的同时,有效降低目标域和整体不安全生成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11499 2026-05-29 cs.LG cs.AI 57%

Offline Reinforcement Learning with Generative Trajectory Policies

基于生成轨迹策略的离线强化学习

Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen

机构 * School of Computing, Data Sciences Computer Engineering Department, UCLA, Los Angeles, USA

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出生成轨迹策略(GTP),通过统一扩散、流匹配和一致性模型为常微分方程驱动的连续时间生成轨迹,并引入两种理论自适应方法,在D4RL基准上达到最先进性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28867 2026-05-29 cs.LG cs.AI 57%

PrismFlow: Residual Dynamics for Flow Matching in Time-Series Generation

PrismFlow: 时间序列生成中流匹配的残差动力学

Junru Zhang, Lang Feng, Jinbo Wang, Xu Guo, Yucheng Wang, Han Yu, Min Wu, Yabo Dong, Duanqing Xu

机构 * Zhejiang University, China(浙江大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡) I2R, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)新加坡研究所,新加坡)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出PrismFlow方法,通过Koopman启发的动力学专家和置信度感知的胜者全得目标,在流匹配中学习残差修正,以解决标准流匹配中全局向量场估计器导致的频谱失真和模式覆盖不足问题,在时间序列生成中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21032 2026-05-29 cs.CV 57%

Multi-Attribute guided Thermal Face Image Translation based on Latent Diffusion Model

基于潜在扩散模型的多属性引导热人脸图像翻译

Mingshu Cai, Osamu Yoshie, Yuya Ieiri

机构 * Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息、生产与系统研究生院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种基于潜在扩散模型的多属性引导方法,从热红外图像生成高质量可见光人脸图像,同时保留关键身份特征,解决异质人脸识别中的域偏移和特征丢失问题。

Comments Accepted by 2025 IEEE International Joint Conference on Biometrics (IJCB 2025)

Journal ref 2025 IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15236 2026-05-29 cs.CR cs.AI cs.LG 57%

Jailbreaking and Mitigation of Vulnerabilities in Large Language Models

大语言模型的越狱与漏洞缓解

Benji Peng, Hanxuan Chen, Keyu Chen, Qian Niu, Ziqian Bi, Ming Liu, Pohsun Feng, Tianyang Wang, Lawrence K. Q. Yan, Yizhu Wen, Yichao Zhang, Caitlyn Heqi Yin, Xinyuan Song, Riyang Bao, Jiacheng Shi

机构 * Hunan University Changsha, PRC Georgia Institute of Technology Atlanta, USA Kyoto University Kyoto, Japan Purdue University West Lafayette, USA National Taiwan Normal University Taipei, ROC University of Liverpool Suzhou, PRC Hong Kong University of Science University of Hawaii Honolulu, USA The University of Texas at Dallas Dallas, USA University of Wisconsin-Madison Madison, USA Emory University Atlanta, USA College of William \& Mary Williamsburg, USA

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了大语言模型在提示注入和越狱攻击下的漏洞,分类攻击方法并评估防御策略,指出研究空白与未来方向。

Journal ref Eureka 1(1) (2026) 26-61

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30330 2026-05-29 cs.LG 50%

When, why, and how do diffusion posterior samplers fail? A finite-sample lens

何时、为何以及如何扩散后验采样器失败?一个有限样本视角

Benjamin A. Burns, Sara Fridovich-Keil

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文从有限样本视角分析扩散后验采样器中似然近似误差导致后验分布偏差的原因,发现中间时间步的后验扩散估计不准确会导致模式加权错误和幻觉,并提出一种与近似类型无关的诊断方法。

Comments All code for experiments is available at: https://github.com/voilalab/diagnosing-posterior-sampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29811 2026-05-29 astro-ph.EP astro-ph.GA astro-ph.IM astro-ph.SR 50%

A Calibrated Bayesian Search for Potential Chemical Technosignatures in Polluted White Dwarf

污染白矮星中潜在化学技术特征的一种校准贝叶斯搜索

Bo-Lun Huang, Zhen-Zhao Tao, Tong-Jie Zhang

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出一种陨石校准的贝叶斯框架,通过比较自然岩石与理想化“加工”模板的组成模式,搜索白矮星丰度记录中的化学技术特征,并量化其可检测发生率。

Comments 21 pages, 11 figures, 5 tables. Accepted for publication in The Astrophysical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29766 2026-05-29 cs.RO 50%

MARS Policy: Multimodality Only When It Matters

MARS策略:仅在必要时使用多模态

Jindou Jia, Tuo An, Yuxuan Hu, Gen Li, Jingliang Li, Bohan Hou, Xiangyu Chen, Jiaqi Bai, Bofan Lyu, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出MARS策略,通过自适应地在需要时引入随机性,在单模态阶段使用确定性学习,平衡生成策略的多模态能力与确定性模型的高效率,在模拟和真实任务中提升成功率和推理速度。

Comments 13 figures, 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 22 篇

2508.16873 2026-05-29 cs.CV cs.SI 89%

Multimodal LLMs See Sentiment

多模态大语言模型感知情感

Neemias B. da Silva, John Harrison, Rodrigo Minetto, Myriam R. Delgado, Bogdan T. Nassu, Thiago H. Silva

机构 * Universidade Tecnológica Federal do Paraná(联邦技术大学帕拉纳州大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 本文通过系统评估研究,探讨多模态大语言模型在图像情感分析中的三种方法,发现基于MLLM描述的两阶段流水线在微调后性能显著优于传统基线。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21151 2026-05-29 cs.IR 85%

VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion

VOGUE:面向时尚领域对话式推荐的多模态数据集

David Guo, Minqi Sun, Yilun Jiang, Jiazhou Liang, Scott Sanner

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);multimodal foundation model(abstract)

AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29462 2026-05-29 cs.CV cs.AI 84%

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset

大型视觉语言模型在CFMME上的基准测试:一个全面的中文金融多模态评估数据集

Qian Chen, Xianyin Zhang, Yanzhi Liu, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文言金团队,阿里云计算)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出CFMME,一个包含6052个实例的中文金融多模态评估基准,涵盖八种主要金融图像模态和四项核心多模态任务,用于评估LVLMs在金融业务全流程中的感知、理解、推理和认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30168 2026-05-29 cs.CV 83%

OmniCD: A Foundational Framework for Remote Sensing Image Change Detection Guided by Multimodal Semantics

OmniCD:多模态语义引导的遥感图像变化检测基础框架

Chenhao Sun

机构 * Wuhan University(武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出OmniCD框架,通过多模态语义引导(图像和文本提示)统一遥感变化检测任务,结合层次化场景检索和风格解耦机制,并构建大规模数据集RSITCD,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29455 2026-05-29 cs.CV eess.SP 83%

Uni-RCM: Unified Reference-guided Cross-modal Mapping for Multi-Class Anomaly Detection

Uni-RCM:面向多类异常检测的统一参考引导跨模态映射

Yangchen Wu, Huiqiang Xie

机构 * School of Information Science and Technology, Jinan University(信息科学与技术学院,暨南大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出Uni-RCM框架,通过参考引导块和离线残差量化器,实现多类工业异常检测的统一建模,在MVTec-3D AD数据集上达到最优性能。

Comments This work has been submitted IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20743 2026-05-29 cs.HC cs.AI cs.CL 81%

Empathic Prompting: Non-Verbal Context Integration for Multimodal LLM Conversations

共情提示:多模态大语言模型对话中的非语言上下文整合

Lorenzo Stacchio, Andrea Ubaldi, Alessandro Galdelli, Maurizio Mauri, Emanuele Frontoni, Andrea Gaggioli

机构 * University of Macerata(马切拉塔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出共情提示框架,通过集成面部表情识别服务将非语言情感线索隐式融入大语言模型对话,实现无需用户显式控制的流畅多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16548 2026-05-29 cs.LG cs.AI cs.CV 81%

A Composable Multimodal Framework for cine CMR-Text-Driven Prediction of Heart Failure Outcomes

用于电影心脏磁共振-文本驱动的心力衰竭结局预测的可组合多模态框架

Jianzhou Chen, Jinyang Sun, Xiumei Wang, Xi Chen, Heyu Chu, Guo Song, Yuji Luo, Xingping Zhou, Rong Gu

机构 * Department of Cardiology, Nanjing Drum Tower Hospital, State Key Laboratory of Pharmaceutical Biotechnology, Nanjing University(南京鼓楼医院心内科,南京大学国家药物生物技术重点实验室) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) College of Electronic and Optical Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学电子与光学工程学院) College of Integrated Circuit Science and Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学集成电路科学与工程学院) Department of Cardiology, Nanjing Drum Tower Hospital Clinical College of Nanjing Medical University(南京医科大学南京鼓楼医院临床学院心内科) Institute of Quantum Information and Technology, Nanjing University of Posts and Telecommunications(南京邮电大学量子信息与技术研究院)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种可组合多模态框架,通过整合cine CMR影像、结构化临床指标和非结构化文本记录,实现比单模态AI算法更准确的心力衰竭预后预测,并支持个性化治疗优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30027 2026-05-29 cs.CV cs.IR 79%

DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark

DocRetriever:面向多模态文档检索的即插即用框架与综合基准

Ruofan Hu, Menghui Zhu, Jieming Zhu, Bo Chen, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Li Tang, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DocRetriever即插即用框架,通过布局感知的稀疏嵌入和推理增强的重排序器解决多模态文档检索中语义模糊和泛化瓶颈问题,并构建MultiDocR基准实现更严格评估。

Comments Accepted at KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏