arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-09 至 2026-03-09 共收录 79 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2603.06090 2026-03-09 cs.CV cs.CL 86%

DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model

DeepSight: 通过深度驱动的多模态模型连接深度图与语言

Hao Yang, Hongbo Zhang, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 DeepSight通过深度驱动的多模态模型提升三维场景理解,利用深度图像特性增强空间推理能力,并通过新数据集和模型改进实现了深度感知和任务性能的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06340 2026-03-09 cs.CV cs.AI 81%

K-MaT: Knowledge-Anchored Manifold Transport for Cross-Modal Prompt Learning in Medical Imaging

K-MaT: 基于知识的流形传输用于医学影像中的跨模态提示学习

Jiajun Zeng, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 K-MaT通过基于知识的流形传输实现跨模态提示学习,提升医学影像模型在不同模态间的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06084 2026-03-09 cs.RO 78%

Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning

多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划

Cristiano Battistini, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19535 2026-03-09 cs.CV cs.AI 62%

CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion

CASA: 交叉注意力优于自注意力用于高效的视觉-语言融合

Moritz Böhle, Amélie Royer, Juliette Marrie, Edouard Grave, Patrick Pérez

机构 * Kyutai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CASA通过交叉注意力机制提升视觉-语言模型的效率,实现实时视频字幕处理中的低延迟和恒定内存成本。

Comments updated with improved CA results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06270 2026-03-09 cs.CV cs.AI 62%

HiPP-Prune: Hierarchical Preference-Conditioned Structured Pruning for Vision-Language Models

HiPP-Prune: 基于层次化偏好条件的结构化剪枝用于视觉-语言模型

Lincen Bai, Hedi Tabia, Raul Santos-Rodriguez

机构 * Université Paris-Saclay(巴黎萨克雷大学) University of Bristol(布里斯托大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 HiPP-Prune通过层次化偏好条件的结构化剪枝框架,在视觉-语言模型中实现高效部署,通过多目标优化提供可控的鲁棒性与效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06256 2026-03-09 cs.CV cs.AI 62%

GazeMoE: Perception of Gaze Target with Mixture-of-Experts

GazeMoE:基于专家混合的注视目标感知

Zhuangzhuang Dai, Zhongxi Lu, Vincent G. Zakka, Luis J. Manso, Jose M Alcaraz Calero, Chen Li

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GazeMoE通过MoE模块结合多模态线索,实现对注视目标的高精度识别,优于现有方法。

Comments 8 pages, 3 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01653 2026-03-09 cs.CV cs.AI 62%

MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing

MAP: 通过地图级注意力处理缓解大视觉-语言模型中的幻觉

Chenxi Li, Yichen Guo, Benfang Qian, Jinhao You, Kai Tang, Yaosong Du, Zonghao Zhang, Xiande Huang

机构 * DAIL Tech(DAIL科技)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MAP通过地图级注意力处理提升大视觉-语言模型的事实一致性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05732 2026-03-09 cs.CV 57%

From Phase Grounding to Intelligent Surgical Narratives

从相位接地到智能手术叙述

Ethan Peterson, Huixin Zhan

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业技术研究所)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的多模态框架,通过自动创建手术时间线和叙述,减少手动标注的需要。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 13 篇

2504.00837 2026-03-09 cs.SD cs.AI cs.MM 87%

A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives

从单模态、跨模态和多模态视角综述音乐生成

Shuyu Li, Shulei Ji, Zihao Wang, Songruoyao Wu, Jiaxing Yu, Kejun Zhang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(title);分类 cs.AI、cs.MM

AI总结 本文综述了多模态音乐生成的研究现状,探讨了多模态数据对齐、系统评估方法及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06530 2026-03-09 cs.CV 83%

AV-Unified: A Unified Framework for Audio-visual Scene Understanding

AV-Unified: 一个用于音频-视觉场景理解的统一框架

Guangyao Li, Xin Wang, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AV-Unified提出一个统一框架,通过多尺度时空感知网络和跨模态指导模块,实现音频-视觉场景理解任务的联合学习和高效处理。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12436 2026-03-09 eess.AS cs.AI cs.LG cs.MM cs.SD 82%

Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition

在融合前净化:迈向无掩码的语音增强以实现鲁棒的音频-视觉语音识别

Linzhi Wu, Xingyu Zhang, Hao Yuan, Yakun Zhang, Changyan Zheng, Liang Xie, Tiejun Liu, Erwei Yin

机构 * University of Electronic Science and Technology of China(电子科技大学) Defense Innovation Institute, Academy of Military Sciences(国防科技创新研究院) Peking University(北京大学) High-tech Institute(高新技术研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出了一种端到端的噪声鲁棒音频-视觉语音识别框架,结合语音增强技术,在无需显式生成噪声掩码的情况下提升鲁棒性。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23136 2026-03-09 cs.CL cs.AI cs.LG 81%

Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs

模态崩溃作为不匹配解码:多模态大语言模型的信息论限制

Jayadev Billa

机构 * Yahoo(雅虎) Nuance BBN

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示多模态大语言模型中模态崩溃现象的信息论限制,指出解码器评分规则决定了可访问信息量,通过LoRA干预验证了训练目标对情绪检测性能的提升作用。

Comments 24 pages, 11 tables, 2 figures. Code: https://github.com/jb1999/modality_collapse_paper, submitted for review COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05708 2026-03-09 cs.CV 70%

Interpretable Perception and Reasoning for Audiovisual Geolocation

可解释的视听定位与推理

Yiyang Su, Xiaoming Liu

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于可解释感知和多模态推理的视听定位框架,通过合成声学原子与视觉特征,实现高精度全球定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13127 2026-03-09 cs.CV cs.CR 70%

SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge

SPARK:通过协同提示音频与重新上下文化知识实现T2V模型的劫持

Zonghao Ying, Moyang Chen, Nizhang Li, Zhiqiang Wang, Wenxin Zhang, Quanchen Zou, Zonglei Jing, Aishan Liu, Xianglong Liu

机构 * State Key Laboratory of Complex \& Critical Software Environment, Beihang University College of Science, Mathematics Technology, Wenzhou-Kean University 360 AI Security Lab Faculty of Innovation Engineering, Macau University of Science Hong Kong University of Science University of Chinese Academy of Sciences

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 SPARK通过模块化提示设计,利用音频与视觉关联模式,实现对T2V模型的高效劫持,提升攻击成功率23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06542 2026-03-09 cs.SD cs.AI 57%

RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering

RAMoEA-QA:面向呼吸音频问答的分层专业化

Gaia A. Bertolino, Yuwei Zhang, Tong Xia, Domenico Talia, Cecilia Mascolo

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) University of Calabria(卡拉布里亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 RAMoEA-QA通过分层专业化机制,统一处理多种呼吸音频问答任务,提升在不同领域和任务转换下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06373 2026-03-09 eess.AS 57%

Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction

医生还是病人?协同语音识别与说话人识别用于代码混合希金斯医疗条件提取

Séverin Baroudi, Yanis Labrak, Shashi Kumar, Joonas Kalda, Sergio Burdisso, Pawel Cyrta, Juan Ignacio Alvarez-Trejos, Petr Motlicek, Hervé Bredin, Ricard Marxer

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种端到端神经说话人识别与向量聚类方法,用于代码混合希金斯医疗条件提取,通过领域特定微调和错误校正,实现了较高的转录准确率,并在DISPLACE-M挑战中取得优异成绩。

Comments Submitted for review at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05272 2026-03-09 cs.CL cs.HC 57%

Oral to Web: Digitizing 'Zero Resource'Languages of Bangladesh

口到网:数字化孟加拉国的‘零资源’语言

Mohammad Mamun Or Rashid

机构 * Bangladesh Computer Council(孟加拉国计算机委员会) Jahangirnagar University(贾hangirnagar大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文介绍了多语言云语料库,旨在为孟加拉国的濒危语言提供数字化资源,涵盖42种语言,通过系统田野工作和多模态数据收集,支持低资源NLP和语言保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05793 2026-03-09 cs.HC 50%

A Closed-Loop CPR Training Glove with Integrated Tactile Sensing and Haptic Feedback

闭环式带集成触觉感知与触觉反馈的CPR训练手套

Jaeyoung Moon, Mingzhuo Ma, Qifeng Yang, Youjin Choi, Seokhyun Hwang, Samuel Burden, Kyung-Joong Kim, Yiyue Luo

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出了一种闭环CPR训练手套,通过集成触觉感知和触觉反馈,提升自主练习中的CPR质量与准确性。

Comments 8pages, 10 figures, This paper is accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00789 2026-03-09 physics.app-ph physics.flu-dyn 50%

Aeroacoustic signatures reveal fast transient dynamics of vapor-jet-driven cavity oscillations in metallic additive manufacturing

气动声学特征揭示金属增材制造中蒸发喷射驱动腔体振荡的快速瞬态动力学

Haolin Liu, S. Kiana Naghibzadeh, Zhongshu Ren, Yanming Zhang, Jiayun Shao, Samuel J. Clark, Kamel Fezzaa, Xuzhe Zeng, Lin Gao, Wentao Yan, Noel Walkington, Kaushik Dayal, Tao Sun, Anthony D. Rollett, Levent Burak Kara

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 该研究通过气动声学特征揭示金属增材制造中蒸发喷射驱动的腔体振荡快速瞬态动力学,利用声学信号耦合瞬时腔体深度和振荡频率,重新定义蒸发过程的临界频率事件。

Comments 35 pages 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07619 2026-03-09 cs.RO 50%

CAVER: Curious Audiovisual Exploring Robot

CAVER:好奇的视听探索机器人

Luca Macesanu, Boueny Folefack, Samik Singh, Ruchira Ray, Ben Abbatematteo, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 CAVER是一种新型机器人,通过好奇心驱动的探索算法和多模态视听表示,提升材料分类和音频示范模仿的性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14063 2026-03-09 cs.RO 50%

Language Conditioning Improves Accuracy of Aircraft Goal Prediction in Non-Towered Airspace

语言引导提升非塔台空域飞机目标预测的准确性

Sundhar Vinodh Sangeetha, Chih-Yuan Chiu, Sarah H. Q. Li, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院) School of Aerospace Engineering(航空航天工程学院) School of Electrical and Computer Engineering(电气与计算机工程学院) School of Mechanical Engineering(机械工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出利用语言信息提升非塔台空域飞机目标预测准确性的多模态框架,通过整合自然语言理解和空间推理,有效提高自主决策能力。

Comments The last two authors advised equally. Accepted to the 2026 IEEE International Conference on Robotics and Automation. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2603.06213 2026-03-09 cs.CV cs.AI 84%

Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

直击核心:一种无需训练的多模态摘要方法 via 事件链

Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 无需训练的多模态摘要方法CoE通过事件链和层次事件图实现跨模态整合与时间推理,提升摘要质量与领域适应性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05581 2026-03-09 cs.LG cs.AI eess.SP 79%

Spatiotemporal Heterogeneity of AI-Driven Traffic Flow Patterns and Land Use Interaction: A GeoAI-Based Analysis of Multimodal Urban Mobility

人工智能驱动交通流模式与土地利用相互作用的时空异质性:基于GeoAI的多模式城市交通分析

Olaf Yunus Laitinen Imanov

机构 * Department of Applied Mathematics(应用数学系) Computer Science (DTU Compute), Technical University of Denmark, Kongens Lyngby, Denmark(计算机科学(DTU Compute),丹麦技术大学,Kongens Lyngby)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出GeoAI混合框架,通过整合MGWR、RF和ST-GCN,分析多模式城市交通的时空异质性及土地利用互动,提升交通管理与政策设计的科学性。

Comments 13 pages, 7 figures, 9 tables. Submitted to Computers, Environment and Urban Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09095 2026-03-09 cs.LG 78%

Temporal Misalignment Attacks against Multimodal Perception in Autonomous Driving

针对自动驾驶多模态感知的时序错位攻击

Md Hasan Shahriar, Md Mohaimin Al Barat, Harshavardhan Sundar, Ning Zhang, Naren Ramakrishnan, Y. Thomas Hou, Wenjing Lou

机构 * Amazon.com, Inc.(亚马逊公司) Washington University in St. Louis(华盛顿大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出DejaVu攻击,通过制造时序错位破坏自动驾驶多模态感知,导致目标检测和跟踪性能显著下降。

Comments 19 pages, 18 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16538 2026-03-09 cs.CV 70%

OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding

OnlineSI: 通过大规模语言模型实现在线3D理解和定位

Zixian Liu, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 OnlineSI通过整合3D点云与语义信息,提升大规模语言模型在动态环境中的空间理解和物体识别能力。

Comments Project Page: https://onlinesi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05923 2026-03-09 cs.CL cs.HC 57%

Learning Next Action Predictors from Human-Computer Interaction

从人机交互中学习下一步动作预测器

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, Yikun Chi, Nick Haber, Thomas Robinson, Nilam Ram, Byron Reeves, Sherry Yang, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) Hasso Plattner Institute(哈索普拉特纳研究所) New York University(纽约大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。

Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04461 2026-03-09 cs.CV 57%

UniTS: Unified Spatio-Temporal Generative Model for Remote Sensing

UniTS:面向遥感的统一时空生成模型

Yuxiang Zhang, Shunlin Liang, Wenyuan Li, Han Ma, Jianglei Xu, Yichuan Ma, Jiangwei Xie, Wei Li, Mengmeng Zhang, Ran Tao, Xiang-Gen Xia

机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) Department of Geography, the University of Hong Kong(香港大学地理系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05554 2026-03-09 cs.CV cs.IR 57%

RED: Robust Event-Guided Motion Deblurring with Modality-Specific Disentanglement

RED: 基于事件引导的鲁棒运动去模糊化与模态特定解耦

Yihong Leng, Siming Zheng, Jinwei Chen, Bo Li, Jiaojiao Li, Peng-Tao Jiang

机构 * Xidian University(西安电子科技大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 RED通过事件引导的鲁棒运动去模糊化方法,结合模态特定解耦与选择性融合,提升模糊图像的清晰度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11245 2026-03-09 cs.CV 57%

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation

NarrLV: 向长视频生成的综合性叙事导向评估迈进

X. Feng, H. Yu, M. Wu, S. Hu, J. Chen, C. Zhu, J. Wu, X. Chu, K. Huang

机构 * UCAS CASIA(中国科学院自动化研究所) AMAP, Alibaba Group(阿里云实验室) NTU(国立科技大学) PKU(北京大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 NarrLV是首个针对长视频生成模型的综合性叙事评估基准,通过引入时间叙事原子和基于MLLM的评估指标,全面评估模型在叙事表达上的能力。

Comments Project Page: https://amap-ml.github.io/NarrLV-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2507.06265 2026-03-09 cs.CV cs.AI 84%

SPARC: Concept-Aligned Sparse Autoencoders for Cross-Model and Cross-Modal Interpretability

SPARC:概念对齐的稀疏自编码器用于跨模型和跨模态可解释性

Ali Nasiri-Sarvi, Hassan Rivaz, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE) Concordia University, Canada(计算机科学与软件工程系(CSSE)康科迪亚大学,加拿大) Department of Electrical and Computer Engineering (ECE) Concordia University, Canada(电气与计算机工程系(ECE)康科迪亚大学,加拿大)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SPARC通过稀疏自编码器实现跨模型和跨模态的概念对齐,提升概念表示的一致性与可解释性

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏