arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-02 至 2026-03-02 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2602.23863 2026-03-02 cs.CV cs.CL 84%

NAU-QMUL: Utilizing BERT and CLIP for Multi-modal AI-Generated Image Detection

NAU-QMUL: 利用BERT和CLIP进行多模态AI生成图像检测

Xiaoyu Guo, Arkaitz Zubiaga

机构 * School of Accounting, Nanjing Audit University (NAU), Nanjing, Jiangsu, China(会计学院,南京审计大学(NAU)) School of Electronic Engineering and Computer Science, Queen Mary University of London (QMUL), London, UK(电子工程与计算机科学学院,女王玛丽大学(QMUL))

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 NAU-QMUL利用BERT和CLIP进行多模态AI生成图像检测,通过跨模态特征融合和多任务损失函数提升检测性能,在竞赛中取得佳绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23588 2026-03-02 cs.CV cs.AI cs.LG 84%

Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning

高维跨模态对齐冻结语言和图像模型以实现高效的图像描述生成

Abhishek Dalvi, Vasant Honavar

机构 * Artificial Intelligence Research Laboratory(人工智能研究实验室) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 HDFLIM通过冻结语言和图像模型的高维计算实现高效的图像描述生成,无需参数调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24038 2026-03-02 cs.CV cs.MA 70%

Enhancing CLIP Robustness via Cross-Modality Alignment

通过跨模态对齐增强CLIP鲁棒性

Xingyu Zhu, Beier Zhu, Shuo Wang, Kesen Zhao, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20812 2026-03-02 cs.CV cs.AI cs.CL 67%

Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation

小草稿,大结论:通过推测进行信息密集的视觉推理

Yuhan Liu, Lianhui Qin, Shengjie Wang

机构 * New York University(纽约大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SV通过结合多个轻量级草稿专家和大型结论模型,提升信息密集视觉推理的效率和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24014 2026-03-02 cs.CV cs.AI 62%

Interpretable Debiasing of Vision-Language Models for Social Fairness

可解释的视觉-语言模型社会公平性偏见消除

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Copenhagen(哥本哈根大学) NVIDIA(英伟达公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。

Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2602.24195 2026-03-02 cs.AI cs.CL cs.CV cs.LG 85%

Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume

多模态大语言模型的不确定性量化:基于不一致性调整的语义体积

Gregory Kang Ruey Lau, Hieu Dao, Nicole Kan Hui Lin, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UMPIRE是一种无需训练的多模态大语言模型不确定性量化框架,通过内部特征有效捕捉语义多样性和响应不一致性,提升错误检测和不确定性校准性能。

Comments Earlier versions presented at ICLR 2025 QUESTION workshop and ICML 2025 R2-FM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23994 2026-03-02 cs.LG cs.AI cs.CV 84%

MINT: Multimodal Imaging-to-Speech Knowledge Transfer for Early Alzheimer's Screening

MINT:多模态影像到语音知识迁移用于早期阿尔茨海默病筛查

Vrushank Ahire, Yogesh Kumar, Anouck Girard, M. A. Ganaie

机构 * Department of CSE, Indian Institute of Technology Ropar(印度理工学院罗帕尔计算机科学与工程系) Embry-Riddle Aeronautical University(埃姆布里-瑞尔德航空大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MINT通过多模态知识迁移,利用MRI生物标志物提升语音识别的阿尔茨海默病早期筛查性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23393 2026-03-02 cs.SD cs.CV 83%

Leveraging large multimodal models for audio-video deepfake detection: a pilot study

利用大型多模态模型进行音频视频深度伪造检测:一项试点研究

Songjun Cao, Yuqi Li, Yunpeng Luo, Jianjun Yin, Long Ma

机构 * Tencent Youtu Lab(腾讯优图实验室) Fudan University(复旦大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出AV-LMMDetect,利用大型多模态模型进行音频视频深度伪造检测,通过监督微调和分阶段训练,在多个数据集上达到新的性能水平。

Comments 5pages,ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD 81%

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09658 2026-03-02 cs.HC 78%

Co-Designing Multimodal Systems for Accessible Asynchronous Dance Instruction

为无障碍异步舞蹈教学设计多模态系统

Ujjaini Das, Shreya Kappala, Meng Chen, Mina Huh, Amy Pavel

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文通过协同设计研讨会,探讨了如何通过多模态系统为盲人和低视力学习者提供无障碍异步舞蹈教学。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23747 2026-03-02 cs.HC 71%

Feelings, Not Feel: Affective Audio-Visual Pseudo-Haptics in Hand-Tracked XR

感受,而非感受:手部追踪XR中的情感音频视觉伪触觉

Kristian Paolo David, Tyrone Justin Sta Maria, Mikkel Dominic Gamboa, Jordan Aiko Deja

专题命中 音频语音多模态 :audio-visual(title)

AI总结 该研究探讨了在无控制器的XR环境中,通过伪触觉线索(音频、视觉)影响用户情感体验的机制,发现其更应视为情感反馈而非直接触觉替代。

Comments 5 pages, 2 figures, 1 table, CHI EA Posters

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23649 2026-03-02 cs.SD cs.AI 57%

AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech

AudioCapBench: 音频描述能力的快速评估:涵盖声音、音乐和语音

Jielin Qiu, Jianguo Zhang, Zixiang Chen, Liangwei Yang, Ming Zhu, Juntao Tan, Haolin Chen, Wenting Zhao, Rithesh Murthy, Roshan Ram, Akshara Prabhakar, Shelby Heinecke, Caiming, Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AudioCapBench通过对比不同模型在环境声音、音乐和语音描述任务中的表现,评估了大模型的音频描述能力,揭示Gemini模型在整体质量上优于OpenAI模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2602.24021 2026-03-02 cs.CV 83%

Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection

在冻结的多模态大语言模型中引导和校正潜在表示流形以进行视频异常检测

Zhaolin Cai, Fan Li, Huiyu Duan, Lijun He, Guangtao Zhai

专题命中 视频多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 SteerVAD通过引导和校正冻结多模态大语言模型的潜在表示流形,提升视频异常检测的性能,仅需1%训练数据即达最优效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14896 2026-03-02 cs.CV 83%

Leveraging Multimodal LLM Descriptions of Activity for Explainable Semi-Supervised Video Anomaly Detection

利用多模态大语言模型对活动的描述进行可解释的半监督视频异常检测

Furkan Mumcu, Michael J. Jones, Anoop Cherian, Yasin Yilmaz

机构 * Department of Electrical Engineering University of South Florida(电气工程系 佛罗里达州立大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出利用多模态大语言模型描述活动,以实现可解释的半监督视频异常检测,有效检测复杂交互异常并提升模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23937 2026-03-02 cs.RO cs.CV 79%

Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos

通过真实世界室内游览视频的多模态事件知识增强视觉语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Xingxing Zuo, Yaoxian Song, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(马尔代夫 bin Zayed 大学人工智能学院) Hangzhou City University(杭州城市学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于多模态事件知识的视觉语言导航增强方法,通过构建大规模时空知识图谱并结合层次检索机制,提升长视界推理和粗粒度指令处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08578 2026-03-02 cs.CV 79%

Multimodal Knowledge Distillation for Egocentric Action Recognition Robust to Missing Modalities

多模态知识蒸馏用于抗缺失模态的自体视觉动作识别

Maria Santos-Villafranca, Dustin Carrión-Ojeda, Alejandro Perez-Yus, Jesus Bermudez-Cameo, Jose J. Guerrero, Simone Schaub-Meyer

机构 * I3A – University of Zaragoza(萨拉戈萨大学I3A研究中心) Technical University of Darmstadt, Department of Computer Science(达姆施塔特技术大学计算机科学系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 KARMMA通过多模态知识蒸馏实现抗缺失模态的自体视觉动作识别,以轻量模型提升机器人部署效率。

Comments Project Page: https://visinf.github.io/KARMMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00805 2026-03-02 cs.CV 70%

Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding

通过草稿思考:用于高效长视频理解的推测性时间推理

Pengfei Hu, Meng Cao, Yingyao Wang, Yi Wang, Jiahua Dong, Jun Song, Yu Cheng, Bo Zheng, Xiaodan Liang

机构 * MBZUAI(马克斯·普朗克智能研究院) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SpecTemp通过协作双模型设计,实现高效长视频理解,平衡效率与准确性,提升推理速度。

Comments Accepted by CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23784 2026-03-02 cs.LG cs.AI q-fin.CP q-fin.TR 57%

TradeFM: A Generative Foundation Model for Trade-flow and Market Microstructure

TradeFM: 一种用于交易流和市场微观结构的生成基础模型

Maxime Kawawa-Beaudan, Srijan Sood, Kassiani Papasotiriou, Daniel Borrajo, Manuela Veloso

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 TradeFM是一种基于生成Transformer的市场微观结构基础模型,通过学习大规模交易数据实现跨资产泛化,有效捕捉市场特征并提升合成数据生成与交易策略研究能力。

Comments 29 pages, 17 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2509.01959 2026-03-02 cs.CV cs.AI cs.LG 84%

Structure-aware Contrastive Learning for Diagram Understanding of Multimodal Models

结构感知对比学习用于多模态模型的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。

Comments 10 pages, 8 figures

Journal ref ICCVW (2025) 7463-7472

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14245 2026-03-02 cs.IR 82%

XR: Cross-Modal Agents for Composed Image Retrieval

XR:跨模态代理用于组合图像检索

Zhongyu Yang, Wei Pang, Yingfang Yuan

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)

AI总结 XR通过多代理协作提升组合图像检索性能,实现38%的提升

Comments Accepted by WWW 2026. Project: https://01yzzyu.github.io/xr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23369 2026-03-02 cs.IR cs.AI cs.CL 81%

Reason to Contrast: A Cascaded Multimodal Retrieval Framework

对比之理:一种级联多模态检索框架

Xuanming Cui, Hong-You Chen, Hao Yu, Hao Yuan, Zihao Wang, Shlok Kumar Mishra, Hanchao Yu, Yonghuan Yang, Jun Xiao, Ser-Nam Lim, Jianpeng Cheng, Qi Guo, Xiangjun Fan

机构 * AI at Meta(Meta人工智能部门) University of Central Florida(中央佛罗里达大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TTE-v2框架,通过引入基于额外输入标记预算的推理驱动性能扩展,提升多模态检索的测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24134 2026-03-02 cs.CV cs.CL 62%

AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation

AgenticOCR: 为高效检索增强生成解析所需内容

Zhengren Wang, Dongsheng Ma, Huaping Zhong, Jiayu Li, Wentao Zhang, Bin Wang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 AgenticOCR通过动态解析范式提升视觉文档检索增强生成系统的效率和准确性,实现按需提取和解耦检索粒度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23906 2026-03-02 cs.CV 57%

Half-Truths Break Similarity-Based Retrieval

半真信息破坏基于相似性的检索

Bora Kargi, Arnas Uselis, Seong Joon Oh

机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(科纳德·祖斯卓越学习与智能系统学校(ELIZA))

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 CS-CLIP通过分解标题为实体和关系单元并改进监督方法,提升了基于相似性检索的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23890 2026-03-02 cs.CV 57%

DACESR: Degradation-Aware Conditional Embedding for Real-World Image Super-Resolution

DACESR: 退化感知条件嵌入用于现实世界图像超分辨率

Xiaoyan Lei, Wenlong Zhang, Biao Luo, Hui Liang, Weifeng Cao, Qiuting Lin

机构 * School of Electrical and Information Engineering, Zhengzhou University of Light Industry(郑州轻工业大学电气与信息工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Automation, Central South University(中南大学自动化学院) Intelligent Manufacturing Engineering at Machinery Technology Development Co.,Ltd.(机械技术发展有限公司智能制造工程) China Academy of Machinery Science and Technology Group Co.,Ltd.(中国机械科学与技术集团有限公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 DACESR通过退化感知条件嵌入提升现实世界图像超分辨率的保真度与感知质量。

Comments Accepted by TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09626 2026-03-02 cs.CV 57%

ECAM: A Contrastive Learning Approach to Avoid Environmental Collision in Trajectory Forecasting

ECAM: 一种用于轨迹预测中避免环境碰撞的对比学习方法

Giacomo Rosin, Muhammad Rameez Ur Rahman, Sebastiano Vascon

机构 * Department of Environmental Sciences, Informatics and Statistics, Ca' Foscari University of Venice, Italy(环境科学、信息学与统计学系,威尼斯卡福斯卡里大学,意大利)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 ECAM通过对比学习方法提升轨迹预测中对环境碰撞的避免能力,有效降低碰撞率。

Comments IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2602.23739 2026-03-02 cs.CV 83%

U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation

U-Mind:一种实时光学交互的统一框架

Xiang Deng, Feng Gao, Yong Zhang, Youxin Pang, Xu Xiaoming, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 U-Mind 提出了一种统一框架,通过实时生成和多模态联合建模,实现高效且连贯的多模态交互,推动智能对话代理的发展。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23366 2026-03-02 cs.HC cs.IR 82%

Doc To The Future: Infomorphs for Interactive, Multimodal Document Transformation and Generation

文档面向未来:用于交互式、多模态文档转换与生成的Infomorphs

Balasaravanan Thoravi Kumaravel

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 Doc To The Future提出Infomorphs,通过模块化、用户可控的AI增强转换,实现交互式多模态文档转换与生成,提升生成式AI在信息工作中的透明度和模块化交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24183 2026-03-02 cs.CV cs.LG 79%

A multimodal slice discovery framework for systematic failure detection and explanation in medical image classification

一种用于医学图像分类中系统性故障检测和解释的多模态切片发现框架

Yixuan Liu, Kanwal K. Bhatia, Ahmed E. Fetit

机构 * Department of Computing, Imperial College London, UK(帝国理工学院 computing 部,英国) Aival, London, UK(Aival,伦敦,英国)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出了一种多模态切片发现框架,用于医学图像分类中的系统性故障检测与解释,展示了其在故障发现和解释生成方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23711 2026-03-02 cs.CV 70%

Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?

统一的生成与理解模型能否在不同输出模态间保持语义等价性?

Hongbo Jiang, Jie Li, Yunhang Shen, Pingyang Dai, Xing Sun, Haoyu Cao, Liujuan Cao

机构 * Tencent Youtu Lab(腾讯云图实验室) Xiamen University(厦门大学) Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏