arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-31 至 2026-03-31 共收录 162 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 10 篇

2603.27418 2026-03-31 cs.HC 50%

Buzz Buzz: Haptic Cuing of Road Conditions in Autonomous Cars for Drivers Engaged in Secondary Tasks

Buzz Buzz:自动驾驶车辆中通过触觉提示维持驾驶员情境意识的辅助驾驶功能

Shivam Pandey

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 研究通过触觉提示在自动驾驶中维持驾驶员情境意识,发现触觉信息能提升正确回答率并减少看屏幕次数,且不影响次要任务表现。

Comments Ph.D. dissertation at Rice University. April 2021. Main text and appendices are 75 pages, 35 figures combined

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 19 篇

2603.28696 2026-03-31 cs.CV cs.AI 86%

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

AdaptToken: 基于熵的自适应令牌选择用于多模态大语言模型长视频理解

Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) EPFL(瑞士联邦理工学院洛桑) ETH Zurich(苏黎世联邦理工学院)

专题命中 视频多模态 :MLLM(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 AdaptToken通过利用模型自不确定性实现全局控制信号,提升多模态大语言模型对长视频的理解能力,通过熵信号分配令牌预算并支持提前停止,提升准确率并减少推理时间。

Comments Project page: https://haozheqi.github.io/adapt-token

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25327 2026-03-31 cs.CV cs.AI cs.LG 84%

MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding

MMEdge: 通过流水线传感和编码加速设备端多模态推理

Runxi Huang, Mingxuan Yu, Mingyu Tsoi, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MMEdge提出一种基于流水线传感和编码的设备端多模态推理框架,通过细粒度传感和编码单元实现增量计算,结合轻量级时间聚合模块和自适应配置优化器,降低延迟并保持高精度。

Comments Code available at: https://github.com/HKUST-MINSys-Lab/MMEdge. Accepted by SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27558 2026-03-31 cs.CV 83%

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27690 2026-03-31 cs.CV 79%

Customized Visual Storytelling with Unified Multimodal LLMs

基于统一多模态大语言模型的定制化视觉叙事

Wei-Hua Li, Cheng Sun, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。

Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27531 2026-03-31 cs.CV 79%

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

OmniColor: 一种多模态线稿上色的统一框架

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 OmniColor提出一种统一框架,通过空间对齐和语义参考信号分类,提升线稿上色的可控性、视觉质量和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26699 2026-03-31 eess.SP cs.CV cs.LG 79%

EMPD: An Event-based Multimodal Physiological Dataset for Remote Pulse Wave Detection

EMPD:基于事件的多模态生理数据集用于远程脉波检测

Qian Feng, Pengfei Li, Rongshan Gao, Jiale Xu, Rui Gong, Yidi Li

机构 * College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 EMPD数据集通过事件相机和临床级脉氧仪采集多模态数据,用于提升非接触式生理监测算法的鲁棒性,支持高时间精度的脉波检测。

Comments 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24975 2026-03-31 cs.IR 78%

Unbiased Multimodal Reranking for Long-Tail Short-Video Search

长尾短视频搜索的无偏多模态重排序

Wenyi Xu, Feiran Zhu, Songyang Li, Renzhe Zhou, Chao Zhang, Chenglei Dai, Yuren Mao, Yunjun Gao, Yi Zhang

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出基于LLM的多模态重排序框架,通过多阶段训练提升长尾查询内容质量,实验显示在AUC、NDCG@K和用户偏好判断等指标上优于基线方法,线上A/B测试验证了其在用户体验和消费指标上的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16997 2026-03-31 cs.CV cs.LG cs.RO 74%

Resolving Spatio-Temporal Entanglement in Video Prediction via Multi-Modal Attention

通过多模态注意力解决视频预测中的时空纠缠

Shreyam Gupta, P. Agrawal, Priyam Gupta

机构 * Indian Institute of Technology (BHU), Varanasi(印度理工学院(巴纳拉斯印度教大学),瓦拉纳西) University of Colorado, Boulder(科罗拉多大学博尔德分校) Erasmus+, Intelligent Field Robotic Systems (IFRoS), University of Girona(伊拉斯谟+,智能现场机器人系统(IFRoS),赫罗纳大学)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 本文提出MAUCell架构,结合GAN与层级处理策略及三种注意力机制,解决RNN在长时间序列中的局限,提升视频预测的时空一致性与实时性。

Comments 11 pages, 3 figures, 5 tables, and 3 Algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12360 2026-03-31 cs.CV cs.CL 62%

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

VideoARM:基于分层记忆的代理推理用于长视频理解

Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 VideoARM通过自适应代理推理和分层记忆结构,有效降低长视频理解的token消耗,优于现有方法DVD。

Comments Accepted to CVPR 2026, code available at https://milvlg.github.io/videoarm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21086 2026-03-31 cs.CV cs.AI 62%

Efficient Mixture-of-Expert for Video-based Driver State and Physiological Multi-task Estimation in Conditional Autonomous Driving

高效多专家模型用于基于视频的驾驶员状态和生理多任务估计在条件自动驾驶中

Jiyao Wang, Xiao Yang, Zhenyu Wang, Ximeng Wei, Ange Wang, Dengbo He, Kaishun Wu

机构 * the Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Hong Kong(香港大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VDMoE模型,通过RGB视频和远程PPG数据监测驾驶员状态,优化多专家框架以提升多模态输入下的检测效率与准确性,通过新数据集验证其在条件自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26727 2026-03-31 cs.CV cs.AI 62%

The Nonverbal Gap: Toward Affective Computer Vision for Safer and More Equitable Online Dating

非语言鸿沟:迈向更安全和公平的在线约会情感计算

Ratna Kandala, Niva Manchanda, Akshata Kishore Moharir

机构 * University of Kansas(堪萨斯大学) University of Maryland(马里兰大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨在线约会中非语言信息缺失的问题,提出以公平性为核心的研究议程,涵盖实时不适检测、互动不对称建模、知情同意互动设计及长期互动总结等能力领域,强调需建立公平评估体系和设备端处理架构以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27913 2026-03-31 cs.CV 57%

Spatial Orthogonal Refinement for Robust RGB-Event Visual Object Tracking

空间正交细化用于鲁棒的RGB-事件视觉目标跟踪

Dexing Huang, Shiao Wang, Fan Zhang, Xiao Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SOR-Track框架,通过空间正交细化方法改进RGB-事件融合跟踪,在高速运动和低光条件下提升鲁棒性。

Comments Joint International Conference on Automation-Intelligence-Safety and International Symposium on Autonomous Systems 2026 (ICAIS and ISAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27866 2026-03-31 cs.CV 57%

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

Wan-R1: 可验证强化学习用于视频推理

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Tulane University(杜兰大学) Princeton University(普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出可验证奖励设计以提升视频推理的泛化能力,通过改进GRPO算法在流基视频模型中训练,验证奖励在复杂迷宫和机器人导航任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21742 2026-03-31 cs.CV 57%

VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues

VRR-QA:超越显性提示的视频视觉关系推理

Sirnam Swetha, Rohit Gupta, Parth Parag Kulkarni, David G Shatwell, Jeffrey A Chan Santiago, Nyle Siddiqui, Joseph Fioresi, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida, USA(美国中佛罗里达大学人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VRR-QA通过精心 curated 的创意视频数据集,评估视频问答模型在隐含关系推理上的表现,揭示现有模型对显性视觉线索的依赖及隐含推理的难度。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27184 2026-03-31 cs.CV 57%

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

激励时间感知的自体视频理解模型

Zhiyang Xu, Tian Qin, Bowen Jin, Zhengfeng Lai, Meng Cao, Lifu Huang, Peng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) Apple(苹果公司) Harvard University(哈佛大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Davis(加州大学戴维斯分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TGPO算法,通过强化学习提升多模态大语言模型在自体视频理解中的时间感知能力,实验表明其在时间接地和因果连贯性方面优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27103 2026-03-31 cs.CV 57%

LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model

通过分层全局-局部骨架-语言模型增强动作识别

Ruosi Wang, Fangwei Zuo, Lei Li, Zhaoqiang Xia

机构 * Northwestern Polytechnical University(西北工业大学) Shandong University of Finance and Economics(山东财经大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出HocSLM模型,通过分层全局-局部网络和大视觉-语言模型融合骨架与文本信息,提升动作识别的语义表达和跨模态理解能力,实验表明在三个主流数据集上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13846 2026-03-31 cs.HC cs.AI 57%

Is Seeing Believing? Evaluating Human Sensitivity to Synthetic Video

看见就是相信吗?评估人类对合成视频的敏感性

David Wegmann, Emil Stevnsborg, Søren Knudsen, Luca Rossi, Aske Mottelson

机构 * IT University of Copenhagen(哥本哈根信息技术大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文通过三项研究探讨人类对合成视频中视觉和听觉扭曲的感知,发现视频扭曲和深度伪造瑕疵会降低可信度,为深入理解合成视频的认知处理提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12533 2026-03-31 cs.CV 57%

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

你看到我指向的是什么?基于手势的 egocentric 视频问答

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03100 2026-03-31 cs.CV 57%

AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video

AVATAR:通过视频进行视觉、听觉和推理的强化学习

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 AVATAR通过离线训练架构和时间优势塑造策略解决多模态长时视频推理中的数据效率、消失优势和信用分配问题,实现跨多个基准测试的优越性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 跨模态检索 7 篇

2509.19315 2026-03-31 eess.SP cs.AI cs.LG 83%

Advancing Few-Shot Pediatric Arrhythmia Classification with a Novel Contrastive Loss and Multimodal Learning

通过新颖的对比损失和多模态学习推进少样本儿童心律失常分类

Yiqiao Chen, Zijian Huang, Zhenghui Feng

机构 * Faculty of Frontier Sciences, Harbin Institute of Technology(哈尔滨工业大学(深圳)前沿科学学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出多模态端到端框架,结合体表ECG和心内电图信号,引入自适应全局类感知对比损失,提升少样本下儿童心律失常分类性能。

Comments 12pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07738 2026-03-31 cs.LG cs.CV 83%

From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training

从探索到利用:一种两阶段熵RLVR方法用于噪声容忍的多模态大语言模型训练

Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po

机构 * Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学)

专题命中 跨模态检索 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种两阶段熵优化方法,通过探索阶段提升输出多样性,利用阶段提高预测准确性,增强噪声容忍能力,实验证明在不同模型和任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26683 2026-03-31 cs.IR cs.AI cs.CL cs.CV 82%

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

LITTA:晚期交互与测试时对齐用于视觉接地多模态检索

Seonok Kim

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 LITTA通过查询扩展提升多模态文档检索,利用晚期交互评分和反向排名融合提高检索鲁棒性,适用于计算机科学、制药和工业手册等多领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26695 2026-03-31 eess.SP cs.AI cs.LG eess.IV quant-ph 79%

Complementarity-Preserving Generative Theory for Multimodal ECG Synthesis: A Quantum-Inspired Approach

保持互补性的多模态ECG生成理论:一种受量子启发的方法

Timothy Oladunni, Farouk Ganiyu-Adewumi, Clyde Baidoo, Kyndal Maclin

机构 * Morgan State University(摩根州立大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出保持互补性的生成理论,通过量子启发框架Q-CFD-GAN生成多模态ECG数据,减少潜在嵌入方差并恢复三领域互补性,提升临床应用的生理意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26669 2026-03-31 cs.IR cs.AI cs.LG 79%

ReCQR: Incorporating conversational query rewriting to improve Multimodal Image Retrieval

ReCQR:将对话查询重写纳入多模态图像检索以提高性能

Yuan Hu, ZhiYu Cao, PeiFeng Li, QiaoMing Zhu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出ReCQR任务,通过构建多轮对话查询重写数据集,提升多模态图像检索的准确性和用户查询建模能力。

Comments 4 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28575 2026-03-31 cs.LG cs.AI 57%

ChemCLIP: Bridging Organic and Inorganic Anticancer Compounds Through Contrastive Learning

ChemCLIP:通过对比学习弥合有机和无机抗癌化合物的鸿沟

Mohamad Koohi-Moghadam, Hongzhe Sun, Hongyan Li, Kyongtae Tyler Bae

机构 * Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院) Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) Department of Chemistry, The University of Hong Kong(香港大学化学系)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出ChemCLIP框架,通过对比学习统一有机和无机抗癌化合物的表示,利用共享抗癌活性而非结构相似性,提升跨领域化学知识迁移能力。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15681 2026-03-31 cs.LO cs.AI 57%

ProofBridge: Auto-Formalization of Natural Language Proofs in Lean via Joint Embeddings

ProofBridge: 通过联合嵌入实现自然语言证明的自动形式化(Lean)

Prithwish Jana, Kaan Kale, Ahmet Ege Tanriverdi, Cruise Song, Sriram Vishwanath, Vijay Ganesh

机构 * Georgia Institute of Technology(佐治亚理工学院) Bogazici University(博阿齐奇大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 ProofBridge通过联合嵌入模型实现自然语言定理和证明到Lean 4的自动形式化,结合检索增强微调和迭代证明修复,提升语义和类型正确性。

Comments Published as a conference paper at the 14th International Conference on Learning Representations (ICLR 2026), Rio de Janeiro, Brazil, April 23-27, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 27 篇

2511.13719 2026-03-31 cs.CV cs.AI cs.LG cs.MM cs.RO 89%

Scaling Spatial Intelligence with Multimodal Foundation Models

通过多模态基础模型提升空间智能

Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun, Tongxi Zhou, Jiaqi Li, Hui En Pang, Oscar Qian, Yukun Wei, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。

Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19413 2026-03-31 cs.LG cs.AI cs.CV 86%

UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

UniGame: 将统一多模态模型转变为自身对手

Zhaolong Su, Wang Lu, Hao Chen, Sharon Li, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 UniGame通过自对抗框架提升多模态模型的一致性与鲁棒性,显著增强理解、生成和对抗鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28333 2026-03-31 cs.CV cs.AI 84%

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏