arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-13 至 2026-04-13 共收录 66 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2604.09532 2026-04-13 cs.CV cs.AI 81%

Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise

见仁见智:在标签噪声下鲁棒的视觉引导跨模态提示学习

Zibin Geng, Xuefeng Jiang, Jia Li, Zheng Li, Tian Wen, Lvhua Wu, Sheng Sun, Yuwei Wang, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) PCALab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院PCALab, VCIP)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisPrompt框架,通过跨模态注意力机制将视觉语义注入提示表示,提升在标签噪声下的鲁棒性,实验表明其在多个数据集上表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09253 2026-04-13 cs.CV cs.AI 81%

Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization

Mosaic: 通过多视图集成优化实现对闭源视觉语言模型的多模态劫持

Yuqin Lan, Gen Li, Yuanze Hu, Weihao Shen, Zhaoxin Fan, Faguo Wu, Xiao Zhang, Laurence T. Yang, Zhiming Zheng

机构 * Beihang University(北京航空航天大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mosaic框架,通过多视图集成优化减少对单一代理模型的依赖,提升对闭源VLMs的多模态劫持效果,实验显示其在安全基准上的攻击成功率和毒性均达到最优。

Comments 14pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08815 2026-04-13 cs.CV 79%

Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models

通过上下文对齐的视觉-语言模型实现负责任的多模态医疗推理

Sumra Khan, Sagar Chhabriya, Aizan Zafar, Sheeraz Arif, Amgad Muneer, Anas Zafar, Shaina Raza, Rizwan Qureshi

机构 * Salim Habib University(萨利姆·哈比卜大学) Institute of Business Administration Sukkur(苏库尔工商管理学院) University of Central Florida(中佛罗里达大学) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Toronto Metropolitan University(多伦多都会大学) Vector Institute(向量研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种上下文对齐的框架,通过整合多种临床证据提升医疗多模态推理的可靠性与可信度,实验显示其在胸部X光数据集上提升了判别性能并减少幻觉关键词。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09017 2026-04-13 cs.NI 78%

Multimodal Large Language Model Enabled Robust Beamforming for HAP Downlink Communications

多模态大语言模型赋能的HAP下行链路鲁棒波束成形

Xiaoyu Xing, Peng Yang, Guoquan Tao, Dingyi Lu, Zehui Xiong, Xianbin Cao

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本文提出基于多模态大语言模型的波束成形框架,通过飞行 telemetry 预测HAP姿态并实现鲁棒下行通信,提升用户服务比和总速率22.1%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09529 2026-04-13 cs.CV cs.AI cs.CL 67%

VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning

VL-Calibration:解耦的大型视觉-语言模型推理置信度校准

Wenyi Xiao, Xinchi Xu, Leilei Gan

机构 * Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VL-Calibration,通过强化学习框架解耦视觉和推理置信度,提升大视觉-语言模型的校准与视觉推理准确率。

Comments 24 pages, ACL 2026 Main. Repository: https://github.com/Mr-Loevan/VL-Calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21472 2026-04-13 cs.CV cs.CL cs.MM 67%

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

通过自适应注意力校准缓解大视觉-语言模型中的幻觉

Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出CAAC框架,通过解决空间感知偏差和模态偏差,提升大视觉-语言模型在长文本生成中的准确性和视觉对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06665 2026-04-13 cs.CV cs.AI 62%

Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine

更好的眼睛,更好的思考:为何视觉链式推理在医学中失效

Yuan Wu, Zongxian Yang, Jiayu Qian, Songpan Gao, Guanxing Chen, Qiankun Li, Yu-An Huang, Zhi-An Huang

机构 * Department of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学系) College of Computing and Data Science (CCDS), Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文发现链式推理在医学视觉问答中表现欠佳,提出通过感知锚定和描述 grounding 提升视觉 grounding 和跨模态对齐以改善性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09067 2026-04-13 cs.CV cs.AI 62%

Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations

通过合成演示增强医疗视觉-语言模型的安全性

Zhiyu Xue, Reza Abbasi-Asl, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) UC San Francisco(加州大学旧金山分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种新的推理时防御策略,通过合成临床演示提升模型安全性,同时平衡安全与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14075 2026-04-13 cs.CV cs.CL 62%

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models

通过蒸馏和强化学习生长多头Twig以加速大视觉-语言模型

Zhenwei Shao, Mingyang Wang, Weijun Zhang, Zhou Yu, Wenwen Pan, Yan Yang, Tao Wei, Hongyuan Zhang, Jun Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, School of Computer Science, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,计算机学院,杭州电子科技大学) Li Auto Inc.(理想汽车) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出TwigVLM,通过在基础VLM早期层上生长轻量模块Twig,结合 Twig 引导的 token 剪枝和自推测解码策略,实现更高的准确性和速度。实验表明, TwigVLM 在剪枝88.9%的视觉token后仍保持96%的原始性能,并在生成长响应时达到154%的速度提升。

Comments An extended version of our ICCV paper at ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html" target="_blank" rel="noopener">https://openaccess.thecvf.com/content/ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08877 2026-04-13 cs.CV 57%

Harnessing Weak Pair Uncertainty for Text-based Person Search

利用弱对不确定性进行基于文本的人检索

Jintao Sun, Zhedong Zheng, Gangyi Ding

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出利用弱正样本不确定性提升文本驱动的人检索性能,通过引入不确定性估计和正则化模块,有效利用弱正样本,实验表明在三个数据集上mAP提升显著。

Comments 39 pages, 15 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2505.20638 2026-04-13 cs.SD cs.CV cs.MM eess.AS 89%

Music Audio-Visual Question Answering Requires Specialized Multimodal Designs

音乐音频视觉问答需要专门的多模态设计

Wenhao You, Xingjian Diao, Wenjun Huang, Chunhui Zhang, Keyi Kong, Weiyi Wu, Chiyu Ma, Zhongyu Ouyang, Tingxuan Wu, Ming Cheng, Soroush Vosoughi, Jiang Gui

机构 * University of Waterloo(滑铁卢大学) Dartmouth College(达特茅斯学院) UC Irvine(加州大学尔湾分校) New York University(纽约大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文探讨了音乐音频视觉问答任务中多模态设计的必要性,指出需专门的输入处理、空间时间架构和音乐特定建模策略以应对连续密集的音频视觉内容和复杂时间动态。

Comments Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026). The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02231 2026-04-13 cs.CV cs.AI cs.LG 84%

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08518 2026-04-13 math.OC cs.LG 50%

SPP-SBL: Space-Power Prior Sparse Bayesian Learning for Block Sparse Recovery

SPP-SBL:空间功率先验稀疏贝叶斯学习用于块稀疏恢复

Yanhao Zhang, Zhihan Zhu, Yong Xia

机构 * LMIB of the Ministry of Education, School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院教育部数学、信息与行为重点实验室)

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文提出SPP-SBL方法,通过空间功率先验和EM算法结合高阶方程求解,解决块稀疏信号结构未知的恢复问题,提升恢复精度。

Comments IEEE Transactions on Signal Processing, 2026

Journal ref In IEEE Transactions on Signal Processing, vol. 74, pp. 1293-1308, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 13 篇

2604.09473 2026-04-13 cs.CV 83%

Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement

实现沉浸式体积分量视频:一种多模态框架用于6自由度VR互动

Zhengxian Yang, Shengqi Wang, Shi Pan, Hongshuai Li, Haoxiang Wang, Lin Li, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu

机构 * Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Migu Beijing Research Institute(咪咕北京研究院) School of Architecture, Tsinghua University(清华大学建筑学院) Department of Automation, Tsinghua University(清华大学自动化系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种多模态框架,用于构建沉浸式体积分量视频,通过多视角多模态数据集和动态光场重建框架,实现高分辨率、高帧率的动态内容,支持6自由度VR交互。

Comments Journal extension of CVPR 2025. See also arXiv:2503.14359 . Project page and code: https://github.com/Metaverse-AI-Lab-THU/ImViD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08771 2026-04-13 cs.HC cs.ET 82%

TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction

TeamLLM: 探索LLMs在多模态群体交互预测中的能力

Diana Romero, Xin Gao, Daniel Khalkhali, Salma Elmalaki

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 本文研究LLMs在多模态传感器数据中预测群体协调模式的能力,发现LLMs在语言基础行为上比LSTM基线提升3.2倍,细调准确率达96%。同时揭示了文本模型在多模态交互中的局限性及模拟模式的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08719 2026-04-13 cs.CV cs.AI cs.RO 81%

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09326 2026-04-13 cs.RO cs.CV 79%

Multimodal Anomaly Detection for Human-Robot Interaction

多模态异常检测用于人机交互

Guilherme Ribeiro, Iordanis Antypas, Leonardo Bizzaro, João Bimbo, Nuno Cruz Garcia

机构 * LASIGE Faculty of Sciences U. Lisboa, Portugal Dep. of Information Engineering University of Padova Padova, Italy

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MADRI框架,通过将视频流转换为语义特征向量进行基于重建的异常检测,并结合机器人内部传感器数据和场景图,提升人机协作中多模态异常检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09527 2026-04-13 cs.CV cs.AI cs.LG 62%

Envisioning the Future, One Step at a Time

逐步展望未来

Stefan Andreas Baumann, Jannik Wiese, Tommaso Martorella, Mahdi M. Kalayeh, Björn Ommer

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Netflix

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过稀疏点轨迹逐步推断来预测开放集未来场景动态,提升大规模探索效率,同时引入OWM基准测试预测准确性与现实不确定性下的多样性。

Comments CVPR 2026. For code and models, see http://compvis.github.io/myriad

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06869 2026-04-13 cs.CV cs.AI 62%

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09059 2026-04-13 cs.CV cs.AI 62%

Learning Vision-Language-Action World Models for Autonomous Driving

学习视觉-语言-动作世界模型以实现自动驾驶

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Central Research Institute, Huawei(华为中央研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-World模型,通过结合预测想象与反思推理提升自动驾驶的前瞻性。该模型利用生成的轨迹引导图像生成,并通过反思优化轨迹预测,实验表明其在规划和未来场景生成任务中优于现有方法。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09037 2026-04-13 cs.CV cs.CL cs.HC 62%

SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos

SiMing-Bench:从连续交互评估临床技能视频中的过程正确性

Xiyang Huang, Jiawei Lin, Keying Wu, Jiaxin Huang, Kailai Yang, Renxiong Wei, Cheng zeng, Jiayi Xiang, Ziyan Kuang, Min Peng, Qianqian Xie, Sophia Ananiadou

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言与信息研究中心) Southwest Jiaotong University(西南交通大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Manchester(曼彻斯特大学) Zhongnan Hospital of Wuhan University(武汉大学中南医院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 SiMing-Bench旨在评估多模态大语言模型在临床技能视频中通过连续交互更新过程状态的能力,通过医师标注的数据集和标准化评分标准,揭示模型在过程级判断上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 62%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 57%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21334 2026-04-13 cs.CV 57%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08966 2026-04-13 cs.CV 57%

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

视频大语言模型应如何输出时间?对高效时间接地范式的分析

Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

机构 * The University of Central Florida(中佛罗里达大学) Axon(Axon公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文对比三种主流视频时间接地范式,探讨输出设计对精度与效率的影响,发现连续分布范式在效率-精度权衡中表现最佳。

Comments CVPR 2026 Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09159 2026-04-13 cs.LG 50%

Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling

截断修正流策略用于具有一步采样的强化学习

Xubin Zhou, Yipeng Yang, Zhan Li

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出TRFP框架,通过混合确定性-随机性架构解决MaxEnt RL中连续时间生成策略的可微性问题,实现稳定训练和有效一步采样,实验表明其在多目标环境和MuJoCo基准中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2604.09024 2026-04-13 cs.CV cs.AI cs.CR cs.LG 84%

Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection

别让我看图片:通过视觉提示注入防止多模态大语言模型分析图片

Zedian Shao, Hongbin Liu, Yuepeng Hu, Neil Zhenqiang Gong

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学)

专题命中 跨模态检索 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ImageProtector,通过在图像中嵌入精心设计的微小扰动,使多模态大语言模型在分析时产生拒绝响应,同时评估了三种潜在的防御措施,发现它们在降低ImageProtector效果的同时影响模型性能。

Comments Appeared in ACL 2026 main conference

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20821 2026-04-13 cs.CL cs.AI cs.CE 84%

MultiFinRAG: An Optimized Multimodal Retrieval-Augmented Generation (RAG) Framework for Financial Question Answering

MultiFinRAG:一种优化的多模态检索增强生成(RAG)框架,用于金融问答

Chinmay Gondhalekar, Urjitkumar Patel, Fang-Chun Yeh

机构 * S&P Global Ratings(标普全球评级)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MultiFinRAG通过多模态提取和分层回退策略,提升金融问答任务中跨模态推理的准确性,比ChatGPT-4o在复杂任务上高19个百分点。

Comments Preprint Copy

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08645 2026-04-13 cs.CV cs.AI cs.LG cs.RO 62%

3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

3D-VCD:通过视觉对比解码缓解3D-LLM具身代理中的幻觉

Makanjuola Ogunleye, Eman Abdelrahman, Ismini Lourentzou

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-VCD,一种用于缓解3D具身代理幻觉的视觉对比解码框架,通过构造扭曲的3D场景图来提升 grounded 推理能力,实验表明其在3D-POPE和HEAL基准上有效。

Comments 8 pages, 6 figures, Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2604.08125 2026-04-13 cs.CV 83%

PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction

PolySLGen:多对多交互中的在线多模态说话-倾听反应生成

Zhi-Yi Lin, Thomas Markhorst, Jouh Yeong Chew, Xucong Zhang

机构 * Computer Vision Lab, Delft University of Technology(代尔夫特理工大学计算机视觉实验室) Honda Research Institute Japan(本田日本研究所)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出PolySLGen框架,用于多对多交互中的多模态反应生成,通过融合姿态和社交信号提升对话连贯性和真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏