arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-13 至 2026-03-13 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2603.11320 2026-03-13 cs.CV 70%

UniCompress: Token Compression for Unified Vision-Language Understanding and Generation

UniCompress: 用于统一视觉-语言理解和生成的标记压缩

Ziyao Wang, Chen Chen, Jingtao Li, Weiming Zhuang, Jiabo Huang, Ang Li, Lingjuan Lyu

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniCompress通过引入可学习的全局元标记引导的插件压缩和解压缩机制,显著减少视觉标记数量,同时保持图像理解和生成任务的性能,为资源受限场景下的统一多模态建模提供高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11938 2026-03-13 cs.AI cs.CV cs.LG 62%

Prototype-Based Knowledge Guidance for Fine-Grained Structured Radiology Reporting

基于原型的知识引导的细粒度结构化放射科报告

Chantal Pellegrini, Adrian Delchev, Ege Özsoy, Nassir Navab, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technische Universität München, Germany(计算机辅助医疗程序,慕尼黑技术大学,德国) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ProtoSR通过整合自由文本信息提升细粒度结构化放射科报告的自动化水平,利用多模态知识库和原型条件残差增强模型预测,有效改进了对罕见发现和属性的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12208 2026-03-13 cs.CV 57%

ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models

ForensicZip: 更多令牌更好但并非必要在取证视觉-语言模型中

Yingxin Lai, Zitong Yu, Jun Wang, Linlin Shen, Yong Xu, Xiaochun Cao

机构 * Great Bay University(大湾大学) Shenzhen University(深圳大学) Harbin Institute of Technology(哈尔滨工业大学) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ForensicZip通过引入无需训练的框架,从伪造驱动的角度重新定义令牌压缩,利用最优传输问题量化物理不连续性,实现高压缩率下的取证证据分离与高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11441 2026-03-13 cs.CV 57%

Detect Anything in Real Time: From Single-Prompt Segmentation to Multi-Class Detection

实时检测任意目标:从单提示分割到多类检测

Mehmet Kerem Turkcan

机构 * Columbia University(哥伦比亚大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 DART通过共享视觉主干网络计算,实现实时多类检测,无需训练,提升速度达25倍,达到80类检测的55.8 AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02421 2026-03-13 cs.CV 57%

Generalizing Vision-Language Models with Dedicated Prompt Guidance

通过专用提示引导泛化视觉语言模型

Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GuiDG框架,通过提示微调和跨模态注意力模块提升视觉语言模型的领域泛化能力,并在ImageNet-DG上验证了其有效性。

Comments Accepted to AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏