arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-06 至 2026-03-06 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2510.18876 2026-03-06 cs.CV cs.AI cs.CL 82%

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解

Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Wuhan University(武汉大学) ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04957 2026-03-06 cs.CV cs.CL 81%

VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters

VisionPangu:一个紧凑且细粒度的多模态助手,参数为17亿

Jiaxin Fan, Wenpo Song

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 VisionPangu通过高效多模态对齐和高质量监督,实现17亿参数紧凑多模态模型,在无需激进扩展的情况下提升图像描述的结构和细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04894 2026-03-06 cs.AI 79%

Differentially Private Multimodal In-Context Learning

差分隐私多模态上下文学习

Ivoline C. Ngong, Zarreen Reza, Joseph P. Near

机构 * University of Vermont, Burlington, VT, USA(佛罗里达大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DP-MTV是首个实现多样本多模态上下文学习的差分隐私框架,通过激活空间中的任务向量聚合,在保持隐私的前提下提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04878 2026-03-06 cs.CV 79%

Structure Observation Driven Image-Text Contrastive Learning for Computed Tomography Report Generation

基于结构观测的图像-文本对比学习用于CT报告生成

Hong Liu, Dong Wei, Qiong Peng, Yawen Huang, Xian Wu, Yefeng Zheng, Liansheng Wang

机构 * School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医学数据科学研究院) Jarvis Research Center, Tencent YouTu Lab, Shenzhen, China(腾讯YouTu实验室 Jarvis研究部) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou, China(西湖大学医学人工智能实验室)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 本文提出基于结构观测的图像-文本对比学习框架,用于提升CT报告生成的临床效率和准确性。

Comments Accept to IPMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏