arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-03 至 2026-04-03 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2603.25040 2026-04-03 cs.LG cs.CL cs.CV 90%

Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale

Intern-S1-Pro:万亿参数科学多模态基础模型

Yicheng Zou, Dongsheng Zhu, Lin Zhu, Tong Zhu, Yunhua Zhou, Peiheng Zhou, Xinyu Zhou, Dongzhan Zhou, Zhiwang Zhou, Yuhao Zhou, Bowen Zhou, Zhanping Zhong, Zhijie Zhong, Haiteng Zhao, Penghao Zhao, Xiaomeng Zhao, Zhiyuan Zhao, Yechen Zhang, Jin Zhang, Wenwei Zhang, Hongjie Zhang, Zhuo Zhang, Wenlong Zhang, Bo Zhang, Chao Zhang, Chen Zhang, Yuhang Zang, Fei Yuan, Jiakang Yuan, Jiashuo Yu, Jinhui Yin, Haochen Ye, Qian Yao, Bowen Yang, Danni Yang, Kaichen Yang, Ziang Yan, Jun Xu, Yicheng Xu, Wanghan Xu, Xuenan Xu, Chao Xu, Ruiliang Xu, Shuhao Xing, Long Xing, Xinchen Xie, Ling-I Wu, Zijian Wu, Zhenyu Wu, Lijun Wu, Yue Wu, Jianyu Wu, Wen Wu, Fan Wu, Xilin Wei, Qi Wei, Bingli Wang, Rui Wang, Ziyi Wang, Zun Wang, Yi Wang, Haomin Wang, Yizhou Wang, Lintao Wang, Yiheng Wang, Longjiang Wang, Bin Wang, Jian Tong, Zhongbo Tian, Huanze Tang, Chen Tang, Shixiang Tang, Yu Sun, Qiushi Sun, Xuerui Su, Qisheng Su, Chenlin Su, Demin Song, Jin Shi, Fukai Shang, Yuchen Ren, Pengli Ren, Xiaoye Qu, Yuan Qu, Jiantao Qiu, Yu Qiao, Biqing Qi, Runyu Peng, Tianshuo Peng, Jiahui Peng, Qizhi Pei, Zhuoshi Pan, Linke Ouyang, Wenchang Ning, Yichuan Ma, Zerun Ma, Ningsheng Ma, Runyuan Ma, Chengqi Lyu, Haijun Lv, Han Lv, Lindong Lu, Kuikun Liu, Jiangning Liu, Yuhong Liu, Kai Liu, Hongwei Liu, Zhoumianze Liu, Mengjie Liu, Ziyu Liu, Wenran Liu, Yang Liu, Liwei Liu, Kaiwen Liu, Junyao Lin, Junming Lin, Tianyang Lin, Dahua Lin, Jianze Liang, Linyang Li, Peiji Li, Zonglin Li, Zehao Li, Pengze Li, Guoyan Li, Lingkai Kong, Linglin Jing, Zhenjiang Jin, Feifei Jiang, Qian Jiang, Junhao Huang, Zixian Huang, Haian Huang, Zhouqi Hua, Ermo Hua, Han Hu, Linfeng Hou, Yinan He, Conghui He, Tianyao He, Xu Guo, Qipeng Guo, Aijia Guo, Yuzhe Gu, Lixin Gu, Jingyang Gong, Qiming Ge, Jiaye Ge, Songyang Gao, Jianfei Gao, Xinyu Fang, Caihua fan, Yue Fan, Yanhui Duan, Zichen Ding, Shengyuan Ding, Ning Ding, Xuanlang Dai, Erfei Cui, Ganqu Cui, Pei Chu, Tao Chu, Guangran Cheng, Yu Cheng, Kai Chen, Yongkang Chen, Chiyu Chen, Guanzhou Chen, Qiaosheng Chen, Sitao Chen, Xin Chen, Haojiong Chen, Yicheng Chen, Weihan Cao, Yuhang Cao, Qinglong Cao, Lei Bai

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 Intern-S1-Pro是首个万亿参数科学多模态基础模型,具备跨通用与科学领域的能力提升,融合强推理、图像-文本理解及先进代理能力,专精于100余项科学任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01251 2026-04-03 cs.CV eess.IV 83%

Camouflage-aware Image-Text Retrieval via Expert Collaboration

通过专家协作实现伪装意识的图像-文本检索

Yao Jiang, Zhongkuan Mao, Xuan Wu, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) National Key Lab of Fundamental Science on Synthetic Vision, Sichuan University(四川大学视觉合成图形图像技术国家级重点实验室)

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出伪装意识图像-文本检索任务,构建了CamoIT数据集,并提出CECNet网络,通过双分支编码器和C²GA机制提升检索性能,实验表明在七种模型中取得29%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01749 2026-04-03 cs.CV 79%

Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding

超声-CLIP:面向超声图像-文本理解的语义感知对比预训练

Jiayun Jin, Haolong Chai, Xueying Huang, Xiaoqing Guo, Zengwei Zheng, Zhan Zhou, Junmei Wang, Xinyu Wang, Jie Liu, Binbin Zhou

机构 * Hangzhou City University(杭州城市大学) Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) City University of Hong Kong(香港城市大学)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 本文提出超声-CLIP,通过构建US-365K数据集和UDT知识框架,引入语义软标签和损失函数,提升超声图像与文本的语义对比学习效果,实现分类和检索的SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01987 2026-04-03 cs.CV cs.LG 57%

Curia-2: Scaling Self-Supervised Learning for Radiology Foundation Models

Curia-2:用于放射学基础模型的自监督学习扩展

Antoine Saporta, Baptiste Callard, Corentin Dancette, Julien Khlaut, Charles Corbière, Leo Butsanets, Amaury Prat, Pierre Manceron

机构 * Raidium Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP, Paris, France(巴黎欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) Faculté de Santé, Université Paris-Cité, Paris, France(巴黎西岱大学健康学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Curia-2通过改进预训练策略和表征质量,提升了放射学数据的捕捉能力,首次实现了多模态CT和MRI基础模型的亿参数视觉变换器架构,并在两个新评估轨道中验证了其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01915 2026-04-03 cs.CV 57%

Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts

通过知识引导的空间提示增强医学视觉 grounding

Yifan Gao, Tao Zhou, Yi Zhou, Ke Zou, Yizhe Zhang, Huazhu Fu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Yong Yoo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KnowMVG框架,通过知识增强提示和全局局部注意力机制提升医学视觉 grounding的精度,实验显示在四个基准上优于现有方法。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV 57%

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏