arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-23 至 2026-03-23 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2512.24903 2026-03-23 cs.CV cs.CE 83%

FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation

FinMMDocR:基于场景意识、文档理解与多步骤计算的金融多模态推理基准测试

Zichen Tang, Haihong E, Rongjin Li, Jiacheng Liu, Linwei Jia, Zhuodi Hao, Zhongjun Yang, Yuanze Li, Haolin Tian, Xinyi Hu, Peizhi Zhao, Yuan Liu, Zhengyu Wang, Xianghe Wang, Yiling Huang, Xueyuan Lin, Ruofei Bai, Zijian Xie, Qian Huang, Ruining Cao, Haocheng Gao

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 FinMMDocR通过引入场景意识、文档理解和多步骤计算,推动多模态大语言模型在现实金融场景中的推理能力提升,其包含12种隐含金融场景、9类丰富文档及平均11步推理任务。

Comments Accepted by AAAI-26 Main Track

Journal ref Proc. AAAI 2026 (Vol. 40, No. 30), pages 25858-25866

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20181 2026-03-23 cs.CR cs.AI 79%

Improving Generalization on Cybersecurity Tasks with Multi-Modal Contrastive Learning

通过多模态对比学习提升网络安全任务的泛化能力

Jianan Huang, Rodolfo V. Valentim, Luca Vassio, Matteo Boffa, Marco Mellia, Idilio Drago, Dario Rossi

机构 * Huawei Paris Research Center, France(华为巴黎研究中心,法国)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态对比学习框架,通过文本指导 payloads 分类,提升网络安全任务的泛化能力,并在合成基准和真实数据集上验证效果。

Comments Submitted to Euro S&P - 5th International Workshop on Designing and Measuring Security in Systems with AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20016 2026-03-23 cs.CV 79%

CFCML: A Coarse-to-Fine Crossmodal Learning Framework For Disease Diagnosis Using Multimodal Images and Tabular Data

CFCML:一种用于多模态图像和表格数据疾病诊断的粗到细跨模态学习框架

Tianling Liu, Hongying Liu, Fanhua Shang, Lequan Yu, Tong Han, Liang Wan

机构 * College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) Medical School of Tianjin University(天津大学医学院) Peng Cheng Lab(鹏城实验室) Department of Statistics and Actuarial Science, School of Computing and Data Science, The University of Hong Kong(统计与精算系,计算与数据科学学院,香港大学) Department of Radiology, Tianjin Huanhu Hospital(天津华医院放射科) Tianjin Key Laboratory of Cerebral Vascular and Neurodegenerative Diseases(天津脑血管与神经退行性疾病重点实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CFCML框架,通过粗到细的跨模态学习逐步缩小多模态数据间的模态差距,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17470 2026-03-23 cs.CV cs.AI 62%

VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection

VirPro: 基于视觉引用的概率提示学习用于弱监督单目3D检测

Chupeng Liu, Jiyong Rao, Shangquan Sun, Runkai Zhao, Weidong Cai

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VirPro,通过生成场景条件化提示并结合多高斯提示建模,提升单目3D检测的弱监督性能,实验表明在KITTI基准上平均精度提升4.8%。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04803 2026-03-23 cs.CV cs.AI cs.LG 62%

Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation

通过对比信号引导扩散重建以实现平衡的视觉表示

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Xilin Zhao, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过对比信号优化扩散重建,以提升CLIP中判别能力和细节感知能力,解决传统方法在平衡视觉表示上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏