arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-08 至 2026-05-08 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2601.09298 2026-05-08 cs.CV 89%

Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain

基于多模态LLM的ICT图像描述:弥合通用与行业领域之间的差距

Lianying Chao, Kai Zhang, Haoran Cai, Sijie Wu, Xubin Li, Xin Chen

机构 * GTS, Huawei Technologies Co., Ltd.(华为技术有限公司GTS部门)

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);multimodal(abstract);image-text(abstract)

AI总结 本文提出多阶段训练策略,构建ICT领域图像描述模型DICModel,通过合成图像文本对提升模型性能,实验表明其在BLEU指标和准确率上均优于现有模型。

Journal ref 2025 CCF BigData

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05886 2026-05-08 cs.CV 79%

Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models

无需训练的多模态大语言模型密集手部接触估计

Daniel Sungho Jung, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(电子工程与自动控制研究所,首尔国立大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出ContactPrompt,利用多模态大语言模型进行无需训练的密集手部接触估计,通过引入详细的部位分割和部分顶点网格表示,结合多阶段结构化接触推理,实现高精度的接触预测。

Comments Project page: https://contactprompt-release.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05546 2026-05-08 cs.AI 70%

SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

SPARK:基于知识图谱的异步奖励自我对抗学习

Hyobin Park, Taeseop Kim, Dong-Geol Choi

机构 * Hanbat National University, South Korea(韩国翰bac国立大学)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 SPARK通过构建统一知识图谱实现多文档科学文献的自我对抗学习,利用图路径生成关系推理问题并基于结构化事实计算奖励,优于传统自对抗基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06592 2026-05-08 cs.CV cs.AI cs.LG 62%

DINORANKCLIP: DINOv3 Distillation and Injection for Vision-Language Pretraining with High-Order Ranking Consistency

DINORANKCLIP:基于DINOv3蒸馏与注入的视觉-语言预训练高阶排名一致性方法

Shuyang Jiang, Nan Yu, Yiming Zhang, Zenghui Ding, Zhenyu Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Aimaikj(阿米亚克j) HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) National University of Defense Technology(国防科技大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 DINORANKCLIP通过融合DINOv3教师模型与高阶排名一致性损失,改进CLIP在视觉-语言预训练中的表现,提升细粒度和分布外推理能力。

Comments 18 pages, 7 figures, 9 tables. Code will be made publicly available upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05421 2026-05-08 cs.CV cs.AI cs.LG 62%

DARK: Diagonal-Anchored Repulsive Knowledge Distillation for Vision-Language Models under Extreme Compression

DARK:针对极端压缩下视觉-语言模型的对角锚定排斥知识蒸馏

Numan Saeed, Asif Hanif, Fadillah Adamsyah Maani, Hussain Alasmawi, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed人工智能大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DARK,一种对比知识蒸馏框架,通过分解损失函数为对角项和非对角项,使学生模型在极端压缩下更高效地排斥教师模型的非目标相似结构,实验证明其在零样本基准上表现优异。

Comments Project website: www.numansaeed.com/mobilefetalclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06080 2026-05-08 cs.CV 57%

MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation

MSD-Score:多尺度分布评分用于无参考图像描述评估

Shichao Kan, Xuyang Zhang, Haojie Zhang, Zhe Zhu, Yigang Cen, Yixiong Liang, Lianlei Shan, Linna Zhang, Zhe Qu, Jiazhi Xia

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) School of Computer Science and Technology and the State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学计算机科学与技术学院和先进轨道交通自主运行国家重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Mechanical Engineering, Guizhou University(贵州大学机械工程学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出MSD-Score,一种无参考图像描述评估指标,通过多尺度分布评分方法量化语义差异,实现对局部 grounding 错误的透明诊断,优于现有无参考指标。

Comments Preprint. 17 pages, 10 figures. Code is available at: https://steinsgatesg.github.io/MSDScore/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV 57%

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13670 2026-05-08 cs.LG 50%

Advancing Analytic Class-Incremental Learning through Vision-Language Calibration

通过视觉-语言校准推进分析类增量学习

Binyu Zhao, Wei Zhang, Xingrui Yu, Zhaonian Zou, Ivor Tsang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)的CFAR和IHPC) College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 本文提出VILA框架,通过双级视觉语言校准策略解决预训练模型分析类增量学习中的表示刚性问题,提升学习效率与稳定性,在多个基准测试中表现优异。

Comments 20 pages, 11 figures, 9 tables. Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏