arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4644 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4644 篇

2607.08503 2026-07-10 cs.CV 新提交 79%

CT-CLIP Representations for Multimodal Lung Cancer Survival Prediction

用于多模态肺癌生存预测的CT-CLIP表示

Sofie Allgöwer, Mikael Johansson, Andreas Hallqvist, Jonas Andersson, Åse Johnsson, Ida Häggström, Jennifer Alvén

机构 * Chalmers University of Technology(查尔姆斯理工大学) Umeå University(于默奥大学) Sahlgrenska University Hospital(萨尔格伦斯卡大学医院) Sahlgrenska Academy at Gothenburg University(哥德堡大学萨尔格伦斯卡学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究评估特定领域基础模型CT-CLIP用于肺癌多模态生存预测,通过多种策略提取特征,结果显示冻结的CT-CLIP模型结合可训练生存头表现出色,能有效区分高低风险组。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05438 2026-07-08 cs.IR cs.AI 新提交 79%

Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级

Xue Li, Yiming Gai

机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05222 2026-07-07 cs.CV 新提交 79%

A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

面向科学传播中图表-图像连贯性锚定的多模态推理类型学

Avina Nakarmi, Sohom Sen, Xun Song, Sreyashi Samaddar, Aritra Dasgupta

机构 * New Jersey Institute of Technology(新泽西理工学院) Brooklyn College(布鲁克林学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出R1-R5多模态推理类型学,刻画科学文献中图表、图像与文本的协同推理缺口,可系统识别连贯性锚定状态,缩小不同人群解读科学结论的认知差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03461 2026-07-07 cs.CV cs.LG 新提交 79%

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02592 2026-07-07 cs.CV cs.LG 新提交 79%

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

H-OPD:置信感知异构多教师多模态在线策略蒸馏

Qixiang Yin, Huanjin Yao, Yuchen Cai, Jianghao Chen, Ziyi Wang, Min Yang, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ByteDance(字节跳动) USTC(中国科学技术大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部互动技术与体验系统重点实验室) Zhongguancun Academy(中关村科学城)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究多模态推理的在线策略蒸馏问题,提出H-OPD框架,通过验证异构教师互补性,以令牌级教师仲裁取代任务或样本级路由,结合视觉与文本教师,在多基准测试中性能优越。

Comments Technical report(work-in-progress). Code will be available at \url{https://github.com/buptyqx/H-OPD}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28160 2026-07-07 cs.AI 79%

Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

按需查看:多模态推理中视觉证据获取的认知调度框架

Yang Zhang, Xiaoshuai Sun, Rui Zhao, Wujin Sun, Yidong Chen, Jiayi Ji, Qian Chen, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知实验室) Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China(教育部高效计算实验室,厦门大学,361005,中国) Sino-Russian ResearchCenter for Digital Economy(中俄数字经济研究中心) Institute of Artificial Intelligence, Xiamen University, China(人工智能研究院,厦门大学,中国) School of Informatics, Xiamen University, China(信息学院,厦门大学,中国) School of Information Engineering, Xiamen Ocean Vocational College, Xiamen 361102, China(信息工程学院,厦门海洋职业技术学院,厦门361102,中国)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出CSMR框架,通过语言模型控制何时调用独立视觉感知模块获取任务相关视觉证据,在零样本设置下多个基准上优于基线方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30296 2026-07-02 cs.AI 版本更新 79%

ManimAgent: Self-Evolving Multimodal Agents for Visual Education

ManimAgent: 用于视觉教育的自进化多模态智能体

Wenjia Jiang, Zongyuan Cai, Yuanhang Shao, Chenru Wang, Boyan Han, Zhixue Song, Keyu Chen, Shengwei An, Xu Yang, Zhou Yang

机构 * University of Alberta(阿尔伯塔大学) Southeast University(东南大学) Virginia Tech(弗吉尼亚理工学院) Xidian University(西安电子科技大学) Vivavia Inc(Vivavia公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出ManimAgent,通过双通道情节记忆库跨任务传递反思经验,无需权重更新或人工种子,在代码生成任务中提升通过率并减少反思轮次。

Comments Project page: https://manimagent.github.io/. Code: https://github.com/jwj1342/Paper2Manim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28991 2026-06-30 cs.CV eess.IV 79%

Learning from Acquisition: Metadata-driven Multimodal Pre-training for Cardiac MRI

从采集信息中学习:基于元数据驱动的心脏MRI多模态预训练

Xueyi Fu, Liwei Hu, Zi Wang, Guang Yang

机构 * Department of Surgery & Cancer(外科与癌症系) Bioengineering Department and Imperial-X(生物工程系和Imperial-X) National Heart and Lung Institute(国家心脏和肺研究所) Cardiovascular Research Centre(心血管研究中心) School of Biomedical Engineering & Imaging Sciences(生物医学工程与成像科学学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出MetaCLIP-CMR框架,将采集元数据转化为文本监督进行对比学习,在分类和分割任务上优于ImageNet和掩码重建初始化,且仅需不到1%的预训练图像量即可达到与大规模模型相当的性能。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28938 2026-06-30 cs.CL 79%

EVLA: An Electro-Aware Multimodal Assistant for Physically-Grounded Driving Reasoning and Control

EVLA:一种用于物理接地驾驶推理与控制的电感知多模态助手

Yuxin Liu, Zihan Chen, Haoyu Wang, Mingxuan Zhang, Ruijie Lin, Siyuan Zhao

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 图文多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 提出EVLA框架,融合视觉、文本与实时电动动力总成状态,通过统一共状态编码器和电感知结构化推理链,生成上下文感知且能量最优的驾驶决策,在驾驶问答基准上显著优于基线模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27373 2026-06-26 cs.CV 新提交 79%

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

在自进化大型多模态模型中更加关注视觉标记

Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学) Australian National University(澳大利亚国立大学) Linköping University(林雪平大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出VISE框架,通过几何不变性和语义不变性奖励直接正则化视觉条件策略,解决自进化LMMs中视觉欠条件问题,在无监督设置下提升视觉语言理解。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26922 2026-06-26 cs.RO cs.AI 新提交 79%

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling

风险感知的选择性多模态驾驶员监控与驾驶员状态世界建模

Daosheng Qiu, Haozhuang Chi, Hao Su, Shu Long, Xinyue Miao, Yongle Dong, Wei Zhang

机构 * Hubei University(湖北大学) Nanyang Technological University(南洋理工大学) Osaka University(大阪大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出成本感知的选择性推理框架,结合轻量级RGB-生理学生网络和门控机制,在低延迟下减少不安全决策,实现可部署的多模态驾驶员监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20873 2026-06-23 cs.CL 新提交 79%

SciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding

SciLens: 多模态科学声明验证的智能蕴含与归因框架

Yueming Wang, Tianshi Zheng, Jiaxin Bai, Yangqiu Song, Ginny Wong, Simon See

机构 * The Hong Kong University of Science and Technology(香港科技大学) Hong Kong Baptist University(香港浸会大学) NVIDIA AI Technology Center(英伟达人工智能技术中心)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

AI总结 提出SciLens框架,通过将声明分解为原子命题并归因到表格/图表证据,实现多模态科学声明验证,在SciClaimEval上达到79.2%宏F1和63.1%配对准确率。

Comments KDD 2026 SciSoc Agents & LLMs (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06190 2026-06-23 cs.CV 版本更新 79%

Category-Adaptive Cross-Modal Semantic Refinement and Transfer for Open-Vocabulary Multi-Label Recognition

类别自适应跨模态语义精炼与迁移用于开放词汇多标签识别

Haijing Liu, Tao Pu, Hefeng Wu, Keze Wang, Feng Gao, Fan Yang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peking University(北京大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出C²SRT框架,通过类别内语义精炼(ISR)和类别间语义迁移(IST)模块,自适应建模类别内和跨类别语义相关性,提升开放词汇多标签识别性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19882 2026-06-19 cs.CV cs.LG 新提交 79%

Multimodal Concept Bottleneck Models

多模态概念瓶颈模型

Tongqing Shi, Ge Yan, Tuomas Oikarinen, Tsui-Wei Weng

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出多模态概念瓶颈模型(MM-CBM),利用双概念瓶颈层对齐图像和文本嵌入,实现可解释的零样本分类和图像检索,在四个基准上平均准确率提升高达51.26%。

Comments Present at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19627 2026-06-19 cs.IR cs.AI cs.LG 新提交 79%

VCG: A Multimodal Retrieval Framework for E-Commerce Video Feeds under Extreme Cold-Start Conditions

VCG:极端冷启动条件下电商视频流的多模态检索框架

Katya Mirylenka, Egor Malykh, Mahdyar Ravanbakhsh, Michael Gygli, Marco-Andrea Buchmann, Andrew Dzhoha, Svitlana Borzenko, Francesca Catino, Mohamed Gaafar, Maarten Versteegh, Thomas Kober, Dario d'Andrea, Ellie Langhans

机构 * Zalando Switzerland AG(Zalando瑞士有限公司) TU Wien(维也纳技术大学) Zalando SE(Zalando德国分公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对电商视频流中的极端冷启动和偏差问题,提出基于领域自适应视觉-语言模型(CLIP)的可扩展多模态检索系统VCG,实现零样本检索,在线测试显示深度视频完成率提升50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18553 2026-06-18 cs.CV 新提交 79%

Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning

基于知识的分层多模态检索用于新闻图像描述生成

Minh-Loi Nguyen, Xuan-Vu Le, Long-Bao Nguyen, Hoang-Bach Ngo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市分校理学院) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市分校)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出分层多模态文章检索增强的图像描述框架,通过结构感知检索和上下文精炼,结合VLM和LLM生成富含上下文细节的描述,在EVENTA 2025挑战赛中获得第5名。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17809 2026-06-17 cs.CV 新提交 79%

Million-scale multimodal pollen microscopy with expert-guided foundation models

百万级多模态花粉显微镜图像与专家引导的基础模型

András Biricz, Björn Gedda, Donát Magyar, Antonio Spanu, János Fillinger, Péter Pollner, István Csabai

机构 * Department of Physics of Complex Systems, ELTE Eötvös Loránd University(ELTE罗兰大学复杂物理系) The Palynological Laboratory at the Swedish Museum of Natural History(瑞典自然历史博物馆孢粉学实验室) National Centre for Public Health and Pharmacy(国家公共卫生与药品中心) INRAE, UR 546 BioSP, Site Agroparc(法国国家农业、食品与环境研究院,UR 546 BioSP,阿格罗帕克园区) National Korányi Institute for Pulmonology(国家科拉尼肺病研究所) Health Data Science and AI Knowledge Centre, Health Services Management Training Centre, Faculty of Health and Public Administration, Semmelweis University(塞梅维什大学健康与公共管理学院卫生服务管理培训中心健康数据科学与人工智能知识中心) Department of Biological Physics, ELTE Eötvös Loránd University(ELTE罗兰大学生物物理系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出百万级多模态花粉显微镜数据集Pollen AI Atlas,结合专家引导的视觉-语言模型生成形态描述,实现跨区域、跨设置的高精度花粉识别与检索。

Comments 31 pages, 5 main figures, supplementary information included. Submitted to Scientific Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14883 2026-06-16 cs.CV cs.LG 新提交 79%

Understanding Cross-Modal Contributions in Continual Vision-Language Models: A Theoretical Perspective

理解连续视觉-语言模型中的跨模态贡献:一个理论视角

Salimeh Sekeh, Mary Wisell

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文从理论角度分析连续视觉-语言模型中跨模态(视觉-语言)贡献,提出新视角并通过实验验证其有效性,揭示任务顺序和相似性对贡献鲁棒性的影响,提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10886 2026-06-15 cs.CL 版本更新 79%

MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models

MET-Bench:用于评估视觉语言与推理模型局限性的多模态实体追踪

Vanya Cohen, Raymond Mooney

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出MET-Bench多模态实体追踪基准,发现视觉语言模型在图像实体追踪上显著弱于文本,主要源于视觉推理缺陷,强化学习可提升模态内性能但跨模态迁移不足。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04427 2026-06-12 cs.LG cs.AI 版本更新 79%

Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models

解码多模态迷宫:多模态注意力模型中可解释性采纳的系统综述

Md Raisul Kibria, Sébastien Lafond, Janan Arslan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文系统综述了2020年至2024年初多模态模型可解释性研究,发现多数工作集中于视觉-语言和纯语言模型,注意力机制是主要解释方法,但评估缺乏系统性和鲁棒性,并提出了改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07689 2026-06-09 cs.CV 新提交 79%

Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking

Struct-Searcher:代理式结构化思维推进多模态深度信息检索

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Zheng Lian, Hao Wu, Yuan Gao, Xinyu Geng, Xin Wang, Pheng-Ann Heng

机构 * CUHK(香港中文大学) LIGHTSPEED PKU(北京大学) Tongji University(同济大学) THU(清华大学) HKUST(香港科技大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出基于信念修正理论的结构化代理工作流Struct-Searcher,通过维护多模态结构图实现冲突感知的深度信息检索,在多个基准上平均相对准确率提升17.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30784 2026-06-01 cs.CV 79%

Text-guided Feature Disentanglement for Cross-modal Gait Recognition

文本引导的跨模态步态识别特征解耦

Zhiyang Lu, Ming Cheng

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,厦门大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对LiDAR与RGB相机之间的模态差异,提出TCFDNet网络,利用文本先验引导解耦模态共享特征,通过CLIP对齐、特征解耦和稳定性增强实现跨模态步态识别,在SUSTech1K和FreeGait数据集上达到最优性能。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10228 2026-05-29 cs.AI 79%

SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning

SVSR:一种用于多模态推理的自我验证与自我修正范式

Zhe Qian, Nianbing Su, Zhonghua Wang, Hebei Li, Zhongxing Xu, Yueying Li, Fei Luo, Zhuohan Ouyang, Yanbiao Ma

机构 * South China Agricultural University(华南农业大学) University of Glasgow(格拉斯哥大学) University of Electronic Science and Technology of China(电子科技大学) Monash University(莫纳什大学) University of Science and Technology of China(中国科学技术大学) National University of Defense Technology(国防科技大学) Renmin University of China(中国人民大学) South China Normal University(华南师范大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出SVSR框架,通过三阶段训练(统一偏好数据集构建、冷启动监督微调、半在线直接偏好优化)将自我验证与自我修正显式集成到多模态推理流程中,提升复杂视觉理解和多模态推理的鲁棒性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27894 2026-05-28 cs.CV 79%

Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs

面向不完整多模态输入的统一视觉-语言模型

Xiang Fang, Wanlong Fang, Changshuo Wang, Keke Tang, Daizong Liu, Siyi Wang, Wei Ji

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院) Guangzhou University(广州大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对视频-语言模型在传感器失效导致模态不完整数据下的训练-测试不一致问题,提出首个统一的不完整视频-语言模型作为即插即用模块,提升多模态任务性能。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18774 2026-05-20 cs.IR cs.AI 79%

M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models

M3DocDep: 多模态、多页、多文档依赖分块方法基于大视觉-语言模型

Joongmin Shin, Jeongbae Park, Jaehyung Seo, Heuiseok Lim

机构 * Human-inspired AI Research, Korea University(韩国大学人智AI研究所) Computer Science and Engineering, Konkuk University(konkuk大学计算机科学与工程系) Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出M3DocDep,一种基于大视觉-语言模型的多模态、多页、多文档依赖分块方法,通过恢复块级依赖并构建分块,提高了长多页多模态文档的检索和问答质量。

Comments Accepted to CVPR2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11629 2026-05-13 cs.CL 79%

OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

OmniThoughtVis: 一种可扩展的蒸馏流水线,用于可部署的多模态推理模型

Yuanhao Yue, Chengyu Wang, Yuanjie Lyu, Lei Shen, Jun Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出OmniThoughtVis流水线,通过大规模多模态Co T监督将高容量教师模型的推理能力转移到小型部署模型,实现了在多个基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV 79%

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09242 2026-05-12 eess.IV cs.CV 79%

Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading

跨模态语义增强的扩散框架用于糖尿病视网膜病变分级

Yiqun Wang

机构 * School of Software Engineering Beijing Jiaotong University(软件工程学院 北京交通大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出CLIP引导语义扩散框架,通过整合视觉-语言预训练与扩散概率建模,解决糖尿病视网膜病变分级中的细粒度病变模式区分、分布差异和临床语义知识利用问题。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05886 2026-05-08 cs.CV 79%

Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models

无需训练的多模态大语言模型密集手部接触估计

Daniel Sungho Jung, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(电子工程与自动控制研究所,首尔国立大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出ContactPrompt,利用多模态大语言模型进行无需训练的密集手部接触估计,通过引入详细的部位分割和部分顶点网格表示,结合多阶段结构化接触推理,实现高精度的接触预测。

Comments Project page: https://contactprompt-release.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09925 2026-04-30 cs.CV 79%

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

FLARE:完全整合视觉-语言表示以实现深度跨模态理解

Zheng Liu, Mengjie Liu, Jingzhou Chen, Jingwei Xu, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Nanjing University(南京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏