arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3450 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3450 篇

1501.02598 2015-03-13 cs.CL cs.CV cs.LG 81%

Combining Language and Vision with a Multimodal Skip-gram Model

Angeliki Lazaridou, Nghia The Pham, Marco Baroni

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments accepted at NAACL 2015, camera ready version, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1410.1090 2014-10-07 cs.CV cs.CL cs.LG 81%

Explain Images with Multimodal Recurrent Neural Networks

Junhua Mao, Wei Xu, Yi Yang, Jiang Wang, Alan L. Yuille

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19969 2026-08-11 cs.AI 版本更新 80%

M$^3$Prune: Hierarchical Communication Graph Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M$^3$Prune: 多模态多智能体分层通信图剪枝用于高效多模态多智能体检索增强生成

Weizi Shao, Taolin Zhang, Zijie Zhou, Chen Chen, Chengyu Wang, Xiaofeng He

机构 * East China Normal University(东华大学) Hefei University of Technology(合肥工业大学) China University of Petroleum(中国石油大学) Guangdong university of Finance & Economics(广东财经大学) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI

AI总结 M$^3$Prune通过分层通信图剪枝提升多模态多智能体检索增强生成的效率和性能。

Comments Critical flaw in Eq.(5)/Alg.1 (Sec 3.2): scoring fails Lipschitz continuity in multi-modal spaces, causing invalid hierarchy. Thus, latency/FLOPs in Tables 2&3 are overestimated & irreproducible. Core defect unfixable by minor update. Withdraw to avoid misleading; will revise theory & experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14142 2025-09-18 cs.CV 80%

MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook

Peng Xu, Shengwu Xiong, Jiajun Zhang, Yaxiong Chen, Bowen Zhou, Chen Change Loy, David A. Clifton, Kyoung Mu Lee, Luc Van Gool, Ruiming He, Ruilin Yao, Xinwei Long, Jirui Huang, Kai Tian, Sa Yang, Yihua Shao, Jin Feng, Yue Zhong, Jiakai Zhou, Cheng Tang, Tianyu Zou, Yifang Zhang, Junming Liang, Guoyou Li, Zhaoxiang Wang, Qiang Zhou, Yichen Zhao, Shili Xiong, Hyeongjin Nam, Jaerin Lee, Jaeyoung Chung, JoonKyu Park, Junghun Oh, Kanggeon Lee, Wooseok Lee, Juneyoung Ro, Turghun Osman, Can Hu, Chaoyang Liao, Cheng Chen, Chengcheng Han, Chenhao Qiu, Chong Peng, Cong Xu, Dailin Li, Feiyu Wang, Feng Gao, Guibo Zhu, Guopeng Tang, Haibo Lu, Han Fang, Han Qi, Hanxiao Wu, Haobo Cheng, Hongbo Sun, Hongyao Chen, Huayong Hu, Hui Li, Jiaheng Ma, Jiang Yu, Jianing Wang, Jie Yang, Jing He, Jinglin Zhou, Jingxuan Li, Josef Kittler, Lihao Zheng, Linnan Zhao, Mengxi Jia, Muyang Yan, Nguyen Thanh Thien, Pu Luo, Qi Li, Shien Song, Shijie Dong, Shuai Shao, Shutao Li, Taofeng Xue, Tianyang Xu, Tianyi Gao, Tingting Li, Wei Zhang, Weiyang Su, Xiaodong Dong, Xiao-Jun Wu, Xiaopeng Zhou, Xin Chen, Xin Wei, Xinyi You, Xudong Kang, Xujie Zhou, Xusheng Liu, Yanan Wang, Yanbin Huang, Yang Liu, Yang Yang, Yanglin Deng, Yashu Kang, Ye Yuan, Yi Wen, Yicen Tian, Yilin Tao, Yin Tang, Yipeng Lin, Yiqing Wang, Yiting Xi, Yongkang Yu, Yumei Li, Yuxin Qin, Yuying Chen, Yuzhe Cen, Zhaofan Zou, Zhaohong Liu, Zhehao Shen, Zhenglin Du, Zhengyang Li, Zhenni Huang, Zhenwei Shao, Zhilong Song, Zhiyong Feng, Zhiyu Wang, Zhou Yu, Ziang Li, Zihan Zhai, Zijian Zhang, Ziyang Peng, Ziyun Xiao, Zongshu Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments ICCV 2025 MARS2 Workshop and Challenge "Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond''

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08668 2025-06-30 cs.IR cs.AI 80%

A Survey on Patent Analysis: From NLP to Multimodal AI

Homaira Huda Shomee, Zhu Wang, Sathya N. Ravi, Sourav Medya

机构 * Department of Computer Science, University of Illinois Chicago(计算机科学系,伊利诺伊大学芝加哥分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

Comments Accepted to ACL 2025, title as A Survey on Patent Analysis: From NLP to Multimodal AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06370 2025-03-27 cs.CV 80%

Robust Multiview Multimodal Driver Monitoring System Using Masked Multi-Head Self-Attention

Yiming Ma, Victor Sanchez, Soodeh Nikan, Devesh Upadhyay, Bhushan Atote, Tanaya Guha

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments 9 pages (1 for reference); accepted by the 6th Multimodal Learning and Applications Workshop (MULA) at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18007 2024-06-27 cs.MM 80%

Deep Mamba Multi-modal Learning

Jian Zhu, Xin Zou, Yu Cui, Zhangmin Huang, Chenshu Hu, Bo Lyu

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.MM

Comments Deep Mamba Multi-modal Learning; Deep Mamba Multi-modal Hashing

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14240 2023-11-02 cs.MM 80%

Boon: A Neural Search Engine for Cross-Modal Information Retrieval

Yan Gong, Georgina Cosma

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.MM;multimodal(journal_ref)

Journal ref MMIR '23: Proceedings of the 1st International Workshop on Deep Multimodal Learning for Information Retrieval (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09421 2019-04-23 cs.CV 80%

Multi-modal gated recurrent units for image description

Xuelong Li, Aihong Yuan, Xiaoqiang Lu

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments 25 pages, 7 figures, 6 tables, magazine

Journal ref Multi-modal gated recurrent units for image description. Multimedia Tools Appl. 77(22): 29847-29869 (2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20623 2026-01-29 cs.IR 80%

When Vision Meets Texts in Listwise Reranking

当视觉与文本在列表级重排序中相遇

Hongyi Cai

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);image-text(abstract)

AI总结 本文提出Rank-Nexus,一种轻量级多模态图像-文本文档重排序器,通过渐进跨模态训练策略提升重排序性能,适用于文本和图像重排序基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14029 2026-08-17 cs.CL 新提交 79%

S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling

S2Dialog:结合语义与声学风格建模的多模态对话检索

Xueqi Wang, Zhigang Wang, Runqing Zhang, Zhenqi Jia, Junfeng Zhao

机构 * College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) University of Electronic Science and Technology of China, Shenzhen Campus(电子科技大学深圳校区)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 研究针对现有多模态对话检索方法无法捕捉对话全局语义与风格一致性的问题,提出S2Dialog框架,结合对话级文本与声学检索器及对比学习,在DailyTalk数据集上实现出色检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新 79%

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28026 2026-08-17 cs.AI 版本更新 79%

BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

当选择成为先验:用于科学图表多选问答的对比解码

Taeyun Roh, Suhyeong Park, Dongyoung Lee, Eunyeong Jo, Wonjune Jang, Junha Jung, Jaewoo Kang

机构 * Korea University(高丽大学) Konkuk University(建国大学) Myongji University(明知大学) AIGEN Sciences

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SCICON方法,通过对比文本和图像信息,减少选择偏差,提升科学图表多选问答的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12570 2026-08-14 cs.CV cs.IR 新提交 79%

Attribute-Conditioned Multimodal Slot Factorization for Controllable Fashion Retrieval

用于可控时尚检索的属性条件多模态槽分解

Najmeh Forouzandehmehr, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出MM-slotgate多模态槽编码器,将Fashion-CLIP嵌入分解为属性槽,在H&M数据集上实现可控时尚检索,颜色等属性性能提升显著,优于多模态融合与仅文本检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08935 2026-08-11 cs.AI 新提交 79%

Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis

用于检索增强推理、物体感知与损伤分析的集成多模态AI系统

Kalelo Dukuray, Israel Pina, Evan Perez, Erika Ardiles-Cruz, Jie Wei

机构 * City College of New York(纽约城市学院) Air Force Research Lab(空军研究实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出整合RAG、热谱感知等技术的多模态AI系统,用于损伤评估,通过多模块对比实验验证了其在提升推理准确性、鲁棒性及跨场景检测方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06943 2026-08-10 cs.CV 新提交 79%

Dual-Space Modality Consistency Learning for Universal Cross-Modal Re-Identification

用于通用跨模态行人重识别的双空间模态一致性学习

Yujian Zhao, Yukang Zhao, Hankun Liu, Haoxuan Xu, Bo Li, Hanzi Wan, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Humanities and Social Sciences, Beihang University(北京航空航天大学人文与社会科学高等研究院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出DSMCL即插即用框架,联合建模空间与频域一致性,在5个数据集的17项协议上提升跨模态ReID基线性能,适配多样化异构模态场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06060 2026-08-07 cs.CV 新提交 79%

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索

Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。

Comments 26 pages,10 figures,14 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20269 2026-08-07 cs.CR cs.AI 版本更新 79%

Text Steganography with Dynamic Codebook and Multimodal Large Language Model

基于动态代码本和多模态大语言模型的文本隐写术

Jianxin Gao, Ruohan Lei, Wanli Peng

机构 * China Agricultural University(中国农业大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于动态代码本和多模态大语言模型的文本隐写术,通过共享会话配置和多模态模型构建动态代码本,设计加密隐写映射并引入反馈优化机制,提升隐写术的安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29440 2026-08-05 cs.AI 版本更新 79%

Beyond Retrieval: Analytic Memory for Multimodal Agents

超越检索:多模态智能体的分析记忆

Zhoujin Tian, Hao Zhang, Yao Tian, Cheng Chen, Yakun Li, Lei Zhang, Xiaofang Zhou

机构 * HKUST(香港科技大学) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00955 2026-08-05 cs.LG cs.AI cs.IR 版本更新 79%

From Generator to Embedder: Harnessing Innate Abilities of Multimodal LLMs via Building Zero-Shot Discriminative Embedding Model

从生成器到嵌入器:通过构建零样本判别嵌入模型来利用多模态大语言模型的固有能力

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence(人工智能系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种高效框架,通过构建零样本判别嵌入模型,利用多模态大语言模型的固有能力,提升多模态表示空间的鲁棒性和零样本嵌入能力。

Comments Accepted to IEEE Transactions on Multimedia (T-MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27269 2026-08-04 cs.AI 版本更新 79%

Unifying biomedical knowledge in a modern multimodal graph

OptimusKG:统一生物医学知识的现代多模态图

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Edison Scientific Inc.(Edison科学公司) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28751 2026-08-03 cs.CV 新提交 79%

ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding

ReLoop-UME:带可学习检索寄存器的循环深度通用多模态嵌入

Shijie Wang, Xiangzhao Hao, Yueti Li, Guangyu Cao, Xinyu Tang, Haiyun Guo

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对通用多模态嵌入的延迟问题,提出带可学习检索寄存器的循环深度模型ReLoop-UME,在MMEB-V2等数据集上提升检索性能且运行速度显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28580 2026-07-31 cs.AI 新提交 79%

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li

机构 * Beihang University(北京航空航天大学) SKLCCSE

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28156 2026-07-31 cs.CL 新提交 79%

RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning

RRM:用于长周期多模态推理的经验驱动反思式检索记忆

Jingxiang Fan, Junbao Zhuo, Bochao Zou

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18584 2026-07-30 cs.AI cs.DL cs.IR cs.LG 版本更新 79%

MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

MathNet:数学推理与检索的全球多模态基准

Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei, Sultan Albarakati, William T. Freeman, Antonio Torralba

机构 * MIT(麻省理工学院) KAUST(卡塔尔人工智能研究 institute) HUMAIN Individual Researcher(独立研究者)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 MathNet是一个大规模多模态数学问题基准,包含47个国家、17种语言、20年竞赛的30676道专家级数学问题,支持问题解决、数学检索和检索增强生成三个任务,实验表明先进模型在推理和检索任务上仍面临挑战。

Comments ICLR 2026; Website: http://mathnet.mit.edu

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24799 2026-07-29 cs.IR cs.AI 新提交 79%

Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs

使用开源语言模型进行科学文档理解的多模态混合检索增强生成

Alexandru-Andrei Saucă, Ana-Luiza Rusnac

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对科学文档理解中大型语言模型的问题,提出多模态混合检索增强生成系统。利用开源视觉语言模型生成摘要,结合多种检索方法并优化,采用查询压缩器确保连贯性。经评估,该系统提高了检索质量,验证了开源模型与先进策略结合的竞争力。

Comments 7 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 79%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23581 2026-07-28 cs.AI 新提交 79%

Verification-Notebook Learning for Source-Aware Multimodal Misinformation Detection

用于源感知多模态错误信息检测的验证笔记本学习

Junyuan Tan

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态错误信息检测,提出验证笔记本学习框架VNL,通过构建包含决策原则等的笔记本,在推理时指导验证新示例,实验显示其性能优于基线,能提高源归因且紧凑可解释,无需模型训练积累知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18819 2026-07-22 cs.CV 新提交 79%

In-Context Learning for Wound Classification with Small Multimodal Language Models

使用小型多模态语言模型进行伤口分类的上下文学习

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

机构 * Jönköping University(延雪平大学) Halmstad University(哈尔姆斯塔德大学) Mölnlycke Health Care(墨尼克医疗保健公司) Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16316 2026-07-21 cs.CV 新提交 79%

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

Eddy-VL 1.9B:用于边缘可部署多模态嵌入的结构剪枝与分层蒸馏

HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

机构 * Urock-AI Lab(Urock人工智能实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍用于边缘可部署视觉语言检索的Eddy-VL 1.9B模型,采用探针驱动结构剪枝和分层知识蒸馏压缩,参数减少约9.5%,在MMEB-V2等评估中保留教师模型大部分性能,降低延迟,证明其在受限边缘部署下多模态检索的有效性。

Comments 11pages,4figures,Model weights and inference code are available on Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏