Combining Language and Vision with a Multimodal Skip-gram Model
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments accepted at NAACL 2015, camera ready version, 11 pages
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments accepted at NAACL 2015, camera ready version, 11 pages
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL
M$^3$Prune: 多模态多智能体分层通信图剪枝用于高效多模态多智能体检索增强生成
机构 * East China Normal University(东华大学) ; Hefei University of Technology(合肥工业大学) ; China University of Petroleum(中国石油大学) ; Guangdong university of Finance & Economics(广东财经大学) ; Alibaba Group(阿里巴巴集团)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI
AI总结 M$^3$Prune通过分层通信图剪枝提升多模态多智能体检索增强生成的效率和性能。
Comments Critical flaw in Eq.(5)/Alg.1 (Sec 3.2): scoring fails Lipschitz continuity in multi-modal spaces, causing invalid hierarchy. Thus, latency/FLOPs in Tables 2&3 are overestimated & irreproducible. Core defect unfixable by minor update. Withdraw to avoid misleading; will revise theory & experiments
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
Comments ICCV 2025 MARS2 Workshop and Challenge "Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond''
机构 * Department of Computer Science, University of Illinois Chicago(计算机科学系,伊利诺伊大学芝加哥分校)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
Comments Accepted to ACL 2025, title as A Survey on Patent Analysis: From NLP to Multimodal AI
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
Comments 9 pages (1 for reference); accepted by the 6th Multimodal Learning and Applications Workshop (MULA) at CVPR 2023
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.MM
Comments Deep Mamba Multi-modal Learning; Deep Mamba Multi-modal Hashing
专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.MM;multimodal(journal_ref)
Journal ref MMIR '23: Proceedings of the 1st International Workshop on Deep Multimodal Learning for Information Retrieval (2023)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV
Comments 25 pages, 7 figures, 6 tables, magazine
Journal ref Multi-modal gated recurrent units for image description. Multimedia Tools Appl. 77(22): 29847-29869 (2018)
当视觉与文本在列表级重排序中相遇
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);image-text(abstract)
AI总结 本文提出Rank-Nexus,一种轻量级多模态图像-文本文档重排序器,通过渐进跨模态训练策略提升重排序性能,适用于文本和图像重排序基准。
S2Dialog:结合语义与声学风格建模的多模态对话检索
机构 * College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) ; University of Electronic Science and Technology of China, Shenzhen Campus(电子科技大学深圳校区)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 研究针对现有多模态对话检索方法无法捕捉对话全局语义与风格一致性的问题,提出S2Dialog框架,结合对话级文本与声学检索器及对比学习,在DailyTalk数据集上实现出色检索性能。
提升多模态RLVR的泛化鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学) ; University of California Berkeley(加州大学伯克利分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Renmin University of China(中国人民大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。
Comments 32 pages, 5 figures
当选择成为先验:用于科学图表多选问答的对比解码
机构 * Korea University(高丽大学) ; Konkuk University(建国大学) ; Myongji University(明知大学) ; AIGEN Sciences
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出SCICON方法,通过对比文本和图像信息,减少选择偏差,提升科学图表多选问答的准确性。
用于可控时尚检索的属性条件多模态槽分解
机构 * Walmart Global Tech(沃尔玛全球科技)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 本研究提出MM-slotgate多模态槽编码器,将Fashion-CLIP嵌入分解为属性槽,在H&M数据集上实现可控时尚检索,颜色等属性性能提升显著,优于多模态融合与仅文本检索方法。
用于检索增强推理、物体感知与损伤分析的集成多模态AI系统
机构 * City College of New York(纽约城市学院) ; Air Force Research Lab(空军研究实验室)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本研究提出整合RAG、热谱感知等技术的多模态AI系统,用于损伤评估,通过多模块对比实验验证了其在提升推理准确性、鲁棒性及跨场景检测方面的优势。
用于通用跨模态行人重识别的双空间模态一致性学习
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; School of Humanities and Social Sciences, Beihang University(北京航空航天大学人文与社会科学高等研究院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Informatics, Xiamen University(厦门大学信息学院)
专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV
AI总结 提出DSMCL即插即用框架,联合建模空间与频域一致性,在5个数据集的17项协议上提升跨模态ReID基线性能,适配多样化异构模态场景。
从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。
Comments 26 pages,10 figures,14 Tables
基于动态代码本和多模态大语言模型的文本隐写术
机构 * China Agricultural University(中国农业大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出一种基于动态代码本和多模态大语言模型的文本隐写术,通过共享会话配置和多模态模型构建动态代码本,设计加密隐写映射并引入反馈优化机制,提升隐写术的安全性和实用性。
超越检索:多模态智能体的分析记忆
机构 * HKUST(香港科技大学) ; ByteDance(字节跳动)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。
从生成器到嵌入器:通过构建零样本判别嵌入模型来利用多模态大语言模型的固有能力
机构 * Department of Artificial Intelligence(人工智能系)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出一种高效框架,通过构建零样本判别嵌入模型,利用多模态大语言模型的固有能力,提升多模态表示空间的鲁棒性和零样本嵌入能力。
Comments Accepted to IEEE Transactions on Multimedia (T-MM)
OptimusKG:统一生物医学知识的现代多模态图
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Edison Scientific Inc.(Edison科学公司) ; Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) ; Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) ; Harvard Data Science Initiative(哈佛大学数据科学计划)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。
ReLoop-UME:带可学习检索寄存器的循环深度通用多模态嵌入
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究针对通用多模态嵌入的延迟问题,提出带可学习检索寄存器的循环深度模型ReLoop-UME,在MMEB-V2等数据集上提升检索性能且运行速度显著优于现有模型。
DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架
机构 * Beihang University(北京航空航天大学) ; SKLCCSE
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages
RRM:用于长周期多模态推理的经验驱动反思式检索记忆
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。
MathNet:数学推理与检索的全球多模态基准
机构 * MIT(麻省理工学院) ; KAUST(卡塔尔人工智能研究 institute) ; HUMAIN ; Individual Researcher(独立研究者)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 MathNet是一个大规模多模态数学问题基准,包含47个国家、17种语言、20年竞赛的30676道专家级数学问题,支持问题解决、数学检索和检索增强生成三个任务,实验表明先进模型在推理和检索任务上仍面临挑战。
Comments ICLR 2026; Website: http://mathnet.mit.edu
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
使用开源语言模型进行科学文档理解的多模态混合检索增强生成
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 针对科学文档理解中大型语言模型的问题,提出多模态混合检索增强生成系统。利用开源视觉语言模型生成摘要,结合多种检索方法并优化,采用查询压缩器确保连贯性。经评估,该系统提高了检索质量,验证了开源模型与先进策略结合的竞争力。
Comments 7 pages, 1 figure, 4 tables
DICA:多模态大语言模型中的双指标引导对比对齐
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。
用于源感知多模态错误信息检测的验证笔记本学习
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 针对多模态错误信息检测,提出验证笔记本学习框架VNL,通过构建包含决策原则等的笔记本,在推理时指导验证新示例,实验显示其性能优于基线,能提高源归因且紧凑可解释,无需模型训练积累知识。
使用小型多模态语言模型进行伤口分类的上下文学习
机构 * Jönköping University(延雪平大学) ; Halmstad University(哈尔姆斯塔德大学) ; Mölnlycke Health Care(墨尼克医疗保健公司) ; Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。
Eddy-VL 1.9B:用于边缘可部署多模态嵌入的结构剪枝与分层蒸馏
机构 * Urock-AI Lab(Urock人工智能实验室)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 介绍用于边缘可部署视觉语言检索的Eddy-VL 1.9B模型,采用探针驱动结构剪枝和分层知识蒸馏压缩,参数减少约9.5%,在MMEB-V2等评估中保留教师模型大部分性能,降低延迟,证明其在受限边缘部署下多模态检索的有效性。
Comments 11pages,4figures,Model weights and inference code are available on Hugging Face