Beyond Retrieval: Analytic Memory for Multimodal Agents
超越检索:多模态智能体的分析记忆
机构 * HKUST(香港科技大学) ; ByteDance(字节跳动)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
超越检索:多模态智能体的分析记忆
机构 * HKUST(香港科技大学) ; ByteDance(字节跳动)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。
从生成器到嵌入器:通过构建零样本判别嵌入模型来利用多模态大语言模型的固有能力
机构 * Department of Artificial Intelligence(人工智能系)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出一种高效框架,通过构建零样本判别嵌入模型,利用多模态大语言模型的固有能力,提升多模态表示空间的鲁棒性和零样本嵌入能力。
Comments Accepted to IEEE Transactions on Multimedia (T-MM)
OptimusKG:统一生物医学知识的现代多模态图
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Edison Scientific Inc.(Edison科学公司) ; Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) ; Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) ; Harvard Data Science Initiative(哈佛大学数据科学计划)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。
MathNet:数学推理与检索的全球多模态基准
机构 * MIT(麻省理工学院) ; KAUST(卡塔尔人工智能研究 institute) ; HUMAIN ; Individual Researcher(独立研究者)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 MathNet是一个大规模多模态数学问题基准,包含47个国家、17种语言、20年竞赛的30676道专家级数学问题,支持问题解决、数学检索和检索增强生成三个任务,实验表明先进模型在推理和检索任务上仍面临挑战。
Comments ICLR 2026; Website: http://mathnet.mit.edu
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
超越思维链:重写作为生成式多模态嵌入的通用接口
机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。
Comments Accepted by ACMMM 2026
LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Kuaishou Technology(快手科技) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。
基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全
机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) ; School of Software, Tiangong University(软件学院、天津工业大学) ; Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM
AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。
Comments Published in IEEE Transactions on Multimedia, 2026
检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头
机构 * HKUST(香港科技大学) ; University of Edinburgh(爱丁堡大学) ; CUHK(香港中文大学) ; NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) ; Tsinghua University(清华大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。
Comments Work in Progress
Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA
机构 * ShanghaiTech University(上海科技大学) ; Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) ; Lingang Laboratory(临港实验室)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。
Comments Accepted by ICLR 26, code and weights are publicly available
TechGraphRAG:面向技术文献推理的智能图增强RAG框架
机构 * Global Tire Intelligence and Solutions (GTIS)(全球轮胎智能与解决方案(GTIS)) ; The Goodyear Tire & Rubber Company(固特异轮胎与橡胶公司)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 提出一种13步自主流水线的智能检索增强生成框架,通过证据充分性评分、知识图谱遍历和自校正生成,支持领域特定技术文献推理。
CR-JEPA:用于遥感图像检索的跨模态联合嵌入预测学习
机构 * Space Applications Centre, Indian Space Research Organisation(印度空间研究组织空间应用中心) ; Centre of Studies in Resources Engineering, Indian Institute of Technology Bombay(印度理工学院孟买资源工程研究中心)
专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV
AI总结 提出CR-JEPA架构,通过模态特定主干、共享Transformer和JEPA预测目标实现跨模态语义对齐与同模态邻域保持,在BEN-14K等数据集上显著提升跨模态检索性能。
Comments 24 pages
UniCVR:从对齐到重排序的统一零样本复合视觉检索
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; City University of Hong Kong(香港城市大学) ; Southern University of Science and Technology(南方科技大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 UniCVR提出首个统一零样本复合视觉检索框架,结合多模态大语言模型与视觉语言预训练模型,通过两阶段方法实现多任务联合优化,实验表明其在五个基准测试中表现优异。
Xray-Visual模型:在产业级数据上扩展视觉模型
机构 * Meta-AI ; MIT(麻省理工学院) ; University of Maryland(马里兰大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 Xray-Visual通过三阶段训练流程和LLM2CLIP技术,在产业级数据上实现高效多模态视觉模型,取得最佳性能并提升鲁棒性与泛化能力。
隐蔽且可调节的文本引导后门攻击多模态预训练模型
机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学国家防伪工程技术研究中心) ; School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) ; Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 本文提出一种基于文本的后门攻击方法,利用常见文本词汇作为触发器,提升攻击隐蔽性和实用性,并通过视觉对抗扰动调节模型对文本触发器的学习,实现可控的攻击效果。
ExDoS:专家引导的双焦点跨模态蒸馏用于智能合约漏洞检测
专题命中 跨模态检索 :cross-modal(title,abstract)
AI总结 本文提出ExDoS方法,通过双焦点蒸馏框架,从源代码到字节码转移语义知识,提升智能合约漏洞检测的细粒度对齐与识别能力。
Comments This work has been submitted to the IEEE for possible publication
学习多模态内容的稀疏表示以增强冷启动项目推荐
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 针对数字平台项目目录规模大及冷启动问题,提出利用稀疏嵌入优势,通过改进冷启动训练方法和设计预稀疏化激活技术,降低存储成本并提升冷启动推荐准确性,还展示了稀疏内容嵌入的可解释性与稳健性。
Comments Accepted at RecSys 2026
电子健康记录多模态分析中的对比学习
机构 * Harvard T.H. Chan School of Public Health(哈佛T.H. 柏林公共卫生学院) ; Harvard Medical School(哈佛医学院) ; Rutgers University(罗格斯大学) ; National University of Singapore(新加坡国立大学)
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 研究针对电子健康记录多模态数据传统分析方法不足,提出多模态特征嵌入生成模型及对比损失来学习特征表示,经理论分析、模拟研究和真实数据验证,该方法有效且具隐私保护特性,展现了多模态学习优势。
FLOWREADER: 多模态长文档问答的最小成本流优化
机构 * Ca’ Foscari University of Venice(威尼斯卡布里亚大学)
专题命中 跨模态检索 :multi-modal(title);multimodal(abstract)
AI总结 提出FLOWREADER,将多模态长文档中的证据组装建模为最小成本流问题,通过统一评分向量控制源选择、汇选择和边成本,在碎片化证据场景下优于top-k检索方法。
非结构化度假租赁图像集合中的房间场景发现与分组
机构 * Expedia Group(Expedia集团)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV
AI总结 针对度假租赁平台图片缺乏结构化分类的问题,提出一种低延迟、样本高效的机器学习流水线,通过监督式房间类型检测、重叠检测和聚类算法实现房间分组,并利用多模态大语言模型识别床型,显著优于对比学习和预训练嵌入聚类方法。
Comments Presented at the Two-sided Marketplace Optimization Workshop, KDD 2025
MIRAGE:基于层次分解的多向量图像检索运行时调度
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) ; School of Information, Renmin University of China(中国人民大学信息学院) ; School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出MIRAGE框架,通过层次化分解和跨层次相似性一致性减少冗余计算,实现多向量图像检索的精度提升和3.5倍计算加速。
Comments Will appear in DAC'2026, camera ready
NMIRacle:从红外和核磁共振谱进行多模生成分子解析
机构 * Federico Ottomano ; Yingzhen Li ; Alex M. Ganose
专题命中 跨模态检索 :multi-modal(title)
AI总结 NMIRacle通过两阶段生成框架,利用红外和核磁共振光谱数据实现分子结构的高精度解析,优于现有方法并保持复杂性下的鲁棒性。
MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习
机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) ; Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) ; State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。
Comments Accepted by IEEE Transactions on Artificial Intelligence
SleepLM:人类睡眠的自然语言智能
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。
Comments spotlight presentation
Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)
二次审视:多模态大语言模型中的免训练证据高亮
机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出Look Twice框架,通过模型注意力模式识别相关视觉区域和文本证据,提升预训练MLLMs在多模态证据利用中的表现,实验显示在多个VQA基准上效果显著。
Comments Project Page: https://aimagelab.github.io/LoT/
MMEB-V3: 多模态嵌入模型性能差距的测量
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract)
AI总结 本文提出MMEB-V3基准,评估文本、图像、视频、音频及基于代理的多模态嵌入,发现现有模型在跨模态检索中存在显著偏差和不足。
Comments Accepted at COLM 2026
视觉与语言在哪里交汇?通过对比注意力理解并优化MLLMs中的视觉融合
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM
AI总结 通过对比注意力框架,研究揭示了MLLMs中视觉-文本融合的层次演变,并改进了多模态推理性能。
Comments CVPR Accepted
情感碰撞:双双曲镜面流形用于通过反情感反射进行情感恢复
机构 * University of Macau(澳门大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Tongji University(同济大学) ; University of Southampton(南安普顿大学) ; University of Bologna(博洛尼亚大学) ; Minzu University of China(中央民族大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.MM
AI总结 本文提出Emotion Collider网络,利用双双曲镜面流形实现多模态情感和情绪建模,通过双曲空间对比学习提升类别分离,并在标准多模态情感基准上验证了其鲁棒性和准确性。
Comments 25 pages, 14 figures
现在你看到了仇恨:用于隐藏仇恨幻觉的自适应视图检索
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对仇恨性视觉错觉检测难题,提出自适应视图检索方法,将其公式化为感知检索问题,通过检索并校准框架组装视图库,该方法在多方面超越基线和其他方法,表明多模态审核需先恢复隐藏含义再判断是否有害。
面向知识的检索增强生成综述
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 该综述对检索增强生成进行全面概述,涵盖其基本组件、关键特性、分类法、评估基准及应用等,讨论了相关挑战与新兴研究方向,强调其在自然语言处理中应对现实挑战及推动发展的潜力。
Comments Accepted by ACM Transactions on Information Systems (TOIS)
CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示
机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Galbot ; CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。