USTAR: Online Multimodal Embedding for Modeling User-Guided Spatiotemporal Activity
专题命中 跨模态检索 :multimodal(title)
Comments 10 pages, IEEE International Conference on Big Data 2019 (IEEE Big Data 2019)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :multimodal(title)
Comments 10 pages, IEEE International Conference on Big Data 2019 (IEEE Big Data 2019)
专题命中 跨模态检索 :multimodal(title)
Comments Paper for Invited Talk at 2015 Conference on Intelligent Computer Mathematics (July, Washington DC)
DSPrompt:针对M-RAG污染的动态软提示防御
专题命中 跨模态检索 :multimodal(abstract,abstract_cn);分类 cs.CL
AI总结 本文针对M-RAG面临的对抗攻击问题,提出DSPrompt动态软提示防御框架,通过在冻结检索器编码器插入可学习软提示,以低开销实现了优于现有方法的防御效果,同时维持检索与生成性能。
FusionBERT: 多视角图像-3D检索 via 跨注意力视觉融合与正常感知3D编码器
机构 * IROOTECH TECHNOLOGY ; Wolf 1069 b Lab, Sany Group(三一集团Wolf 1069 b实验室) ; Zhejiang University(浙江大学) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; BPIT, Sany Group(三一集团BPIT)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 FusionBERT通过跨注意力视觉融合和正常感知3D编码器,实现多视角图像-3D多模态检索,提升跨模态检索性能。
Comments 9 pages, 5 figures, 3 tables
解耦共享表示可改进形态-转录组整合
机构 * ESPCI Paris, PSL University(巴黎高等物理化工学院,PSL大学) ; Sorbonne Université(索邦大学) ; CNRS(法国国家科学研究中心) ; Inserm(法国国家健康与医学研究院) ; AP-HP(巴黎公共医疗集团) ; Inria(法国国家信息与自动化研究所) ; Paris Brain Institute – ICM(巴黎脑研究所 – ICM)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本研究针对空间转录组学的多模态表示学习问题,对比不同模型的标准与解耦变体,发现解耦共享与模态特有信息可提升相关指标,为多模态学习提供评估框架。
监督之前的感知:来自反事实盲区的自包含视觉蒸馏
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Aalto University(阿尔托大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。
Comments BMVC 2026
DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。
基于结构保留的细胞表型分子表示学习
机构 * Xiangtan University(湘潭大学) ; Hunan University(湖南大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Southeast University(东南大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出结构保留的PhenMol框架,通过解耦分子与细胞表示实现表型引导对齐,在多类任务上提升性能,为药物发现整合细胞表型与化学知识提供了有效途径。
MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习
机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) ; Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) ; State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。
Comments Accepted by IEEE Transactions on Artificial Intelligence
ClinRAG-GRAPH: 基于临床先验的检索增强图模型与领域对抗学习用于乳腺癌pCR预测
机构 * Department of Medical Imaging, Radboud University Medical Center, Nijmegen, The Netherlands(拉德堡德大学医学中心医学影像科,奈梅亨,荷兰) ; The Netherlands Cancer Institute, Amsterdam, The Netherlands(荷兰癌症研究所,阿姆斯特丹,荷兰) ; Faculty of Applied Sciences, Macao Polytechnic University, Macau, China(澳门理工大学应用科学学院,澳门,中国) ; Boston Children’s Hospital, Harvard Medical School, Boston, USA(波士顿儿童医院,哈佛医学院,波士顿,美国) ; Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong, China(中国科学院香港创新研究院人工智能与机器人创新中心,香港,中国) ; Imaging Division, University Medical Center Utrecht, Utrecht, The Netherlands(乌得勒支大学医学中心影像部,乌得勒支,荷兰) ; Department of Radiology, Fuzhou University Affiliated Provincial Hospital, Fuzhou, China(福州大学附属省立医院放射科,福州,中国) ; Department of Radiology, Yantai Yuhuangding Hospital, Shandong, China(烟台毓璜顶医院放射科,山东,中国)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出ClinRAG-GRAPH框架,通过构建患者内临床先验图、双分支领域对抗学习和大语言模型驱动的子图检索增强模块,实现术前pCR预测,在内部和外部测试集上取得良好性能。
Comments 11 pages, 5 figures
学习组合:重新审视零样本组合图像检索的代理任务设计
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出FoCo模型,通过文本锚定的视觉聚合和上下文条件语义补全两个代理任务联合学习组合函数,在零样本组合图像检索中取得最优性能。
Comments Accepted by ECCV 2026
SleepLM:人类睡眠的自然语言智能
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。
Comments spotlight presentation
Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)
LaVPR:语言与视觉用于位置识别的基准测试
专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。
Comments Accepted to ECCV
See & Sniff: 学习视觉-嗅觉表征
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Hankuk University of Foreign Studies(韩国外国语大学) ; Ulsan National Institute of Science and Technology(蔚山科学技术院)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。
Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/
IMAGINE:自适应模式-意象增强组合用于组合视频检索
机构 * Shandong University(山东大学) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对组合视频检索中修改文本隐含语义与显式视觉内容不匹配的问题,提出自适应模式-意象增强组合网络(IMAGINE),通过动态多模态原型捕获隐含概念并调制视觉特征,在三个基准上达到最优性能。
Comments Accepted by ICMR 2026
COMBINER: 基于属性邻居关系的组合图像检索
机构 * School of Software, Shandong University(山东大学软件学院) ; School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) ; Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对组合图像检索中视觉相似但属性不同的样本问题,提出基于属性原型的跨模态统一表示方法COMBINER,通过自适应语义解耦、统一原型组合和双重关系建模提升检索准确性。
Comments Accepted by IEEE TIP 2026
Touch-R1:在多模态大语言模型中强化触觉推理
机构 * Xiamen University(厦门大学) ; Great Bay University(大湾大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Daimon Robotics(达摩机器人)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 针对触觉推理中物理属性序数性和跨传感器分布偏移的挑战,提出基于触觉接地GRPO目标训练的Touch-R1模型,在TouchReason-Bench上平均性能超过Octopi-13B和GPT-4o。
Comments Our code and data will be made public on the https://laiyingxin2.github.io/Projects
FreeRet: 无需训练的多模态大语言模型检索器
机构 * Nanjing University(南京大学) ; Shanghai AI Lab(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; Institute of Science Tokyo(东京科学研究院) ; Zhejiang University(浙江大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 提出FreeRet框架,将现成的多模态大语言模型转化为无需额外训练的两阶段检索器,通过语义嵌入和重排序提升检索性能。
Comments ICML 2026
UniRank: 混合文本-图像候选的端到端领域特定重排序
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出UniRank,一种基于视觉语言模型的重排序框架,通过无需模态转换的统一评分和端到端领域适应(包括指令微调和基于强化学习的偏好对齐),在科学文献检索和设计专利搜索中显著提升性能。
监督分类头作为语义原型:通过权重重用解锁视觉-语言对齐
机构 * Department of Computer Science and Artificial Intelligence, DaSCI Institute, University of Granada, Granada, Spain(计算机科学与人工智能系,DaSCI研究所,格拉纳达大学,格拉纳达,西班牙) ; Department of Mathematics ``Tullio Levi-Civita'', University of Padova, Padova, Italy(托里利-西维塔数学系,帕多瓦大学,帕多瓦,意大利)
专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出利用预训练视觉模型的分类头作为语义原型,通过权重重用实现视觉-语言对齐,提升跨模态检索、零样本和少样本分类任务的性能。
UNIV:用于红外和可见模态的统一基础模型
机构 * Research Center for Intelligent Computing Systems, CAS ICT(智能计算系统研究所以及中国科学院信息科技研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 跨模态检索 :cross-modal(abstract,abstract_cn);分类 cs.CV
AI总结 UNIV通过跨模态对比学习提升红外与可见光感知的鲁棒性,解决模态偏差问题,实验显示在红外任务中表现优异。
Logit-Attention Divergence:通过注意力引导的校准缓解多图像检索中的位置偏差
机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学紫阳学院) ; Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种无需训练的注意力引导去偏框架,通过利用内在注意力信号在推理时进行实例级校正,显著提升排列不变性并取得最佳性能。
SLQ:通过共享潜在查询桥接模态以实现冻结MLLMs的检索
机构 * School of Electronic Engineering, Beijing University of Posts(北京邮电大学电子工程学院) ; Xiaohongshu Inc., China(小红书公司)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 SLQ通过冻结MLLMs的主干,引入共享潜在查询提升多模态检索性能,实验显示其在多个基准上表现优异。
Comments Accepted to ICML-2026
从独立大语言模型到整合智能:复合AI系统综述
机构 * New Jersey Institute of Technology(新泽西理工学院)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL
AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。
ChatSearch: 一个用于通用对话图像检索的数据集和生成检索模型
机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统实验室,自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Bytedance Inc.(字节跳动公司) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出ChatSearch数据集和生成检索模型,用于开放领域图像的对话式检索,通过多轮多模态对话上下文查询提升检索准确性。
Journal ref Pattern Recognition, 167 (2025) 111696
基于文本的CAD检索:一个强大的基线
机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; College of Computer Science and Software Engineer, Shenzhen University(深圳大学计算机科学与软件工程学院) ; Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院)
专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出文本到CAD检索任务,通过多模态嵌入框架实现CAD模型的语义检索,为下游CAD生成奠定基础。
对比学习太阳物理图像预训练用于太阳动力学观测记录
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出SolarCHIP,通过对比学习预训练视觉骨干网络,解决太阳成像中的多模态传感、弱类间分离性和强类内变化性问题,提升跨模态翻译和日冕闪分类性能。
Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions
ViFiCon:通过自监督对比学习实现视觉与无线关联
机构 * Rutgers University(罗切斯特大学) ; Stony Brook University(石溪大学) ; Saudi Electronic University(沙特电子大学) ; Georgia State University(佐治亚州立大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 ViFiCon通过自监督对比学习实现视觉与无线模态的关联,利用RGB-D相机和WiFi测距数据,减少隐私和能耗,无需标注数据即可实现高精度关联。
Comments 8 pages, 6 figures, 6 tables
对比预训练模型的成员推断与仅文本隐私信息查询
机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学) ; School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出UMID框架,通过仅文本模态推断多模态模型的记忆,有效检测隐私信息泄露,无需生物特征输入,提升隐私审计效率与效果。
面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿
机构 * Beihang University(北航)
专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。