arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2606.27794 2026-06-29 cs.CV 新提交 57%

Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation

文本作为照明:面向语言引导医学图像分割的空间对比度Retinex学习

Jian Shi, Cheng Zhen, Pingping Zhang, Rui Xu, Yanan Lv, Yili Ma, Huan Bi, Haojie Li, Huchuan Lu

机构 * School of Software Technology & DUT-RU International School of Information Science and Engineering, Dalian University of Technology(大连理工大学软件学院 & 大连理工大学-俄罗斯国际信息科学与工程学院) School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) Central Hospital of Dalian University of Technology(大连理工大学中心医院) Cancer Hospital of Dalian University of Technology(大连理工大学肿瘤医院) College of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出TIRNet框架,将文本嵌入作为语义照明调制特征,通过Retinex启发模块和对比损失实现语言与分割的精确对齐,在MosMedData+和QaTa-COV19数据集上取得最优性能。

Comments Aceepted by MICCAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20390 2026-06-26 cs.CV 新提交 57%

Geometry-Aware Superpixel Graph Transformer with Metadata for Skin Lesion Classification

几何感知超像素图变换器结合元数据用于皮肤病变分类

Muhammad Azeem, Tanveer Hussain, Amr Ahmed, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种基于区域的图学习框架,将病变建模为超像素图,利用几何边属性和元数据上下文节点,通过边缘感知图变换器实现多模态融合,在四个公开数据集上取得优于现有方法的分类性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00813 2026-06-26 cs.CV 版本更新 57%

Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval

生成一个Paracosm用于免训练零样本组合图像检索

Tong Wang, Yunhan Zhao, Shu Kong

机构 * University of Macau(澳门大学) UC Irvine(伊丽莎白女王大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出Paracosm方法,通过大多模态模型直接生成“心理图像”并构建合成域,实现免训练的零样本组合图像检索,在多个基准上达到最优性能。

Comments Accepted to ECCV 2026. Website and code: https://leowangtong.github.io/Paracosm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13731 2026-06-25 cs.CV 版本更新 57%

GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization

GeoRanker:面向全球图像地理定位的距离感知排序

Pengyue Jia, Seongheon Park, Song Gao, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Geography, University of Wisconsin-Madison(威斯康星大学麦迪逊分校地理系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出GeoRanker框架,利用大视觉语言模型联合编码查询-候选交互并预测地理邻近性,引入多阶距离损失以建模结构化空间关系,在IM2GPS3K和YFCC4K基准上达到最优。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22872 2026-06-23 cs.CV 新提交 57%

Fursee: Hybrid YOLO-DINOv3 Framework for Fursuit Identity Retrieval and Clustering

Fursee: 用于毛装身份检索与聚类的混合YOLO-DINOv3框架

Jundi Wu

机构 * Shandong University(山东大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对毛装照片人工分类成本高的问题,提出三阶段混合框架Fursee,结合YOLO检测裁剪、ArcFace优化DINOv3嵌入和DBSCAN自动聚类,在检索与聚类任务上超越GPT5.5等主流多模态模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21838 2026-06-23 cs.CV cs.LG 新提交 57%

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification

超越平面标签:面向层次细粒度视觉分类的层级限制对比学习

Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Neuromatch Boston University(波士顿大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态对比学习在层次标签空间中预测不一致的问题,提出层级限制对比学习,仅在同一层级内进行对比,并采用组平衡设计,显著提升层次一致性和分类精度。

Comments Accepted to CVPR 2026 FGVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21174 2026-06-23 cs.CV q-bio.GN 新提交 57%

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis

HERO:基于假设驱动的组学证据检索用于多任务乳腺癌分析

Xiangyu Li, Ran Su

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出HERO框架,将组学数据作为形态学假设进行显式检索,通过稀疏通路先验和TF-IDF检索实现可审计的多模态乳腺癌分析,在TCGA-BRCA上取得多项预测任务的最优结果。

Comments 11 pages, 3 figures, Early accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08819 2026-06-23 cs.IR cs.AI 版本更新 57%

Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage

超越相关性:检索与RAG信息覆盖之间的关系

Saron Samuel, Alexander Martin, Eugene Yang, Andrew Yates, Dawn Lawrie, Ian Soboroff, Laura Dietz, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) National Institute of Standards and Technology(国家标准与技术研究院) University of New Hampshire(新罕布什尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究检索质量与生成响应信息覆盖的关系,发现基于覆盖的检索指标与生成响应中的要点覆盖强相关,支持用检索指标代理RAG性能。

Comments 12 pages, ICTIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13402 2026-06-23 cs.HC cs.IR cs.MM 57%

InfoCIR: Multimedia Analysis for Composed Image Retrieval

InfoCIR:面向复合图像检索的多媒体分析

Ioannis Dravilas, Ioannis Kapetangeorgis, Anastasios Latsoudis, Conor McCarthy, Gonçalo Marcelino, Marcel Worring

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 InfoCIR通过整合检索、可解释性与提示工程,提供交互式界面,帮助用户理解多模态提示与嵌入空间的交互,提升模型开发中的洞察力生成。

Comments 9+2 pages, 8 figures. Accepted for publication in IEEE PacificVis 2026 (Conference Track). Interactive composed image retrieval (CIR) and ranking explanation

Journal ref 2026 IEEE 19th Pacific Visualization Conference (PacificVis), Sydney, Australia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22307 2026-06-23 cs.CV 版本更新 57%

Johnson-Lindenstrauss Lemma Guided Network for Efficient 3D Medical Segmentation

Johnson-Lindenstrauss引理引导的高效3D医学分割网络

Jinpeng Lu, Linghan Cai, Yinda Chen, Guo Tang, Songhan Jiang, Haoyuan Shi, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Dresden University of Technology(德累斯顿理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出VeloxSeg,通过双流CNN-Transformer架构(PWA和JLC)结合格拉姆矩阵空间解耦知识迁移,在低计算预算下实现多模态3D医学图像高效分割,Dice提升26%,GPU吞吐量提升11倍。

Comments 30 pages, 12 figures. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04424 2026-06-19 cs.CV 版本更新 57%

Composed Object Retrieval: Object-level Retrieval via Composed Expressions

组合对象检索:通过组合表达式进行对象级检索

Tong Wang, Guanyu Yang, Nian Liu, Zongyan Han, Jinxing Zhou, Salman Khan, Fahad Shahbaz Khan

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, Ministry of Education, Jiangsu, China(新一代人工智能技术及跨学科应用国家重点实验室,东南大学,教育部,江苏,中国) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿布扎赫德,阿联酋)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出组合对象检索(COR)任务,通过组合参考对象、掩码和检索文本进行对象级检索,并构建COR125K基准和CORE模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03120 2026-06-17 cs.CV cs.RO 版本更新 57%

SCC-Loc: A Unified Semantic Cascade Consensus Framework for UAV Thermal Geo-Localization

SCC-Loc: 无人机热红外地理定位的统一语义级联共识框架

Xiaoran Zhang, Yu Liu, Jinyu Liang, Kangqiushi Li, Zhiwei Huang, Huaxin Xiao

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出SCC-Loc框架,通过共享DINOv2骨干网络、语义引导视口对齐、级联空间自适应纹理结构滤波和共识驱动可靠性感知位置选择,解决热红外-可见光模态差异导致的特征模糊问题,实现零样本高精度绝对位置估计,平均定位误差9.37米。

Comments 17 pages, 5 figures. Submitted to IEEE J-STARS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17027 2026-06-16 cs.CV 新提交 57%

MeshLoom: Feed-Forward Non-Rigid Registration of Mesh Sequences

MeshLoom: 网格序列的前馈式非刚性配准

Jianqi Chen, Jiraphon Yenphraphai, Xiangjun Tang, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, Rameen Abdal

机构 * KAUST Saudi Arabia(沙特阿拉伯国王科技大学) Snap Inc. United States of America(Snap Inc. 美国) Purdue University United States of America(普渡大学 美国)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出MeshLoom,一种前馈式配准网络,通过拓扑感知编码器-解码器直接重建网格序列的顶点变形,实现秒级多网格配准,并在非刚性配准任务上达到最先进水平,同时支持运动插值和网格变形。

Comments Project page: https://meshloom.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14941 2026-06-16 cs.AI 新提交 57%

Semantics-Enhanced Retrieval-Augmented Time Series Forecasting

语义增强的检索增强时间序列预测

Shiqiao Zhou, Zipeng Wu, Holger Schöner, Edouard Fouché, IAG Wilson, Shuo Wang

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Montreal(蒙特利尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 针对非平稳性下仅靠时间序列相似性检索不足的问题,提出SERAF框架,通过双模态检索(时间序列及其自生成文本描述)联合利用历史模式,提升预测性能。

Comments Accepted to the ICML 2026 Workshop on Forecasting as a New Frontier of Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新 57%

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14078 2026-06-15 cs.LG cs.AI 新提交 57%

Rethinking Backdoor Adversarial Unlearning through the Lens of Catastrophic Forgetting in Continual Learning

通过持续学习中的灾难性遗忘视角重新思考后门对抗性去学习

Zhenqian Zhu, Yamin Hu, Yujiang Liu, Luping Wei, Wenbo Hou, Bin Li, Haodong Li, Wenjian Luo

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Key Laboratory of Media Security, Shenzhen University(深圳大学媒体安全深圳市重点实验室)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文将后门学习与去学习建模为持续学习视角下的三阶段过程,基于灾难性遗忘机制推导完全后门去学习的必要条件,并提出盲反演-后门对抗性去学习(BI-BAU)方法,通过期望最大化算法优化最大后验目标,有效消除后门效应。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13427 2026-06-12 cs.CV 新提交 57%

VietFashion: Benchmarking Sketch-Text Composed Image Retrieval for Cultural Outfits

VietFashion:面向文化服饰的草图-文本组合图像检索基准

Hoang-Nguyen Cao, Le-Hoang Bui, Dinh-Khoi Vo, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出VietFashion基准,针对越南传统服饰奥黛,结合手绘草图和文本描述进行多目标检索,揭示现有方法在细粒度文化语义和跨模态组合上的不足。

Comments ICMR 2026. Project page: https://hng0303.github.io/VietFashion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08505 2026-06-12 cs.LG cs.AI 版本更新 57%

Echo2ECG: Enhancing ECG Representations with Cardiac Morphology from Multi-View Echos

Echo2ECG:利用多视角超声心动图的心脏形态增强心电图表示

Michelle Espranita Liman, Özgün Turgut, Alexander Müller, Eimo Martens, Daniel Rueckert, Philip Müller

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与医学中的中心,慕尼黑技术大学(TUM)和慕尼黑大学医院) Department of Cardiology, TUM University Hospital(心血管科,慕尼黑大学医院) Department of Computing, Imperial College London(计算系,伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 提出Echo2ECG多模态自监督学习框架,通过多视角超声心动图丰富心电图表示,在结构表型分类和超声检索任务上优于现有方法,模型大小仅为最大基线的1/18。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09873 2026-06-10 cs.LG cs.AI 新提交 57%

Rotate2Think: Geometric Priming via Orthogonal Rotation to Improve Language Model Reasoning

Rotate2Think:通过正交旋转进行几何提示以提升语言模型推理能力

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Mila - Quebec AI Institute(Mila-魁北克人工智能研究所) LAMA-WeST Lab(LAMA-WeST实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 发现推理模型的输入嵌入与思考嵌入存在高锥度且方向非共线,提出无训练方法Rotate2Think,通过正交Procrustes分析估计旋转并注入合成思考向量,在30/32配置中提升数学、科学和代码任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07698 2026-06-09 cs.LG cs.AI 新提交 57%

Pharmacogenomic Knowledge Graph Augmentation for Graph Neural Network-Based Drug-Drug Interaction Prediction

基于图神经网络的药物相互作用预测的药理基因组学知识图谱增强

Juergen Dietrich

机构 * AI Solutions Berlin

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究通过整合PharmGKB的药理基因组学先验知识(CYP酶注释)作为特征向量,增强图神经网络在药物相互作用预测中的性能,在配对数据划分下显著提升DDI类型分类,但未能突破信息天花板。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08304 2026-06-09 cs.CR cs.AI 版本更新 57%

Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions

保障检索增强生成:攻击、防御与未来方向的分类法

Yuming Xu, Mingtao Zhang, Zhuohan Ge, Haoyang Li, Nicole Hu, Yongqi Zhang, Zhiyuan Wen, Jason Chen Zhang, Qing Li, Lei Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SLOT分类法,从攻击面、防御层、目标(遵循CIA属性)和攻击目标四个维度系统化梳理检索增强生成(RAG)的安全风险与防御,并指出知识访问管道中的结构性错配,最后展望未来方向。

Comments We have curated a paper list on RAG security in https://github.com/TreeAI-Lab/Awesome-RAG-Security, and we warmly welcome authors who wish to have their new work included to contact us via email

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06524 2026-06-08 eess.IV cs.CV cs.LG 新提交 57%

Advanced Flood Prediction with Physics-Guided Deep Learning: Combining UNet, FNO, and SAR/Optical Imagery

基于物理引导深度学习的先进洪水预测:结合UNet、FNO与SAR/光学影像

Tewodros Syum Gebre, Jagrati Talreja, Leila Hashemi-Beni

机构 * National Center for Atmospheric Research (NCAR)(国家大气研究中心)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出物理引导深度学习框架,融合多模态遥感与浅水方程约束,通过UNet-FNO混合架构实现高精度洪水预测,IoU达0.82,F1达0.90。

Comments This paper has been accepted for publication in the Proceedings of the IEEE Radar Conference (RadarConf 2026). The final authenticated version will be available through IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05489 2026-06-05 cs.CV cs.DB 57%

LLM-Guided ANN Index Optimization for Human-Object Interaction Retrieval

LLM引导的ANN索引优化用于人-物交互检索

Shahrzad Esmat, Chaunte W. Lacewell, Sameh Gobriel, Nilesh Jain, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Intel Corporation(英特尔公司)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 提出一种基于大语言模型的阶段感知智能体,通过耦合参数空间的分阶段优化,在HICO-DET等基准上显著提升向量检索吞吐量。

Comments 13 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01113 2026-06-05 cs.CV 57%

R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking

R^3: 基于推理引导的召回与重排序的组合视频检索

Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出R^3零样本组合视频检索流程,通过生成推理轨迹增强查询表示,并融合重排序验证候选视频,有效解决源视频与编辑指令组合检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04133 2026-06-04 cs.CV 57%

Pinpoint: Grounded Worldwide Image Geolocation via Cross-Source Retrieval and Reranking

Pinpoint: 基于跨源检索与重排序的全球图像地理定位

Nika Chuzhoy, Brian Hu, Amit A. Arora, Jae Ro, Sarthak S. Sahu

机构 * Virtualitics

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种检索-重排序架构Pinpoint,通过对比学习融合Flickr照片和街景图像,结合注意力重排序器利用跨源证据实现全球图像地理定位,在多个基准上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04061 2026-06-04 cs.CV 57%

Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal Reasoning

模态内邻居从不说谎:基于图模态内推理纠正模态间噪声对应

Yang Liu, Wentao Feng, Shu-Dong Huang, Yalan Ye, Jiancheng Lv

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出IN2R框架,利用模态内数据的几何稳定性,通过图精炼器对动态跨模态记忆中的邻居进行关系推理,合成连续软原型以纠正模态间噪声对应,显著提升跨模态检索性能。

Journal ref International Conference of Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00910 2026-06-02 cs.CV cs.LG 57%

Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval

推理、检索、重排序:一种用于组合视频检索的零样本推理感知框架

Ali Alavi

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出R3-CoVR零样本管道,通过多模态大模型推理编辑后状态、对比编码检索和约束感知重排序,在CVPR 2026 VidLLMs挑战赛上达到91.9% R@1和98.2% R@10。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21511 2026-06-02 cs.IR cs.CL 57%

From Tokens to Concepts: Leveraging SAE for SPLADE

从词元到概念:利用稀疏自编码器增强SPLADE

Yuxuan Zong, Mathias Vast, Basile Van Cooten, Laure Soulier, Benjamin Piwowarski

机构 * Sorbonne Université, CNRS, ISIR Paris France(索邦大学、国家科学研究中心、巴黎信息科学研究所法国)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对SPLADE依赖骨干词汇表导致多义性和同义性等问题,提出用稀疏自编码器学习的语义概念空间替换词汇表,实现性能相当且效率提升。

Comments 11 pages, 3 figures, 9 tables. To appear at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31503 2026-06-01 cs.CV cs.LG 57%

How can embedding models bind concepts?

嵌入模型如何绑定概念?

Arnas Uselis, Darina Koishigarina, Seong Joon Oh

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文研究视觉-语言嵌入模型(如CLIP)在概念绑定上的局限性,发现场景嵌入可加性分解为对象表示,但CLIP的高复杂度绑定函数阻碍了泛化,而通过充分数据训练的Transformer模型能学习低复杂度乘法交互绑定函数实现系统泛化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00501 2026-05-28 cs.CV 57%

CPPO: Contrastive Perception Policy Optimization for VLM Agents

CPPO: 面向VLM智能体的对比感知策略优化

Ahmad Rezaei, Mohsen Gholami, Saeed Ranjbar Alvar, Kevin Cannons, Mohammad Asiful Hossain, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * Huawei Technologies Canada Co. Ltd.(华为技术加拿大有限公司) Huawei Cloud(华为云)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种自监督的对比感知策略优化方法CPPO,通过对比感知损失增强视觉语言模型的视觉基础能力,无需额外模型或标注,在感知关键任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏