arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2603.25267 2026-04-02 cs.CV 57%

EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval

EagleNet:面向文本-视频检索的能耗感知细粒度关系学习网络

Yuhan Chen, Pengwen Dai, Chuan Wang, Dayan Wu, Xiaochun Cao

机构 * Sun Yat-sen University(中山大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Key Laboratory of Adversarial Artificial Intelligence(深圳市对抗性人工智能重点实验室) Beijing Jiaotong University(北京交通大学) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EagleNet,通过细粒度关系学习机制和能耗感知匹配,提升文本-视频检索中文本与视频帧间关系的表达,增强语义匹配能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV 57%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28575 2026-03-31 cs.LG cs.AI 57%

ChemCLIP: Bridging Organic and Inorganic Anticancer Compounds Through Contrastive Learning

ChemCLIP:通过对比学习弥合有机和无机抗癌化合物的鸿沟

Mohamad Koohi-Moghadam, Hongzhe Sun, Hongyan Li, Kyongtae Tyler Bae

机构 * Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院) Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) Department of Chemistry, The University of Hong Kong(香港大学化学系)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出ChemCLIP框架,通过对比学习统一有机和无机抗癌化合物的表示,利用共享抗癌活性而非结构相似性,提升跨领域化学知识迁移能力。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15681 2026-03-31 cs.LO cs.AI 57%

ProofBridge: Auto-Formalization of Natural Language Proofs in Lean via Joint Embeddings

ProofBridge: 通过联合嵌入实现自然语言证明的自动形式化(Lean)

Prithwish Jana, Kaan Kale, Ahmet Ege Tanriverdi, Cruise Song, Sriram Vishwanath, Vijay Ganesh

机构 * Georgia Institute of Technology(佐治亚理工学院) Bogazici University(博阿齐奇大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 ProofBridge通过联合嵌入模型实现自然语言定理和证明到Lean 4的自动形式化,结合检索增强微调和迭代证明修复,提升语义和类型正确性。

Comments Published as a conference paper at the 14th International Conference on Learning Representations (ICLR 2026), Rio de Janeiro, Brazil, April 23-27, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25216 2026-03-27 cs.NI cs.AI eess.SP 57%

A Wireless World Model for AI-Native 6G Networks

面向AI原生6G网络的无线世界模型

Ziqi Chen, Yi Ren, Yixuan Huang, Qi Sun, Nan Li, Yuhong Huang, Chih-Lin I, Yifan Li, Liang Xia

机构 * China Mobile Research Institute(中国移动研究院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出无线世界模型(WWM),通过内化三维几何与信号动态的因果关系,预测无线信道的时空演化,实现跨动态环境的泛化能力,优于现有单模基础模型和任务专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22013 2026-03-27 cs.CV 57%

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。

Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05631 2026-03-27 cs.CV 57%

OFFSET: Segmentation-based Focus Shift Revision for Composed Image Retrieval

OFFSET: 基于分割的聚焦偏移修正用于复合图像检索

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Xuemeng Song, Liqiang Nie

机构 * Shandong University(山东大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OFFSET网络,通过分割模块和双聚焦映射模块修正复合图像检索中的视觉和文本焦点偏差,提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24556 2026-03-26 cs.IR cs.AI 57%

Evaluating Chunking Strategies For Retrieval-Augmented Generation in Oil and Gas Enterprise Documents

评估检索增强生成在石油和天然气企业文档中的分块策略

Samuel Taiwo, Mohd Amaluddin Yusoff

机构 * Digital and Innovation Department, Nigeria LNG Limited(尼日利亚LNG公司数字与创新部门)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了四种分块策略在石油和天然气企业文档中的效果,发现结构感知分块在检索效果和计算成本上表现最佳,但对图表类文档仍有限。

Comments Presented at CCSEIT 2026. This version matches the published proceedings

Journal ref Computer Science and Information Technology (CS and IT), pp. 49-67, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23029 2026-03-25 cs.CV 57%

WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval

WISER:更广的搜索、更深入的思考和自适应融合用于无训练零样本复合图像检索

Tianyue Wang, Leigang Qu, Tianyu Yang, Xiangzhao Hao, Yifan Xu, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Minzu University of China(民族大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 WISER通过'检索-验证-细化'流程统一文本到图像和图像到图像检索,显式建模意图和不确定性意识,实现更广泛的搜索和更深入的思考,提升零样本复合图像检索性能。

Comments Accept to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21925 2026-03-24 cs.AI 57%

Guideline-grounded retrieval-augmented generation for ophthalmic clinical decision support

基于指南的检索增强生成用于眼科临床决策支持

Shuying Chen, Sen Cui, Zhong Cao

机构 * University of International Business and Economics(国际商务经济大学) Tsinghua University(清华大学) Heidelberg Institute of Global Health(海德堡全球健康研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Oph-Guid-RAG系统,通过多模态视觉RAG方法提升眼科临床问答与决策支持,通过可控检索框架和多模态推理提升证据基础和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01049 2026-03-24 cs.CV cs.RO 57%

KeySG: Hierarchical Keyframe-Based 3D Scene Graphs

KeySG:基于关键帧的层次化3D场景图

Abdelrhman Werby, Dennis Rotondi, Fabio Scaparro, Kai O. Arras

机构 * Socially Intelligent Robotics Lab, Institute for Artificial Intelligence University of Stuttgart, Germany(社会智能机器人实验室,人工智能研究所,斯图加特大学,德国)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 KeySG通过层次化3D场景图结构,结合关键帧提取多模态信息,提升复杂环境中的语义推理与规划能力,优于现有方法。

Comments Code and video are available at https://keysg-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13876 2026-03-24 cs.CV 57%

Scene Prior Filtering for Depth Super-Resolution

场景先验过滤用于深度超分辨率

Zhengxue Wang, Zhiqiang Yan, Ming-Hsuan Yang, Jinshan Pan, Guangwei Gao, Ying Tai, Jian Yang

机构 * PCA Lab, Nanjing University of Science and Technology, China(南京理工大学科学与工程学院实验室) National University of Singapore(新加坡国立大学) University of California, USA, and Yonsei University, South Korea(美国加州大学和韩国延世大学) PCA Lab, Nanjing University, China(南京大学实验室)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SPFNet网络,利用大尺度模型的表面法线和语义图作为先验信息,通过多模态先验传播和一对一先验嵌入减少纹理干扰并提升边缘表示,实现在真实和合成数据集上的超分辨率性能。

Comments Accepted to IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21083 2026-03-24 cs.CV 57%

Hierarchical Text-Guided Brain Tumor Segmentation via Sub-Region-Aware Prompts

基于子区域感知提示的层次化文本引导脑肿瘤分割

Bahram Mohammadi, Ta Duc Huy, Afrouz Sheikholeslami, Qi Chen, Vu Minh Hieu Phan, Sam White, Minh-Son To, Xuyun Zhang, Amin Beheshti, Luping Zhou, Yuankai Qi

机构 * Macquarie University(麦考瑞大学) Adelaide University(阿德莱德大学) Flinders University(弗林德斯大学) University of Sydney(悉尼大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TextCSP框架,通过文本引导和子区域感知提示提升脑肿瘤分割精度,实验显示在Dice和HD95指标上优于现有方法。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12985 2026-03-24 cs.LG cs.CV 57%

Angular Gradient Sign Method: Uncovering Vulnerabilities in Hyperbolic Networks

角梯度符号法:揭示双曲网络中的漏洞

Minsoo Jo, Dongyoon Yang, Taesup Kim

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于双曲空间几何性质的对抗攻击方法,通过分解梯度为径向和角向分量,生成高影响的对抗样本,提升分类和检索任务的欺骗率。

Comments Accepted by AAAI 2026. Code available at: https://github.com/J-Minsoo/AGSM

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(7), 5566-5574, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20513 2026-03-24 cs.IR cs.AI 57%

ReBOL: Retrieval via Bayesian Optimization with Batched LLM Relevance Observations and Query Reformulation

ReBOL:通过批量LLM相关性观察和查询重述进行检索

Anton Korikov, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 ReBOL通过引入多模态贝叶斯优化和查询重述技术,改进检索阶段的召回率和排名质量,优于现有LLM重排序基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20336 2026-03-24 cs.IR cs.AI cs.DB 57%

GEM: A Native Graph-based Index for Multi-Vector Retrieval

GEM:一种基于图的多向量检索索引

Yao Tian, Zhoujin Tian, Xi Zhao, Ruiyuan Zhang, Xiaofang Zhou

机构 * The Hong Kong University of \ Hong Kong Generative AI Research \& Development Center Hong Kong China The Hong Kong University of Science Hong Kong Generative AI Research \& Development Center

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 GEM提出一种针对多向量表示的原生索引框架,通过构建向量集的接近图,保留细粒度语义并实现高效导航,提升检索效率和准确性。

Comments This paper has been accepted by SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20651 2026-03-20 cs.AI 57%

Memory Bear AI A Breakthrough from Memory to Cognition Toward Artificial General Intelligence

记忆熊AI:从记忆到认知迈向通用人工智能的突破

Deliang Wen, Ke Sun

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Memory Bear系统,通过整合多模态感知、动态记忆维护和适应性认知服务,提升LLM的记忆机制,实现跨领域知识准确性和检索效率的提升,减少幻觉并增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16645 2026-03-18 cs.CV 57%

BUSSARD: Normalizing Flows for Bijective Universal Scene-Specific Anomalous Relationship Detection

BUSSARD:基于归一化流的生物jective通用场景特定异常关系检测

Melissa Schween, Mathis Kruse, Bodo Rosenhahn

机构 * Institute for Information Processing, L3S - Leibniz University Hannover(信息处理研究所,L3S-汉诺威莱布尼茨大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BUSSARD模型,通过归一化流学习场景图中对象-关系-对象三元组到基础分布的可逆变换,实现异常关系检测。在SARD数据集上取得优于当前SOTA的AUROC提升,并展示出更强的鲁棒性和通用性。

Comments CVPR 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14541 2026-03-17 cs.AI cs.IR 57%

Expert Mind: A Retrieval-Augmented Architecture for Expert Knowledge Preservation in the Energy Sector

专家思维:一种用于能源领域专家知识保留的检索增强架构

Diego Ezequiel Cervera

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Expert Mind系统,通过RAG、大语言模型和多模态技术,解决能源领域专家知识流失问题,提升知识传递效率与入职效率。

Comments 6 pages, 1 figure, conceptual architecture paper on retrieval-augmented expert knowledge systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13660 2026-03-17 cs.CV 57%

Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision

从掩码引导自监督学习中学习通用的3D医学图像表示

Yunhe Gao, Yabin Zhang, Chong Wang, Jiaming Liu, Maya Varma, Jean-Benoit Delbrouck, Akshay Chaudhari, Curtis Langlotz

机构 * Stanford University(斯坦福大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MASS方法,通过掩码引导自监督学习,学习通用的医学图像表示,实现了在不同数据集上的高效分割和分类任务。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19621 2026-03-17 cs.CV 57%

Exemplar Med-DETR: Toward Generalized and Robust Lesion Detection in Mammogram Images and beyond

示例医学DETR:迈向乳腺X线图像及其他图像中的通用和稳健病变检测

Sheethal Bhat, Bogdan Georgescu, Adarsh Bhandary Panambur, Mathias Zinnen, Tri-Thien Nguyen, Awais Mansoor, Karim Khalifa Elbarbary, Siming Bayer, Florin-Cristian Ghesu, Sasa Grbic, Andreas Maier

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出Exemplar Med-DETR,一种多模态对比检测器,通过交叉注意力和内在衍生的类特定示例特征实现基于特征的检测,展示了在多种影像模态上的卓越性能。

Comments I am asking for a withdrawal of the paper as I did not have institutional approval to release this paper right now

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15098 2026-03-16 cs.CV 57%

Uni-Parser Technical Report

统一解析器技术报告

Xi Fang, Haoyi Tao, Shuwen Yang, Chaozheng Huang, Suyang Zhong, Haocheng Lu, Han Lyu, Junjie Wang, Xinyu Li, Linfeng Zhang, Guolin Ke

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 Uni-Parser是一种面向科学文献和专利的工业级文档解析引擎,具备高吞吐量、高精度和低成本优势,采用模块化架构实现多模态细粒度对齐,支持大规模部署和扩展,适用于文献检索、摘要生成及化学结构提取等下游应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22427 2026-03-12 cs.CR cs.AI 57%

Adversarial Hubness Detector: Detecting Hubness Poisoning in Retrieval-Augmented Generation Systems

对抗性中心性检测器:在检索增强生成系统中检测中心性污染

Idan Habler, Vineeth Sai Narajala, Stav Koren, Amy Chang, Tiffany Saade

机构 * Idan Habler Vineeth Sai Narajala Stav Koren Amy Chang Tiffany Saade

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 Hubscan通过多检测器架构检测RAG系统中的对抗性中心性问题,利用统计分析、聚类扩展、稳定性测试和领域感知方法,有效识别并隔离潜在的安全威胁。

Comments 11 pages, 5 figures, 2 tables, Github: https://github.com/cisco-ai-defense/adversarial-hubness-detector, Updated with minor changes to naming

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09185 2026-03-11 cs.CL 57%

DEO: Training-Free Direct Embedding Optimization for Negation-Aware Retrieval

DEO:无训练直接嵌入优化用于否定感知检索

Taegyeong Lee, Jiwon Park, Seunghyun Hwang, JooYoung Jang

机构 * Department of Industrial Engineering, Hanyang University(工业工程系,翰阳大学) Department of Applied Data Science, Sungkyunkwan University(应用数据科学系,成均馆大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 DEO通过无训练的直接嵌入优化方法,提升了否定和排除感知检索的性能,尤其在多模态检索中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18384 2026-03-11 cs.CV 57%

LiDAR Remote Sensing Meets Weak Supervision: Concepts, Methods, and Perspectives

LiDAR遥感与弱监督学习:概念、方法与展望

Yuan Gao, Shaobo Xia, Pu Wang, Xiaohuan Xi, Sheng Nie, Cheng Wang

机构 * aircas.ac.cn(航空科学研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文从弱监督学习视角系统回顾了LiDAR遥感的最新进展,探讨了弱监督方法在数据解释、参数反演及跨域适应中的应用,并展望了WSL在提升LiDAR遥感性能与泛化能力方面的未来方向。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing Volume 235, May 2026, Pages 72-104

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07497 2026-03-10 cs.CV 57%

AMR-CCR: Anchored Modular Retrieval for Continual Chinese Character Recognition

AMR-CCR: 以锚定模块检索实现连续中文字符识别

Yuchuan Wu, Yinglian Zhu, Haiyang Yu, Ke Niu, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 AMR-CCR通过锚定模块检索框架实现连续中文字符识别,解决持续类增长和脚本多样性问题,提出轻量级脚本注入模块和多原型字典以提升识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07493 2026-03-10 cs.CV 57%

RayD3D: Distilling Depth Knowledge Along the Ray for Robust Multi-View 3D Object Detection

RayD3D: 沿射线蒸馏深度知识以实现鲁棒的多视角3D目标检测

Rui Ding, Zhaonian Kuang, Zongwei Zhou, Meng Yang, Xinhu Zheng, Gang Hua

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 RayD3D通过沿射线蒸馏深度知识,提升多视角3D目标检测的鲁棒性,无需增加计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19112 2026-03-10 cs.CV 57%

Universal 3D Shape Matching via Coarse-to-Fine Language Guidance

通过粗到细的语言引导实现通用3D形状匹配

Qinfeng Xiao, Guofeng Mei, Bo Yang, Liying Zhang, Jian Zhang, Kit-lun Yick

机构 * Hong Kong Polytechnic University, HK SAR(香港理工大学) Fondazione Bruno Kessler, Italy(布鲁诺·凯斯勒基金会) University of Technology Sydney, Australia(悉尼科技大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 UniMatch通过粗到细的语言引导方法,实现跨类别非等距形状的通用3D匹配。

Comments Accepted by CVPR 2026

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06722 2026-03-10 cs.LG cs.AI 57%

ProtAlign: Contrastive learning paradigm for Sequence and structure alignment

ProtAlign: 用于序列和结构对齐的对比学习范式

Aditya Ranganath, Hasin Us Sami, Kowshik Thopalli, Bhavya Kailkhura, Wesam Sakla

机构 * Center for Applied Scientific Computing, Lawrence Livermore National Laboratory(应用科学计算中心,劳伦斯利弗莫尔国家实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 ProtAlign通过对比学习范式,统一了蛋白质序列与结构的表示,提升跨模态检索和下游预测性能。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04598 2026-03-06 cs.CV 57%

PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

PinPoint:评估组合图像检索的综合基准,包含显式负样本、多图像查询和同义词测试

Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV

AI总结 PinPoint提出一个综合基准测试,通过多正确答案、显式负样本和同义词测试评估组合图像检索的鲁棒性和公平性。

Comments Accepted for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏