arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2601.15891 2026-05-27 cs.CV 57%

RadJEPA: Radiology Encoder for Chest X-Rays via Joint Embedding Predictive Architecture

RadJEPA:基于联合嵌入预测架构的胸部X光放射学编码器

Anas Anwarul Haq Khan, Mariam Husain, Pratik Jalan, Kshitij Jadhav

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Department of Biomedical Engineering, Johns Hopkins University(约翰霍普金斯大学生物医学工程系) Koita Centre for Digital Health, Indian Institute of Technology Bombay(印度理工学院孟买分校Koita数字健康中心)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 提出RadJEPA,一种无需语言监督的自监督框架,通过联合嵌入预测架构在约84万张无标签胸部X光图像上预训练,学习预测掩码区域的潜在表示,在放射学报告生成等任务中达到或超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25657 2026-05-26 cs.CV 57%

ARMA-C3: A Contrastive ARMA Convolutional Framework for Unsupervised and Semi-supervised Classification

ARMA-C3: 一种用于无监督和半监督分类的对比ARMA卷积框架

VSS Tejaswi Abburi, Saurabh J. Shigwan, Nitin Kumar

机构 * VSS Tejaswi Abburi Saurabh J. Shigwan Nitin Kumar

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出ARMA-C3框架,利用对比学习和图割正则化在无监督和半监督场景下学习图节点的判别性表示,在多个医学影像数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13193 2026-05-20 cs.CV 57%

FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition

FIKA-Bench: 从细粒度识别到细粒度知识获取

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FIKA-Bench,一个包含311个公开来源和现实实例的细粒度知识获取基准,通过过滤和审计确保实例质量,评估最新多模态模型和代理发现细粒度识别任务仍具挑战性,需改进代理设计以提升知识获取能力。

Comments Project page with code: https://ligeng0197.github.io/FIKA-Bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25722 2026-05-20 cs.CV cs.LG 57%

No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models

无需硬负样本:基于概念的学习在不降低对比模型零样本能力的情况下实现组合性

Hai X. Pham, David T. Hoffmann, Ricardo Guerrero, Brais Martinez

机构 * Samsung AI Center(三星人工智能中心)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于概念的学习方法,无需使用硬负样本即可在不损害对比模型零样本和检索能力的情况下实现组合性,通过简单的方法改进了文本和图像编码器的全局池化问题。

Comments Accepted at CVPR 2026. 2nd rev: update github repo URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19734 2026-05-20 cs.CV 57%

GeoMamba: A Geometry-driven MambaVision Framework and Dataset for Fine-grained Optical-SAR Object Retrieval

GeoMamba: 一种基于几何的MambaVision框架及数据集,用于细粒度光学-雷达目标检索

Tiantong Fang, Xiuwei Wang, Jing Xiao, Wujie Zhou, Liang Liao, Mi Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Artificial Intelligence and Information Engineering, Zhejiang University of Science & Technology(浙江科技大学人工智能与信息工程学院) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GeoMamba框架,通过引入几何特征注入模块和几何一致性约束模块,提升光学-雷达细粒度目标检索的鲁棒性,并构建了新的FGOS-as数据集来评估跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18763 2026-05-20 cs.IR cs.AI 57%

Query-Conditioned Graph Retrieval for Contextualized LLM Reasoning in Personalized Wearable Data

基于查询的图检索用于个性化可穿戴数据中的上下文化LLM推理

Zhenyu Lu, Mahyar Abbasian, Amir M. Rahmani

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Irvine(加州大学 Irvine 分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出WAG框架,通过图检索实现LLM在可穿戴数据中的上下文化推理,通过构建个性化知识图谱并检索查询条件子图,提高推理效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18434 2026-05-19 cs.IR cs.CV 57%

TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

TIGER-FG: 基于文本引导的隐式细粒度 grounding 用于电商检索

Xinyu Sun, Huangyu Dai, Lingtao Mao, Zexin Zheng, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TIGER-FG框架,通过文本引导生成目标聚焦的物品表示,解决电商检索中模态和粒度不匹配的问题,并在两个基准测试中提升了检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18029 2026-05-19 cs.CV 57%

What Matters for Grocery Product Retrieval with Open Source Vision Language Models

在开源视觉语言模型中,什么因素影响杂货产品检索

Emmanuel G. Maminta, Rowel O. Atienza

机构 * AI Graduate Program, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院人工智能研究生项目) EEEI, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院电子工程系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了开源视觉语言模型在杂货产品检索任务中的表现,发现数据质量比规模更重要,高效模型可以胜出,并且存在召回率差距的问题。

Comments Accepted in the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16755 2026-05-19 cs.LG cs.AI 57%

Learning Unbiased Permutations via Flow Matching

通过流匹配学习无偏排列

Yimeng Min, Carla P. Gomes

机构 * Department of Computer Science(计算机科学系) Cornell University(康奈尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PermFlow框架,通过在具有单位行和列和的矩阵仿射子空间上直接操作,学习多模态排列分布,避免了基于熵正则化Sinkhorn方法在模糊性下的崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09544 2026-05-18 cs.LG cs.CE cs.CV 57%

Integrating chemical structures as treatments improves representations of microscopy images for morphological profiling

将化学结构作为治疗手段提高显微镜图像的表示以进行形态学分析

Yemin Yu, Emre Hayir, Neil Tenenholtz, Lester Mackey, Ying Wei, David Alvarez-Melis, Ava P. Amini, Alex X. Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Microsoft Research(微软研究院) Department of Computer Science, Zhejiang University(浙江大学计算机科学系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MICON框架,通过整合化学结构信息提升显微镜图像的表示能力,改进了形态学分析中的特征学习。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12988 2026-05-14 cs.AI cs.CY cs.IR 57%

Retrieval-Augmented Tutoring for Algorithm Tracing and Problem-Solving in AI Education

增强检索的辅导系统用于AI教育中的算法追踪与问题解决

Mragisha Jain, Tirth Bhatt, Griffin Pitts, Aum Pandya, Peter Brusilovsky, Narges Norouzi, Arto Hellas, Juho Leinonen, Bita Akram

机构 * North Carolina State University(北卡罗来纳州立大学) University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校) Aalto University(阿尔托大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出KITE系统,通过增强检索生成技术辅助学生理解算法追踪和问题解决,提升算法推理能力。

Comments Paper accepted to the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08802 2026-05-13 cs.CV 57%

CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization

CoLVR: 通过对比优化增强探索性潜在视觉推理

Ziyang Ding, Linjian Meng, Yiming Wu, Yuhan Li, Yuhao Liu, Zhen Zhao

机构 * Shandong University(山东大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 CoLVR通过引入潜在对比训练框架,利用角度扰动引导学习多样化且探索性的表示,提升潜在视觉推理的探索能力,在VSP和Jigsaw任务中分别提升5.83%和8.00%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10510 2026-05-12 cs.LG cs.AI 57%

CMKL: Modality-Aware Continual Learning for Evolving Biomedical Knowledge Graphs

CMKL:面向演变生物医学知识图谱的模态感知持续学习

Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Qixin Zhang, Yongcheng Jing, Renqiang Luo, Xikun Zhang

机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业部门) King Abdullah University of Science and Technology(卡塔尔科技大学) School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学) College of Computer Science and Technology(计算机科学与技术学院) Jilin University(吉林大学) School of Computing Technologies(计算技术学院) RMIT University(皇家墨尔本理工大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 CMKL通过混合专家路由融合结构、文本和分子信息,利用EWC和K-means多样化重放缓冲区保护已有知识,在生物医学持续学习任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09392 2026-05-12 cs.CV 57%

HyNeuralMap: Hyperbolic Mapping of Visual Semantics to Neural Hierarchies

HyNeuralMap:视觉语义到神经层次的双曲映射

Zihan Ma, Tian Xia, Kexin Wang, Xiao Li, Xiaowei He, Yudan Ren

机构 * School of Electronic Information (School of Artificial Intelligence), the Xi’an Key Laboratory of Radiomics and Intelligent Perception, Northwest University(电子信息学院(人工智能学院)、西安放射组学与智能感知重点实验室、西北大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出HyNeuralMap框架,利用双曲洛伦兹模型将视觉语义映射到共享的跨被试神经层次,通过双曲空间的负曲率捕捉层次化语义结构,实验表明其在多标签预测和跨模态检索中优于欧几里得基线。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12812 2026-05-12 cs.AI 57%

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解

Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08421 2026-05-12 cs.CV 57%

Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval

超越图像块:通过文本监督学习全局布局用于晚期交互视觉文档检索

Pascal Tilli, Mohsen Mesgar

机构 * University of Stuttgart(斯图加特大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出通过文本监督学习文档全局布局,改进视觉文档检索的晚期交互架构,提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23370 2026-05-11 cs.CV 57%

GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval

GRAPE:通过检索排名监督查询重写

Zhaohua Zhang, Jianhuan Zhuo, Muxi Chen, Chenchen Zhao, Wenyu Jiang, Tianwen Jiang, Mingyang Chen, Yutang, Qiuyong Xiao, Jihong Zhang, Zhixun Su

机构 * Dalian University of Technology, Dalian, China(大连理工大学) Tencent HunYuan Data, Shenzhen, China(腾讯混元数据)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 GRAPE通过组相对策略优化提升检索排名,改进多语言、长文本和多模态查询的检索性能,平均提升Recall@10 4.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09850 2026-05-11 cs.CV 57%

Towards Explainable Industrial Anomaly Detection via Knowledge-Guided Latent Reasoning

面向可解释性工业异常检测的基于知识引导的潜在推理

Peng Chen, Chao Huang, Yunkang Cao, Chengliang Liu, Wei Wang, Wenqiang Wang, Mingbo Yang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Reason-IAD框架,通过引入领域特定文本描述和熵驱动的潜在推理机制,提升工业异常检测的准确性和可解释性,实验表明其在多个任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06245 2026-05-08 cs.MM 57%

Modality-Aware Contrastive and Uncertainty-Regularized Emotion Recognition

模态感知的对比学习与不确定性正则化情绪识别

Yan Zhuang, Minhao Liu, Yanru Zhang, Jiawen Deng, Fuji Ren

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 本文提出MCUR框架,通过表征一致性方法提升多模态情绪识别的鲁棒性,采用模态组合对比学习和样本级不确定性正则化,实验表明在MOSI、MOSEI和IEMOCAP数据集上均取得显著提升。

Comments 24 pages, 6 figures and 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01393 2026-05-05 cs.CV 57%

Recall to Predict: Grounding Motion Forecasting in Interpretable Motion Bank

回忆以预测:在可解释的运动库中 grounded 运动预测

Abhishek Vivekanandan, Ahmed Abouelazm, J. Marius Zöllner

机构 * FZI Forschungszentrum Informatik(弗劳恩霍夫研究所信息技术研究中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种端到端的可区分框架,通过对比学习构建全面的'运动库'来 grounding 运动预测,采用新颖的锚点检索层动态检索显式运动先验,结合 DETR 式解码器和 WTA 动态高斯混合模型,实现可解释的多模态预测。

Comments Sumitted for PeerReview

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01165 2026-05-05 cs.CV 57%

CEZSAR: A Contrastive Embedding Method for Zero-Shot Action Recognition

CEZSAR:一种用于零样本动作识别的对比嵌入方法

Valter Estevam, Rayson Laroca, Helio Pedrini, David Menotti

机构 * Federal Institute of Paraná, Irati, Brasil(巴西南里奥格兰德联邦理工学院) Federal University of Paraná, Curitiba, Brasil(巴西南里奥格兰德联邦大学) Pontifical Catholic University of Paraná, Curitiba, Brasil(巴西南里奥格兰德天主教大学) University of Campinas, Campinas, Brasil(坎皮纳斯大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于对比学习的零样本动作识别方法,通过联合嵌入空间对视频和句子进行编码,解决语义鸿沟和领域偏移问题,实验在UCF-101和Kinetics-400数据集上取得最佳效果。

Comments Accepted for presentation at the International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00925 2026-05-05 cs.LG cs.CV q-bio.QM 57%

Linking spatial biology and clinical histology via Haiku

通过俳句连接空间生物学与临床组织学

Yan Cui, Jacob S. Leiby, Wenhui Lei, Dokyoon Kim, Yanxiang Deng, Aaron T. Mayer, Zhenqin Wu, Alexandro E. Trevino, Zhi Huang

机构 * Department of Pathology and Laboratory Medicine, University of Pennsylvania(宾夕法尼亚大学病理学与实验室医学系) Department of Bioengineering, University of Pennsylvania(宾夕法尼亚大学生物工程系) Department of Biostatistics, Epidemiology & Informatics, University of Pennsylvania(宾夕法尼亚大学生物统计学、流行病学与信息学系) Enable Medicine, Menlo Park, CA, USA(Enable Medicine)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Haiku模型,整合分子、形态和临床数据,通过三模态对比学习实现跨模态检索,提升分类和预测任务性能,并支持零样本生物标志物推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00902 2026-05-05 cs.CV cs.IR 57%

Validation of Whole-Slide Foundation Models for Image Retrieval in TCGA Data

对TCGA数据中整张滑动图像检索的整张滑动图像基础模型进行验证

Tianhao Lei, Parsa Esmaeilkhani, Saghir Alfasly, Wataru Uegami, Judy C. Boughey, Matthew P. Goetz, Krishna R. Kalari, H. R. Tizhoosh

机构 * KIMIA Lab, Artificial Intelligence and Informatics, Mayo Clinic, Rochester, MN, USA(KIMIA实验室,人工智能与信息学,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Neurology, Northwestern University Feinberg School of Medicine, Chicago, IL, USA(神经病学系,北western大学费因伯格医学院,芝加哥,伊利诺伊州,美国) Department of Computer Science, Temple University, Philadelphia, PA, USA(计算机科学系,泰勒大学,费城,宾夕法尼亚州,美国) Department of Breast and Melanoma Surgical Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA(乳腺和黑色素瘤外科肿瘤学系,综合癌症中心,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA(肿瘤学系,综合癌症中心,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Quantitative Health Sciences, Mayo Clinic, Rochester, MN, USA(定量健康科学系,梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本研究验证了TCGA数据中整张滑动图像基础模型的检索性能,发现基于片段和监督聚合的方法在Top-1和Top-3准确率上表现相当,但整体性能受器官和诊断差异影响较大,形态学检索存在固有限制,需进一步改进特征表示和多模态框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12778 2026-05-05 cs.CL 57%

HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks

HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架

Zhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25533 2026-04-29 cs.CV 57%

DualGeo: A Dual-View Framework for Worldwide Image Geo-localization

DualGeo: 一个用于全球图像地理定位的双视角框架

Junchao Cui, Wenqi Shi, Shaoyong Du, Hang He, Xuanzi Ma, Hao Tang, Xiangyang Luo

机构 * Henan Key Laboratory of Cyberspace Situation Awareness, Zhengzhou, China(河南空域态势感知重点实验室,郑州,中国) Information Engineering University, Zhengzhou, China(信息工程大学,郑州,中国)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 DualGeo通过融合图像与语义分割特征构建地理表示,并利用双视角对比学习与地理聚类提升全球图像定位精度,实验表明其在街道和城市级别定位准确率提升显著。

Comments ICME2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25390 2026-04-29 cs.IR cs.CV 57%

GeoSearch: Augmenting Worldwide Geolocalization with Web-Scale Reverse Image Search and Image Matching

GeoSearch:通过网络级反向图像搜索和图像匹配增强全球地理定位

Tung-Duong Le-Duc, Hoang-Quoc Nguyen-Son, Minh-Son Dao

机构 * University of Science, VNU-HCM(越南国家科学大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GeoSearch框架,通过整合网络级反向图像搜索与图像匹配技术,提升全球图像地理定位的准确性,实验表明其在考虑泄漏因素下的优越性。

Comments Accepted to SIGIR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25296 2026-04-29 cs.CL 57%

Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

从医学实体树学习:一种以实体为中心的医疗数据工程框架用于多模态大语言模型

Jianghang Lin, Haihua Yang, Deli Yu, Kai Wu, Kai Ye, Jinghao Lin, Zihan Wang, Yuhang Wu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) ByteDance(字节跳动) Northeastern University(东北大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出以实体为中心的医疗数据工程框架,通过构建医学实体树,提升多模态大语言模型在医疗领域的表现,通过实体引导检索、双重过滤和知识感知数据合成等方法,增强模型处理复杂临床问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25102 2026-04-29 cs.CV 57%

One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations

一个扰动,两种失效模式:通过嵌入引导的字形扰动探测VLM安全性

Ravikumar Balakrishnan, Sanket Mendapara

机构 * Cisco Systems(思科系统)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文通过实证研究揭示多模态嵌入距离对VLM攻击成功率的预测作用,并提出基于嵌入引导的字形扰动方法,验证了可读性与安全对齐的交互影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24469 2026-04-28 cs.IR cs.CV 57%

Geometric Analysis of Self-Supervised Vision Representations for Semantic Image Retrieval

视觉语义图像检索中自监督表示的几何分析

Esteban Rodríguez-Betancourt, Edgar Casasola-Murillo

机构 * Universidad de Costa Rica(哥斯达黎加大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 研究评估现代自监督学习方法在图像检索中的表现,发现高各向异性表示会损害基于分区和哈希的搜索性能,而更各向同性表示能提升语义检索效果。

Comments 8 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22755 2026-04-28 cs.IR cs.AI 57%

RADIANT-LLM: an Agentic Retrieval Augmented Generation Framework for Reliable Decision Support in Safety-Critical Nuclear Engineering

RADIANT-LLM:一种用于安全关键核工程中可靠决策支持的代理检索增强生成框架

Zavier Ndum Ndum, Jian Tao, John Ford, Mansung Yim, Yang Liu

机构 * Department of Nuclear Engineering, Texas A\&M University, College Station, TX, USA College of Performance, Visualization Fine Arts, Texas A\&M University, College Station, TX, USA

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出RADIANT-LLM框架,通过多模态检索增强生成技术,结合领域知识库和代理层,提升核工程中的决策支持准确性与透明度,降低幻觉风险。

详情

展开后加载摘要…

URL PDF HTML 收藏