arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3457 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3457 篇

2602.22716 2026-02-27 cs.CV cs.AI 62%

SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

SoPE: 基于球坐标的位置嵌入:增强3D大视觉-语言模型的空间感知

Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen

机构 * University of Macau(澳门大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SoPE通过基于球坐标的位置嵌入提升3D LVLMs的空间感知能力,结合多尺度频率混合策略,增强几何表示的一致性和表达性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14162 2026-02-27 cs.CL cs.CV cs.IR 62%

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

索引轻,推理深:延迟视觉摄入用于视觉密集文档问答

Tao Xu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出延迟视觉摄入框架,通过分层图号聚类构建索引,利用BM25检索和VLM分析提升视觉密集文档问答性能。

Comments 24 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00523 2026-02-24 cs.AI cs.CV 62%

VIRTUE: Visual-Interactive Text-Image Universal Embedder

VIRTUE: 视觉-交互文本-图像通用嵌入器

Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团有限公司) Sony AI(索尼人工智能)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VIRTUE通过引入视觉交互能力,提升图像和文本的联合表示学习,实现更精确的实体级信息处理和应用拓展。

Comments ICLR 2026. 25 pages. Project page: https://sony.github.io/virtue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00653 2026-02-12 cs.CV cs.AI 62%

Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment

非对比视觉语言学习与预测嵌入对齐

Lukas Kuhn, Giuseppe Serra, Florian Buettner

机构 * Goethe University Frankfurt(法兰克福歌德大学) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联合会(DKTK))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 NOVA通过联合嵌入预测与分布正则化,实现非对比视觉语言学习,简化训练目标并提升稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06652 2026-02-09 cs.AI cs.CV 62%

Same Answer, Different Representations: Hidden instability in VLMs

相同答案,不同表示:VLMs中的隐藏不稳定性

Farooq Ahmad Wani, Alessandro Suglia, Rohit Saxena, Aryo Pradipta Gema, Wai-Chung Kwan, Fazl Barez, Maria Sofia Bucarelli, Fabrizio Silvestri, Pasquale Minervini

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) CNRS(法国国家科学研究中心) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) i3S(i3S研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究揭示了视觉语言模型中隐藏的不稳定性,通过引入新的评估框架发现模型在内部表示漂移、鲁棒性与决策边界等方面存在显著问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09523 2026-01-30 cs.CV cs.AI cs.CY cs.LG 62%

MuseCL: Predicting Urban Socioeconomic Indicators via Multi-Semantic Contrastive Learning

MuseCL:通过多语义对比学习预测城市社会经济指标

Xixian Yong, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MuseCL通过多语义对比学习融合视觉与文本信息,提升城市社会经济预测的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17905 2026-01-27 cs.CV cs.AI stat.ML 62%

Feature-Space Generative Models for One-Shot Class-Incremental Learning

特征空间生成模型用于单样本类增量学习

Jack Foster, Kirill Paramonov, Mete Ozay, Umberto Michieli

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 Gen1S通过特征空间生成模型提升单样本类增量学习中的新类识别性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10004 2026-01-26 cs.AI cs.CL 62%

Exploring LLMs for Scientific Information Extraction Using The SciEx Framework

探索使用SciEx框架利用大语言模型进行科学信息提取

Sha Li, Ayush Sadekar, Nathan Self, Yiqi Su, Lars Andersland, Mira Chaplin, Annabel Zhang, Hyoju Yang, James B Henderson, Krista Wigginton, Linsey Marr, T. M. Murali, Naren Ramakrishnan

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciEx框架,通过解耦关键组件提升科学信息提取的准确性和一致性,评估结果显示其在多科学领域中的有效性。

Comments Accepted to the KGML Bridge at AAAI 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16125 2026-01-23 cs.CV cs.CL cs.IR 62%

Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing

重新思考组合图像检索评估:从图像编辑中获得的细粒度基准

Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Tongyi Lab, Alibaba Group(阿里云实验室) UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) NTU(国立新加坡大学) Yale(耶鲁大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出EDIR细粒度CIR基准,通过图像编辑技术生成多样化查询,揭示现有模型在多模态任务中的能力差距与局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08311 2026-01-14 cs.CV cs.AI 62%

Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation

通过检索增强生成提升大型多模态模型的图像质量评估能力

Kang Fu, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Jun Zhao, Xiongkuo Min, Jia Wang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 IQA-RAG通过检索增强生成提升LMMs图像质量评估能力,提供高效替代微调方案

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13564 2026-01-14 cs.CL cs.AI 62%

Memory in the Age of AI Agents

人工智能代理时代的记忆

Yuyang Hu, Shichun Liu, Yanwei Yue, Guibin Zhang, Boyang Liu, Fangyi Zhu, Jiahang Lin, Honglin Guo, Shihan Dou, Zhiheng Xi, Senjie Jin, Jiejun Tan, Yanbin Yin, Jiongnan Liu, Zeyu Zhang, Zhongxiang Sun, Yutao Zhu, Hao Sun, Boci Peng, Zhenrong Cheng, Xuanbo Fan, Jiaxin Guo, Xinlei Yu, Zhenhong Zhou, Zewen Hu, Jiahao Huo, Junhao Wang, Yuwei Niu, Yu Wang, Zhenfei Yin, Xiaobin Hu, Yue Liao, Qiankun Li, Kun Wang, Wangchunshu Zhou, Yixin Liu, Dawei Cheng, Qi Zhang, Tao Gui, Shirui Pan, Yan Zhang, Philip Torr, Zhicheng Dou, Ji-Rong Wen, Xuanjing Huang, Yu-Gang Jiang, Shuicheng Yan

机构 * Core Supervisors. 0.5em Affiliations: National University of Singapore, Renmin University of China, Fudan University, Peking University, Nanyang Technological University, Tongji University, University of California San Diego, Hong Kong University of Science Technology (Guangzhou), Griffith University, Georgia Institute of Technology, OPPO, Oxford University

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文系统梳理了人工智能代理记忆的现状与分类,提出了记忆的三种形式、功能分类及动态分析,为未来智能设计提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09681 2026-01-13 cs.IR cs.AI cs.CL cs.LG 62%

DB3 Team's Solution For Meta KDD Cup' 25

DB3团队的Meta KDD杯'25解决方案

Yikuan Xia, Jiazun Chen, Yirui Zhan, Suifeng Zhao, Weipeng Jiang, Chaorui Zhang, Wei Han, Bo Bai, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(高可信软件技术重点实验室,中国科学院,北京大学) Theory Lab, Central Research Institute, 2012 Labs, Huawei Technologies Co., Ltd, Shenzhen, China(理论实验室,中央研究院,2012实验室,华为技术有限公司,深圳)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 DB3团队通过多模态检索框架和拒绝训练方法,在KDD杯'25的CRAG-MM挑战中取得优异成绩,尤其在处理第一人称视角问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01513 2026-01-08 cs.CV cs.AI 62%

FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation

FastV-RAG: 向快速且细粒度的视频问答迈进:基于检索增强生成的框架

Gen Li, Peiyu Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of International Business and Economics(国际商务经济大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FastV-RAG通过引入推测解码和基于相似性的过滤策略,提升视频问答任务的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03270 2026-01-08 cs.CL cs.AI math.OC 62%

Advances and Challenges in Semantic Textual Similarity: A Comprehensive Survey

语义文本相似性的发展与挑战:全面综述

Lokendra Kumar, Neelesh S. Upadhye, Kannan Piedy

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了语义文本相似性在变压器模型、对比学习、领域适应等六个方面的最新进展,探讨了多模态、图方法和知识增强技术,并指出现有挑战与未来发展方向。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13164 2025-12-17 cs.CV cs.AI 62%

A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis

语义增强的生成基础模型提升病理图像合成

Xianchao Guan, Zhiyuan Fan, Yifeng Wang, Fuqiang Chen, Yanjiang Zhou, Zengyang Che, Hongxue Meng, Xin Li, Yaowei Wang, Hongpeng Wang, Min Zhang, Heng Tao Shen, Zheng Zhang, Yongbing Zhang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CRAFTS通过语义增强的生成基础模型提升病理图像合成质量,生成多样化病理图像并增强多种临床任务性能。

Comments 68 pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16313 2025-12-17 cs.LG cs.AI cs.CL 62%

Retrieval Enhanced Feedback via In-context Neural Error-book

通过上下文神经错误本增强的检索反馈

Jongyeop Hyun, Bumsoo Kim

机构 * School of CSE Chung-Ang University(计算机科学与工程学院 Chung-Ang 大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 REFINE通过结构化反馈框架,系统分析并缓解多模态推理中的错误,提升推理效率和可扩展性。

Comments Accepted at EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10596 2025-12-12 cs.CV cs.AI 62%

Beyond Pixels: A Training-Free, Text-to-Text Framework for Remote Sensing Image Retrieval

超越像素:一种无训练的文本到文本框架用于遥感图像检索

J. Xiao, Y. Guo, X. Zi, K. Thiyagarajan, C. Moreira, M. Prasad

机构 * Information Technology University of Technology Sydney Sydney, Australia(信息科技技术大学悉尼分校悉尼澳大利亚) Robotics Laboratory (SensR Lab) Centre for Advanced Manufacturing Technology Western Sydney University Sydney, Australia(机器人实验室(SensR实验室)先进制造技术中心西悉尼大学悉尼澳大利亚) The Data Science Institute Faculty of Engineering(数据科学学院工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无训练的文本到文本框架TRSLLaVA,通过结构化文本实现高效遥感图像检索,实验表明其性能优于现有监督模型。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02603 2025-12-11 eess.AS cs.CL cs.SD 62%

SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation

SEAL:用于带有检索增强生成的语音大语言模型的语音嵌入对齐学习

Chunyu Sun, Bingyu Liu, Zhichao Cui, Junhan Shi, Anbin Qi, Tian-hao Zhang, Dinghao Zhou, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 SEAL通过统一的语音和文本嵌入框架,提升语音大语言模型的检索效率与准确性,减少延迟并增强多模态检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06105 2025-12-09 cs.CV cs.AI 62%

Explainable Melanoma Diagnosis with Contrastive Learning and LLM-based Report Generation

基于对比学习和大语言模型的可解释性黑色素瘤诊断

Junwen Zheng, Xinran Xu, Li Rong Wang, Chang Cai, Lucinda Siyun Tan, Dingyuan Wang, Hong Liang Tey, Xiuyi Fan

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于对比学习和大语言模型的可解释性黑色素瘤诊断框架,通过将临床标准映射到视觉Transformer空间,实现图像与临床解释的透明连接,提升模型可解释性与临床信任度。

Comments AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05908 2025-12-08 cs.SE cs.AI cs.CL cs.IR 62%

Natural Language Summarization Enables Multi-Repository Bug Localization by LLMs in Microservice Architectures

自然语言摘要通过LLM在微服务架构中多仓库Bug定位

Amirkia Rafiei Oskooei, S. Selcan Yukcu, Mehmet Cevheri Bozoglan, Mehmet S. Aktas

机构 * Yildiz Technical University, Dept. of Computer Eng.(Yildiz技术大学,计算机工程系) Yildiz Technical University, Department of Computer Engineering(Yildiz技术大学,计算机工程系)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 利用自然语言摘要和LLM技术,通过多仓库微服务架构实现更高效的Bug定位,显著提升定位准确率和透明度。

Comments Accepted at LLM4Code Workshop, ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00294 2025-12-02 cs.CV cs.AI cs.HC 62%

Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR

词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索

Lixing Guo, Tobias Höllerer

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07221 2025-11-25 cs.CV cs.AI 62%

Exploring the Use of Contrastive Language-Image Pre-Training for Human Posture Classification: Insights from Yoga Pose Analysis

探索对比语言-图像预训练在人体姿态分类中的应用:从瑜伽姿势分析获得的见解

Andrzej D. Dobrzycki, Ana M. Bernardos, Luca Bergesio, Andrzej Pomirski, Daniel Sáez-Trigueros

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用CLIP模型在瑜伽姿势分类中取得高准确率,展示其在人体姿态识别中的潜力,并验证其在自动化系统中的应用可行性。

Journal ref Mathematics 2024, 12(1), 76

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15488 2025-11-20 cs.CV cs.AI 62%

FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection

Jiangyong Yu, Changyong Shu, Sifan Zhou, Zichen Yu, Xing Hu, Yan Chen, Dawei Yang

机构 * HOUMO AI

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments This paper is acceptted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09228 2025-11-13 cs.CV cs.CL 62%

Taming Object Hallucinations with Verified Atomic Confidence Estimation

Jiarui Liu, Weihao Xuan, Zhijing Jin, Mona Diab

机构 * CMU(卡内基梅隆大学) The University of Tokyo(东京大学) The University of Toronto(多伦多大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08369 2025-11-12 cs.CV cs.AI 62%

Text-based Aerial-Ground Person Retrieval

Xinyu Zhou, Yu Wu, Jiayao Ma, Wenhao Wang, Min Cao, Mang Ye

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20354 2025-11-11 cs.CL cs.AI 62%

Rethinking Text-based Protein Understanding: Retrieval or LLM?

Juntong Wu, Zijing Liu, He Cao, Hao Li, Bin Feng, Zishan Shu, Ke Yu, Li Yuan, Yu Li

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted by Empirical Methods in Natural Language Processing 2025 (EMNLP 2025) Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17685 2025-10-21 cs.CV cs.AI 62%

Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning

Min Cao, Xinyu Zhou, Ding Jiang, Bo Du, Mang Ye, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Key Laboratory of New Generation Artificial Intelligence Technology & Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新 generation 人工智能技术及交叉应用重点实验室(东南大学),教育部,中国)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Final version published in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Xplore link: https://ieeexplore.ieee.org/document/11199360

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13366 2025-10-16 cs.CL cs.AI 62%

Document Intelligence in the Era of Large Language Models: A Survey

Weishi Wang, Hengchang Hu, Zhijie Zhang, Zhaochen Li, Hongxin Shao, Daniel Dahlmeier

机构 * SAP, Singapore(新加坡SAP)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10426 2025-10-14 cs.CV cs.AI 62%

Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs

Suyang Xi, Chenxi Yang, Hong Ding, Yiqing Ni, Catherine C. Liu, Yunhao Liu, Chengqi Zhang

机构 * Emory University(埃默里大学) University of Electronic Science and Technology of China(电子科技大学) University of Illinois Chicago(伊利诺伊大学香槟分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05949 2025-10-08 cs.LG cs.AI cs.CV stat.ML 62%

Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density

Randall Balestriero, Nicolas Ballas, Mike Rabbat, Yann LeCun

机构 * Meta-FAIR Brown University(布朗大学) NYU(纽约大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏