arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 546 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 546 篇

2505.00254 2025-11-03 cs.CV cs.AI 70%

AVA: Towards Agentic Video Analytics with Vision Language Models

Yuxuan Yan, Shiqi Jiang, Ting Cao, Yifan Yang, Qianqian Yang, Yuanchao Shu, Yuqing Yang, Lili Qiu

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments Accepted to NDSI 2026, 19pages, 12 figures, complementary evaluations and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24242 2025-10-29 cs.NI cs.AI cs.LG 70%

Enabling Near-realtime Remote Sensing via Satellite-Ground Collaboration of Large Vision-Language Models

Zihan Li, Jiahao Yang, Yuxin Zhang, Zhe Chen, Yue Gao

机构 * Fudan University(复旦大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00939 2025-10-23 cs.CV cs.CL 70%

WikiVideo: Article Generation from Multiple Videos

Alexander Martin, Reno Kriz, William Gantt Walden, Kate Sanders, Hannah Recknor, Eugene Yang, Francis Ferraro, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments Repo can be found here: https://github.com/alexmartin1722/wikivideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15261 2025-10-20 cs.AI 70%

AUGUSTUS: An LLM-Driven Multimodal Agent System with Contextualized User Memory

Jitesh Jain, Shubham Maheshwari, Ning Yu, Wen-mei Hwu, Humphrey Shi

机构 * Adobe(Adobe公司) Netflix Eyeline Studios(Netflix Eyeline工作室) UIUC(伊利诺伊大学香槟分校)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments LAW 2025 Workshop at NeurIPS 2025. Work done from late 2023 to early 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12801 2025-10-15 cs.CV cs.IR 70%

DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search

Kartik Narayan, Yang Xu, Tian Cao, Kavya Nerella, Vishal M. Patel, Navid Shiee, Peter Grasch, Chao Jia, Yinfei Yang, Zhe Gan

机构 * Johns Hopkins University(约翰霍普金斯大学) Apple(苹果公司)

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11645 2025-10-14 cs.AI 70%

Adapting and Evaluating Multimodal Large Language Models for Adolescent Idiopathic Scoliosis Self-Management: A Divide and Conquer Framework

Zhaolong Wu, Pu Luo, Nan Meng, Jason Pui Yin Cheung, Teng Zhang

机构 * Department of Orthopaedics and Traumatology, The University of Hong Kong(骨科与创伤外科部,香港大学)

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments Accepted by MICCAI 2025 MLLMCP Workshop

Journal ref Lecture Notes in Computer Science 16147 (2026) 280-289

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03458 2025-10-07 cs.CL 70%

Omni-Embed-Nemotron: A Unified Multimodal Retrieval Model for Text, Image, Audio, and Video

Mengyao Xu, Wenfei Zhou, Yauhen Babakhin, Gabriel Moreira, Ronay Ak, Radek Osmulski, Bo Liu, Even Oldridge, Benedikt Schifferer

机构 * NVIDIA

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02803 2025-10-06 cs.RO cs.AI cs.CV 70%

Work Zones challenge VLM Trajectory Planning: Toward Mitigation and Robust Autonomous Driving

Yifan Liao, Zhen Sun, Xiaoyun Qiu, Zixiao Zhao, Wenbing Tang, Xinlei He, Xinhu Zheng, Tianwei Zhang, Xinyi Huang, Xingshuo Han

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Northwest A&F University(西北农林科技大学) Nanyang Technological University(南洋理工大学) Jinan University(济南大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments 13 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02580 2025-10-06 cs.AI 70%

V2X-UniPool: Unifying Multimodal Perception and Knowledge Reasoning for Autonomous Driving

Xuewen Luo, Fengze Yang, Fan Ding, Xiangbo Gao, Shuo Xing, Yang Zhou, Zhengzhong Tu, Chenxi Liu

机构 * University of Utah(犹他大学) Monash University(莫纳什大学) Texas A&M University(德克萨斯农工大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25669 2025-10-01 cs.AI 70%

GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination

Xinxi Chen, Tianyang Chen, Lijia Hong

机构 * Independent Researcher(独立研究者)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18450 2025-09-30 cs.CL 70%

BRIT: Bidirectional Retrieval over Unified Image-Text Graph

Ainulla Khan, Yamada Moyuru, Srinidhi Akella

机构 * Fujitsu Research India(富士通印度研究)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments Accepted in EMNLP-2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21179 2025-09-25 cs.LG cs.AI 70%

CANDLE: A Cross-Modal Agentic Knowledge Distillation Framework for Interpretable Sarcopenia Diagnosis

Yuqi Jin, Zhenhao Shuai, Zihan Hu, Weiteng Zhang, Weihao Xie, Jianwei Shuai, Xian Shen, Zhen Feng

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments 11 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19952 2025-09-25 cs.CV cs.AI 70%

When Words Can't Capture It All: Towards Video-Based User Complaint Text Generation with Multimodal Video Complaint Dataset

Sarmistha Das, R E Zera Marveen Lyngkhoi, Kirtan Jain, Vinayak Goyal, Sriparna Saha, Manish Gupta

机构 * Indian Institute of Technology Patna(印度帕纳布理工大学) Microsoft, India(微软印度)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11376 2025-09-16 cs.LG cs.AI cs.CE 70%

Intelligent Reservoir Decision Support: An Integrated Framework Combining Large Language Models, Advanced Prompt Engineering, and Multimodal Data Fusion for Real-Time Petroleum Operations

Seyed Kourosh Mahjour, Seyed Saman Mahjour

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03536 2025-09-05 cs.AI cs.HC 70%

PG-Agent: An Agent Powered by Page Graph

Weizhi Chen, Ziwei Wang, Leyang Yang, Sheng Zhou, Xiaoxuan Tang, Jiajun Bu, Yong Li, Wei Jiang

机构 * Zhejiang Key Lab of Accessible Perception \& Intelligent Systems, Zhejiang University Hangzhou China Zhejiang University

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments Paper accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16632 2025-08-28 cs.CL cs.SD eess.AS 70%

Step-Audio 2 Technical Report

Boyong Wu, Chao Yan, Chen Hu, Cheng Yi, Chengli Feng, Fei Tian, Feiyu Shen, Gang Yu, Haoyang Zhang, Jingbei Li, Mingrui Chen, Peng Liu, Wang You, Xiangyu Tony Zhang, Xingyuan Li, Xuerui Yang, Yayue Deng, Yechang Huang, Yuxin Li, Yuxin Zhang, Zhao You, Brian Li, Changyi Wan, Hanpeng Hu, Jiangjie Zhen, Siyu Chen, Song Yuan, Xuelin Zhang, Yimin Jiang, Yu Zhou, Yuxiang Yang, Bingxin Li, Buyun Ma, Changhe Song, Dongqing Pang, Guoqiang Hu, Haiyang Sun, Kang An, Na Wang, Shuli Gao, Wei Ji, Wen Li, Wen Sun, Xuan Wen, Yong Ren, Yuankai Ma, Yufan Lu, Bin Wang, Bo Li, Changxin Miao, Che Liu, Chen Xu, Dapeng Shi, Dingyuan Hu, Donghang Wu, Enle Liu, Guanzhe Huang, Gulin Yan, Han Zhang, Hao Nie, Haonan Jia, Hongyu Zhou, Jianjian Sun, Jiaoren Wu, Jie Wu, Jie Yang, Jin Yang, Junzhe Lin, Kaixiang Li, Lei Yang, Liying Shi, Li Zhou, Longlong Gu, Ming Li, Mingliang Li, Mingxiao Li, Nan Wu, Qi Han, Qinyuan Tan, Shaoliang Pang, Shengjie Fan, Siqi Liu, Tiancheng Cao, Wanying Lu, Wenqing He, Wuxun Xie, Xu Zhao, Xueqi Li, Yanbo Yu, Yang Yang, Yi Liu, Yifan Lu, Yilei Wang, Yuanhao Ding, Yuanwei Liang, Yuanwei Lu, Yuchu Luo, Yuhe Yin, Yumeng Zhan, Yuxiang Zhang, Zidong Yang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Heung-Yeung Shum, Jiansheng Chen, Jing Li, Xiangyu Zhang, Yibo Zhu

机构 * StepFun Audio Team(StepFun音频团队)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments v3: Added introduction and evaluation results of Step-Audio 2 mini

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18772 2025-08-27 cs.CV cs.CL 70%

Beyond the Textual: Generating Coherent Visual Options for MCQs

Wanqiang Wang, Longzhu He, Wei Zheng

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04377 2025-08-12 cs.CV cs.CL cs.MM 70%

Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions

Xiao Zhang, Johan Bos

机构 * University of Groningen(格罗宁根大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03967 2025-08-07 cs.CV cs.CR cs.IR 70%

RAVID: Retrieval-Augmented Visual Detection: A Knowledge-Driven Approach for AI-Generated Image Identification

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdelmalik Taleb-Ahmed, Abdenour Hadid

机构 * Laboratory of IEMN, Univ. Polytechnique Hauts-de-France(IEMN实验室,法国高等技术法国大学) KU 6G Research Center, Khalifa University(KU 6G研究中心,哈利法大学) Sorbonne Center for Artificial Intelligence, Sorbonne University(人工智能研究中心,索邦大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21124 2025-07-30 cs.HC cs.AI cs.GR cs.LG 70%

VizGenie: Toward Self-Refining, Domain-Aware Workflows for Next-Generation Scientific Visualization

Ayan Biswas, Terece L. Turton, Nishath Rajiv Ranasinghe, Shawn Jones, Bradley Love, William Jones, Aric Hagberg, Han-Wei Shen, Nathan DeBardeleben, Earl Lawrence

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) Coastal Carolina University(海岸卡罗来纳大学) Ohio State University(俄亥俄州立大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14675 2025-07-22 cs.CV cs.CL 70%

Docopilot: Improving Multimodal Models for Document-Level Understanding

Yuchen Duan, Zhe Chen, Yusong Hu, Weiyun Wang, Shenglong Ye, Botian Shi, Lewei Lu, Qibin Hou, Tong Lu, Hongsheng Li, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Nankai University(南开大学) Fudan University(复旦大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16412 2025-07-10 cs.CL 70%

InfoTech Assistant: A Multimodal Conversational Agent for InfoTechnology Web Portal Queries

Sai Surya Gadiraju, Duoduo Liao, Akhila Kudupudi, Santosh Kasula, Charitha Chalasani

机构 * School of Computing(计算学院) George Mason University(乔治·马歇尔大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments Accepted by IEEE Big Data 2024

Journal ref IEEE BigData, Year: 2024, Pages: 3264-3272

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04590 2025-07-08 cs.CV cs.CL 70%

VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents

Rui Meng, Ziyan Jiang, Ye Liu, Mingyi Su, Xinyi Yang, Yuepeng Fu, Can Qin, Zeyuan Chen, Ran Xu, Caiming Xiong, Yingbo Zhou, Wenhu Chen, Semih Yavuz

机构 * Salesforce Research(Salesforce研究机构) UC Santa Barbara(加州大学圣巴巴拉分校) University of Waterloo(滑铁卢大学) Tsinghua University(清华大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20670 2025-06-26 cs.CV cs.CL 70%

MMSearch-R1: Incentivizing LMMs to Search

Jinming Wu, Zihao Deng, Wei Li, Yiding Liu, Bo You, Bo Li, Zejun Ma, Ziwei Liu

机构 * ByteDance(字节跳动) S-Lab, NTU(NTU的S实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments Code: https://github.com/EvolvingLMMs-Lab/multimodal-search-r1

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15569 2025-06-19 cs.CL 70%

SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification

Chengye Wang, Yifei Shen, Zexi Kuang, Arman Cohan, Yilun Zhao

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12232 2025-06-17 cs.CV cs.CL 70%

Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles

Mohammed Elhenawy, Shadi Jaradat, Taqwa I. Alhadidi, Huthaifa I. Ashqar, Ahmed Jaber, Andry Rakotonirainy, Mohammad Abu Tami

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19593 2025-06-11 cs.CL cs.CV 70%

SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs

Xin Su, Man Luo, Kris W Pan, Tien Pei Chou, Vasudev Lal, Phillip Howard

机构 * Intel Labs(英特尔实验室) Amazon(亚马逊)

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL

Comments ICML 2025 Spotlight Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00211 2025-06-09 cs.RO cs.AI cs.LG cs.SY eess.SY 70%

SafeAuto: Knowledge-Enhanced Safe Autonomous Driving with Multimodal Foundation Models

Jiawei Zhang, Xuan Yang, Taiqi Wang, Yu Yao, Aleksandr Petiushko, Bo Li

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07688 2025-05-29 cs.CV cs.AI 70%

ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG

Zilun Zhang, Haozhan Shen, Tiancheng Zhao, Zian Guan, Bin Chen, Yuhao Wang, Xu Jia, Yuxiang Cai, Yongheng Shang, Jianwei Yin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院) School of Software Engineering of Zhejiang University(浙江大学软件工程学院) Polytechnic Institute of Zhejiang University(浙江大学 polytechnic 院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19509 2025-05-27 cs.LG cs.AI 70%

Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models

Yifan Jia, Kailin Jiang, Yuyang Liang, Qihan Ren, Yi Xin, Rui Yang, Fenze Feng, Mingcai Chen, Hengyang Lu, Haozhe Wang, Xiaoye Qu, Dongrui Liu, Lizhen Cui, Yuntao Du

机构 * Joint SDU-NTU Centre for Artificial Intelligence Research&School of Software(山东大学与南京工业大学人工智能研究中心及软件学院) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Jiangnan University(江南大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

Comments The source code is available at https://github.com/MLLMKCBENCH/MLLMKC

详情

展开后加载摘要…

URL PDF HTML 收藏