Vision-Guided Chunking Is All You Need: Enhancing RAG with Multimodal Document Understanding
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
Comments 11 pages, 1 Figure, 1 Table
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
Comments 11 pages, 1 Figure, 1 Table
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of California, Merced(加州大学梅德福分校) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
Comments 12 pages, 3 figures
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments CIKM 2024 Full Research Paper; arXiv admin note: text overlap with arXiv:2402.07016
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments GenAI4Health - AAAI '25
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments 15 pages, 7 figures
专题命中 多模态RAG :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.CL、cs.AI
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024 main
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
Comments 8 pages, submitted to ACL Rolling Review June 2024
专题命中 多模态RAG :retrieval augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted in IEEE HSI 2024
专题命中 多模态RAG :retrieval augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.AI
Comments SIGIR 2024 Workshop on Multimodal Representation and Retrieval (MRR 2024)
MammoWise:多模型本地RAG流水线用于乳腺X线摄影报告生成
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 多模态RAG :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR
AI总结 MammoWise是一种本地多模型流水线,通过多任务分类和检索增强生成技术,实现乳腺X线摄影报告的高准确度生成与分类。
Comments arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics
SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。
Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness
通过视觉-语言反馈进行局部笔触质量评估
机构 * Tokyo Institute of Science High School(东京理科大学附属高中) ; National Institute of Advanced Industrial Science and Technology (AIST)(国立先进工业科学技术研究所) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 研究多模态语言模型能否评估书法局部笔触质量并生成反馈,构建评估框架让三个模型评估图像对并与专家打分比较,还研究了RAG变体,结果显示模型有一定绝对分数准确性,但与专家排名相关性不强,RAG有正负两方面表现。
Comments 6 pages, 8 figures. Accepted to the SAUAFG Workshop at CVPR 2026
ORACAL: 一种基于因果图增强的鲁棒且可解释的智能合约漏洞检测多模态框架
机构 * Information Security Lab, University of Information Technology(信息安全部,信息科技大学) ; Vietnam National University(越南国家大学) ; School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 提出ORACAL异构多模态图学习框架,集成控制流图、数据流图和调用图,通过RAG和LLM增强关键子图,并采用因果注意力机制和PGExplainer实现鲁棒且可解释的智能合约漏洞检测。
Comments 21 pages, version 2
基于生成AI和数字孪生的个性化教育:VR、RAG和零样本情感分析用于工业4.0劳动力发展
机构 * Department of Electrical and Computer Engineering, University of Arizona, Tucson, AZ, USA(电气与计算机工程系,亚利桑那大学,图森,亚利桑那州,美国) ; Department of Systems and Industrial Engineering, University of Arizona, Tucson, AZ, USA(系统与工业工程系,亚利桑那大学,图森,亚利桑那州,美国) ; Department of Industrial Engineering, University of Sonora, Hermosillo, Mexico(工业工程系,索诺拉大学,赫尔莫索,墨西哥)
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本研究提出gAI-PT4I4,利用生成AI和数字孪生技术,结合VR、RAG和零样本情感分析,提升工业4.0劳动力的个性化教育质量。
元数据中的隐藏攻击:多模态检索增强生成中的隐秘污染攻击
机构 * The City University of New York, CSI, Staten Island, NY 10314, USA(纽约城市大学,CSI,史泰登岛分校) ; The City University of New York, Graduate Center, New York, NY 10016, USA(纽约城市大学研究生中心)
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.AI
AI总结 本研究提出MM-MEPA,一种通过操纵多模态检索条目元数据来影响模型响应的隐秘污染攻击,展示了其在多模态RAG系统中的高攻击成功率和防御不足问题。
在搜索前修复:多模态检索增强生成中代理查询视觉预处理的基准测试
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR
AI总结 本文提出V-QPP-Bench,通过代理决策任务评估视觉查询预处理的改进,揭示视觉不完美对检索性能的严重影响及训练方法的优化潜力。
通过检索增强生成提升大型多模态模型的图像质量评估能力
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯)
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.AI
AI总结 IQA-RAG通过检索增强生成提升LMMs图像质量评估能力,提供高效替代微调方案
BayesRAG: 基于概率互证的多模态检索增强生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Unisound AI Technology Co.Ltd(Unisound AI技术有限公司) ; MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL
AI总结 BayesRAG通过概率互证机制提升多模态检索增强生成的性能,有效解决异构模态的隔离问题。
Comments 17 pages, 8 figures
UNIDOC-BENCH: 一个统一的文档中心多模态RAG基准
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 UniDoc-Bench是首个大规模文档中心多模态RAG基准,通过多模态问答对评估文本-图像融合与联合检索性能,揭示多模态嵌入不足及视觉上下文补充机制。
如何使医疗AI系统更安全?在多模态医疗RAG系统中模拟漏洞和威胁
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出MedThreatRAG框架,通过模拟攻击环境揭示医疗RAG系统漏洞,展示跨模态冲突注入对系统性能的严重影响。
Comments Sumbitted to 2026 ICASSP
生成向量搜索以提升多模态视觉-语言任务中的病理基础模型
专题命中 多模态RAG :vector search(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 STHLM通过生成向量搜索方法提升多模态视觉-语言任务中病理基础模型的检索性能,实现10-30%的性能提升和10倍的维度压缩
Comments 13 pages main (54 total), 2 main figures (9 total)
Medusa: 跨模态可转移的对抗攻击用于多模态医疗检索增强生成
机构 * Westlake University(西湖大学) ; Heilongjiang University(黑龙江大学) ; City University of Hong Kong(香港城市大学) ; Tencent(腾讯)
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.AI
AI总结 Medusa提出了一种针对多模态医疗检索增强生成系统的跨模态可转移对抗攻击方法,通过优化扰动和双循环策略实现高攻击成功率并抵御主流防御措施。
Comments Accepted at KDD 2026 First Cycle (full version). Authors marked with * contributed equally. Yi Liu is the lead author
多模态检索增强生成大语言模型系统中基于文本和基于图像的检索比较
机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)
专题命中 多模态RAG :retrieval augmented generation(title);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
AI总结 本文比较了多模态RAG系统中基于文本和基于图像的检索方法,发现直接多模态嵌入检索在性能和准确性上优于基于LLM总结的方法。
Video-RAG: 基于视觉对齐的检索增强长视频理解
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Nanjing University(南京大学) ; University of Rochester(罗切斯特大学)
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 Video-RAG通过视觉对齐的辅助文本提升长视频理解性能,无需训练且兼容性强,显著优于专有模型。
Comments Accepted at NeurIPS 2025. Camera-ready version
机构 * Graduate School of Informatics(信息科学研究生学校) ; Nagoya University(名古屋大学) ; Research Institute for Information Technology(信息科学技术研究所)
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI
机构 * Korea University(韩国大学) ; Sungkyunkwan University(全北大学) ; Hanwha Systems(韩华系统)
专题命中 多模态RAG :retrieval-augmented generation(title);retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL
Comments Project Page: https://vatkg.github.io/
机构 * Sun Yat-Sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Science(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI