arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 546 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 多模态RAG 546 篇

2605.26641 2026-05-27 cs.CV 67%

OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation

OmniRetriever: 通过融合作为教师蒸馏实现任意到任意的音频-视频-文本检索

Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

机构 * Memories.ai Research(Memories.ai研究院)

专题命中 多模态RAG :RAG(abstract,abstract_cn)

AI总结 提出融合作为教师蒸馏方法,利用三元组嵌入的融合信号训练单模态嵌入,并构建OmniRetriever-7B模型,在零样本检索基准上超越现有方法,同时发布OmniRetriever-Bench基准。

Comments https://yunzeliu.github.io/OmniRetriever/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25393 2026-05-26 cs.RO 67%

Decision-Making with Lightweight Confidence-Aware Language Model for Autonomous Driving

基于轻量级置信感知语言模型的自动驾驶决策

Ruoyu Yao, Ruiguo Zhong, Pei Liu, Mingxing Peng, Rui Yang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract)

AI总结 提出一种利用轻量级置信感知语言模型的决策框架,通过多智能体协作生成置信注释的决策演示并蒸馏到双头轻量模型,在nuPlan上实现SOTA成功率和低延迟。

Comments 8 Pages, 3 figures, ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10772 2026-04-14 cs.CV 67%

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑

Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

机构 * The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08410 2026-04-10 cs.CV 67%

Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval

通过一次剪辑检索增强多模态大语言模型的长视频理解

Tao Chen, Shaobo Ju, Qiong Wu, Chenxin Fang, Kun Zhang, Jun Peng, Hui Li, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) Xiamen University(厦门大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22998 2026-03-25 cs.CV 67%

VQ-Jarvis: Retrieval-Augmented Video Restoration Agent with Sharp Vision and Fast Thought

VQ-Jarvis:具备锐利视觉与快速思考的检索增强视频修复代理

Xuanyu Zhang, Weiqi Li, Qunliang Xing, Jingfen Xie, Bin Chen, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院,深圳,中国) ByteDance Inc., Shenzhen, China(字节跳动公司,深圳,中国)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出VQ-Jarvis,一种具备锐利视觉与快速思考的视频修复代理,通过构建大规模视频配对增强数据集和分层操作调度策略,提升视频修复的准确性和效率。

Comments Video restoration, Agent-based restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24903 2026-03-23 cs.CV cs.CE 67%

FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation

FinMMDocR:基于场景意识、文档理解与多步骤计算的金融多模态推理基准测试

Zichen Tang, Haihong E, Rongjin Li, Jiacheng Liu, Linwei Jia, Zhuodi Hao, Zhongjun Yang, Yuanze Li, Haolin Tian, Xinyi Hu, Peizhi Zhao, Yuan Liu, Zhengyu Wang, Xianghe Wang, Yiling Huang, Xueyuan Lin, Ruofei Bai, Zijian Xie, Qian Huang, Ruining Cao, Haocheng Gao

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 FinMMDocR通过引入场景意识、文档理解和多步骤计算,推动多模态大语言模型在现实金融场景中的推理能力提升,其包含12种隐含金融场景、9类丰富文档及平均11步推理任务。

Comments Accepted by AAAI-26 Main Track

Journal ref Proc. AAAI 2026 (Vol. 40, No. 30), pages 25858-25866

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17055 2026-03-19 cs.CV 67%

PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning

PaAgent:通过主观-客观强化学习实现的面向人物图像修复代理

Yijian Wang, Qingsen Yan, Jiantao Zhou, Duwei Dai, Wei Dong

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) National-Local Joint Engineering Research Center of Biodiagnosis and Biotherapy, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学生物诊断与生物治疗国家地方联合工程研究中心) College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 PaAgent通过结合自进化的人物银行和检索增强生成技术,提升图像修复任务中对复杂场景的感知能力,通过主观-客观强化学习策略优化修复工具选择,实验验证其在多种修复基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13375 2026-03-17 cs.CV cs.LG 67%

InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization

InfiniteDance: 可扩展的3D舞蹈生成以实现真实场景泛化

Ronghui Li, Zhongyuan Hu, Li Siyao, Youliang Zhang, Haozhe Xie, Mingyuan Zhang, Jie Guo, Xiu Li, Ziwei Liu

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出InfiniteDance,通过扩大数据与模型设计,实现可扩展的3D舞蹈生成,解决了真实场景下的泛化问题。

Comments project page: https://infinitedance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01091 2026-02-18 cs.SD 67%

AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models

AudioRAG+: 基于反馈的检索增强音频生成与大音频语言模型

Junqi Zhao, Chenxing Li, Jinzheng Zhao, Rilin Chen, Dong Yu, Mark D. Plumbley, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, UK(视觉、语音和信号处理中心(CVSSP),英国萨里大学) Tencent AI Lab, Beijing, China(腾讯人工智能实验室,中国北京) Tencent AI Lab, Seattle, USA(腾讯人工智能实验室,美国西雅图)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 AudioRAG+利用大音频语言模型提升文本到音频生成中特定声音事件的合成能力,通过反馈驱动检索增强生成过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09411 2026-02-10 cs.CV cs.GR 67%

ImageRAG: Dynamic Image Retrieval for Reference-Guided Image Generation

ImageRAG:用于参考引导图像生成的动态图像检索

Rotem Shalev-Arkushin, Rinon Gal, Amit H. Bermano, Ohad Fried

机构 * Tel-Aviv University(特拉维夫大学) Tel Aviv University(特拉维夫大学) Reichman University(里奇曼大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 ImageRAG通过动态图像检索提升参考引导图像生成的质量,无需专门训练即可适应不同模型类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00028 2026-02-03 cs.LG cs.MM 67%

ELLMPEG: An Edge-based Agentic LLM Video Processing Tool

ELLMPEG:一种基于边缘的代理LLM视频处理工具

Zoha Azimi, Reza Farahani, Radu Prodan, Christian Timmerer

机构 * Christian Doppler Laboratory ATHENA, Department of Information Technology (ITEC) University of Klagenfurt(亚琛实验室ATHENA,信息科技系,克雷格弗尔特大学) Department of Information Technology (ITEC) University of Klagenfurt(信息科技系,克雷格弗尔特大学) Department of Computer Science University of Innsbruck(计算机科学系,因斯布鲁克大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 ELLMPEG是一种基于边缘的代理LLM视频处理工具,通过整合工具感知的检索增强生成与迭代自我反思,实现本地生成和验证FFmpeg和VVenC命令,提升视频处理效率和准确性。

Comments 12 pages, 5 tables, 8 Figures, accepted for the MMSys 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14874 2026-01-22 cs.RO 67%

HumanoidVLM: Vision-Language-Guided Impedance Control for Contact-Rich Humanoid Manipulation

HumanoidVLM: 用于接触密集型人形机器人工操作的视觉-语言引导阻抗控制

Yara Mahmoud, Yasheerah Yaqoot, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 HumanoidVLM通过视觉-语言模型和检索增强生成模块,实现人形机器人在接触密集场景中的自适应阻抗控制与抓取配置选择。

Comments This paper has been accepted for publication at LBR of HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10551 2026-01-16 cs.CV 67%

Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure

释放大型视觉-语言模型的能力以实现道路基础设施的智能感知

Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出一种领域适应框架,通过数据高效微调和知识引导推理,提升大型视觉语言模型在城市道路基础设施感知中的性能和专业合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09557 2026-01-16 cs.NE cs.CR 67%

SiliconHealth: A Complete Low-Cost Blockchain Healthcare Infrastructure for Resource-Constrained Regions Using Repurposed Bitcoin Mining ASICs

SiliconHealth: 一种基于区块链的低成本医疗基础设施,利用再利用的比特币挖矿ASICs为资源匮乏地区服务

Francisco Angulo de Lafuente, Seid Mehammed Abdu, Nirmal Tej

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 SiliconHealth利用废弃比特币挖矿ASICs构建低成本区块链医疗系统,实现安全、节能的医疗记录管理,适用于资源匮乏地区。

Comments 8 pages, 9 tables, 2 figures, experimental validation with cross-device results, economic analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05908 2025-12-08 cs.SE cs.AI cs.CL cs.IR 67%

Natural Language Summarization Enables Multi-Repository Bug Localization by LLMs in Microservice Architectures

自然语言摘要通过LLM在微服务架构中多仓库Bug定位

Amirkia Rafiei Oskooei, S. Selcan Yukcu, Mehmet Cevheri Bozoglan, Mehmet S. Aktas

机构 * Yildiz Technical University, Dept. of Computer Eng.(Yildiz技术大学,计算机工程系) Yildiz Technical University, Department of Computer Engineering(Yildiz技术大学,计算机工程系)

专题命中 多模态RAG :RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 利用自然语言摘要和LLM技术,通过多仓库微服务架构实现更高效的Bug定位,显著提升定位准确率和透明度。

Comments Accepted at LLM4Code Workshop, ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02025 2025-11-26 cs.SE 67%

SAFE: Harnessing LLM for Scenario-Driven ADS Testing from Multimodal Crash Data

SAFE: 借助LLM从多模态碰撞数据中驱动场景的ADS测试

Siwei Luo, Yang Zhang, Yao Deng, Linfeng Liang, Xi Zheng

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 SAFE通过多模态提取和LLM技术,提升从碰撞数据中重建真实场景和检测安全违规的能力,实现高准确率和高效生成。

Comments The paper has been accepted for publication in the proceedings of the IEEE/ACM 48th International Conference on Software Engineering to be held 12-18 April 2026 (ICSE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13589 2025-11-25 cs.CV 67%

AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding

AdaVideoRAG:多情境自适应检索增强高效长视频理解

Zhucun Xue, Jiangning Zhang, Xurong Xie, Yuxuan Cai, Yong Liu, Xiangtai Li, Dacheng Tao

机构 * Zhejiang University(浙江大学) Youtu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technolog(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 AdaVideoRAG通过自适应检索增强框架提升长视频理解效率与准确性,支持多层级知识检索与深度语义分析。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10108 2025-11-21 cs.LG q-bio.NC 67%

NeuroXVocal: Detection and Explanation of Alzheimer's Disease through Non-invasive Analysis of Picture-prompted Speech

NeuroXVocal:通过非侵入性分析提示语音检测和解释阿尔茨海默病

Nikolaos Ntampakis, Konstantinos Diamantaras, Ioanna Chouvarda, Magda Tsolaki, Vasileios Argyriou, Panagiotis Sarigianndis

机构 * International Hellenic University, Sindos, Greece MetaMind Innovations, Kozani, Greece Aristotle University of Thessaloniki, Thessaloniki, Greece Greek Association of Alzheimer’s Disease \& Related Disorders, Thessaloniki, Greece Kingston University London, London, UK University of Western Macedonia, Kozani, Greece

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 NeuroXVocal通过非侵入性语音分析实现阿尔茨海默病的检测与解释,结合高精度分类和文献支持的可解释性,提升临床诊断效果。

Journal ref Medical Image Computing and Computer Assisted Intervention - MICCAI 2025. Lecture Notes in Computer Science, vol 15973. Springer, Cham (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02415 2025-11-05 cs.CV 67%

ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension

Duo Xu, Hao Cheng, Xin Lin, Zhen Xie, Hao Wang

机构 * Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments 23 pages, EMNLP25 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23357 2025-10-28 cs.RO 67%

Large language model-based task planning for service robots: A review

Shaohan Bian, Ying Zhang, Guohui Tian, Zhiqiang Miao, Edmond Q. Wu, Simon X. Yang, Changchun Hua

机构 * School of Electrical Engineering, Yanshan University(燕山大学电气工程学院) Engineering Research Center of Intelligent Control System and Intelligent Equipment, Ministry of Education, Yanshan University(燕山大学智能控制与设备工程研究中心) Hebei Key Laboratory of Intelligent Rehabilitation and Neuromodulation, Yanshan University(河北省智能康复与神经调制重点实验室) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(国家机器人视觉感知与控制技术工程研究中心) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) Advanced Robotics and Intelligent Systems Laboratory, School of Engineering, University of Guelph(圭尔夫大学工程学院先进机器人与智能系统实验室)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Submitted to Biomimetic Intelligence and Robotics for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18303 2025-10-22 cs.CV 67%

Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models

Lehan Wang, Yi Qin, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14032 2025-10-17 cs.CV 67%

Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding

Xiaoqian Shen, Wenxuan Zhang, Jun Chen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布斯大学)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments NeurIPS 2025 (Spotlight). Webpage at https://xiaoqian-shen.github.io/Vgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01622 2025-10-03 cs.IR cs.AI cs.CL 67%

LLM4Rec: Large Language Models for Multimodal Generative Recommendation with Causal Debiasing

Bo Ma, Hang Li, ZeHua Hu, XiaoFan Gui, LuYao Liu, Simon Lau

机构 * Department of Software \& Microelectronics Peking University Beijing, China Department of Software \& Microelectronics Peking University Beijing, China hangli\ Department of Software \& Microelectronics Peking University Beijing, China zehua\ Department of Software \& Microelectronics Peking University Beijing, China xiaofan\ Economic Law School China University of Political Science Peking University Changsha, China

专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02723 2025-10-02 cs.RO 67%

ImpedanceGPT: VLM-driven Impedance Control of Swarm of Mini-drones for Intelligent Navigation in Dynamic Environment

Faryal Batool, Yasheerah Yaqoot, Malaika Zafar, Roohan Ahmed Khan, Muhammad Haris Khan, Aleksey Fedoseev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科沃科学与技术研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Accepted in IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13326 2025-09-18 cs.HC cs.LG 67%

LLM Chatbot-Creation Approaches

Hemil Mehta, Tanvi Raut, Kohav Yadav, Edward F. Gehringer

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Forthcoming in Frontiers in Education (FIE 2025), Nashville, Tennessee, USA, Nov 2-5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11124 2025-09-16 cs.SD eess.AS 67%

STASE: A spatialized text-to-audio synthesis engine for music generation

Tutti Chi, Letian Gao, Yixiao Zhang

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Accepted to LLM4Music @ ISMIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19338 2025-09-03 cs.LG cs.CR 67%

Membership Inference Attacks on Large-Scale Models: A Survey

Hengyu Wu, Yang Cao

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Preprint. Submitted for peer review. The final version may differ

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20585 2025-08-29 cs.HC 67%

Persode: Personalized Visual Journaling with Episodic Memory-Aware AI Agent

Seokho Jin, Manseo Kim, Sungho Byun, Hansol Kim, Jungmin Lee, Sujeong Baek, Semi Kim, Sanghum Park, Sung Park

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09845 2025-08-05 cs.RO 67%

Friction-Aware Safety Locomotion for Wheeled-legged Robots using Vision Language Models and Reinforcement Learning

Bo Peng, Donghoon Baek, Qijie Wang, Joao Ramos

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Mechanical Science Engineering(机械科学与工程系) School of Software(软件学院)

专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)

Comments Accepted to Humanoids 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21924 2025-07-30 cs.CV 67%

MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning

Tianhong Gao, Yannian Fu, Weiqun Wu, Haixiao Yue, Shanshan Liu, Gang Zhang

机构 * Baidu Inc.(百度公司)

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏