PYPILINE: Malicious PyPI Package Detection via Suspicious API Knowledge and Agent Workflow
PYPILINE:通过可疑API知识和Agent工作流检测恶意PyPI包
专题命中 图谱与结构化RAG :RAG(abstract)
AI总结 提出PYPILINE方法,结合可疑API知识库与Agent工作流,通过静态分析构建知识库并自动检测恶意PyPI包,在精度、召回率和F1分数上显著优于现有工具。
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
PYPILINE:通过可疑API知识和Agent工作流检测恶意PyPI包
专题命中 图谱与结构化RAG :RAG(abstract)
AI总结 提出PYPILINE方法,结合可疑API知识库与Agent工作流,通过静态分析构建知识库并自动检测恶意PyPI包,在精度、召回率和F1分数上显著优于现有工具。
VL-MemKnG:结合时空知识图谱的混合记忆用于长程自我中心导航轨迹问答
机构 * Mobile Robotics Laboratory, Artificial Intelligence Center(移动机器人实验室,人工智能中心) ; Skoltech(斯科尔科沃科学技术学院) ; Intelligent Multimodal Vision Analysis Group, Department of Engineering, Universitat Pompeu Fabra(智能多模态视觉分析组,工程系,庞培法布拉大学) ; Independent Researcher(独立研究员)
专题命中 图谱与结构化RAG :hybrid retrieval(abstract)
AI总结 提出VL-MemKnG混合记忆框架,结合时空知识图谱与片段级上下文记忆,通过混合检索推理模块提升长程自我中心视频导航问答的准确性和效率。
VArify:一个用于验证食品科学中知识增强型大语言模型响应的可视化分析系统
专题命中 图谱与结构化RAG :retrieval-augmented generation(abstract)
AI总结 针对GraphRAG系统检索数据复杂、难以验证的问题,提出VArify可视化分析系统,通过文件目录式树状可视化支持证据的组间关系与组内层次探索,用户研究证明其有效区分LLM内部知识与外部证据,并帮助识别知识图谱错误。
HDSL:一种用于结构化3D室内场景生成和基于LLM智能体局部编辑的层次化领域特定语言
机构 * SIGS, Tsinghua University(清华大学深圳国际研究生院) ; Nankai University(南开大学) ; University of Arizona(亚利桑那大学) ; Zhejiang University(浙江大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 图谱与结构化RAG :retrieval-augmented generation(abstract)
AI总结 提出HDSL语言,以树结构表示室内场景,结合LLM智能体生成、多模态检索和力导向布局优化,实现结构化场景生成与局部编辑,显著提升对象覆盖率和编辑效率。
VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title,abstract);hybrid retrieval(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。
RAG-Audio:用于忠实脑电信号到音频重建的检索增强生成
机构 * CVML Lab(CVML实验室)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title);分类 cs.AI
AI总结 RAG-Audio通过检索真实音频样本初始化生成器采样轨迹,缓解脑电到音频生成的先验主导问题,在Brain2Music数据集上提升了刺激识别准确率并大幅降低Fréchet音频距离。
QV-PIC:面向高效RAG服务的查询感知视觉位置无关缓存
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 QV-PIC是一种查询感知双分辨率PIC复用框架,通过离线编译视觉缓存、在线分分辨率处理,解决渲染图像PIC质量下降问题,在6项RAG任务中显著提升F1并降低TTFT。
DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架
机构 * Beihang University(北京航空航天大学) ; SKLCCSE
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract);retriever(abstract,abstract_cn);分类 cs.AI
AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages
MIRROR: 基于新颖性约束的记忆引导MCTS红队测试用于智能体RAG
机构 * Fujitsu Research of Europe, United Kingdom(欧洲富士通研究机构,英国) ; Fujitsu Limited, Japan(日本富士通有限公司)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出MIRROR框架,通过记忆引导蒙特卡洛树搜索和显式新颖性约束,在多模态智能体RAG系统的四个攻击面上实现高攻击成功率,并降低跨表面方差。
Comments 6 pages, 2 figures. Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026), IEEE WCCI 2026; presented as an oral talk. Code and ART-SafeBench benchmark: https://github.com/FujitsuResearch/mirror
MAGE-RAG:面向长文档问答的多粒度自适应图证据多模态RAG
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态RAG :RAG(title,title_cn);分类 cs.IR、cs.CL、cs.AI
AI总结 提出MAGE-RAG框架,通过离线构建包含页面和元素节点的证据图,在线自适应构建证据子图,平衡证据覆盖与噪声控制,在长文档多模态问答中取得最优性能。
多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract)
AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。
Comments 8 pages, 3 figures
使用RAG增强大语言模型进行空间图像隐写术的代码级成本函数生成
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract)
AI总结 该研究针对空间图像隐写术成本函数设计难题,提出利用RAG增强大语言模型的进化系统,含SE-RAG模块及反馈机制。实验表明,此框架安全性更高,还提升了代码执行率并降低搜索成本,凸显结合大语言模型与领域知识的优势。
HAM-RAG:面向结构保真交错生成的层级感知多模态检索增强生成
专题命中 多模态RAG :RAG(title,title_cn);分类 cs.IR、cs.AI
AI总结 本文针对现有多模态RAG方法丢失结构化文档层级信息的问题,提出HAM-RAG框架,引入HAM-Bench基准验证,使多模态平均性能提升17.3%,为可靠多模态助手提供了层级感知的基础信号。
TAP-RAG:用于长文档多模态问答的任务感知策略控制
机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) ; The International Joint Institute of Tianjin University(天津大学国际联合学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 多模态RAG :RAG(title,title_cn)
AI总结 研究长文档多模态问答,提出TAP-RAG框架,含任务感知策略控制器及两个执行器,能预测任务先验、估计证据信号并生成策略,在多模态文档图上扩展证据,在相关数据集上取得最佳总体准确率。
Comments 18 pages, 6 figures, 9 tables
模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级
机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。
面向大学利益相关者的多模态聊天助手开发:基于RAG的方法
机构 * Institute of Information and Communication Technology, Khulna University of Engineering & Technology(信息与通信技术研究所,库尔纳工程技术大学)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 针对大学利益相关者获取信息困难的问题,提出基于检索增强生成的多模态聊天系统,结合大语言模型与语义检索,支持文本和图像查询,将幻觉率从31.7%降至6.6%。
Comments Accepted at 2025 28th International Conference on Computer and Information Technology (ICCIT)
Journal ref 2025 28th International Conference on Computer and Information Technology (ICCIT)
解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线
机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) ; School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(title);dense retrieval(abstract);分类 cs.CL、cs.AI
AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。
Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)
融合前的信任:用于受污染多模态RAG的QIMG-7和源感知分辨率
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 研究多模态检索增强生成中受污染内容问题,提出QIMG-7基准。针对朴素多模态融合脆弱问题,提出源感知信任分辨率(SATR),Field-Selector变体效果最佳,结果支持选择性信任,显式文本可靠性建模是收益主要驱动因素。
Comments 23 pages, 6 figures, 23 tables. Preprint under review
PhysRAG: 通过检索增强生成提升视频生成中的物理感知
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract)
AI总结 提出PhysRAG管道,利用检索增强生成(RAG)和可学习查询注入物理知识,在7K高质量视频上训练,在PhyGenBench和VBench上达到最优视觉质量和物理规则遵从性。
Comments Accepted to ECCV 2026
先看再缩放:视觉RAG中分辨率-上下文权衡的自适应路由
机构 * VinUni-Illinois Smart Health Center, VinUniversity(VinUni-Illinois智慧健康中心,VinUniversity) ; Texas A&M University(德克萨斯农工大学)
专题命中 多模态RAG :RAG(title,title_cn);分类 cs.CL
AI总结 提出ViRGo框架,通过自适应路由选择全局感知、基于补丁或注意力的检索,以平衡小目标细节和大目标上下文,提升视觉RAG的精度与效率。
FinAbstain:用于选择性金融预测的不确定性校准多模态检索增强生成模型
专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract)
AI总结 研究针对大语言模型在金融预测中证据不足时高置信度的问题,提出FinAbstain框架,通过多模态检索增强生成及选择性预测,经多种不确定性评估方法和指标评估,贡献了时间安全架构、复合不确定性公式和可重复评估蓝图。
用于长文档理解的分层证据驱动推理
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research(科大讯飞研究院)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI
AI总结 针对现有多模态RAG管道面临的问题,提出分层证据驱动的多模态RAG框架HIEVI-RAG,通过四阶段管道,包括分层问题分解、粗视觉页面检索、细粒度页面验证和内存引导迭代生成,提升长文档理解,效果显著优于现有基线。
用于检索增强推理、物体感知与损伤分析的集成多模态AI系统
机构 * City College of New York(纽约城市学院) ; Air Force Research Lab(空军研究实验室)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本研究提出整合RAG、热谱感知等技术的多模态AI系统,用于损伤评估,通过多模块对比实验验证了其在提升推理准确性、鲁棒性及跨场景检测方面的优势。
AquiLLM:支持研究群体中隐性知识捕获的架构
机构 * Southern Oregon University(南俄勒冈大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。
Comments Accepted for publication in the NGEN-AI 2026 proceedings
面向I-GUIDE平台地理空间知识发现的智能多模态检索与推理
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 提出I-GUIDE Smart Search系统,结合多模态索引与知识图谱的迭代RAG管道,实现地理空间异构数据的语义检索、图谱溯源和对话合成,在单A100部署下支持约100并发用户,提升检索覆盖与答案质量。
通过视觉-语言反馈进行局部笔触质量评估
机构 * Tokyo Institute of Science High School(东京理科大学附属高中) ; National Institute of Advanced Industrial Science and Technology (AIST)(国立先进工业科学技术研究所) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 研究多模态语言模型能否评估书法局部笔触质量并生成反馈,构建评估框架让三个模型评估图像对并与专家打分比较,还研究了RAG变体,结果显示模型有一定绝对分数准确性,但与专家排名相关性不强,RAG有正负两方面表现。
Comments 6 pages, 8 figures. Accepted to the SAUAFG Workshop at CVPR 2026
对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线
机构 * Aston University(阿斯顿大学) ; Domestic & General
专题命中 多模态RAG :RAG(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。
Comments 10 pages, 8 figures, 2 tables
A/B Agent:面向工业A/B测试中策略迭代的自进化智能体
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Kuaishou Technology(快手科技) ; University of Electronic Science and Technology of China(电子科技大学) ; Southwest Jiaotong University(西南交通大学)
专题命中 多模态RAG :RAG(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出A/B Agent智能体,通过层级经验树与Tree-RAG技术优化工业A/B测试的策略迭代,在短视频电商场景实现GMV提升4.829%且护栏指标正向增益。
DeCoRAG:用于复杂文档理解的认知解耦和语义感知裁剪
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.IR
AI总结 研究针对复杂文档理解中多模态检索增强生成的难题,提出DeCoRAG方法,通过认知解耦、建立语义锚及区域感知裁剪机制,提升语义通过率,减少提示令牌,在复杂文档基准测试中取得良好效果。
Comments 11 pages, 4 figures, 8 tables
RadiomicNet: 一种混合放射组学引导的轻量级可解释医学图像分割架构
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Ahsanullah University of Science and Technology (AUST)(阿萨努拉科学与技术大学)
专题命中 多模态RAG :RAG(summary_cn,abstract);分类 cs.AI
AI总结 提出RadiomicNet,通过放射组学注意力门(RAG)将手工放射组学特征集成到轻量级编码器-解码器中,实现可解释分割,在BUSI和Kvasir-SEG数据集上分别达到0.763和0.854的Dice系数,参数仅3.27M。
Comments Accepted at the IEEE ICIP 2026 LBDL 2 Workshop