arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1199 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1199 篇

2506.06331 2026-08-14 cs.CL cs.AI cs.IR 版本更新 67%

How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG

实际性能提升有多显著?GraphRAG的无偏评估框架

Qiming Zeng, Hao Luo, Yuhao Lin, Yicheng Jin, Yuxiang Wang, Fangcheng Fu, Xiao Yan, Jiawei Jiang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) OceanBase

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 针对GraphRAG现有评估框架的不相关问题与评估偏差缺陷,提出无偏评估框架并发现代表性GraphRAG方法的性能提升远小于此前报告结果,呼吁开展科学评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28229 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 67%

EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

EMBL AI Librarian:面向AI智能体的生命科学知识层

Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar, Matt Jeffryes, Daljit Nijjer, Vittorio Perera, Ola Spjuth, Julio Saez-Rodriguez, Melissa Harrison, Fabio Petroni

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 该研究推出EMBL AI Librarian,为AI智能体升级Europe PMC接口,通过LLM统筹检索,在多基准任务中提升性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19238 2026-07-22 cs.CE 新提交 67%

FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents

FinanceComplexQA:对工业级金融文档进行智能体推理的基准测试

Xianfu Cheng, Shiwei Zhang, Jiyu Zhao, Jian Yang, Xinyuan Wang, Ming Zhou, Weixiao Zhou, Xiangyuan Guan, Xiang Li, Zhenhe Wu, Ziyi Ni, Zhoujun Li, Bingjing Xu

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 研究针对金融文档智能体推理性能差异问题,设计Finance-LaTeX SKILL生成金融文档和问答对,引入FinanceComplexQA基准测试,对领先系统和工具全面评估,通过分析失败案例研究其在多方面的能力。

Comments 27 pages, 9 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00262 2026-07-22 cs.SE 版本更新 67%

LLM-Driven Cost-Effective Requirements Change Impact Analysis

基于大语言模型的低成本需求变更影响分析

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06605 2026-07-22 cs.LG 版本更新 67%

How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配

Shai Feldman, Yaniv Romano

机构 * Department of Computer Science(计算机科学系) Technion, Israel(技术ion, 以色列) Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13754 2026-07-16 cs.CR 新提交 67%

PriEval-Protect: A Unified Framework for Privacy Evaluation and Protection in Healthcare Systems

PriEval-Protect:医疗系统中隐私评估与保护的统一框架

Ilef Chebil, Asma El Hadj, Souheib Yousfi, Aroua Hedhili, Layth Sliman

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 针对医疗系统隐私问题,PriEval-Protect框架分两阶段统一评估与缓解隐私风险。评估阶段结合法规评分与技术分析得出综合风险评分,保护阶段依风险推荐对策,实现法规与数据级风险分析的衔接,结果具合规性与可解释性。

Comments 10 pages, 3 figures. Accepted at IDT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28208 2026-07-03 cs.AR cs.ET 版本更新 67%

FCDC: Nonvolatile Charge-Domain Attention with HZO Ferroelectric Capacitors

基于HZO铁电电容的非易失性电荷域注意力机制:从器件到系统的仿真评估

Fares Abouagor

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract_cn)

AI总结 提出铁电电荷域计算单元(FCDC),利用HZO忆电容器实现非易失性模拟存储和电荷域向量矩阵乘法,用于Transformer注意力机制,通过器件到系统仿真评估两种部署模式,在多种大语言模型上验证了低功耗和精度保持。

Comments 28 pages, 7 figures. Code: https://github.com/faris-agour/FCDC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29894 2026-06-30 cs.IR cs.AI cs.CL cs.LG 67%

SABER-Math: Automated Benchmark for Information Retrieval Evaluation in Mathematics

SABER-Math:数学信息检索评估的自动化基准

Nikolay Georgiev, Maria Drencheva, Kseniia Ibragimova, Ivo Petrov, Dimitar I. Dimitrov, Martin Vechev

专题命中 RAG评测 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出首个无需专家标注的数学信息检索自动化基准SABER-Math,通过三步构建重排序任务,评估检索器在数学领域的效果,发现通用基准无法可靠预测数学检索性能。

Comments Accepted in the 3rd AI for Math Workshop at the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27245 2026-05-27 cs.LG 67%

Symbolic Regression via Latent Iterative Refinement

通过潜在迭代细化的符号回归

Xieting Chu, Sriram Vishwanath, Vijay Ganesh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 提出潜在方程嵌入(LEE)框架,通过迭代推断在功能基础化的潜在空间中缩小符号回归的推断差距,生成更简单且准确的表达式。

Comments Preprint. 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20312 2026-05-21 cs.CR cs.LO cs.MA 67%

Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks

Pramana:自主代理网络中声明验证的协议层处理

Ravi Kiran Kadaboina

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 本文提出Pramana协议层,通过定义缺失的线缆格式,为自主代理网络中的声明验证提供结构化方法,结合经典印度认识论中的四种知识类型,确保验证过程的确定性和可追溯性。

Comments 23 pages, 4 figures, 5 tables, 42 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14442 2026-05-15 cs.CY 67%

GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction

GGBound:一种基于基因组的微生物生命边界预测代理

Hanbo Huang, Xuan Gong, Jing Wang, Lei Bai, Xiang Xiao, Weishu Zhao, Shiyu Liang

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01425 2026-05-05 cs.LG 67%

Barriers to Counterfactual Credit Attribution for Autoregressive Models

自回归模型中反事实信用归因的障碍

Aloni Cohen, Chenhao Zhang

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 研究自回归模型中反事实信用归因的挑战,发现信用归因不具有自回归性,且基于弱最优性要求的反事实归因需指数级查询复杂度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27127 2026-03-31 cs.CR 67%

Red-MIRROR: Agentic LLM-based Autonomous Penetration Testing with Reflective Verification and Knowledge-augmented Interaction

Red-MIRROR:基于大语言模型的自主渗透测试系统,结合反射验证与知识增强交互

Tran Vy Khang, Nguyen Dang Nguyen Khang, Nghi Hoang Khoa, Do Thi Thu Hien, Van-Hau Pham, Phan The Duy

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 Red-MIRROR通过引入紧密耦合的记忆-反射架构,解决传统渗透测试中依赖参数知识、记忆碎片化和验证不足的问题,实现复杂Web漏洞的高效检测与验证,其在XBOW基准测试中成功率达到86%。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22184 2026-03-24 cs.LG quant-ph 67%

Revisiting Quantum Code Generation: Where Should Domain Knowledge Live?

重新审视量子代码生成:领域知识应该在哪里居住?

Oscar Novo, Oscar Bastidas-Jossa, Alberto Calvo, Antonio Peris, Carlos Kuchkovsky

机构 * Quantum Computing Research, QCentroid(量子计算研究,QCentroid)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 研究比较了Qiskit代码生成中不同专精策略,发现通用LLM在零样本和检索增强设置下表现更优,结合执行反馈代理可提升性能,表明无需领域微调即可实现更灵活的量子软件开发。

Comments Submitted to Quantum Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17773 2026-03-19 cs.CY cs.HC 67%

Large Language Models in Teaching and Learning: Reflections on Implementing an AI Chatbot in Higher Education

大语言模型在教学与学习中的应用:在高等教育中实施AI聊天机器人反思

Fiammetta Caccavale, Carina L. Gargalo, Julian Kager, Magdalena Skowyra, Steen Larsen, Krist V. Gernaey, Ulrich Krühne

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文探讨了在高等教育中实施增强型AI助手中的风险与挑战,通过实验评估了大语言模型对学习动机、教学质量及学生表现的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11073 2026-03-13 cs.SE 67%

Context Before Code: An Experience Report on Vibe Coding in Practice

上下文在代码之前:关于在实践中使用Vibe编码的经验报告

Md Nasir Uddin Shuvo, Md Aidul Islam, Md Mahade Hasan, Muhammad Waseem, Pekka Abrahamsson

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文报告了一个全栈团队在实践中应用Vibe编码构建多项目代理学习平台和学术检索增强生成系统,并探讨了生成代码在隔离约束和架构设计上的不足。

Comments 6 Pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14878 2026-03-10 cs.HC 67%

InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models

InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统

Zhiyuan Zhou, Jilong Liu, Sanwang Wang, Shijie Hao, Yanrong Guo, Richang Hong

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。

Comments Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20799 2026-02-25 cs.SE 67%

Unseen-Codebases-Domain Data Synthesis and Training Based on Code Graphs

基于代码图的未见代码库数据合成与训练

Guangsheng Ou, Qiming Zhang, Sirong Chen, Anji Li, Dong Xu, Tiancheng Luo, Dekun Dai, Cuiyun Gao, Long Wang, Jun Zhou, Mingwei Liu, Zibin Zheng

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 提出UCD-Training框架,通过代码图构建和两阶段训练,提升模型对未见代码库的推理能力和数据合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15567 2026-02-03 cs.CR cs.SE 67%

MalCVE: Malware Detection and CVE Association Using Large Language Models

MalCVE: 使用大语言模型进行恶意软件检测与CVE关联

Eduard Andrei Cristea, Petter Molnes, Jingyue Li

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 MalCVE利用大语言模型检测恶意软件并关联CVE,实现高准确率的恶意软件识别和漏洞关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22706 2026-02-02 cs.CR cs.SE 67%

RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories

RealSec-bench:一个评估现实世界仓库中安全代码生成的基准

Yanlin Wang, Ziyao Zhang, Chong Wang, Xinyi Xu, Mingwei Liu, Yong Wang, Jiachi Chen, Zibin Zheng

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 RealSec-bench是一个基于现实世界Java仓库构建的安全代码生成评估基准,通过多阶段流程和专家验证,评估5种LLM在功能正确性和安全性方面的表现。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12448 2026-01-30 cs.SE 67%

Evaluating Large Language Models for Time Series Anomaly Detection in Aerospace Software

评估大型语言模型在航空航天软件时间序列异常检测中的应用

Yang Liu, Yixing Luo, Xiaofeng Li, Xiaogang Dong, Bin Gu, Zhi Jin

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出ATSADBench基准,评估大型语言模型在航空航天软件时间序列异常检测中的性能,发现其在单变量任务表现良好,但多变量任务效果欠佳,且RAG策略可能加剧假警报问题。

Comments This paper has been accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10258 2026-01-29 cs.CV cs.MM 67%

XY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark

XY-Cut++: 一种基于新型基准的分层遮罩机制的高级布局排序方法

Shuai Liu, Youmeng Li, Jizeng Wei

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 XY-Cut++通过分层遮罩机制在新型基准上实现高级布局排序,提升文档阅读顺序恢复的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10718 2026-01-19 cs.AI cs.CL cs.IR cs.LG 67%

Japanese AI Agent System on Human Papillomavirus Vaccination: System Design

日本的人乳头瘤病毒疫苗人工智能代理系统:系统设计

Junyu Liu, Siwen Yang, Dexiu Ma, Qian Niu, Zequn Zhang, Momoko Nagai-Tanima, Tomoki Aoyama

机构 * Kyoto University(京都大学) University of Waterloo(滑铁卢大学) Texas Tech University(德克萨斯技术大学) The University of Tokyo(东京大学) USTC(中国科学技术大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本研究设计了一种双用途的人工智能代理系统,通过对话界面提供HPV疫苗信息并生成分析报告,有效应对疫苗犹豫问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10128 2026-01-16 cs.CE cond-mat.mtrl-sci cs.SE 67%

A Generalizable Framework for Building Executable Domain-Specific LLMs under Data Scarcity: Demonstration on Semiconductor TCAD Simulation

在数据稀缺条件下构建可执行领域特定大语言模型的通用框架:以半导体TCAD仿真为例

Di Wang, Zhenhua Wu, Yu Liu, Kai Chang, Shaohua Wu

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出一种通用框架,在数据稀缺条件下构建可执行的领域特定大语言模型,通过生成合成数据和代码优化流程,实现领域知识灌输和脚本可执行性提升。

Comments Submitted to Nature Computational Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00513 2026-01-05 cs.LG 67%

When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents

当小模型适用于错误的原因:信任代理的过程验证

Laksh Advani

机构 * Laksh Advani

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文揭示小型语言模型在推理过程中的可靠性问题,提出推理完整性评分,并展示RAG提升推理质量而元认知可能损害性能,强调过程验证对可信代理的重要性。

Comments Accepted to Trustagent workshop AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13632 2025-12-16 cs.LG 67%

StutterFuse: Mitigating Modality Collapse in Stuttering Detection with Jaccard-Weighted Metric Learning and Gated Fusion

StutterFuse: 通过Jaccard加权度量学习和门控融合缓解语塞崩溃

Guransh Singh, Md Shah Fahad

机构 * Department of Computer Science, Birla Institute of Technology, Mesra(计算机科学系,比拉理工学院,梅斯拉)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 StutterFuse通过Jaccard加权度量学习和门控融合策略,有效缓解语塞检测中的模态崩溃问题,实现高精度多标签分类。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23229 2025-12-16 cs.LG 67%

Citegeist: Automated Generation of Related Work Analysis on the arXiv Corpus

Citegeist: 在arXiv语料库上自动生成相关工作分析的应用程序

Claas Beger, Carl-Leander Henneking

机构 * Cornell University(康奈尔大学)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract)

AI总结 Citegeist通过动态RAG技术在arXiv语料库上自动生成相关工作分析,结合嵌入相似性匹配、总结和多阶段过滤,提供引用支持的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06504 2025-12-09 cs.CR 67%

When Code Crosses Borders: A Security-Centric Study of LLM-based Code Translation

当代码跨越国界:一种以安全为中心的LLM代码翻译研究

Hailong Chang, Guozhu Meng, Shuhui Xiao, Kai Chen, Kun Sun, Yilin Li

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文研究了LLM在代码翻译中的安全风险,发现28.6%-45%的翻译引入新漏洞,并提出RAG策略降低漏洞率32.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16224 2025-11-24 cs.SE 67%

Beyond Code Similarity: Benchmarking the Plausibility, Efficiency, and Complexity of LLM-Generated Smart Contracts

超越代码相似性:评估LLM生成智能合约的可信度、效率和复杂性

Francesco Salzano, Simone Scalabrino, Rocco Oliveto, Remo Pareschi

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文评估了LLM生成智能合约的可信度、效率和复杂性,发现检索增强生成显著提升了功能正确性,但生成代码仍需专家验证。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10240 2025-11-19 cs.AR cs.LG 67%

Graph Neural Networks Based Analog Circuit Link Prediction

Guanyuan Pan, Tiansheng Zhou, Jianxiang Zhao, Zhi Li, Yugui Lin, Bingtao Ma, Yaqi Wang, Pietro Liò, Shuai Wang

机构 * HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子科技大学信息处理联合研究所) Intelligent Information Processing Laboratory, Hangzhou Dianzi University(杭州电子科技大学智能信息处理实验室) Innovation Center for Electronic Design Automation Technology, Hangzhou Dianzi University(杭州电子科技大学电子设计自动化技术创新中心) School of Computer Science and Technology, South China Business College, Guangdong University of Foreign Studies(广东外语外贸大学南方商学院计算机科学与技术学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

Comments Code and data will be made available on request to the corresponding author

Journal ref Pan, G., Zhou, T., Zhao, J., Li, Z., Lin, Y., Ma, B., ... & Wang, S. (2026). Graph Neural Networks Based Analog Circuit Link Prediction. Engineering Applications of Artificial Intelligence, 163, 113035

详情

展开后加载摘要…

URL PDF HTML 收藏