arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1205 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1205 篇

2409.12739 2026-03-24 cs.CL 57%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11721 2026-03-24 cs.AI 57%

When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows

当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统

Wenxian Yang, Hanzheng Qiu, Bangqun Zhang, Chengquan Li, Zhiyong Huang, Xiaobin Feng, Rongshan Yu, Jiahong Dong

机构 * Independent Researcher(独立研究者) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) National University of Singapore, Singapore(新加坡国立大学) Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16581 2026-03-18 cs.AI 57%

V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

V-DyKnow:面向视觉语言模型的时间敏感知识动态基准

Seyed Mahed Mousavi, Christian Moiola, Massimo Rizzoli, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出V-DyKnow基准,评估视觉语言模型对时间敏感事实知识的处理能力,分析模型响应可靠性、知识更新方法有效性及过时预测原因,揭示当前VLM在多模态时间敏感知识获取与更新中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22333 2026-03-17 cs.DC cs.CL 57%

PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel

PAT: 通过资源高效的多瓷砖内核加速大语言模型解码的前缀感知注意力

Jinjun Yi, Zhixin Zhao, Yitao Hu, Ke Yan, Weiwei Sun, Hao Wang, Laiping Zhao, Yuhao Zhang, Wenxin Li, Keqiu Li

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 本文提出PAT,一种基于前缀感知的注意力内核,通过包前向合并范式减少内存访问,提升资源利用率,降低解码延迟和TPOT。

Comments Accepted by ASPLOS'26, code available at https://github.com/flashserve/PAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10570 2026-03-12 cs.CL 57%

End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering

端到端对话机器人评估与自适应推理和不确定性过滤

Nhi Dang, Tung Le, Huy Tien Nguyen

专题命中 RAG评测 :retrieval augmented generation(abstract);分类 cs.CL

AI总结 本研究提出一种端到端自动评估器,通过生成问答对和置信度过滤,实现对话机器人评估的自动化和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 57%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05828 2026-03-09 cs.CL 57%

HART: Data-Driven Hallucination Attribution and Evidence-Based Tracing for Large Language Models

HART: 基于数据的幻觉归因与证据导向追踪用于大语言模型

Shize Liang, Hongzhi Wang

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

AI总结 HART通过结构化建模方法提升大语言模型幻觉归因与证据追踪的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02876 2026-03-04 cs.CL 57%

Eval4Sim: An Evaluation Framework for Persona Simulation

Eval4Sim: 一种用于人设模拟的评估框架

Eliseo Bao, Anxo Perez, Xi Wang, Javier Parapar

机构 * University of Sheffield(谢菲尔德大学)

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL

AI总结 Eval4Sim提出了一种评估框架,用于衡量模拟对话与人类对话模式的契合度,通过三个互补维度评估人设的忠实性、一致性和自然性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00285 2026-03-03 cs.AI 57%

TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?

TraderBench: AI代理在对抗性资本市场中的鲁棒性如何?

Xiaochuang Yuan, Hui Xu, Silvia Xu, Cui Zou, Jing Xiong

机构 * Amazon.com Inc.(亚马逊公司) Stony Brook University(石溪大学) Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

AI总结 TraderBench通过结合静态任务与对抗性交易模拟,评估AI代理在动态市场中的鲁棒性,发现现有模型在加密交易中表现稳定但缺乏真实适应性。

Comments Equal Contribution: Xiaochuang Yuan and Hui Xu contributed equally to this work. All correspondence should be directed to yxc20098@gmail.com. Submitted to Agents in the Wild Workshop, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17675 2026-02-23 cs.DC cs.AI 57%

Mind the Boundary: Stabilizing Gemini Enterprise A2A via a Cloud Run Hub Across Projects and Accounts

注意边界:通过跨项目和账户的云运行枢纽稳定Gemini Enterprise A2A

Takao Morita

机构 * Independent Researcher(独立研究者)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 通过跨项目和账户的云运行枢纽稳定Gemini Enterprise A2A,解决边界依赖认证和UI兼容性问题,实现可靠路由和稳定响应。

Comments 7 pages. Implementation and evaluation study of cross-boundary agent orchestration for Gemini Enterprise UI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17046 2026-02-20 cs.AI 57%

Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs

动态系统指令与工具暴露用于高效代理LLM

Uria Franko

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14955 2026-02-17 cs.CL cs.SE 57%

Tool-Aware Planning in Contact Center AI: Evaluating LLMs through Lineage-Guided Query Decomposition

接触中心AI中的工具感知规划:通过 lineage 引导的查询分解评估LLMs

Varun Nathan, Shreyas Guha, Ayush Kumar

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 本文提出接触中心AI中的工具感知规划框架,通过lineage引导查询分解评估LLMs,揭示工具理解的不足及简计划的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08070 2026-02-10 cs.IR 57%

IRB: Automated Generation of Robust Factuality Benchmarks

IRB: 自动生成鲁棒事实性基准

Lam Thanh Do, Bhagyashree Taleka, Hozaifa Ammar Bhutta, Vikram Sharma Mailthody, Kevin Chen-Chuan Chang, Wen-mei Hwu

专题命中 RAG评测 :RAG(abstract);分类 cs.IR

AI总结 IRB通过自动生成鲁棒事实性基准,评估RAG系统事实性,发现前沿LLM在闭书设置中面临挑战,推理LLM更可靠,改进检索组件更有效。

Comments Code: https://github.com/Hozaifa-Bhutta/IRB

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05883 2026-02-06 cs.AI 57%

A Guide to Large Language Models in Modeling and Simulation: From Core Techniques to Critical Challenges

大语言模型在建模与仿真中的应用指南:从核心技术到关键挑战

Philippe J. Giabbanelli

机构 * Old Dominion University(旧 Dominion 大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在建模与仿真中的应用,分析了核心技术和关键挑战,提供了全面的使用指南和实践建议。

Comments Book chapter. Accepted in Artificial Intelligence in Modeling and Simulation, Philippe J. Giabbanelli and Istvan David (eds). Series on Simulation Foundations, Methods and Applications. Springer, Cham. Series ISSN: 2195-2817

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02053 2026-02-04 cs.CL 57%

WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora

WildGraphBench: 用野源语料基准测试图式检索增强生成

Pengyu Wang, Benfeng Xu, Licheng Zhang, Shaohan Wang, Mingxuan Du, Chiwei Zhu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 WildGraphBench通过真实语料评估GraphRAG在长上下文和异构文档中的性能,揭示多事实聚合的局限性。

Comments https://github.com/BstWPY/WildGraphBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00723 2026-02-03 cs.LG cs.AI 57%

Rethinking Hallucinations: Correctness, Consistency, and Prompt Multiplicity

重新思考幻觉:正确性、一致性与提示多样性

Prakhar Ganesh, Reza Shokri, Golnoosh Farnadi

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出提示多样性框架,揭示LLM幻觉评估中一致性的重要性,指出现有检测与缓解技术的局限性。

Comments To appear at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00641 2026-02-03 cs.AI 57%

AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents

AgentAuditor: 为LLM代理提供人类水平的安全性和安全性评估

Hanjun Luo, Shenyu Dai, Chiming Ni, Xinfeng Li, Guibin Zhang, Kun Wang, Tongliang Liu, Hanan Salam

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 AgentAuditor通过构建经验记忆和多阶段检索生成过程,提升LLM在代理安全性和安全性评估中的性能,达到人类水平的准确性。

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21937 2026-02-02 cs.AI 57%

Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities

检索增强推理沙盒:一种解耦检索与推理能力的基准

Shuangshuang Ying, Zheyu Wang, Yunjian Peng, Jin Chen, Yuhao Wu, Hongbin Lin, Dingyu He, Siyi Liu, Gengchen Yu, YinZhu Piao, Yuchen Wu, Xin Gui, Zhongyuan Peng, Xin Li, Xeron Du, Libo Qin, YiXin Cao, Ge Zhang, Stephen Huang

机构 * Full author list in Contributions(完整作者列表)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 DeR2通过解耦检索与推理能力,提供了一种评估大语言模型处理新颖科学信息能力的基准测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15745 2026-01-23 cs.CL 57%

Hallucination Mitigating for Medical Report Generation

缓解医疗报告生成中的幻觉

Ruoqing Zhao, Runze Xia, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

AI总结 KERM框架通过知识检索、净化模块和细粒度奖励,有效缓解医疗报告生成中的幻觉问题,提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09527 2026-01-15 cs.LG cs.AI cs.PF 57%

Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs

在消费级Blackwell GPU上进行私有LLM推理:为中小企业实现低成本本地部署的实用指南

Jonathan Knoop, Hendrik Holtmann

机构 * IE Business University(IE商学院)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文评估了消费级Blackwell GPU在LLM推理中的性能,证明其在多数中小企业工作负载中可替代云服务,但长上下文RAG任务仍需高端GPU。

Comments 15 pages, 18 tables, 7 figures. Includes link to GitHub repository and Docker image for reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09523 2026-01-15 cs.IR 57%

TEMPO: A Realistic Multi-Domain Benchmark for Temporal Reasoning-Intensive Retrieval

TEMPO:一个用于时间推理密集检索的多领域基准

Abdelrahman Abdallah, Mohammed Ali, Muhammad Abdul-Mageed, Adam Jatowt

专题命中 RAG评测 :RAG(abstract);分类 cs.IR

AI总结 TEMPO是一个结合时间推理与多领域检索的基准,通过复杂查询和多步骤检索规划,评估检索系统在时间信息处理上的挑战和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04416 2026-01-09 cs.AI 57%

Transitive Expert Error and Routing Problems in Complex AI Systems

复杂人工智能系统中的传递专家误差与路由问题

Forest Mars

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 复杂AI系统中,传递专家误差导致领域边界处因果错误输出,通过多专家激活、边界校准和覆盖检测等干预措施加以解决。

Comments 31pp

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02504 2026-01-07 cs.SE cs.AI cs.CY 57%

Enhancing Debugging Skills with AI-Powered Assistance: A Real-Time Tool for Debugging Support

利用AI赋能提升调试技能:一种实时的调试支持工具

Elizaveta Artser, Daniil Karol, Anna Potriasaeva, Aleksei Rostovskii, Katsiaryna Dzialets, Ekaterina Koshchenko, Xiaotian Su, April Yi Wang, Anastasiia Birillo

机构 * JetBrains Research(JetBrains研究)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出一种基于AI的实时调试辅助工具,通过减少LLM调用并提升准确性,帮助提升编程教育中的调试技能。

Comments Accepted at ICSE SEET 2026, 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12830 2025-12-25 cs.CY cs.AI 57%

Gobernanza y trazabilidad "a prueba de AI Act" para casos de uso legales: un marco técnico-jurídico, métricas forenses y evidencias auditables

AI Act合规的法律用例治理与可追溯性:技术-法律框架、司法计量学与可审计证据

Alex Dantart

机构 * Humanizing Internet

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出一个开源框架rag-forense,用于确保AI系统在法律领域符合欧盟AI法案的可验证合规性。

Comments in Spanish and English languages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19769 2025-12-24 cs.SE cs.AI cs.PL 57%

A Declarative Language for Building And Orchestrating LLM-Powered Agent Workflows

构建和协调基于大语言模型的智能体工作流的声明式语言

Ivan Daunis

机构 * PayPal

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出一种声明式语言,用于构建和协调基于大语言模型的智能体工作流,通过统一DSL减少开发时间和部署速度,提升非工程师的使用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19253 2025-12-16 cs.IR 57%

DeepResearchGym: A Free, Transparent, and Reproducible Evaluation Sandbox for Deep Research

DeepResearchGym: 一个免费、透明且可复现的深度研究评估沙盒

João Coelho, Jingjie Ning, Jingyuan He, Kangrui Mao, Abhijay Paladugu, Pranav Setlur, Jiahe Jin, Jamie Callan, João Magalhães, Bruno Martins, Chenyan Xiong

专题命中 RAG评测 :retriever(abstract);分类 cs.IR

AI总结 DeepResearchGym提供了一个免费、透明且可复现的深度研究评估沙盒,结合可复现的搜索API和严谨的评估协议,用于评估深度研究系统性能,展示其在成本效益训练中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20209 2025-12-11 cs.LG cs.AI 57%

Assessing the Feasibility of Early Cancer Detection Using Routine Laboratory Data: An Evaluation of Machine Learning Approaches on an Imbalanced Dataset

利用常规实验室数据评估早期癌症检测的可行性:对机器学习方法在不平衡数据集上的评估

Shumin Li

专题命中 RAG评测 :retriever(abstract);分类 cs.AI

AI总结 本研究评估了利用常规实验室数据通过机器学习检测癌症的可行性,发现其在临床分类上表现欠佳,需整合多模态数据以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08998 2025-12-11 eess.IV cs.AI cs.CV 57%

DermETAS-SNA LLM: A Dermatology Focused Evolutionary Transformer Architecture Search with StackNet Augmented LLM Assistant

DermETAS-SNA LLM:一种专注于皮肤科的进化Transformer架构搜索与StackNet增强LLM助手

Nitya Phani Santosh Oruganty, Keerthi Vemula Murali, Chun-Kit Ngan, Paulo Bandeira Pinho

机构 * Data Science Program, Worcester Polytechnic Institute, Massachusetts, USA(沃斯特理工学院数据科学项目,马萨诸塞州,美国) Computer Science Department, Worcester Polytechnic Institute, Massachusetts, USA(沃斯特理工学院计算机科学系,马萨诸塞州,美国) PASE Advisory Group, New Jersey, USA(PASE顾问小组,新泽西州,美国)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 DermETAS-SNA LLM结合进化Transformer架构搜索与StackNet增强LLM,旨在提升皮肤病诊断的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07921 2025-12-10 cs.SE cs.AI 57%

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04307 2025-12-05 cs.LG cs.AI 57%

Evaluating Long-Context Reasoning in LLM-Based WebAgents

评估基于大语言模型的WebAgent的长上下文推理能力

Andy Chung, Yichi Zhang, Kaixiang Lin, Aditya Rawal, Qiaozi Gao, Joyce Chai

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文评估了基于大语言模型的WebAgent在长上下文场景中的推理能力,发现随着上下文长度增加,性能显著下降,提出隐式RAG方法以改进任务执行。

Comments Accepted NeurIPS 25 LAW Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏