arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1205 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1205 篇

2406.06519 2024-06-11 cs.IR 57%

UMBRELA: UMbrela is the (Open-Source Reproduction of the) Bing RELevance Assessor

Shivani Upadhyay, Ronak Pradeep, Nandan Thakur, Nick Craswell, Jimmy Lin

专题命中 RAG评测 :RAG(abstract);分类 cs.IR

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04253 2024-02-07 cs.CL 57%

AnyTool: Self-Reflective, Hierarchical Agents for Large-Scale API Calls

Yu Du, Fangyun Wei, Hongyang Zhang

专题命中 RAG评测 :retriever(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07204 2023-11-14 cs.IR cs.LG 57%

On Elastic Language Models

Chen Zhang, Benyou Wang, Dawei Song

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR

Comments 27 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01173 2023-11-03 cs.CL 57%

CRUSH4SQL: Collective Retrieval Using Schema Hallucination For Text2SQL

Mayank Kothyari, Dhruva Dhingra, Sunita Sarawagi, Soumen Chakrabarti

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL

Comments To appear at EMNLP 2023 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10760 2023-10-18 cs.CL q-fin.PM q-fin.ST stat.AP 57%

Towards reducing hallucination in extracting information from financial reports using Large Language Models

Bhaskarjit Sarmah, Tianjie Zhu, Dhagash Mehta, Stefano Pasquali

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

Comments 4 pages + references. Accepted for publication in Workshop on Generative AI at the 3rd International Conference on AI-ML Systems 2023, Bengaluru, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12678 2022-10-25 cs.CL 57%

ComFact: A Benchmark for Linking Contextual Commonsense Knowledge

Silin Gao, Jena D. Hwang, Saya Kanno, Hiromi Wakaki, Yuki Mitsufuji, Antoine Bosselut

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

Comments Findings of EMNLP 2022, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14997 2026-04-10 cs.CL cs.AI cs.IR 56%

OrgForge: A Multi-Agent Simulation Framework for Verifiable Synthetic Corporate Corpora

OrgForge:一种用于可验证合成企业语料的多智能体仿真框架

Jeffrey Flynt

专题命中 RAG评测 :分类 cs.IR、cs.CL、cs.AI;RAG(comments)

AI总结 OrgForge通过多智能体仿真框架生成一致且可追溯的合成企业语料,解决现有语料在法律约束和幻觉问题上的不足,提升AI系统评估的准确性。

Comments v2: Major revision. Recenters the paper on the simulation framework as the primary contribution. System Architecture substantially expanded (CRM state machine, Knowledge Recovery Arc, multi-pathway knowledge gap detection, embedding-based ticket assignment). Introduction restructured for broader framing. RAG retrieval baselines replaced by cross-document consistency evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25334 2026-06-25 cs.MA 新提交 50%

Bridging the Post-discharge Gap: A Traceable Multi-agent Framework for Safe and Continuous Care

弥合出院后鸿沟:用于安全持续护理的可追溯多智能体框架

Runwei Guan, Yi Zhou, Heyi Lin, Jinjing Zhu, Mingyuan Hou, Yang Yang, Fang Yuan, Xiaohong Lin, Shaofeng Liang, Xuming Hu, Tao Li, Tianbin Zhao, Yutao Yue, Zhiyuan Wang, Hui Xiong

专题命中 RAG评测 :retrieval-augmented generation(abstract)

AI总结 提出Healink框架,通过记忆增强的多智能体架构和约束检索生成,实现基于处方的可追溯出院后随访,在回顾性和盲评中优于医生基线。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19988 2026-06-19 cs.SE 新提交 50%

Repository-Level Solidity Code Generation with Large Language Models: From Prompting to Fine-Tuning

基于大语言模型的仓库级Solidity代码生成:从提示到微调

Shi Chen, Rongcun Wang, Yuan Tian, Xiaoyuan Xie, Wei Song, Rubing Huang

专题命中 RAG评测 :retrieval-augmented generation(abstract)

AI总结 提出SolidityBench基准和SolidityScore指标,评估多种LLM方法在仓库级Solidity代码生成中的表现,发现监督微调最有效。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23285 2026-04-28 cs.NI cs.SE 50%

Towards Agentic Test-Driven Quality Assurance for 6G Networks

面向6G网络的代理驱动测试驱动质量保证

Christos Tranoris, Besiana Agko, Kostis Trantzas, Irene Denazi

专题命中 RAG评测 :knowledge retrieval(abstract)

AI总结 本文提出一个代理驱动的端到端 orchestration 框架,通过意图共创与测试驱动质量保证相结合,确保SLA合规性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11078 2026-04-14 cs.CR 50%

From Context to Rules: Toward Unified Detection Rule Generation

从上下文到规则:迈向统一的检测规则生成

Cheng Meng, Wenxin Le, Xinyi Li, Qiuyun Wang, Fangli Ren, Zhengwei Jiang, Baoxu Liu

专题命中 RAG评测 :RAG(abstract)

AI总结 本文提出UniRule框架,通过双语义投影空间实现跨上下文和语言的统一检测规则生成,实验表明其优于纯LLM生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10846 2026-04-14 eess.SY cs.SY 50%

PFAgent: A Tractable and Self-Evolving Power-Flow Agent for Interactive Grid Analysis

PFAgent:一种可计算且自演化功率流代理用于交互式电网分析

Buxin She, Brian Chen, Luanzheng Guo, Fangxing Li

专题命中 RAG评测 :knowledge retrieval(abstract)

AI总结 本文提出PFAgent,一种可计算且自演化功率流代理,旨在自动化电网分析流程,通过整合意图解析、知识检索、工具执行和结构化报告等功能,提升电网分析的自动化与交互性。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08082 2026-04-10 cs.HC 50%

From Binary Groundedness to Support Relations: Towards a Reader-Centred Taxonomy for Comprehension of AI Output

从二元 groundedness 到支持关系:迈向以读者为中心的 AI 输出理解分类体系

Advait Sarkar, Christian Poelitz, Viktor Kewenig

专题命中 RAG评测 :retrieval augmented generation(abstract)

AI总结 本文提出以读者为中心的 groundedness 分类体系,旨在通过支持关系提升 AI 输出理解的透明度和可解释性。

Comments Advait Sarkar, Christian Poelitz, and Viktor Kewenig. 2026. From Binary Groundedness to Support Relations: Towards a Reader-Centred Taxonomy for Comprehension of AI Output. ACM CHI 2026 Workshop on Science and Technology for Augmenting Reading (CHI '26 STAR) ACM CHI 2026 Workshop on Science and Technology for Augmenting Reading (CHI '26 STAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12142 2025-12-19 cs.CV 50%

MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering

MAVIS:多模态来源归因的长形式视觉问答基准

Seokwon Song, Minsu Park, Gunhee Kim

专题命中 RAG评测 :RAG(abstract)

AI总结 MAVIS基准旨在评估多模态来源归因系统,通过多模态文档检索和长形式答案生成,揭示多模态设置下信息量、 groundedness 和流畅性之间的权衡与改进方向。

Comments AAAI 2026; code is available at https://github.com/seokwon99/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10257 2025-12-15 cs.HC 50%

Reject or Not?: A Benchmark for Voice Assistant Query Rejection in Smart Home Scenario and an Improved Method Based on LLMs

拒绝或不?:智能家庭场景下的语音助手查询拒绝基准及基于LLM的改进方法

Huichao Men, Yizhen Hu, Yingyang He, Yu Gao, Xiaofeng Mou, Yi Xu

专题命中 RAG评测 :RAG(abstract)

AI总结 本文提出面向智能家庭场景的语音助手查询拒绝基准及基于LLM的改进方法,通过构建多模态数据集和三级协作架构提升拒绝准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00619 2025-11-04 cs.SE 50%

GDPR-Bench-Android: A Benchmark for Evaluating Automated GDPR Compliance Detection in Android

Huaijin Ran, Haoyi Zhang, Xunzhu Tang

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05533 2025-10-08 q-fin.PM 50%

The New Quant: A Survey of Large Language Models in Financial Prediction and Trading

Weilong Fu

专题命中 RAG评测 :retrieval-augmented generation(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03902 2025-10-07 cs.SE 50%

Multi-Agent Code-Orchestrated Generation for Reliable Infrastructure-as-Code

Rana Nameer Hussain Khan, Dawood Wasif, Jin-Hee Cho, Ali Butt

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13703 2025-09-18 cs.DC 50%

GPU Programming for AI Workflow Development on AWS SageMaker: An Instructional Approach

Sriram Srinivasan, Hamdan Alabsi, Rand Obeidat, Nithisha Ponnala, Azene Zenebe

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18923 2025-08-14 cs.CV 50%

Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models

Meng Cao, Pengfei Hu, Yingyao Wang, Jihao Gu, Haoran Tang, Haoze Zhao, Chen Wang, Jiahua Dong, Wangbo Yu, Ge Zhang, Jun Song, Xiang Li, Bo Zheng, Ian Reid, Xiaodan Liang

专题命中 RAG评测 :retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06087 2025-08-11 cs.CR cs.LG stat.ML 50%

Adaptive Backtracking for Privacy Protection in Large Language Models

Zhihao Yao, Yuxuan Gu, Xiachong Feng, Weitao Ma, Bo Li, Xiaocheng Feng

专题命中 RAG评测 :retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03340 2025-08-06 cs.SE 50%

Key-Augmented Neural Triggers for Knowledge Sharing

Alex Wolf, Marco Edoardo Palma, Pooja Rani, Harald C. Gall

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02998 2025-08-06 cs.SE 50%

MRG-Bench: Evaluating and Exploring the Requirements of Context for Repository-Level Code Generation

Haiyang Li

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17416 2025-05-26 cs.CR 50%

LLM-BSCVM: An LLM-Based Blockchain Smart Contract Vulnerability Management Framework

Yanli Jin, Chunpei Li, Peng Fan, Peng Liu, Xianxian Li, Chen Liu, Wangjie Qiu

专题命中 RAG评测 :retrieval-augmented generation(abstract)

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15771 2025-05-23 cs.LG 50%

ORION Grounded in Context: Retrieval-Based Method for Hallucination Detection

Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bressler, Shir Chorev, Philip Tannor

机构 * Deepchecks

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18003 2025-04-28 cs.LG 50%

Self-Balancing, Memory Efficient, Dynamic Metric Space Data Maintenance, for Rapid Multi-Kernel Estimation

Aditya S Ellendula, Chandrajit Bajaj

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13805 2025-04-21 cs.HC 50%

LearnAct: Few-Shot Mobile GUI Agent with a Unified Demonstration Benchmark

Guangyi Liu, Pengxiang Zhao, Liang Liu, Zhiming Chen, Yuxiang Chai, Shuai Ren, Hao Wang, Shibo He, Wenchao Meng

专题命中 RAG评测 :knowledge retrieval(abstract)

Comments 23 pages, 16 figures, the project resources are available at https://lgy0404.github.io/LearnAct

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13163 2025-03-14 cs.LG 50%

Unlocking Historical Clinical Trial Data with ALIGN: A Compositional Large Language Model System for Medical Coding

Nabeel Seedat, Caterina Tozzi, Andrea Hita Ardiaca, Mihaela van der Schaar, James Weatherall, Adam Taylor

专题命中 RAG评测 :RAG(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15264 2025-01-14 cs.HC 50%

Validation Requirements for AI-based Intervention-Evaluation in Aging and Longevity Research and Practice

Georg Fuellen, Anton Kulaga, Sebastian Lobentanzer, Maximilian Unfried, Roberto Avelar, Daniel Palmer, Brian K. Kennedy

专题命中 RAG评测 :retrieval-augmented generation(abstract)

Comments 11 pages, 1 Figure, 1 Table

Journal ref Ageing Research Reviews (2025), 104, 102617

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15735 2024-11-25 cs.CR 50%

Boosting Cybersecurity Vulnerability Scanning based on LLM-supported Static Application Security Testing

Mete Keltek, Rong Hu, Mohammadreza Fani Sani, Ziyue Li

专题命中 RAG评测 :knowledge retrieval(abstract)

Comments Under Review of IEEE SaTML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏