arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1205 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1205 篇

2512.01786 2025-12-02 cs.AI cs.LG 57%

Who Judges the Judge? LLM Jury-on-Demand: Building Trustworthy LLM Evaluation Systems

谁评判法官?LLM陪审团即需:构建可信的LLM评估系统

Xiaochuan Li, Ke Wang, Girija Gouda, Shubham Choudhary, Yaqun Wang, Linwei Hu, Joel Vaughan, Freddy Lecue

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出LLM陪审团即需,通过动态学习框架提升LLM评估的可靠性和可扩展性,实验表明其在关键决策中的相关性优于传统方法。

Comments 66 pages, 22 figures, 37 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00991 2025-12-02 cs.CL 57%

Advancing Academic Chatbots: Evaluation of Non Traditional Outputs

推进学术聊天机器人:非传统输出的评估

Nicole Favero, Francesca Salute, Daniel Hardt

机构 * Copenhagen Business School(哥本哈根商学院)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 本研究评估了非传统学术输出生成,比较了两种检索策略并测试了LLMs在幻灯片和播客脚本生成中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00765 2025-11-17 cs.CL 57%

Decomposing and Revising What Language Models Generate

Zhichao Yan, Jiaoyan Chen, Jiapu Wang, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * School of Computer and Information Technology, Shanxi University, Taiyuan, China(计算机与信息科技学院,山西大学,太原,中国) Department of Computer Science, University of Manchester, Manchester, England(计算机科学系,曼彻斯特大学,曼彻斯特,英国) Beijing University of Technology, Beijing, China(北京理工大学,北京,中国) Singapore University of Technology and Design(新加坡科技与设计大学) ILCC, School of Informatics, University of Edinburgh, Edinburgh, England(ILCC,信息学院,爱丁堡大学,爱丁堡,英国)

专题命中 RAG评测 :retriever(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15045 2025-11-14 cs.CL 57%

Error Correction in Radiology Reports: A Knowledge Distillation-Based Multi-Stage Framework

Jinge Wu, Zhaolong Wu, Ruizhe Li, Tong Chen, Abul Hasan, Yunsoo Kim, Jason P. Y. Cheung, Teng Zhang, Honghan Wu

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06183 2025-11-11 cs.CL 57%

BookAsSumQA: An Evaluation Framework for Aspect-Based Book Summarization via Question Answering

Ryuhei Miyazato, Ting-Ruen Wei, Xuyang Wu, Hsin-Tai Wu, Kei Harada

机构 * The University of Electro-Communications(电子通信大学) Santa Clara University(圣克拉拉大学) DOCOMO Innovations, Inc.(doCOMO创新公司)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26130 2025-11-06 cs.SE cs.AI cs.LG 57%

Beyond Synthetic Benchmarks: Evaluating LLM Performance on Real-World Class-Level Code Generation

Musfiqur Rahman, SayedHassan Khatoonabadi, Emad Shihab

机构 * Concordia University(康科德大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

Comments Pre-print submitted for reviwer to TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14681 2025-11-04 cs.CL 57%

Large Language Models as Medical Codes Selectors: a benchmark using the International Classification of Primary Care

Vinicius Anjos de Almeida, Vinicius de Camargo, Raquel Gómez-Bravo, Egbert van der Haring, Kees van Boven, Marcelo Finger, Luis Fernandez Lopez

机构 * Medical School, University of São Paulo(圣保罗大学医学院) University of São Paulo(圣保罗大学) Department of Epidemiology, School of Public Health, University of São Paulo(圣保罗大学流行病学系) Rehaklinik, Centre Hospitalier Neuro-psychiatrique (CHNP)(康复诊所,神经精神病中心(CHNP)) Radboud University(拉德堡德大学) Department of Primary and Community Care, Radboud University(初级与社区护理系,拉德堡德大学) Institute of Mathematics and Statistics, University of Sao Paulo(数学与统计学研究所,圣保罗大学)

专题命中 RAG评测 :retriever(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025 as a poster presentation in The Second Workshop on GenAI for Health: Potential, Trust, and Policy Compliance (https://openreview.net/forum?id=Kl7KZwJFEG). 33 pages, 10 figures (including appendix), 15 tables (including appendix). To be submitted to peer-reviewed journal. For associated code repository, see https://github.com/almeidava93/llm-as-code-selectors-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25820 2025-10-31 cs.AI cs.HC 57%

Symbolically Scaffolded Play: Designing Role-Sensitive Prompts for Generative NPC Dialogue

Vanessa Figueiredo, David Elumeze

机构 * ExplorAI, Department of Computer Science, University of Regina(ExplorAI,计算机科学系,里嘉大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14101 2025-10-24 cs.CL 57%

MultiHal: Multilingual Dataset for Knowledge-Graph Grounded Evaluation of LLM Hallucinations

Ernests Lavrinovics, Russa Biswas, Katja Hose, Johannes Bjerva

机构 * Department of Computer Science, Aalborg University(计算机科学系,奥胡斯大学) Institute of Logic and Computation, TU Wien(逻辑与计算研究所,维也纳技术大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20934 2025-10-17 cs.SE cs.AI 57%

Leveraging LLMs, IDEs, and Semantic Embeddings for Automated Move Method Refactoring

Abhiram Bellur, Fraol Batole, Mohammed Raihan Ullah, Malinda Dilhara, Yaroslav Zharov, Timofey Bryksin, Kai Ishikawa, Haifeng Chen, Masaharu Morimoto, Shota Motoura, Takeo Hosomi, Tien N. Nguyen, Hridesh Rajan, Nikolaos Tsantalis, Danny Dig

机构 * University of Colorado(科罗拉多大学) Tulane University(路易斯安那州立大学) Amazon Web Services(亚马逊网络服务) JetBrains Research(JetBrains研究) NEC Corporation(日本电报电话公司) NEC Laboratories America(日本电报电话美洲实验室) University of Texas at Dallas(德克萨斯大学达拉斯分校) Concordia University(康科迪亚大学) University of Colorado, JetBrains Research(科罗拉多大学,JetBrains研究)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments Published at the International Conference on Software Maintenance and Evolution (ICSME'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08648 2025-10-13 cs.LG cs.AI 57%

Inverse-Free Wilson Loops for Transformers: A Practical Diagnostic for Invariance and Order Sensitivity

Edward Y. Chang, Ethan Y. Chang

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments 24 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07920 2025-10-10 cs.AI 57%

Profit Mirage: Revisiting Information Leakage in LLM-based Financial Agents

Xiangyu Li, Yawen Zeng, Xiaofen Xing, Jin Xu, Xiangmin Xu

机构 * South China University of Technology(华南理工大学) Pazhou Lab(黄埔实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18178 2025-10-02 cs.AI cs.CE cs.LG 57%

Foam-Agent 2.0: An End-to-End Composable Multi-Agent Framework for Automating CFD Simulation in OpenFOAM

Ling Yue, Nithin Somasekharan, Tingwen Zhang, Yadi Cao, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) University of California San Diego(加州大学圣地亚哥分校)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22678 2025-10-02 cs.CL 57%

Self-Evolving Multi-Agent Simulations for Realistic Clinical Interactions

Mohammad Almansoori, Komal Kumar, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

Comments 14 page, 4 figures, 61 references, presented in MICCAI (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25197 2025-10-01 cs.SE cs.AI cs.PL 57%

Towards Repository-Level Program Verification with Large Language Models

Si Cheng Zhong, Xujie Si

机构 * University of Toronto(多伦多大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

Comments Accepted to LMPL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21969 2025-09-29 cs.RO cs.AI 57%

DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation

Tianjun Gu, Linfeng Li, Xuhong Wang, Chenghua Gong, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19218 2025-09-24 cs.CV cs.AI 57%

HyKid: An Open MRI Dataset with Expert-Annotated Multi-Structure and Choroid Plexus in Pediatric Hydrocephalus

Yunzhi Xu, Yushuang Ding, Hu Sun, Hongxi Zhang, Li Zhao

机构 * College of Biomedical Engineering and Instrument Science, Zhejiang University, Hangzhou, China(浙江大学生物医学工程与仪器科学学院) Department of Radiology, Children’s Hospital, Zhejiang University School of Medicine, National Clinical Research Center for Child Health, Hangzhou, China(浙江大学医学院儿童医院放射科) Neurosurgery of Zhejiang Hospital, Hangzhou, China(浙江医院神经外科)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.AI

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18868 2025-09-24 cs.AI 57%

Memory in Large Language Models: Mechanisms, Evaluation and Evolution

Dianxing Zhang, Wendong Li, Kani Song, Jiaye Lu, Gang Li, Liuchun Yang, Sheng Li

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments 50 pages, 1 figure, 8 tables This is a survey/framework paper on LLM memory mechanisms and evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06412 2025-09-09 cs.DL cs.IR 57%

Compare: A Framework for Scientific Comparisons

Moritz Staudinger, Wojciech Kusa, Matteo Cancellieri, David Pride, Petr Knoth, Allan Hanbury

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR

Comments Accepted at CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07968 2025-09-09 cs.CL 57%

Assessing and Mitigating Medical Knowledge Drift and Conflicts in Large Language Models

Weiyi Wu, Xinwen Xu, Chongyang Gao, Xingjian Diao, Siting Li, Lucas A. Salas, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) Massachusetts General Hospital(麻省总医院) Northwestern University(西北大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05225 2025-09-04 cs.CL 57%

QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluation

Mengze Hong, Wailing Ng, Chen Jason Zhang, Di Jiang

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank公司人工智能部)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Main Conference. Homepage: https://github.com/mengze-hong/QualBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10701 2025-08-15 cs.LG cs.AI 57%

REFN: A Reinforcement-Learning-From-Network Framework against 1-day/n-day Exploitations

Tianlong Yu, Lihong Liu, Ziyi Zhou, Fudu Xing, Kailong Wang, Yang Yang

机构 * School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Huazhong University of Science and Technology(华中科技大学) University of Southern California(美国南加州大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06851 2025-08-12 cs.AI cs.CY 57%

MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams

Pengfei Zhou, Xiaopeng Peng, Fanrui Zhang, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Zekai Li, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) USTC(中国科学技术大学) RIT(罗切斯特理工学院) HIT(哈尔滨工业大学) WHU(武汉大学) MBZUAI(马克斯·普朗克人工智能研究所) NUS(新加坡国立大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments 35 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15715 2025-08-07 cs.CL astro-ph.IM 57%

From Queries to Criteria: Understanding How Astronomers Evaluate LLMs

Alina Hyk, Kiera McCormick, Mian Zhong, Ioana Ciucă, Sanjib Sharma, John F Wu, J. E. G. Peek, Kartheik G. Iyer, Ziang Xiao, Anjalie Field

机构 * Oregon State University(俄勒冈州立大学) Loyola University Maryland(马里兰洛约纳大学) Johns Hopkins University(约翰霍普金斯大学) Stanford University(斯坦福大学) Space Telescope Science Institute(空间望远镜科学研究所) Columbia University(哥伦比亚大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

Comments Accepted to the Conference on Language Modeling 2025 (COLM), 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01746 2025-08-05 cs.AI 57%

Bayes-Entropy Collaborative Driven Agents for Research Hypotheses Generation and Optimization

Shiyang Duan, Yuan Tian, Qi Bing, Xiaowei Shao

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments Corresponding author: Xiaowei Shao. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23588 2025-08-01 cs.CL 57%

DiffLoRA: Differential Low-Rank Adapters for Large Language Models

Alexandre Misrahi, Nadezhda Chirkova, Maxime Louis, Vassilina Nikoulina

机构 * EPFL(瑞士联邦理工学院) NAVER LABS Europe(NAVER LABS欧洲)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21815 2025-07-30 cs.CL cs.CY 57%

HRIPBench: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs

Kaixuan Wang, Chenxin Diao, Jason T. Jacques, Zhongliang Guo, Shuai Zhao

机构 * University of St. Andrews(圣安德鲁大学) University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

Comments 15 pages, 5 figures, 12 tables, a dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16809 2025-07-25 cs.CL 57%

LingBench++: A Linguistically-Informed Benchmark and Reasoning Framework for Multi-Step and Cross-Cultural Inference with LLMs

Da-Chen Lian, Ri-Sheng Huang, Pin-Er Chen, Chunki Lim, You-Kuan Lin, Guan-Yu Tseng, Zi-Cheng Yang, Zhen-Yu Lin, Pin-Cheng Chen, Shu-Kai Hsieh

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL

Comments 42p, 17f, 10t. Revisions: Merged paragraphs in Intro to emphasize contributions. Clarified benchmark design (Sec 3.5.1). Added single-agent, OpenAI-guided & 6-round experiments (Sec 5.2). Note: we only ran each experiment once; statistical tests are needed for strong claims. Revised Sec 6. Added acknowledgements, 2 new co-authors, and corrected typos/grammar

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12367 2025-07-23 cs.SE cs.AI cs.PL 57%

GitChameleon 2.0: Evaluating AI Code Generation Against Python Library Version Incompatibilities

Diganta Misra, Nizar Islah, Victor May, Brice Rauby, Zihan Wang, Justine Gehring, Antonio Orvieto, Muawiz Chaudhary, Eilif B. Muller, Irina Rish, Samira Ebrahimi Kahou, Massimo Caccia

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) MPI-IS Tübingen(图宾根MPI研究所) Mila Quebec AI Institute(魁北克AI研究所) Google(谷歌) Polytechnique Montréal(蒙特利尔高等理工学院) McGill University(麦吉尔大学) Moderne(Moderne公司) Gologic(Gologic公司) Tübingen AI Center(图宾根人工智能中心) Université de Montréal(蒙特利尔大学) ServiceNow Research(ServiceNow研究)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

Comments Version 2 of the dataset from: arXiv:2411.05830

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21536 2025-07-17 cs.AI cs.HC 57%

PsyLite Technical Report

Fangjun Ding, Renyu Zhang, Xinyu Feng, Chengye Xie, Zheng Zhang, Yanting Zhang

机构 * Donghua University(东华大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏