arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1205 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1205 篇

2510.04704 2026-05-29 cond-mat.mtrl-sci cs.AI cs.CL 62%

AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials

AtomWorld: 评估大型语言模型在晶体材料空间推理能力的基准

Taoyuze Lv, Alexander Chen, Fengyu Xie, Chu Wu, Jeffrey Meng, Dongzhan Zhou, Yingheng Wang, Bram Hoex, Zhicheng Zhong, Tong Xie

机构 * University of New South Wales, NSW, Sydney, Australia(新南威尔士大学,新州,悉尼,澳大利亚) Suzhou Institute for Advanced Research, University of Science(苏州先进研究院,科学大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Cornell University(康奈尔大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 提出AtomWorld基准,通过十种基本原子结构操作评估LLM在材料科学中的空间推理能力,发现Claude Opus 4.6表现最佳但复杂空间关系操作成功率低,表明LLM更适合作为辅助工具而非完全自主的科研代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19341 2026-05-20 cs.CL cs.AI cs.LG stat.ML 62%

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

HalluWorld: 一个用于通过参考世界模型控制幻觉的基准

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * Carnegie Mellon University(卡内基梅隆大学) Patronus AI Independent Researcher(独立研究者) Stanford University(斯坦福大学) The Ohio State University(俄亥俄州立大学) DegenAI Labs(DegenAI实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HalluWorld基准,通过显式参考世界模型研究语言模型的幻觉问题,发现不同任务中幻觉表现不一致,表明幻觉源于多种失败模式而非单一能力。

Comments HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13295 2026-05-14 cs.CL cs.AI cs.MA 62%

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE:通过对比信用分配优化代理系统

Tom Zehle

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute(埃里克·林斯研究所) Tübingen(图宾根)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CANTANTE框架,通过对比多个联合配置的rollouts分解系统奖励为单个代理的更新信号,提升多代理系统优化效果,在编程、数学推理和多跳问答任务中均取得最佳排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14952 2026-04-28 cs.CL cs.AI 62%

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

CorpusQA:一个1000万词的语料库分析与推理基准

Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen, Ming Yan, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20869 2026-04-24 cs.CY cs.AI cs.HC cs.IR cs.LG 62%

Clinical Reasoning AI for Oncology Treatment Planning: A Multi-Specialty Case-Based Evaluation

肿瘤治疗规划的临床推理AI:多专科基于病例的评估

Philippe E. Spiess, Md Muntasir Zitu, Alison Walker, Daniel A. Anaya, Robert M. Wenham, Michael Vogelbaum, Daniel Grass, Ali-Musa Jaffer, Amod Sarnaik, Caitlin McMullen, Christine Sam, John V. Kiluk, Tianshi Liu, Tiago Biachi, Julio Powsang, Jing-Yi Chern, Roger Li, Seth Felder, Samuel Reynolds, Michael Shafique, Alison Sheehan, Ashley Layman, Cydney A. Warfield, Derrick Legoas, Jaclyn Parrinello, Jena Schmitz, Kevin Eaton, Mark Honor, Luis Felipe, Issam ElNaqa, Elier Delgado, Talia Berler, Rachael V. Phillips, Frantz Francisque, Carlos Garcia Fernandez, Gilmer Valdes

机构 * Moffitt Cancer Center and Research Institute(莫菲特癌症中心与研究学院) Innova Montréal Inc.(蒙特利尔创新公司) Oncobrain, Inc.(Oncobrain公司) Advanced Cancer Treatment Centers(先进癌症治疗中心)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 本文评估了OncoBrain在多专科病例中的表现,展示了其在肿瘤治疗规划中的准确性、安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20182 2026-04-22 cs.CL cs.AI 62%

FaithLens: Detecting and Explaining Faithfulness Hallucination

FaithLens:检测并解释忠实性幻觉

Shuzheng Si, Qingyi Wang, Haozhe Zhao, Yuzhuo Bai, Guanqiao Chen, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Peking University(北京大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FaithLens模型,通过合成训练数据和规则强化学习,有效检测并解释大语言模型中的忠实性幻觉,优于GPT-5.2和o3模型,提升可信度与效率。

Comments ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14554 2026-04-20 cs.CL cs.AI 62%

VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models

VLegal-Bench: 用于大型语言模型越南法律推理的认知导向基准

Nguyen Tien Dong, Minh-Anh Nguyen, Thanh Dat Hoang, Nguyen Tuan Ngoc, Dao Xuan Quang Minh, Phan Phi Hai, Nguyen Thi Ngoc Anh, Dang Van Tu, Binh Vu

机构 * CMC OpenAI VinUniversity HUST SRH University Heidelberg

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 VLegal-Bench是首个系统评估大型语言模型在越南法律任务上的基准,包含10450个样本,通过严格标注流程确保样本基于权威法律文件,涵盖法律问题解答、检索增强生成、多步推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11563 2026-04-14 cs.CL cs.AI cs.LG 62%

Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo

Synthius-Mem: 基于大脑启发的hallucination抵抗性人格记忆实现94.4%的记忆准确率和99.6%的对抗鲁棒性于LoCoMo

Artem Gadzhiev, Andrew Kislov

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 Synthius-Mem通过结构化人格记忆系统在LoCoMo基准上实现94.4%的记忆准确率和99.6%的对抗鲁棒性,优于现有系统并超越人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18019 2026-04-10 cs.CL cs.AI cs.SE 62%

BenchBrowser: Retrieving Evidence for Evaluating Benchmark Validity

BenchBrowser:用于评估基准有效性证据的检索

Harshita Diddee, Gregory Yauney, Swabha Swayamdipta, Daphne Ippolito

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系)

专题命中 RAG评测 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 BenchBrowser通过检索20个基准测试集中的相关评估项目,帮助评估者诊断基准测试在内容有效性与收敛有效性上的不足,从而弥补实践者意图与实际测试内容之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05424 2026-04-08 cs.AI cs.CL 62%

PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection

PRISM-MCTS: 通过元认知反思学习推理轨迹

Siyuan Cheng, Bozhong Tian, YanChao Hao, Zheng Wei

机构 * Tencent PCG(腾讯PCG)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 PRISM-MCTS通过整合过程奖励模型和动态共享内存,有效捕捉启发式与谬误,提升推理效率,减少轨迹需求,在多个推理基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21329 2026-03-24 cs.IR cs.AI 62%

COINBench: Moving Beyond Individual Perspectives to Collective Intent Understanding

COINBench: 超越个体视角到集体意图理解

Xiaozhe Li, Tianyi Lyu, Siyi Yang, Yizhao Yang, Yuxi Gong, Jinxuan Huang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) CurrentsAI Research(CurrentsAI研究院)

专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.AI

AI总结 COINBench通过动态实时更新的基准测试,评估大语言模型在消费者领域集体意图理解能力,揭示当前模型在复杂意图合成分析深度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19268 2026-03-23 cs.CL cs.AI 62%

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

面向燃烧科学的全栈领域增强:构建与优化

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen

机构 * Peking University(北京大学) AI for Science Institute, Beijing(AI for Science研究院,北京)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个针对燃烧科学的全栈领域增强LLM工作流程,整合自动领域语料构建、增量预训练、指令微调及可验证奖励强化学习,构建标准化评估基准FlameBench,显著提升燃烧科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17386 2026-03-19 cs.IR cs.CL 62%

PJB: A Reasoning-Aware Benchmark for Person-Job Retrieval

PJB:用于人-职位检索的推理感知基准

Guangzhi Wang, Xiaohui Yang, Kai Li, Jiawen He, Kai Yang, Ruixuan Zhang, Zhi Liu

机构 * CareerInternational Research Team(CareerInternational研究团队)

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 PJB基准通过引入领域家族和推理类型标签,揭示人-职位检索系统在不同行业中的性能差异,指出模块升级和重排序对性能的影响不同,强调其在招聘检索系统中的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11578 2026-03-17 cs.CL cs.AI 62%

Multi-Agent LLMs for Generating Research Limitations

多智能体大语言模型用于生成研究局限性

Ibrahim Al Azher, Zhishuai Guo, Hamed Alhoori

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多智能体框架生成研究局限性,结合OpenReview评论和作者声明,利用引用论文捕捉上下文缺陷,通过不同角色智能体系统识别显性、隐性、同行评审和文献相关局限性,提升局限性描述的准确性。

Comments 18 Pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04454 2026-03-06 cs.CL cs.AI 62%

Query Disambiguation via Answer-Free Context: Doubling Performance on Humanity's Last Exam

通过无答案上下文进行查询消歧:在人类最后一场考试中性能翻倍

Michael Majurski, Cynthia Matuszek

机构 * National Institute of Standards and Technology(国家标准与技术研究院) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 通过无答案上下文重写问题以减少歧义,显著提升模型在Humanity's Last Exam上的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12843 2026-03-04 cs.CL cs.AI 62%

NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions

NutriBench:一个用于评估大语言模型从餐食描述中估算营养的基准数据集

Andong Hua, Mehak Preet Dhaliwal, Laya Pullela, Ryan Burke, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 NutriBench通过评估大语言模型在餐食描述中估算营养的能力,为营养估算提供了新的研究方向和应用可能性。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03693 2026-02-04 cs.CL cs.AI 62%

OCRTurk: A Comprehensive OCR Benchmark for Turkish

OCRTurk:土耳其的综合OCR基准

Deniz Yılmaz, Evren Ayberk Munis, Çağrı Toraman, Süha Kağan Köse, Burak Aktaş, Mehmet Can Baytekin, Bilge Kaan Görür

机构 * Middle East Technical University, Computer Engineering Department(中东部技术大学,计算机工程系) Politecnico di Torino(托里诺理工大学) Roketsan Inc.(罗克特兰公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 OCRTurk是一个针对土耳其语文档解析的综合基准测试,通过多难度级别和多种文档类型评估七种OCR模型,发现PaddleOCR在多数指标上表现最佳,但幻灯片文档对模型构成挑战。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01885 2026-02-03 cs.CL cs.AI 62%

ES-MemEval: Benchmarking Conversational Agents on Personalized Long-Term Emotional Support

ES-MemEval:在个性化长期情感支持中评估对话代理的基准测试

Tiantian Chen, Jiaqi Lu, Ying Shen, Lin Zhang

机构 * Tongji University(同济大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 ES-MemEval通过评估长期情感支持中的记忆能力,揭示了显式长期记忆对减少幻觉和提升个性化的重要性,同时指出了检索增强模型在时间动态方面的局限性。

Comments 12 pages, 7 figures. Accepted to The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16584 2026-02-03 cs.CL cs.AI 62%

From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations

从分数到步骤:诊断和改进证据医学计算中LLM的性能

Benlu Wang, Iris Xia, Yifan Zhang, Junda Wang, Feiyun Ouyang, Shuo Han, Arman Cohan, Hong Yu, Zonghai Yao

机构 * Department of Computer Science, Yale University, CT, USA(耶鲁大学计算机科学系) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗中心健康组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(UMass洛厄尔矿尔计算机与信息科学学院) Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(UMass阿默斯特马宁信息与计算机科学学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedRaC框架,通过分步评估和代码执行提升LLM在证据医学计算中的准确性,揭示现有评估方法的不足,并推动临床可信度的提升。

Comments Equal contribution for the first two authors. To appear as an Oral presentation in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22911 2026-02-02 cs.CL cs.AI 62%

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing

ElectriQ:一个评估大型语言模型在电力营销中响应能力的基准

Jinzhi Wang, Qingke Peng, Haozhou Li, Zeyuan Zeng, Jiangbo Zhang, Kaixuan Yang, Ningyong Wu, Qinfeng Song, Ruimeng Li, Biyi Zhou

机构 * Systems Engineering Institute, Xi’an Jiaotong University(系统工程研究所,西安交通大学) State Key Laboratory of Multiphase Flow in Power Engineering, School of Energy and Power Engineering, Xi’an Jiaotong University(电力工程多相流国家重点实验室,能源与动力工程学院,西安交通大学) School of Electronic Science and Engineering, Xi'an Jiaotong University(电子科学与工程学院,西安交通大学) Organizational Management Department, School of Management, Xi’an Jiaotong University(组织管理部,管理学院,西安交通大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 ElectriQ是一个用于评估大型语言模型在电力营销中响应能力的基准,通过结合人类评分、自动指标和合规测试,提出SEEK-RAG方法提升领域知识注入,实现高效且合规的电力营销助手部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20276 2026-01-29 cs.CL cs.AI 62%

Beyond the Needle's Illusion: Decoupled Evaluation of Evidence Access and Use under Semantic Interference at 326M-Token Scale

超越针的错觉:在32600万token规模下解耦证据访问和使用下的语义干扰评估

Tianwei Lin, Zuyi Zhou, Xinda Zhao, Chenke Wang, Xiaohong Li, Yu Chen, Chuanrui Hu, Jian Pei, Yafeng Deng

机构 * EverMind Shanda Group(Shanda集团) Duke University(杜克大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMB-S基准,用于评估长上下文模型在大规模语义干扰下的证据访问与使用能力,揭示语义辨别是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09723 2026-01-16 cs.CL cs.AI 62%

SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels

SagaScale: 一种真实、可扩展且高质量的长上下文基准,基于完整小说构建

Guancheng Du, Yong Hu, Wenqing Wang, Yaming Yang, Jiaheng Gao

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 SagaScale基于完整小说构建,提供长上下文基准,通过自动化数据收集管道,评估12个LLMs和三种方法,揭示LLM在长上下文处理中的表现差异及Agentic RAG的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07226 2026-01-13 cs.AI cs.CL 62%

Lost in the Noise: How Reasoning Models Fail with Contextual Distractors

陷入噪声中:推理模型在上下文干扰中的失败

Seongyun Lee, Yongrae Jo, Minju Seo, Moontae Lee, Minjoon Seo

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RARE方法,通过激励识别噪声中的有用信息,提升模型在上下文干扰下的鲁棒性,揭示增加计算量反而导致噪声环境下性能下降的反比例趋势。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04770 2026-01-13 cs.AI cs.DB 62%

SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence

SciIF: 科学指令遵循基准测试以实现严谨的科学智能

Encheng Su, Jianyu Wu, Chen Tang, Lintao Wang, Pengze Li, Aoran Wang, Jinouwen Zhang, Yizhou Wang, Yuan Meng, Xinzhu Ma, Shixiang Tang, Houqiang Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Fudan University(复旦大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI、cs.DB

AI总结 SciIF是一个评估模型在科学问题解决中严格遵守约束条件能力的多学科基准测试,通过显式证据验证科学有效性,提升LLM在科学逻辑框架中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10662 2026-01-13 cs.CL cs.AI 62%

Evaluation of the Automated Labeling Method for Taxonomic Nomenclature Through Prompt-Optimized Large Language Model

通过提示优化的大型语言模型评估自动标注方法在分类学命名中的应用

Keito Inoshita, Kota Nojiri, Haruto Sugeno, Takumi Taga

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提示优化的大型语言模型评估了自动标注方法在分类学命名中的可行性,发现其在形态、地理和人名类别中表现良好,但在生态与行为及文化背景类别中存在挑战。

Comments This paper was accepted by IEEE IAICT

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18565 2026-01-01 cs.CL cs.AI 62%

Bielik 7B v0.1: A Polish Language Model -- Development, Insights, and Evaluation

Bielik 7B v0.1:波兰语言模型——开发、见解与评估

Krzysztof Ociepa, Łukasz Flis, Krzysztof Wróbel, Adrian Gwoździej, Remigiusz Kinas

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 7B v0.1通过创新技术提升波兰语处理能力,实现多项NLP任务性能提升,为语言AI发展提供新基准。

Journal ref Computer Science 26(4) (2025) 131-161

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20949 2025-12-25 cs.CL cs.AI 62%

Neural Probe-Based Hallucination Detection for Large Language Models

基于神经探针的大型语言模型幻觉检测

Shize Liang, Hongzhi Wang

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于神经网络的token级幻觉检测框架,通过冻结语言模型参数并使用MLP探针进行非线性建模,结合多目标损失函数和贝叶斯优化,实现对LLMs幻觉内容的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18749 2025-11-25 cs.CL cs.CY cs.IR 62%

Large Language Models Require Curated Context for Reliable Political Fact-Checking -- Even with Reasoning and Web Search

大语言模型需要经过筛选的上下文才能可靠地进行政治事实核查——即使有推理和网络搜索

Matthew R. DeVerna, Kai-Cheng Yang, Harry Yaojun Yan, Filippo Menczer

专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.CL

AI总结 大语言模型需通过筛选的上下文提升政治事实核查的可靠性,定制RAG系统显著提升宏F1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19843 2025-11-18 cs.CR cs.AI cs.CL 62%

SoK: Large Language Model Copyright Auditing via Fingerprinting

Shuo Shao, Yiming Li, Yu He, Hongwei Yao, Wenyuan Yang, Dacheng Tao, Zhan Qin

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Sun Yat-Sen University(中山大学)

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26457 2025-10-31 cs.SE cs.AI cs.CL 62%

SecureReviewer: Enhancing Large Language Models for Secure Code Review through Secure-aware Fine-tuning

Fang Liu, Simiao Liu, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * 1 State Key Laboratory of Complex \& Critical Software Environment, School of Computer Science Engineering, Beihang University, China

专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI

Comments Accepted by ICSE 2026. Code and data: https://github.com/SIMIAO515/SecureReviewer

详情

展开后加载摘要…

URL PDF HTML 收藏