ELOQ: Resources for Enhancing LLM Detection of Out-of-Scope Questions
机构 * Santa Clara University(圣克拉拉大学) ; Adobe Inc.(Adobe公司)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted by SIGIR'25
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
机构 * Santa Clara University(圣克拉拉大学) ; Adobe Inc.(Adobe公司)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted by SIGIR'25
机构 * DCST, Tsinghua University(清华大学数据科学研究院)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Work in progress
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);retriever(abstract)
Comments Accepted to NAACL 2025 Main Track
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted in 2024 IEEE International Conference on Big Data (IEEE BigData)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted by NeurIPS 2024 (poster)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted by CCIR 2024
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments 8 pages plus references, 4 main figures, 6 pages of supplementary material
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments 12 pages, 5 figures, 6 tables, Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024) @ NAACL 2024
专题命中 RAG评测 :RAG(abstract,comments);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
Comments This article is 16 pages long and includes detailed comparisons of RAG systems and document splitting techniques
Journal ref Access-2024-36001
一个用于新产品概念评估的交互式多智能体系统
专题命中 RAG评测 :retrieval-augmented generation(abstract,comments);RAG(abstract,comments);分类 cs.AI
AI总结 本文提出基于大型语言模型的多智能体系统,用于自动化评估新产品概念的技术可行性和市场可行性,通过结构化讨论和专业数据微调,验证概念并提升判断准确性。
Comments 46 pages, 3 figures + This paper proposes an LLM-based multi-agent system (MAS) for automated evaluation of new product concepts, incorporating retrieval-augmented generation (RAG) and cross-functional virtual agents to assess technical and market feasibility
专题命中 RAG评测 :RAG(title);分类 cs.CL
Comments 13 pages, 3 figures
AnchorBench:针对大语言模型中锚定效应的多路径基准测试
机构 * Saarland University(萨尔大学) ; Hamburg University of Technology(汉堡工业大学) ; Helmholtz-Zentrum Hereon(亥姆霍兹中心赫伦) ; German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文推出针对大语言模型锚定效应的基准测试AnchorBench,经14种模型实验,揭示锚定效应的路径依赖性等特性,发现高控制准确率的前沿模型仍易受合理锚点影响。
Comments Published as a conference paper at COLM 2026
角色设定作为基于大语言模型的信息检索评估的评估者敏感性探测工具
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI
AI总结 本研究以角色设定为探测工具,分析基于大语言模型的IR评估中评估者敏感性,发现高容量模型能保持系统排序一致性,角色来源影响小于评估者角色和模型容量。
Comments Accepted at CIKM 2026
MemArena:面向移动端智能体个人记忆助手的大规模自我中心基准测试
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究针对现有记忆基准测试的不足,构建了MemArena基准,评估了不同记忆后端对移动端个人记忆助手的影响,发现后端选择对内容准确性影响更大,权限感知访问失效,搜索延迟仅在阅读器规模极小时有影响。
Comments 48 pages, 6 figures
OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现
机构 * OpenAI
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI
AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。
Comments 13 pages, two graphs
MemTrace:大型语言模型记忆系统中的错误追踪与归因
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出MemTrace框架,通过构建可执行的记忆演化图实现细粒度错误追踪,并利用自动归因方法定位根因,进而优化提示词提升下游任务性能。
Comments Ongoing work
并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉
机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。
Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026
DeepTutor:迈向代理式个性化辅导
机构 * The University of Hong Kong(香港大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。
Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor
通过增量多轮交互评估LLM代理的记忆能力
机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MemoryAgentBench,通过多轮交互模拟记忆代理的信息积累过程,评估准确检索、测试时学习、长程理解与选择性遗忘四项核心能力。
Comments Y. Hu and Y. Wang contribute equally
告知、指导、共情、倾听:审计LLM护理支持角色
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; OSF HealthCare(OSF医疗集团) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。
基于解耦表示的分布式智能体协作隐私保护文本净化
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出DiSan框架,通过解耦文本为任务语义和风格子空间,结合联邦原型对齐与对抗正则化,在分布式多智能体协作中实现隐私保护,显著降低风格归因和PII泄露。
用户侧记忆中的子模块不对称性:一个诊断框架
机构 * EpistemicaLab — Independent Research(EpistemicaLab — 独立研究)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出一个诊断框架,将LLM用户侧记忆分解为行为一致性、事实存在和事实缺失三个正交子模块,发现参数记忆与检索记忆在不同子模块上存在不对称性,且RLHF调优加剧了这种不对称性。
Comments Preprint. Code: https://github.com/EpistemicaLab/substrate-asymmetry-memory
Code2LoRA:用于软件演化下代码语言模型的超网络生成适配器
机构 * University of Waterloo(滑铁卢大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出Code2LoRA超网络框架,通过生成仓库特定的LoRA适配器注入仓库知识,无需推理时令牌开销,支持静态和演化两种场景,在RepoPeftBench上达到与逐仓库LoRA相当或更优的性能。
基于注意力图拓扑分歧的LLM幻觉检测
机构 * Applied AI Institute(应用人工智能研究所) ; SB AI Lab(SB人工智能实验室) ; HSE University(俄罗斯高等经济学院) ; CNRS, Universite Paris Cite(法国国家科学研究中心,巴黎Cité大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出TOHA方法,通过分析注意力矩阵的拓扑结构来检测LLM中的幻觉现象,实验表明该方法在多个基准测试中表现优异,且对标注数据和计算资源需求较低。
Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
通过归因视角对法律问答中的引用质量进行重排序
机构 * Technical University of Munich(慕尼黑技术大学)
专题命中 RAG评测 :retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL
AI总结 针对法律问答中检索增强生成系统的引用质量问题,提出基于扰动归因分数训练轻量级交叉编码器对候选段落重排序,显著提升引用忠实度并与专家答案对齐。
Comments 11 pages, 4 tables, 1 figure. Published at ASAIL 2026 (8th Workshop on Automated Semantic Analysis of Information in Legal Text), co-located with ICAIL 2026, Singapore
MINTEval: 评估长时间跨度智能体系统中的多目标干扰下的记忆
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出MINTEval基准,用于评估智能体在长时间跨度和多目标干扰下的记忆表现,通过长连接上下文、多领域和多类型问题来测试记忆增强代理的鲁棒性和泛化能力。
Comments Equal contribution; order decided by a coin flip. Code and data: https://github.com/amy-hyunji/MINTEval