A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting
专题命中 RAG评测 :retrieval augmented generation(abstract);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :retrieval augmented generation(abstract);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL
专题命中 RAG评测 :retrieval augmented generation(abstract);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted at the AAAI 2025 Artificial Intelligence for Social Impact Track (AAAI-AISI 2025)
专题命中 RAG评测 :RAG(abstract);retriever(abstract);knowledge retrieval(abstract);分类 cs.CL、cs.AI
RubricRAG: 通过领域知识检索实现可解释且可靠的LLM评估
机构 * Department of Computer Science(计算机科学系) ; Emory University(埃默里大学)
专题命中 RAG评测 :knowledge retrieval(title);分类 cs.IR、cs.CL、cs.AI
AI总结 本文提出RubricRAG,通过领域知识检索生成可解释的评估 rubric,提升LLM评估的透明性和有效性。
利用 RAG-LLMs 进行城市交通模拟与分析
机构 * Centre for Research Training in Machine Learning (ML-Labs)(机器学习研究培训中心(ML实验室)) ; Dublin City University(都柏林城市大学) ; Insight Centre for Data Analytics(数据分析洞察中心) ; School of Electronic Engineering(电子工程学院)
专题命中 RAG评测 :RAG(title,abstract)
AI总结 本文提出基于 RAG-LLMs 的共享电动交通平台,通过个性化路线推荐和 schema-level RAG 框架提升交通模拟与分析效率。
基于机器学习算法的RAG检索质量分析与评估预测
专题命中 RAG评测 :RAG(title,abstract)
AI总结 本文提出基于XGBoost和粒子群优化的模型,通过分析文档相关性与答案质量的正相关性,改进RAG系统的检索质量与生成效果。
机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程大学)
专题命中 RAG评测 :RAG(title,abstract)
机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,莫纳什大学) ; Faculty of Law, Monash University(法学院,莫纳什大学)
专题命中 RAG评测 :RAG(title);分类 cs.IR、cs.CL、cs.AI
Comments For code, data, and models see https://auslawbench.github.io
BLADE:通过对话和解释提升语言答案
机构 * University of Florida(佛罗里达大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 BLADE通过引导学习者接触相关教学资源而非直接提供答案,提升学生对课程资源的导航能力和概念理解。
Comments Contains 7 figures
用于结直肠癌治疗规划的智能体生成式大语言模型
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。
智能体自动驾驶显微镜基准测试支持性能验证,但不一定能泛化到未见任务
机构 * Carl Zeiss Research Microscopy Solutions(卡尔蔡司研究显微镜解决方案)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本研究开发基准框架评估显微镜智能体架构等因素的性能,发现其虽可用于验证比较,但现有基准无法预测智能体在未见显微镜任务上的表现。
Comments 20 pages, 8 figures
通过语义等价对抗攻击引出大语言模型的内在幻觉
机构 * Imperial College London(帝国理工学院) ; Safe Intelligence(安全智能研究院)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文提出新框架,通过语义等价对抗攻击测试LLMs鲁棒性,发现先进模型易受语义保留扰动影响致忠实度大幅下降,凸显需开发鲁棒接地的LLM架构与训练目标。
Comments To be presented at COLM 2026
了解你的来源:用于媒体背景核查的公共知识库
机构 * Cardiff University(卡迪夫大学) ; Queen Mary University of London(伦敦大学女王学院)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 针对检索增强生成中证据来源可靠性问题,提出公开知识库MEDIAREF,支持可复现的低成本媒体背景核查生成,评估多种大语言模型并证明其有效性。
Comments Code and Data: https://github.com/nedjmaou/mediaref
Agent-UCT:应用于树的上置信界,用于具有成本意识的智能工作流优化
机构 * The University of Hong Kong(香港大学) ; School of Artificial Intelligence, Jiangxi Science and Technology Normal University(江西科技师范大学人工智能学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; University of Science and Technology of China(中国科学技术大学) ; New York University(纽约大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 研究针对智能工作流优化中计算冗余和预算分配低效问题,提出Agent-UCT算法,结合RAGSpace框架和WTB,通过重用感知正则化项减少冗余执行,实验证明其能有效识别最佳配置,实现成本感知、可重现且组合高效的智能工作流优化。
学习参与助手(LEA):智能AI辅导系统的跨课程可扩展性与课堂评估
机构 * Faculty of Design, Informatics and Business(设计、信息学与商业学院)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 研究LEA智能AI辅导系统,首次在真实学生中进行课堂部署并测试跨课程可扩展性,发现模拟与实际有差异,基于RAGAS评估答案相关性等指标,表明编排层无需改,下游组件课程无关性待进一步研究。
Comments Extended version of a paper presented at ICAART 2026. Manuscript under review at SN Computer Science (Springer). 32 pages, 3 figures, 6 tables
用于主动企业智能体的上下文图
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 研究旨在让企业智能体更主动,提出上下文图结构,定义相关检测引擎、评分器和呈现层,形式化组件并给出Python实现,经案例研究评估,该方法提升了Precision@5,降低误报率和平均呈现时间。
生成式人工智能工作流程中的特权与保密性
机构 * University of Bristol Law School(布里斯托大学法学院) ; University of Oxford(牛津大学) ; Department of Computer Science(计算机科学系)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 研究生成式人工智能系统三种数据存储和处理模式带来的保密性与法律专业特权风险,结合英美判决、权威及研究进行分析,置于监管框架和专业疏忽原则中探讨,助法律服务人员理解风险,推动GenAI更负责任部署。
大语言模型在研究级数学问题上的失败模式:分类与实证刻画
机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。
可验证的清单签名与透明度强制:面向基于MCP的安全LLM流水线
机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院) ; SæT Laboratory, Polytechnique Montréal(SæT实验室,蒙特利尔理工学院)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 针对MCP协议缺乏工具清单认证的问题,提出清单级强制层,通过策略验证、新鲜度检查、数字签名、执行前验证和Merkle透明度日志,实现低开销、可追溯的LLM工具调用安全控制。
面向高风险推理的多智能体审计框架:临床心理健康筛查中的评估与可解释性
机构 * Duke Kunshan University(昆山杜克大学)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);knowledge retrieval(abstract);分类 cs.CL
AI总结 提出多智能体审计框架,通过感知、知识检索、思维链推理和审计验证的多步协作,在临床心理健康筛查中降低PHQ-8抑郁预测误差,提升可解释性。
MedAI: 评估 TxAgent 在 NeurIPS CURE-Bench 竞赛中的治疗性智能推理
机构 * L3S Research Center(L3S研究中心)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文介绍 TxAgent,一种通过迭代检索增强生成和统一生物医学工具集进行治疗决策的智能AI方法,并在CURE-Bench竞赛中评估其推理质量,通过改进工具检索策略提升性能,荣获开放科学卓越奖。
Comments 7 pages, 3 figures
VietMed-MCQ:面向越南传统医学评估的一致性过滤数据合成框架
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 提出基于检索增强生成和一致性过滤的VietMed-MCQ数据集,含3190道多选题,经专家验证准确率94.2%,基准测试显示通用模型优于越南语模型。
Comments The authors have withdrawn this article because the current version is still undergoing substantial revision. Several components of the data synthesis framework, consistency-filtering procedure, evaluation protocol, and experimental analysis are being refined and expanded. As a result, the current manuscript should not be considered a complete or final representation of the work
CLFEC:一种新的任务,用于段落级中文专业写作中的统一语言和事实纠错
机构 * Huazhong University of Science and Technology(华中科技大学) ; WPS AI, Kingsoft Office(WPS AI,Kingsoft Office)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文提出CLFEC任务,旨在解决段落级中文专业写作中语言和事实错误的联合纠错问题,构建了多领域数据集,并系统研究了基于LLM的纠错方法,揭示了实际挑战并展示了统一纠错的优势。
Dial HEALTHDIAL for Advice: 一个用于知识驱动信息检索的多语言多平行口语对话数据集
机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院) ; Independent Researcher(独立研究员)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文构建了HEALTHDIAL,一个大规模多语言多平行口语对话数据集,用于开发基于检索增强生成的口语对话系统,并揭示了不同语言间的性能差异。
Comments Accepted to Findings of ACL 2026
帮助的诅咒:通过 DistractionIF 在干扰指令鲁棒性中的逆缩放定律
机构 * Minzu University of China, Beijing, China(民族大学,北京,中国) ; Renmin University of China, Beijing, China(中国人民大学,北京,中国) ; Peking University, Beijing, China(北京大学,北京,中国)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出 DistractionIF 基准,发现大语言模型在参考文本中干扰指令的鲁棒性存在逆缩放现象,并通过 GRPO 强化学习提升鲁棒性。
什么被引用:AI 问答引擎中的竞争性生成式引擎优化
机构 * Sprinklr
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 研究 AI 问答引擎中两个检索候选源竞争时,哪些因素决定哪个源被优先引用,通过控制实验发现主题相关性和列表位置是主要驱动因素。
PHYSICS:在大学物理问题求解中基准测试基础模型
机构 * Yale University(耶鲁大学) ; New York University(纽约大学) ; Notre Dame University(诺特丹大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出PHYSICS基准测试,用于评估大学水平物理问题求解能力,包含1297个专家标注的问题,涵盖六个核心领域,并通过自动化评估系统揭示了领先基础模型的显著局限性。
Journal ref Findings of ACL 2025
持久且可对话的多方法可解释性用于可信金融AI
机构 * University of Piraeus, Greece(希腊比雷埃克斯大学) ; ExpertAI-Lux S.à r.l(ExpertAI-Lux公司)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出一种用于金融情感分析的以人为中心的可解释AI架构,结合持久化存储、多方法解释三角验证和自动化评估,提升金融AI的可信度和可解释性。
Comments 5 pages
PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; IBM, New York(IBM,纽约)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。
Comments 23 pages, 3 figures
被引用但未验证:解析和评估LLM深度研究代理中的源归属
机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S(普华永道商业技术与创新办公室,美国)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文提出首个源归属评估框架,通过AST解析器大规模评估LLM生成的Markdown报告中的引用,从链接有效性、内容相关性和事实准确性三个维度验证引用可靠性,揭示了表面引用质量与事实可靠性之间的关键断层。