UMBRELA: UMbrela is the (Open-Source Reproduction of the) Bing RELevance Assessor
专题命中 RAG评测 :RAG(abstract);分类 cs.IR
Comments 5 pages, 3 figures
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :RAG(abstract);分类 cs.IR
Comments 5 pages, 3 figures
专题命中 RAG评测 :retriever(abstract);分类 cs.CL
专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR
Comments 27 pages, 11 figures, 9 tables
专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL
Comments To appear at EMNLP 2023 (Main)
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL
Comments 4 pages + references. Accepted for publication in Workshop on Generative AI at the 3rd International Conference on AI-ML Systems 2023, Bengaluru, India
专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL
Comments Findings of EMNLP 2022, long paper
OrgForge:一种用于可验证合成企业语料的多智能体仿真框架
专题命中 RAG评测 :分类 cs.IR、cs.CL、cs.AI;RAG(comments)
AI总结 OrgForge通过多智能体仿真框架生成一致且可追溯的合成企业语料,解决现有语料在法律约束和幻觉问题上的不足,提升AI系统评估的准确性。
Comments v2: Major revision. Recenters the paper on the simulation framework as the primary contribution. System Architecture substantially expanded (CRM state machine, Knowledge Recovery Arc, multi-pathway knowledge gap detection, embedding-based ticket assignment). Introduction restructured for broader framing. RAG retrieval baselines replaced by cross-document consistency evaluation
弥合出院后鸿沟:用于安全持续护理的可追溯多智能体框架
专题命中 RAG评测 :retrieval-augmented generation(abstract)
AI总结 提出Healink框架,通过记忆增强的多智能体架构和约束检索生成,实现基于处方的可追溯出院后随访,在回顾性和盲评中优于医生基线。
Comments 23 pages, 10 figures
基于大语言模型的仓库级Solidity代码生成:从提示到微调
专题命中 RAG评测 :retrieval-augmented generation(abstract)
AI总结 提出SolidityBench基准和SolidityScore指标,评估多种LLM方法在仓库级Solidity代码生成中的表现,发现监督微调最有效。
Comments 33 pages
面向6G网络的代理驱动测试驱动质量保证
专题命中 RAG评测 :knowledge retrieval(abstract)
AI总结 本文提出一个代理驱动的端到端 orchestration 框架,通过意图共创与测试驱动质量保证相结合,确保SLA合规性。
Comments 8 pages
从上下文到规则:迈向统一的检测规则生成
专题命中 RAG评测 :RAG(abstract)
AI总结 本文提出UniRule框架,通过双语义投影空间实现跨上下文和语言的统一检测规则生成,实验表明其优于纯LLM生成方法。
PFAgent:一种可计算且自演化功率流代理用于交互式电网分析
专题命中 RAG评测 :knowledge retrieval(abstract)
AI总结 本文提出PFAgent,一种可计算且自演化功率流代理,旨在自动化电网分析流程,通过整合意图解析、知识检索、工具执行和结构化报告等功能,提升电网分析的自动化与交互性。
Comments 10 pages, 7 figures
从二元 groundedness 到支持关系:迈向以读者为中心的 AI 输出理解分类体系
专题命中 RAG评测 :retrieval augmented generation(abstract)
AI总结 本文提出以读者为中心的 groundedness 分类体系,旨在通过支持关系提升 AI 输出理解的透明度和可解释性。
Comments Advait Sarkar, Christian Poelitz, and Viktor Kewenig. 2026. From Binary Groundedness to Support Relations: Towards a Reader-Centred Taxonomy for Comprehension of AI Output. ACM CHI 2026 Workshop on Science and Technology for Augmenting Reading (CHI '26 STAR) ACM CHI 2026 Workshop on Science and Technology for Augmenting Reading (CHI '26 STAR)
MAVIS:多模态来源归因的长形式视觉问答基准
专题命中 RAG评测 :RAG(abstract)
AI总结 MAVIS基准旨在评估多模态来源归因系统,通过多模态文档检索和长形式答案生成,揭示多模态设置下信息量、 groundedness 和流畅性之间的权衡与改进方向。
Comments AAAI 2026; code is available at https://github.com/seokwon99/MAVIS
拒绝或不?:智能家庭场景下的语音助手查询拒绝基准及基于LLM的改进方法
专题命中 RAG评测 :RAG(abstract)
AI总结 本文提出面向智能家庭场景的语音助手查询拒绝基准及基于LLM的改进方法,通过构建多模态数据集和三级协作架构提升拒绝准确率。
专题命中 RAG评测 :RAG(abstract)
专题命中 RAG评测 :retrieval-augmented generation(abstract)
Comments 21 pages
专题命中 RAG评测 :RAG(abstract)
专题命中 RAG评测 :RAG(abstract)
专题命中 RAG评测 :retrieval-augmented generation(abstract)
专题命中 RAG评测 :retrieval-augmented generation(abstract)
专题命中 RAG评测 :RAG(abstract)
专题命中 RAG评测 :RAG(abstract)
专题命中 RAG评测 :retrieval-augmented generation(abstract)
Comments 10 pages, 8 figures
机构 * Deepchecks
专题命中 RAG评测 :RAG(abstract)
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 RAG评测 :retrieval-augmented generation(abstract)
专题命中 RAG评测 :knowledge retrieval(abstract)
Comments 23 pages, 16 figures, the project resources are available at https://lgy0404.github.io/LearnAct
专题命中 RAG评测 :RAG(abstract)
专题命中 RAG评测 :retrieval-augmented generation(abstract)
Comments 11 pages, 1 Figure, 1 Table
Journal ref Ageing Research Reviews (2025), 104, 102617
专题命中 RAG评测 :knowledge retrieval(abstract)
Comments Under Review of IEEE SaTML 2024