ConQRet: Benchmarking Fine-Grained Evaluation of Retrieval Augmented Argumentation with LLM Judges
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
Comments submitted to IEEE IoTM
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments EMNLP 2024 Main
专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.CL、cs.AI
Comments under review
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
Comments 12 pages, 5 figures
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract)
Comments ACL 2024 Main Conference
专题命中 RAG评测 :RAG(abstract);分类 cs.IR、cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)
对Nature Portfolio元分析文章进行LLM代理基准测试
机构 * Tsinghua University(清华大学)
专题命中 RAG评测 :RAG(abstract_cn);分类 cs.IR、cs.CL;retriever(comments)
AI总结 提出MetaSyn数据集,包含442篇专家策划的元分析,用于评估LLM代理在检索-筛选-综合全流程中的表现,发现当前系统在筛选阶段存在严重瓶颈。
Comments 17 pages, 8 figures, 11 tables. Code and evaluation: https://github.com/THUIR/MetaSyn Dataset: https://huggingface.co/datasets/THUIR/MetaSyn Model: https://huggingface.co/BFTree/MA-Retriever
AgentMemBench:用于评估对话AI智能体长期记忆管理策略的系统基准
机构 * Sofrecom(索弗雷科姆)
专题命中 RAG评测 :dense retrieval(abstract);分类 cs.CL、cs.AI
AI总结 该研究构建了AgentMemBench基准,评估五种记忆策略及两款现有系统,发现外部键值存储(EKV)在长程对话记忆任务中表现最优,但存在内存占用成本,同时公开了全部可复现资源。
Comments 22 pages, 3 figures submitted on Neural Computing and Applications
SourceMinds参与2026年CheckThat!:多智能体管道中基于自然语言推理的引用审核用于完整事实核查文章生成
专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR、cs.CL
AI总结 针对CLEF 2026 CheckThat!实验室任务3,提出多智能体管道系统,结合证据检索、结构化规划、文章生成、自我批判及引用审核等方法,强调证据选择、结构化生成与生成后引用验证对事实核查文章生成的重要性。
Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany
MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估
机构 * M42
专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI
AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。
Comments Published in Transactions on Machine Learning Research (06/2026)
无坐标或区域标签的视觉文档理解中的证据归因
机构 * Aalto University(阿尔托大学)
专题命中 RAG评测 :retriever(abstract);分类 cs.IR、cs.CL
AI总结 研究视觉文档理解中无坐标或区域标签时的证据归因问题,通过对比坐标与语言接口,发现语言接口能提升证据召回率、降低幻觉率。基于此用引述和检索管道作训练框架,引入GRPO方法,提高了模型严格归因准确率,找到改善归因的实用路径。
希腊图书出版商环境中嵌入模型和大语言模型的比较评估 - CUP数据集
机构 * ICS-FORTH(希腊计算机科学与技术研究所) ; Crete University Press(克里特大学出版社)
专题命中 RAG评测 :hybrid retrieval(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出希腊图书检索基准CUP数据集,评估稀疏、密集、混合及大语言模型辅助的检索方法,发现多语言嵌入优于希腊特定模型,混合检索最佳,还分析了不同方法在各类查询中的表现及大语言模型相关技术的效果。
Comments Preprint of a manuscript submitted to the 14th EETN Conference on Artificial Intelligence (SETN 2026)
用于证据感知材料文献分析的技能收缩代理
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL
AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。
Comments 9 pages, 5 figures
SAGA:用于时间基准生成的合成智能体图架构
机构 * University of Memphis(密苏里大学)
专题命中 RAG评测 :RAG(abstract);分类 cs.AI、cs.DB
AI总结 针对时间图基准稀缺问题,SAGA系统通过四阶段管道生成大规模语义丰富的时间图,其架构解耦结构与语义,能实现结构真实性、语义丰富性和自动异常标注,在单个H100 GPU上高效生成大量带受控异常的时间边。
MedBeads:面向可信医疗AI的智能体原生不可变数据基底
机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) ; Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)
专题命中 RAG评测 :RAG(abstract_cn);分类 cs.AI、cs.DB
AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。
Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads
L-MARS:具有协调推理和代理搜索的法律多智能体工作流
机构 * University of Southern California(南加州大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI
AI总结 L-MARS是一种多代理检索框架,通过分解查询为结构化子问题,利用代理网络搜索获取证据,并通过验证代理过滤结果,从而在法律问答中实现高准确率。
Comments Accepted at the AI4Law Workshop at ICML 2026
从提示到论文:用于生物信息学的智能AI系统
机构 * School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST)(跨学科工程与科学学院(SINES),国立科技大学(NUST))
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有AI自动生成稿件系统的缺陷,提出Prompt-to-Paper多智能体框架。通过检索增强生成、自主编码实验及八维质量评分等创新,经质量驱动改进循环,在生物信息学案例中验证,有效提升稿件质量,成本低且获较好外部评价。
Comments NA
高效可扩展的LLM生成代码片段溯源追踪
机构 * University of Bologna(博洛尼亚大学)
专题命中 RAG评测 :vector search(abstract);分类 cs.IR、cs.AI
AI总结 提出混合两阶段溯源追踪流水线HYBRIDSOURCETRACKER,结合向量搜索与指纹匹配,实现LLM生成代码的高效、可扩展溯源。
AtomWorld: 评估大型语言模型在晶体材料空间推理能力的基准
机构 * University of New South Wales, NSW, Sydney, Australia(新南威尔士大学,新州,悉尼,澳大利亚) ; Suzhou Institute for Advanced Research, University of Science(苏州先进研究院,科学大学) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; Cornell University(康奈尔大学)
专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI
AI总结 提出AtomWorld基准,通过十种基本原子结构操作评估LLM在材料科学中的空间推理能力,发现Claude Opus 4.6表现最佳但复杂空间关系操作成功率低,表明LLM更适合作为辅助工具而非完全自主的科研代理。
HalluWorld: 一个用于通过参考世界模型控制幻觉的基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Patronus AI ; Independent Researcher(独立研究者) ; Stanford University(斯坦福大学) ; The Ohio State University(俄亥俄州立大学) ; DegenAI Labs(DegenAI实验室)
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出HalluWorld基准,通过显式参考世界模型研究语言模型的幻觉问题,发现不同任务中幻觉表现不一致,表明幻觉源于多种失败模式而非单一能力。
Comments HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld
CANTANTE:通过对比信用分配优化代理系统
机构 * University of Freiburg(弗赖堡大学) ; ELLIS Institute(埃里克·林斯研究所) ; Tübingen(图宾根)
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CANTANTE框架,通过对比多个联合配置的rollouts分解系统奖励为单个代理的更新信号,提升多代理系统优化效果,在编程、数学推理和多跳问答任务中均取得最佳排名。
CorpusQA:一个1000万词的语料库分析与推理基准
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。
肿瘤治疗规划的临床推理AI:多专科基于病例的评估
机构 * Moffitt Cancer Center and Research Institute(莫菲特癌症中心与研究学院) ; Innova Montréal Inc.(蒙特利尔创新公司) ; Oncobrain, Inc.(Oncobrain公司) ; Advanced Cancer Treatment Centers(先进癌症治疗中心)
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
AI总结 本文评估了OncoBrain在多专科病例中的表现,展示了其在肿瘤治疗规划中的准确性、安全性和实用性。