LLM-Driven Cost-Effective Requirements Change Impact Analysis
基于大语言模型的低成本需求变更影响分析
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。
Comments 33 pages, 4 figures
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
基于大语言模型的低成本需求变更影响分析
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。
Comments 33 pages, 4 figures
需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配
机构 * Department of Computer Science(计算机科学系) ; Technion, Israel(技术ion, 以色列) ; Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)
专题命中 RAG评测 :RAG(abstract,abstract_cn)
AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。
基于HZO铁电电容的非易失性电荷域注意力机制:从器件到系统的仿真评估
专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract_cn)
AI总结 提出铁电电荷域计算单元(FCDC),利用HZO忆电容器实现非易失性模拟存储和电荷域向量矩阵乘法,用于Transformer注意力机制,通过器件到系统仿真评估两种部署模式,在多种大语言模型上验证了低功耗和精度保持。
Comments 28 pages, 7 figures. Code: https://github.com/faris-agour/FCDC
SourceMinds参与2026年CheckThat!:多智能体管道中基于自然语言推理的引用审核用于完整事实核查文章生成
专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR、cs.CL
AI总结 针对CLEF 2026 CheckThat!实验室任务3,提出多智能体管道系统,结合证据检索、结构化规划、文章生成、自我批判及引用审核等方法,强调证据选择、结构化生成与生成后引用验证对事实核查文章生成的重要性。
Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany
MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估
机构 * M42
专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI
AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。
Comments Published in Transactions on Machine Learning Research (06/2026)
MedBeads:面向可信医疗AI的智能体原生不可变数据基底
机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) ; Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)
专题命中 RAG评测 :RAG(abstract_cn);分类 cs.AI、cs.DB
AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。
Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads
L-MARS:具有协调推理和代理搜索的法律多智能体工作流
机构 * University of Southern California(南加州大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 RAG评测 :RAG(abstract);分类 cs.CL、cs.AI
AI总结 L-MARS是一种多代理检索框架,通过分解查询为结构化子问题,利用代理网络搜索获取证据,并通过验证代理过滤结果,从而在法律问答中实现高准确率。
Comments Accepted at the AI4Law Workshop at ICML 2026
高效可扩展的LLM生成代码片段溯源追踪
机构 * University of Bologna(博洛尼亚大学)
专题命中 RAG评测 :vector search(abstract);分类 cs.IR、cs.AI
AI总结 提出混合两阶段溯源追踪流水线HYBRIDSOURCETRACKER,结合向量搜索与指纹匹配,实现LLM生成代码的高效、可扩展溯源。
ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复
机构 * Huawei(华为) ; HKUST(GZ)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学)
专题命中 RAG评测 :RAG(abstract);分类 cs.AI
AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。
引用溯源:通过法律引用图检测和减少LLM引用幻觉
机构 * LEX AI LLC
专题命中 RAG评测 :RAG(abstract_cn);分类 cs.CL
AI总结 提出引用溯源(CG)指标,利用乌克兰法院判决的引用图(1.008亿判决,5.02亿边)检测LLM法律引用幻觉,并通过CG-DPO方法(基于真实判决构建偏好对)减少幻觉,在100个法律查询上CG为0.791-0.873,幻觉率13-21%。
Comments 21 pages, 4 figures, 5 tables. Substantially revised: title, framing and several v1 results changed. Adds a coverage sweep and a separability analysis; corrects the DPO configuration, the density-accuracy correlation and the qualitative examples. Code and data: https://huggingface.co/datasets/overthelex/citation-grounding-eval
StatEval:大型语言模型在统计学中的综合基准
机构 * Shanghai University of Finance and Economics(上海财经大学)
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL
AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。
DMind Benchmark:面向Web3领域LLM能力的全面评估
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI
AI总结 提出DMind Benchmark,覆盖Web3九个子领域,结合客观知识与开放推理任务,评估31个LLM,发现模型在安全审计等高推理任务中存在显著弱点。
TransLaw:模拟香港判例法专业翻译的大规模数据集与多智能体基准
机构 * City University of Hong Kong, Hong Kong SAR, China(香港城市大学)
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL
AI总结 针对香港判例法英译中资源匮乏、法律术语和格式要求严格的问题,构建了首个大规模句对齐平行语料库HKCFA Judgment 97-22,并提出多智能体框架TransLaw,通过分解翻译任务、集成法律词汇库和检索增强生成,显著提升翻译质量,但仍未达到人类专家的风格自然度。
Comments Accepted at ICML 2026 - AI for Law