Enhancing Domain-Specific Retrieval-Augmented Generation: Synthetic Data Generation and Evaluation using Reasoning Models
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments 8 Pages
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments 8 Pages
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
Comments Working Paper. Accepted at IST-Africa Conference 2025, Nairobi
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.CL、cs.AI
Comments 4 page paper submitted to EMNLP
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments The 31st International Conference on Computational Linguistics (COLING 2025), 19 pages
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2024 Main Conference. Code and data released at https://github.com/Betswish/MIRAGE
Journal ref Proceedings of EMNLP (2024) 6037-6053
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL
专题命中 RAG评测 :retrieval augmented generation(title);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.AI
专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.CL、cs.AI
Comments Technical report
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL
专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
专题命中 RAG评测 :retrieval augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI
Journal ref KDD 2024 (oral)
专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL
专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.CL、cs.AI
Comments 18 pages, 6 tables, 1 figure
专题命中 RAG评测 :retrieval augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL
Comments Was handed in to IJCNN prior to preprint publication here. Was neither accepted nor rejected at date of publication here
结合标题链前缀的结构感知语义分块:1600次查询评估及文本变换消融实验中的测量陷阱
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 本文提出仅在分块侧的三阶段语义分块流水线,经1600次查询评估提升RAG的MRR@5,还发现分块研究中存在的测量陷阱并推荐检索时每个候选前缀评估的方向。
Comments 8 pages, 1 table. Replication package: DOI 10.5281/zenodo.21744653
RARE:面向高相似性语料的冗余感知检索评估框架
机构 * Allganize ; Seoul National University(首尔国立大学)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 RARE通过分解文档为原子事实和增强LLM生成数据,构建更真实的基准,揭示当前评估体系无法捕捉的鲁棒性差距。
Comments Accepted to ACL 2026 (Main Conference)
记忆决定差异:评估不同记忆角色如何塑造对话代理
机构 * Dartmouth College(达特茅斯学院) ; Microsoft(微软公司)
专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 本研究提出对话记忆细粒度分类法,通过用户中心评估框架,揭示不同类型记忆(如澄清记忆、无关记忆)对RAG对话系统响应准确性、个性化及主题相关性的差异化影响。
训练、检索,还是两者兼用?针对安大略省住宅租赁法的正确法定引用的四组头对头比较
机构 * Transformer Lab
专题命中 RAG评测 :RAG(summary_cn,abstract);hybrid retrieval(abstract)
AI总结 研究自诉租户、房东和帮助台工作人员如何获得正确的法定引用,通过四组实验比较微调、检索及混合方法,发现SFT+RAG混合模型在精确匹配上得分最高且无幻觉引用。
公平性审计代理系统在早发性结直肠癌检测中缓解偏见的消融研究
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 提出双代理架构(领域专家代理+公平性顾问代理),通过消融实验比较不同配置下大语言模型在公平性审计中的表现,发现带RAG的代理系统在识别差异方面语义相似度最高。
导师,而非解题者:设计高等教育中带护栏的AI学习助手——PeteChat的设计案例
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 本文通过设计案例PeteChat,提出八项可迁移的评估感知AI导师设计原则,包括作业护栏、调试支架等,基于本地Llama-3模型和RAG技术,旨在平衡学习支持与学术诚信。
Comments Preprint. Includes supplementary appendices, interface figures, and baseline-analysis tables
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) ; Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)
专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。
十位头痛专家与人工智能在临床文献总结中的比较:一项关键评估与对比
机构 * Stanford University Palo Alto CA USA(斯坦福大学) ; Department of Neurology Mayo Clinic Rochester MN USA(梅奥诊所神经科) ; Department of Neurology Dalhousie University Halifax Canada(达尔豪斯大学神经科) ; Jefferson Headache Center Department of Neurology Thomas Jefferson University PA USA(泰勒大学神经科) ; Beth Israel Deaconess Medical Center Boston MA USA(贝斯以色列医疗中心) ; Department of Neurology University of Florida Gainesville FL USA(佛罗里达大学神经科) ; University of Colorado School of Medicine Department of Pediatrics Division of Child Neurology Aurora CO USA(科罗拉多医学院儿科部儿童神经科) ; Department of Medicine Mount Sinai Hospital Icahn School of Medicine at Mount Sinai New York NY USA(西奈医院医学部) ; Department of Neurology Mayo Clinic Scottsdale AZ USA(梅奥诊所Scottsdale分部) ; Harvard Medical School Boston MA USA(哈佛医学院) ; Department of Neurology Mount Sinai Hospital Icahn School of Medicine at Mount Sinai New York NY USA(西奈医院神经科)
专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 本研究通过构建基于RAG的AI框架,比较了三种大语言模型与十位头痛专家在临床文献总结方面的表现,发现专家撰写的摘要更受青睐,但专家有时难以区分人类与AI生成的摘要。
迈向顺序公平性:通过双组优势优化缓解大语言模型的顺序敏感性
机构 * School of Software and Microelectronics, Peking University(软件与微电子学院,北京大学)
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 本文提出双组优势优化(DGAO),通过平衡组内准确性优势和组间稳定性优势,缓解LLM的顺序敏感性,提升模型在RAG、数学推理和分类任务中的性能。
面向6G的代理AI:自主RAN安全合规的新范式
专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)
AI总结 本文提出利用基于LLM的AI代理与RAG流程框架,实现RAN安全合规的智能自主执行,通过案例研究展示其在O-RAN联盟和3GPP标准合规性评估中的应用,并探讨模型幻觉、供应商不一致等挑战及未来发展方向。
Comments Accepted at IEEE Communications Standards Magazine