Boolean queries are all you need?
布尔查询就足够了吗?
专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR
AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
布尔查询就足够了吗?
专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR
AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。
RSRank: 从表示偏移中学习相关性
专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR
AI总结 针对RAG系统中重排序依赖启发式阈值和语言模型logit信号的问题,提出基于表示偏移(RS)的相关性信号,通过轻量级训练框架学习映射,在零阈值下过滤无关内容,超越现有重排序器。
Comments Under Peer Review
CMIP-Forge:一个检索、计算和自我审查气候科学的智能体系统
机构 * Alfred Wegener Institute, Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格ener研究所,极地与海洋研究中心)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.AI
AI总结 提出CMIP-Forge系统,结合检索增强生成与自主分析,通过多层级防御架构和独立审查机制,实现从文献到实时气候数据的端到端自主研究。
Comments 28 pages, 9 figures. Code available at https://github.com/CliDyn/cmip6_gpt
DistilVDR:通过双学生蒸馏实现的紧凑端到端视觉文档检索器
专题命中 检索器与排序 :retriever(title,abstract);分类 cs.IR、cs.CL
AI总结 本研究提出DistilVDR,通过双学生蒸馏从80亿参数视觉-语言教师模型得到5.24亿参数的紧凑端到端VDR系统,在多个基准上性能接近教师模型且索引速度更快、体积更小。
Comments 15 pages, 2 figures, 8 tables
知识图谱引导的检索增强大语言模型用于汽车在环(HiL)验证中的可解释根本原因分析
专题命中 检索器与排序 :RAG(summary_cn,abstract)
AI总结 该研究提出KG引导的RAG-LLM框架,用于汽车HiL数据的RCA与故障定位,在ASM汽油发动机和电动车系统案例中分别获90%、94% Top-1准确率,可实现可解释且泛化的故障分析。
Comments 10 pages, 3 figures, 5 tables. Accepted for publication and oral presentation at the 10th International Conference on System Reliability and Safety (ICSRS 2026), Rome, Italy, November 23--25, 2026
多模态CoLRAG-TF:复杂PDF的三重过滤检索
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract)
AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。
Comments 18 pages, 8 tables, 9 figures
硅像素探测器研发的基于证据的检索基准与混合RAG框架
专题命中 检索器与排序 :RAG(title_cn);dense retrieval(abstract);hybrid retrieval(abstract)
AI总结 针对硅像素探测器文献检索瓶颈,提出首个基于证据的检索基准和混合检索框架,结合稀疏、密集、混合检索和图探索,实验表明混合稀疏-密集检索在证据恢复上最可靠。
Comments 30 pages, 12 figures
用于空间搜索的图增强大型语言模型
机构 * University of Maryland(马里兰大学) ; University of Sydney(悉尼大学)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);分类 cs.IR、cs.AI、cs.DB
AI总结 针对大语言模型空间推理能力不足的问题,提出图增强方法,将空间数据以图形式存储并与检索增强生成结合,提升复杂空间问题回答能力。
可检索梯度:无累积权重漂移的持续后训练
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 提出ReGrad范式,将梯度作为可检索知识单元,通过元学习重塑文档梯度为通用适应信号,实现无权重漂移的可扩展参数知识注入。
用于紧凑密集检索的仅分数蒸馏
专题命中 检索器与排序 :dense retrieval(title);retriever(abstract);分类 cs.IR
AI总结 研究紧凑检索器能否从分数向量学教师排序行为,用行中心分数向量目标训练,在固定评估面板上蒸馏协议可弥补部分基础与教师模型差距,蒸馏后学生模型编码加速,外部迁移性能有好有坏。
检索增强生成支持铁路工程任务:案例研究
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);分类 cs.IR
AI总结 本文通过案例研究,展示了从设计到部署构建检索增强生成系统,用于铁路领域复杂技术法规的咨询,平衡技术能力与领域专业知识。
使用LLM标注的训练数据扩展稠密检索:面向电商赞助搜索的结构化挖掘与渐进式课程
专题命中 检索器与排序 :dense retrieval(title,abstract);分类 cs.IR
AI总结 针对电商搜索中点击信号偏差和人工标注成本高的问题,提出利用多通道检索挖掘、校准的LLM级联标注和五级渐进式课程训练,在Walmart搜索中实现NDCG@10提升5.1%,尾查询提升显著。
Comments Accepted at E-Commerce Workshop, SIGIR 2026
面向开放网络检索增强语言模型的风险约束新鲜度感知语义缓存
机构 * Jeju National University(济州国立大学)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 研究针对开放网络证据时变新鲜度,提出三层语义缓存FreshCache,将缓存重用视为风险约束时间推理问题,给出评估方法并引入基准测试,实验表明其在节省搜索API及降低陈旧错误率方面效果良好。
通过稀疏自编码器将句子嵌入与人类概念对齐
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
AI总结 提出使用Top-k稀疏自编码器解耦句子嵌入,使其特征与语义、句法等人类概念对齐,并通过激活引导机制实现可解释的检索重排序。
减少全切片图像分块冗余以实现可扩展索引与检索
机构 * KIMIA Lab Dept. of Artificial Intelligence & Informatics(KIMIA实验室 人工智能与信息学系)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI
AI总结 提出ARReST框架,通过识别并剪除跨类别判别贡献小的对立块,在保持检索精度的同时显著压缩WSI索引存储(3%-60%),实现可扩展、低成本的病理图像检索。
智能检索与强化学习方程链:面向复杂新颖物理文字题的可控生成框架
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 提出ARVRE两阶段框架,通过离线时序差分学习构建有效物理方程链,结合智能检索增强生成控制问题结构与难度,再由大语言模型生成自然语言问题,实现复杂、新颖且可解的物理文字题生成。
结构注意力税:检索格式如何劫持上下文学习而与内容无关
机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI
AI总结 研究发现知识图谱三元组因其格式结构比自然语言吸引2-3倍注意力,压缩演示注意力达42%,并提出了分解注意力为语义与结构成分的框架及缓解策略。
Comments 10 pages, 5 figures
M³Prune:面向高效多模态多智能体检索增强生成的分层协同剪枝
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract)
AI总结 M³Prune是优化多模态多智能体检索增强生成的分层协同剪枝框架,通过剪枝冗余通信边提升性能与token效率,实验中优于单智能体及多智能体基准系统。
Comments Accepted by ACM MM2026
OptGraph:基于图检索增强生成的大语言模型增强进化优化
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract)
AI总结 针对现有LLM自动化进化优化的局限,提出引入GraphRAG的OptGraph工作流,通过类型化图复用经验等方法,在基准数据集上较现有框架平均精确准确率提升8.9%。
以用户为中心对用于解释魁北克保险合同的检索增强生成系统的评估
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract)
AI总结 研究针对在线保险销售中消费者面临的‘建议差距’问题,对用于解释魁北克汽车保险合同的检索增强生成系统进行以用户为中心的评估,通过用户研究得出系统被视为‘认知均衡器’,但也有局限性,凸显人在回路框架在高风险消费金融中实施AI的重要性。
Comments Accepter to HCII 2026
TFGformer:基于时频图学习与协变量融合的多变量时间序列预测
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 针对异构IoT传感器多变量时间序列预测问题,提出CrossRAG框架,结合SAM、FCC学习与CATF,在7个基准上性能优于仅参数化基线及现有检索增强预测方法。
Softmax丢弃的信息:用于证据积累的质量感知注意力
机构 * Smart Computing Laboratory, Department of Computer Science & Engineering, Konkuk University(智能计算实验室,计算机科学与工程系,建国大学)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 研究探讨模型内部表示中预测相关结构信息保留问题,提出质量感知注意力(MAA),将标准L1归一化推广到Lp族,在多模型和数据集上提升未来链接AUC等,定位为通用归一化原则提高表示信息性。
通过检索增强大语言模型利用外部知识进行历史文献修复
机构 * Kangwon National University(江原国立大学)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 针对历史文献因物理损坏难以辨认及现有修复方法在恢复命名实体上的局限,提出利用检索增强大语言模型的修复框架,结合预训练模型隐含知识与外部上下文,实验表明该方法性能优于基线,是历史记录分析实用工具。
Comments Accepted to Findings of ACL 2026
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 43290-43304, 2026
增强小型语言模型以实现射电天文学中的可持续代码优化
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);分类 cs.AI
AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。
Shapley上下文剪枝:一种用于上下文重排和剪枝的合作博弈视角
机构 * Southern University of Science and Technology(南方科技大学)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文针对检索增强生成系统上下文重排和剪枝缺乏可解释统一框架的问题,提出Shapley上下文剪枝框架,用合作博弈视角归因重要性,采用深度集架构和蒙特卡罗采样,经多实验验证,模型在下游问答性能上表现出色。
无作用的噪声:实验设置如何塑造报告的噪声能力
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 研究重现Cuconasu等人关于噪声对检索增强生成系统问答性能影响的发现,在扩展实验设置下评估其稳健性,发现该效应受推理配置影响大,强调审视推理设计的重要性。
Comments SIGIR 26 Repro
上下文访问鸿沟:交互级架构作为智能不平等的补充维度
机构 * Faculty of Sociology, Kansai University(京都产业大学社会科学学部)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 研究智能不平等中未被关注的个体交互层面的上下文访问鸿沟,提出上下文性作为补充维度,用概率模型形式化CAD,分析其在相关架构中的技术基础及对知识工作分层和平台治理的影响。
Comments 19 pages, 2 figures
历史监狱镇压记录的对话检索与实时知识建模
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 针对历史数字图书馆管理,提出支持实时知识建模的文档分析系统,通过图结构存储事实,经专业交互实现跨源检索,可处理复杂查询,生成更丰富全面信息。
Comments Accepted at ICDAR2026
ContextNest:自主AI智能体的可验证上下文治理
机构 * PromptOwl, LLC(PromptOwl公司) ; Goizueta Business School, Emory University(埃默里大学戈伊苏埃塔商学院) ; IBM Research(IBM研究院)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出ContextNest,一种在检索前提供上下文治理的开放规范,通过版本链、哈希校验和审计追踪确保知识可验证性,实验表明其在防过时攻击和检索确定性上优于传统方法。
Comments 35 pages, 11 tables, 4 figures
CheckRLM: 检索增强推理中的有效知识-思维连贯性检查
机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) ; Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) ; Northeastern University(东北大学)
专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 提出CheckRLM框架,通过检索增强生成及时检查和纠正推理链中的事实错误,确保推理与知识一致,降低长程推理错误累积成本。
Comments 24 pages, 7 figures