Stateful Evidence-Driven Retrieval-Augmented Generation with Iterative Reasoning
具有迭代推理的有状态证据驱动检索增强生成
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种具有迭代推理的有状态证据驱动检索增强生成框架,通过逐步积累证据提升问答稳定性与鲁棒性,在多个基准测试中表现出色。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
具有迭代推理的有状态证据驱动检索增强生成
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种具有迭代推理的有状态证据驱动检索增强生成框架,通过逐步积累证据提升问答稳定性与鲁棒性,在多个基准测试中表现出色。
从标记到步骤:面向验证的推测解码用于高效多步推理
机构 * IIT Kharagpur(印度克哈格普尔理工学院) ; Adobe Research(Adobe研究院)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出SpecGuard框架,通过模型内部信号进行步骤级验证,提升多步推理的准确性和效率,实验显示在多个推理基准上准确率提升3.6%且延迟降低11%。
引导反思的人工智能协作:一种知识支架和可追溯推理的框架
机构 * Faculty of Medicine, Lund University(Lund大学医学院) ; Department of Economics, Lund University School of Economics and Management(Lund大学经济学与管理学院经济系) ; Department of Health Services Research and Policy, London School of Hygiene & Tropical Medicine(伦敦卫生与热带医学学院健康服务研究与政策系)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出一种人机协作的推理框架,通过知识支架和可追溯推理提升AI透明度与可控性,不依赖新模型架构。
MedVerse: 通过DAG结构并行执行实现高效可靠的医学推理
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 MedVerse通过将医学推理转化为可并行的有向无环图过程,提升复杂医疗问题的效率和可靠性,实验表明其在通用大语言模型上提升了8.9%的性能,同时减少推理延迟并提高生成吞吐量。
NEAT:基于神经元的早期退出用于大规模推理模型
机构 * Northeastern University(东北大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 NEAT通过监控神经元激活动态实现免训练早期退出,减少冗余推理步骤,提升推理效率同时保持解的质量。
MetaMuse:通过创造性构思生成算法
机构 * University of California, Berkeley(加州大学伯克利分校) ; Microsoft Research(微软研究院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文研究LLM在算法生成中的应用,提出MetaMuse框架,通过三个自反思原则提升创造性构思,实验显示其在缓存替换和在线装箱问题中性能提升显著。
Comments ICLR 2026
KnowRL: 探索知识增强型强化学习以提升事实性
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 KnowRL通过整合事实性奖励提升慢思考模型的事实准确性,实验表明其有效缓解了幻觉问题并保持推理能力。
Comments ACL 2026
大模型问题解决中的泛化能力:最短路径问题的案例
机构 * National University of Singapore(新加坡国立大学) ; Capital Fund Management(资本基金管理公司) ; Google Research(谷歌研究)
专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了大模型在最短路径问题中的泛化能力,发现模型在空间迁移表现良好,但在长度扩展上因递归不稳定性而失败,分析了不同学习阶段对系统性问题解决的影响。
气候原因:气候报告中的复杂和隐含因果结构
机构 * Department of Computer Science, KU Leuven, Belgium(比利时库勒芬大学计算机科学系) ; Department of Electronics and Information Systems, Ghent University, Belgium(比利时根特大学电子与信息系统系) ; Institute of Argumentation, Linguistics, and Semiotics (IALS), Università della Svizzera italiana, Switzerland(瑞士意大利大学论证、语言学与象征学研究所)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ClimateCause数据集,通过专家标注揭示气候报告中的高阶因果结构,包括隐含和嵌套因果关系,用于提升因果推理和可读性量化。
Comments Accepted to ACL 2026 [Findings]
蓝色数据智能层:面向多源多模态数据导向应用的流数据与智能体
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出Blue数据智能层,通过整合异构数据源、多模态信息及上下文数据,解决多源多模态数据导向应用中的复杂查询需求,结合智能体与数据处理实现自然语言到SQL的扩展。
AIM:面向视觉问答持续学习的非对称信息掩码
机构 * Sun Yat-Sen University(中山大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心) ; Tsinghua University(清华大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 针对视觉问答持续学习中因模型结构不对称导致的灾难性遗忘问题,提出AIM方法,通过模态特定敏感性指导的针对性掩码平衡稳定性与可塑性,提升在VQA v2和GQA任务中的平均性能和平均遗忘度。
Comments 18 pages, 9 figures. Submitted to ACM MM 2026
通过电路看见:面向视觉变换器的忠实机制可解释性
机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了通过计算图在视觉变换器中识别有用机制电路的可能性,提出自动视觉电路发现方法,发现分类特定电路、CLIP中的文字攻击电路以及可引导纠正有害行为的电路。
大语言模型在测试生成中的捷径行为:SAP HANA与LevelDB的实证研究
机构 * THK-AI Research Cluster(THK人工智能研究集群) ; TH Köln(TH科伦大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文研究大语言模型在软件自动化测试生成中的行为,通过对比开源系统LevelDB与商用数据库SAP HANA的测试表现,揭示LLMs在熟悉领域表现优异但面对新复杂领域时依赖编译性而非语义有效性,强调需建立惩罚捷径、奖励泛化的能力评估框架。
专家混合中的等效性:路由拓扑不决定语言建模质量
机构 * Department of Software Systems, Uzhhorod National University(软件系统系,乌日霍罗德国立大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文研究路由拓扑对语言建模质量的影响,通过62次实验发现不同路由方法在渐近困惑度上无显著差异,且通过简化路由机制提升了效率。
V-Reflection:将多模态大语言模型从被动观察者转变为主动提问者
机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向) ; International Digital Economy Academy(国际数字经济学院) ; MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University, and Centre of AI in Medicine(医学视觉人工智能实验室,南洋理工大学Lee Kong Chian医学院,以及人工智能在医学中的中心) ; South China University of Technology(华南理工大学) ; Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出V-Reflection框架,通过'思考后再观察'的视觉反思机制,使多模态大语言模型能主动提问视觉特征空间,提升细粒度任务的感知能力。
Comments Main paper 14 pages with supplementary 7 pages
按需语言,知识为核心:通过编码器-解码器翻译模型组成LLM以实现可扩展的多语言性
机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文提出XBridge架构,利用预训练翻译模型实现多语言理解和生成,同时保留LLM作为英语核心处理通用知识,通过轻量级跨模型映射层和最优传输对齐目标,提升多语言生成性能。
Comments ACL 2026 Main Conference. Code: https://github.com/ictnlp/XBridge | Models: https://huggingface.co/collections/ICTNLP/xbridge
增强基于大语言模型的系统以实现端到端电路分析问题求解
机构 * School of Electrical ; Computer Engineering, Georgia Institute of Technology, Atlanta, GA 30332 USA
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种改进的端到端电路问题求解框架,通过整合YOLO检测器和OpenCV处理提升电路识别精度,并引入ngspice验证循环以减少推理错误,实验结果表明准确率显著提升。
Comments Liangliang Chen and Weiyu Sun contributed equally to this work
Prompt-R1: 通过端到端强化学习实现的协作自动提示框架
机构 * Hainan University(海南大学) ; Nanyang Technological University(南洋理工大学) ; Hithink Research(慧思研究) ; HKUST (Guangzhou)(香港科技大学(广州)) ; IDEA Research(IDEA研究院) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文提出Prompt-R1框架,通过小规模LLM与大规模LLM协作,利用强化学习提升复杂问题解决能力,实验表明其在多个数据集上表现优异。
基于反馈的LLM二进制分析执行
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出FORGE系统,通过反馈驱动执行框架提升LLM在二进制分析中的表现,实现长周期多路径分析与高精度漏洞检测。
Comments 17 pages
量化多查询LLM推理中的跨查询矛盾
机构 * Virginia Tech(弗吉尼亚理工大学) ; Columbia University(哥伦比亚大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI;logical reasoning(comments)
AI总结 本文研究多查询推理中的逻辑一致性,提出包含390个实例的基准测试,引入集级指标,通过提取承诺、验证全局可满足性及反例引导修复,减少跨查询矛盾并保持单查询准确性。
Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 9 pages, 6 tables, code and data at https://huggingface.co/datasets/rohitspider/cross_query_benchmark
METER:评估大型语言模型中的多级上下文因果推理
机构 * College of Computer Science, Sichuan University(四川大学计算机学院) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(中国教育部机器学习与产业智能工程研究中心)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出METER基准,系统评估大型语言模型在因果阶梯的三个层级上的表现,发现随着任务层级升高,模型能力显著下降,揭示了模型在因果推理中的两大失效模式。
Comments ACL 2026. Our code and dataset are available at https://github.com/SCUNLP/METER
Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈
机构 * University of Oxford(牛津大学) ; Nanjing University(南京大学) ; MSRA(微软研究院) ; SJTU(上海交通大学) ; Abel AI ; Outsampler ; University of Strasbourg(斯特拉斯堡大学) ; Squirrel Ai Learning(Squirrel AI学习)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。
Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available
在何时不回答:评估多模态推理系统中的退避
机构 * ServiceNow Research(ServiceNow研究院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出MM-AQA基准,通过视觉模态依赖性和证据充分性变换生成不可回答实例,评估三种前沿VLM和两种MAS架构,发现VLM在标准提示下 rarely 退避,MAS提升退避但引入准确率-退避权衡,序列设计表现优异,表明退避意识训练比提示或更多代理更重要。
Comments 10 pages and 4 figures (excluding appendix)
通过专家之眼:一个基于放射学家目光和推理训练的基础视觉语言模型
机构 * Bioengineering Department and Imperial-X(生物工程系和Imperial-X) ; Imperial College London(帝国理工学院伦敦分校) ; College of physics and information engineering, Fuzhou University(福州大学物理与信息工程学院) ; Department of Surgery and Cancer, Imperial College London(外科与癌症部门,帝国理工学院伦敦分校) ; National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) ; Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里顿医院) ; School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出GazeX模型,通过放射学家的眼动数据模拟专家推理过程,提升医学影像分析的准确性和可解释性。
ReasonScaffold: 一种基于推理的标注协议用于人机协同标注
机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出ReasonScaffold协议,通过暴露LLM生成的推理过程来提升标注一致性,发现推理能增加标注者一致性和最小化修订,为人类与AI协同标注提供实用机制。
寻找并解决:用于日常场景中视觉线索驱动推理的MLLMs基准测试
机构 * Dalian University of Technology(大连理工大学) ; WeChat, Tencent Inc.(微信,腾讯公司) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出DailyClue基准测试,旨在评估MLLMs在日常场景中通过视觉线索进行推理的能力,强调真实日常活动和挑战性查询设计,推动模型深入理解与推理。
Comments Accepted by ACL Findings 2026. Project page: https://xiaominli1020.github.io/DailyClue/
上下文而非内容:揭示自动化评判中的评估造假
机构 * BITS Pilani(比特学院) ; University of Michigan(密歇根大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示自动化评判中因后果信号导致的宽大偏见,指出评判模型在不知情情况下受后果影响而降低评判标准,核心贡献是提出控制实验框架以检测此类评估造假。
Comments Under Review
超越字面总结:重新定义医疗SOAP笔记评估中的幻觉
机构 * Augnito Research(Augnito研究)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。
Comments 12 pages, 2 figures,3 tables
Neuro-Oracle:一种具有轨迹意识的代理RAG框架用于可解释性癫痫手术预后
机构 * The George Washington University(乔治华盛顿大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Neuro-Oracle框架,通过三维Siamese对比编码器提取术前术后MRI变化,检索历史相似手术轨迹,并利用量化Llama-3-8B推理代理生成自然语言预后,验证了轨迹意识检索架构的可行性。
MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法
机构 * Apple(苹果公司) ; University of Washington(华盛顿大学) ; Virginia Tech(弗吉尼亚理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。