Query, Decompose, Compress: Structured Query Expansion for Efficient Multi-Hop Retrieval
查询、分解、压缩:面向高效多跳检索的结构化查询扩展
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出DeCoR框架,通过结构化信息精炼提升多跳检索效率,采用查询分解和文档压缩技术,使小模型在复杂检索中表现优于大模型。
Comments Accepted to CIKM 2025
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
查询、分解、压缩:面向高效多跳检索的结构化查询扩展
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出DeCoR框架,通过结构化信息精炼提升多跳检索效率,采用查询分解和文档压缩技术,使小模型在复杂检索中表现优于大模型。
Comments Accepted to CIKM 2025
无需数据的层自适应融合:通过信息论实现长到短推理LLM
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
AI总结 本文提出FIM-Merging方法,通过计算Fisher信息矩阵来分配每层融合系数,提升长到短推理LLM的性能,减少响应长度,且无需校准数据。
Comments 14 pages, NeurIPS 2026 submission
基于理论的LLM推理中人类似 fallacy 模式的评估
机构 * The Laboratory for Human-Centered AI, Institute for Ethics in AI, Faculty of Philosophy, University of Oxford, UK(以人为中心的人工智能实验室,人工智能伦理研究所,哲学学院,牛津大学,英国) ; Oxford Internet Institute, University of Oxford, UK(牛津互联网研究所,牛津大学,英国) ; School of Computer Science, University of Birmingham, UK(计算机科学学院,伯明翰大学,英国)
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过ETR理论和PyETR工具,评估LLM推理错误是否符合人类fallacy模式,发现模型能力与错误类型相关,且反转前提顺序可减少fallacy生成。
不应检测什么:通过结构化推理和标记合并的否定意识VLMs
机构 * KAIST AI(韩国科学技术院人工智能实验室) ; Boston University(波士顿大学) ; Sogang University(成均馆大学)
专题命中 推理评测 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。
Comments 56 pages
Journal ref ICLR 2026
AEGIS:从线索到结论——通过辩证法和元审计的图引导深度漏洞推理
机构 * NC State University(北卡罗来纳州立大学) ; University of Alberta(阿尔伯塔大学)
专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 AEGIS通过图引导的深度漏洞推理,结合辩证法和元审计,解决LLM推理不严谨的问题,实现从线索到结论的验证,提升漏洞检测的准确性与可靠性。
Comments 29 pages, 6 figures, 3 tables
缓解语言模型中的捷径推理:一种梯度感知的训练方法
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆森大学) ; University of Kansas(堪萨斯大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SART框架,通过梯度感知技术检测并缓解语言模型中的捷径推理,实验显示在受控推理基准上提升准确率和鲁棒性。
Comments 12 pages, 2 figures. Preprint. Experiments on synthetic reasoning benchmarks. Code available
SemEval-2026任务12:归纳事件推理:面向大规模语言模型的现实事件因果推断
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) ; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出面向现实事件因果推断的归纳事件推理任务,通过多选基准测试解决分布式证据、间接背景因素和语义相关但非因果干扰等挑战,评估了122个参与者的518份提交结果。
Comments 9 pages, 3 figures, semeval 2026 task 12 description paper
视觉-语言模型在物理动态和意图推理上仍逊于人类表现
机构 * East China Normal University(东华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; University of Agder(阿格德大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。
协商式多智能体大语言模型提升眼科临床推理
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本研究比较了多智能体协商系统与单一模型在眼科临床推理中的表现,发现协商系统在准确性和安全性上均优于单一模型,且能减少有害错误。
CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估
机构 * Tuojing Intelligence(途京智能) ; King's College London(伦敦大学国王学院) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。
Comments 28 pages, 7 figures
GIR-Bench:用于生成图像的多功能基准
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Peking University(北京大学) ; University of Science and Technology of China(中国科学技术大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。
Comments ICLR2026
理解Transformer中的上下文回忆:微调如何使模型在预训练知识上进行上下文推理
机构 * University of Southern California(南加州大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Flatiron Institute(Flatiron研究所)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG
AI总结 本文研究了Transformer模型在上下文学习中如何通过微调实现对预训练知识的推理,探讨了预训练和微调对上下文回忆能力的影响及机制。
Comments 28 pages, 26 figures
WirelessBench: 一种面向无线网络智能的容忍感知LLM代理基准
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 WirelessBench提出一种容忍感知的LLM无线代理基准,通过三层认知体系和三个设计原则,解决现有基准在连续故障和灾难性错误检测上的不足,提升无线网络管理的自主性。
Comments This paper is submitted to a possiable journal for publication
Patho-R1: 基于多模态强化学习的病理专家推理器
机构 * Department of Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科部门) ; Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院临床病理科研究所) ; University of Toronto(多伦多大学) ; Business School, Sichuan University(四川大学商学院) ; Department of Pathology, Shengjing Hospital of China Medical University(中国医科大学盛京医院病理科部门)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出Patho-R1,通过构建高质量推理导向数据集,结合三阶段训练流程提升病理推理能力,实现跨模态任务的鲁棒性能。
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(33): 28418-28426, 2026
AGI的来临?专家人设是否超越专家基准?
机构 * Tarleton State University(塔尔顿州立大学) ; University of Texas at Tyler(德克萨斯大学泰勒分校)
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 研究探讨专家人设是否能提升语言模型性能,发现其效果受多种机制限制,通过控制实验揭示了人设在特定任务中的表现及局限性。
Nemotron-Cascade 2:基于级联强化学习和多领域在线蒸馏的后训练大语言模型
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Nemotron-Cascade 2是一款30B MoE模型,通过级联强化学习和多领域在线蒸馏提升推理和智能体能力,在2025年国际数学奥林匹克竞赛、国际信息学奥林匹克竞赛和ICPC世界总决赛中达到金奖水平,参数更少性能更强。
Comments We release the model and data at https://huggingface.co/collections/nvidia/nemotron-cascade-2
LinguaMap:哪些LLM层说你的语言以及如何调节它们?
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Amazon(亚马逊)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LinguaMap方法,通过分析LLM各层的语言控制机制,发现语言一致性瓶颈并提出选择性微调策略,实现多语言适应的高效优化。
进步的价格:价格性能与AI的未来
机构 * MIT FutureTech, CSAIL, Cambridge, MA, USA(麻省理工学院未来科技、计算机科学与人工智能实验室,马萨诸塞州剑桥市) ; MIT FutureTech, Sloan, Cambridge, MA, USA(麻省理工学院未来科技、斯隆管理学院,马萨诸塞州剑桥市)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了AI模型在基准测试中的性能与成本关系,发现价格性能显著下降,但前沿模型运行成本因模型规模和推理需求增加而上升。
指令调优语言模型中的沉默承诺失败:跨架构可控性分歧的证据
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究发现指令遵循模型在冲突检测中存在沉默承诺失败,可控性差异显著,且基准准确度无法预测可控性,提示可控性在预训练阶段固定。
Comments 39 pages, 5 figures, 5 tables. Preprint. Submitted to NIST CAISI (Docket NIST-2025-0035, March 2026). Also available on Zenodo: https://doi.org/10.5281/zenodo.18971110
基于可验证奖励的强化学习训练不会提升大语言模型的通用问答能力:评估方法和一个简单解决方案
机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文评估了基于可验证奖励的强化学习是否能提升大语言模型在通用问答任务中的推理能力,发现其效果不如可验证任务,并提出START方法提升问答质量和回答质量。
阿拉伯方言MMLU:评估阿拉伯语和多语言模型在阿拉伯方言上的能力
机构 * IBM Research AI(IBM人工智能研究院) ; New York University Abu Dhabi(纽约大学迪拜分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出阿拉伯方言MMLU基准,通过手动翻译和适应3000个多项选择题答案对至五个主要方言,评估大语言模型在阿拉伯方言上的推理和理解能力,揭示方言泛化中的持续差距。
Comments 9 pages, 10 tables, accepted to LREC 2026
SVBRD-LLM:自主车辆识别的自验证行为规则发现
机构 * Fariborz Maseeh Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程学院) ; School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出SVBRD-LLM框架,通过零样本大语言模型提取可解释的行为规则,用于自主车辆识别,实现了90.0%的准确率和93.3%的F1分数。
从五维到更多:大型语言模型作为精确且可解释的心理档案师
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了大型语言模型能否通过少量量化输入建模人类心理特质的相关结构,发现其在零样本情况下能准确预测心理特质,揭示了LLM通过抽象和推理实现精确预测的机制。
Comments Accepted to ICLR2026
COINBench: 超越个体视角到集体意图理解
机构 * Tongji University(同济大学) ; Stanford University(斯坦福大学) ; CurrentsAI Research(CurrentsAI研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 COINBench通过动态实时更新的基准测试,评估大语言模型在消费者领域集体意图理解能力,揭示当前模型在复杂意图合成分析深度上的不足。
WARBENCH:评估大语言模型在军事决策中的综合基准
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Chinese University of Hong Kong(香港中文大学) ; Zhejiang University of Technology(浙江工业大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出WARBENCH基准,揭示现有大语言模型在军事决策中存在结构性缺陷,包括战术推理崩溃、法律违规率高、量化降维导致性能下降等问题。
跨语言图融合使用大型语言模型
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出利用大型语言模型进行跨语言图融合框架,通过结构线性化和语义优先级解决多语言知识图谱融合问题,展示了LLM在跨语言知识整合中的有效性。
预测正则化对抗多模态大语言模型中的视觉表征退化
机构 * NKIARI ; VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) ; AAIS, Nankai University(AAIS,南开大学) ; Tencent Youtu Lab(腾讯优设实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本文研究多模态大语言模型中的视觉表征退化问题,提出预测正则化方法以维持视觉表征,提升视觉语言性能。
Comments Accepted at CVPR 2026
BenchBench:自动化基准生成的评估
机构 * Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 BenchBench通过三阶段流程评估自动化基准生成能力,生成16.7K问题并评估模型-问题响应质量,揭示基准设计与回答能力的弱相关性。
当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统
机构 * Independent Researcher(独立研究者) ; National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) ; Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) ; School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) ; National University of Singapore, Singapore(新加坡国立大学) ; Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) ; Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。
ACE-RTL:当代理上下文进化与专为RTL设计的LLM相遇
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 ACE-RTL结合代理上下文进化与专为RTL设计的LLM,通过生成器、反射器和协调器三部分提升RTL代码的正确性,实现41.02%的通过率提升。