RAG over Thinking Traces Can Improve Reasoning Tasks
RAG 基于思考轨迹可提升推理任务
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出检索思考轨迹而非文档,通过 T3 方法将其转化为结构化表示,在推理任务上显著提升性能,超越标准 RAG 和无 RAG 基线。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
RAG 基于思考轨迹可提升推理任务
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出检索思考轨迹而非文档,通过 T3 方法将其转化为结构化表示,在推理任务上显著提升性能,超越标准 RAG 和无 RAG 基线。
一个工业级保险大语言模型,实现可验证的领域掌握与幻觉控制,无能力权衡
机构 * Ant Group(蚂蚁集团)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL
AI总结 提出INS-S1保险专用大语言模型,通过可验证数据合成系统和渐进式SFT-RL课程框架,在领域任务上达到SOTA,同时保持通用能力并实现0.6%的低幻觉率。
Comments 21 pages, 12 figures, 17 tables
Journal ref ICLR 2026 Workshop Advances in Financial AI
面向LLM智能体的事实增强前瞻规划
机构 * University of Cambridge(剑桥大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LWM-Planner框架,通过从轨迹中提取关键事实并用于条件化动作提议、世界模型模拟和状态值估计,实现无需参数更新的在线规划改进,在多个环境上优于ReAct/Reflexion和纯搜索基线。
Comments Accepted at the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026). Camera-ready version. 9-page main text plus appendices (63 pages total), 1 figure
自适应教师暴露用于大语言模型推理中的自蒸馏
机构 * ByteDance Douyin(字节跳动抖音)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对自蒸馏中教师暴露完整推理导致学生难以吸收的问题,提出自适应教师暴露方法ATESD,通过轻量Beta策略控制器动态调整暴露比例,并用折扣学习进步奖励优化,在多个模型和数据集上提升推理性能。
Comments 11 pages, 4 figures; code not released yet
MemCast:基于经验条件推理的记忆驱动时间序列预测
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出MemCast框架,将时间序列预测转化为经验条件推理任务,通过层次化记忆学习历史模式、推理智慧和一般规律,并采用动态置信度适应策略实现持续进化,在多个数据集上优于现有方法。
结合强化学习与弧搜索内点法的路径规划
专题命中 规划推理 :planning(title,abstract)
AI总结 提出一种结合强化学习与弧搜索内点法的框架,利用强化学习的实时决策能力和弧搜索内点法的优化性能,实现障碍物环境下的高效路径规划。
Comments 15 pages, 9 figures
Discrete-WAM:面向世界-策略学习的统一离散视觉-动作标记编辑
机构 * Xiaomi EV(小米电动车)
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 提出Discrete-WAM,通过将未来视觉状态和自车动作对齐为离散标记,构建统一离散扩散框架,实现世界建模、世界-动作策略和分层决策策略的联合学习,支持可控生成和反事实推理,提升自动驾驶决策可靠性。
HANDOFF: 通过蒸馏互补教师实现人形机器人任务空间全身控制
机构 * California Institute of Technology(加州理工学院) ; The Institute for Human & Machine Cognition(人机认知研究院)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出HANDOFF框架,通过多教师KL蒸馏和上下文门控机制,将全身运动跟踪、行走和跌倒恢复三个专家策略融合为混合专家学生策略,实现基于紧凑显式接口的全身控制,在Unitree G1上达到先进的速度跟踪性能并扩展了操作工作空间。
Comments 22 pages, 9 figures, Project page: https://lzyang2000.github.io/HANDOFF/
学习为冻结的LLM突出证据
机构 * Stony Brook University(石桥大学) ; Meta AI
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出HiLight框架,通过强化学习训练轻量级Actor在长上下文中插入高亮标签,使冻结的LLM更关注关键证据,无需证据标签或修改求解器,在序列推荐和长上下文问答中提升性能。
BadRobot: 在物理世界中越狱具身LLM智能体
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beihang University(北航) ; Griffith University(格里菲斯大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。
Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io
Journal ref International Conference on Learning Representations (ICLR) 2025
V-REX: 通过问题链进行探索性视觉推理的基准测试
机构 * University of Maryland, College Park(马里兰大学学院市分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 提出V-REX基准,通过问题链将多步探索推理分解为规划和遵循能力,评估视觉语言模型在复杂开放任务中的表现。
Comments 28 pages
SciFlow-Bench:通过逆解析评估结构感知的科学图表生成
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Huawei Cloud BU(华为云业务部) ; Zhongguancun Academy(中关村学院) ; Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 提出SciFlow-Bench基准,通过逆解析将生成的图表图像转换为结构化图进行比较,以结构可恢复性而非视觉相似性评估科学图表生成。
几何定理预测的非参数结构先验
机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) ; Engineering Research Center of Intelligent Technology(智能技术与教育应用工程研究中心) ; Beijing Key Laboratory of Artificial Intelligence for Education, Beijing, China(北京人工智能教育重点实验室) ; Baidu, Beijing, China(百度)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 针对几何定理预测中参数模型泛化性差的问题,提出定理前驱图作为非参数结构先验,通过上下文学习实现无训练定理预测,在FormalGeo7k上达到89.29%准确率。
面向快速鲁棒机器人故障检测与恢复的目标导向通信
机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) ; Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。
Comments Submit to IEEE for potential publication
SAFE: 一种基于LLM作为验证器的证据驱动多跳推理框架
机构 * Seoul National University(首尔国立大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI
AI总结 提出SAFE框架,通过将推理分解为知识图谱三元组,在生成过程中逐步验证中间步骤,以解决多跳问答中模型通过无效推理得到正确答案的问题,平均准确率提升8.8个百分点。
面向叙事任务的轻量级潜在推理
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; CIFAR Fellow
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出LiteReason方法,通过轻量级推理投影器生成连续潜在令牌,在强化学习中动态切换潜在与离散推理,将推理长度减少77-92%,同时保持接近非潜在RL的性能。
CGES:面向高效准确自一致性的置信引导早停方法
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL
AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。
Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges
用于推理时间论证的神经符号学习
机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种用于三元主张验证的可训练神经符号框架,通过在训练和推理过程中结合形式论证语义来指导大语言模型生成论证并分配基础分数,从而提高三元预测的准确性。
Comments Under review
重新审视视觉问答中的贪婪解码:一种校准视角
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学) ; MBZUAI(穆桑比克人工智能研究所)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。
CoT-Space: 一种通过强化学习实现内部慢思考的理论框架
机构 * Zeyu Gan, Yi Hao, Yong Liu(GAN 赵毅、LIU 刘永)
专题命中 复杂问题求解 :CoT(title_cn,summary_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出CoT-Space理论框架,通过强化学习将推理过程从离散的token预测任务转化为连续的推理层面语义空间中的优化过程,揭示了测试时扩展中最优CoT长度的收敛是欠拟合与过拟合基本权衡的自然结果。
Comments Preprint Edition
ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体
机构 * J.P. Morgan AI Research(摩根大通人工智能研究)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。
Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)
模型说走:表面启发式如何覆盖LLM推理中的隐式约束
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Independent Researcher(独立研究者)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究LLM在表面线索与隐式约束冲突时的失败,提出启发式覆盖基准(HOB),通过因果行为分析揭示距离线索影响远大于目标,并验证目标分解提示可部分恢复性能。
ConRAG: 用于多跳问答的共识驱动多视角检索
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 提出ConRAG框架,通过共识驱动的多视角检索(关系、实体、文本信号)优化查询和语料库,显著提升多跳问答性能,在MuSiQue上创下新纪录。
基于智能体人工智能框架推进地下发现与地热监测
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 提出GAIA系统,结合大语言模型、数字孪生与检索增强生成,实现地热开发中的多学科任务自动化与智能决策。
AgentPLM:具有推理增强解码的智能体蛋白质语言模型用于蛋白质序列设计
机构 * Sahil Rahman ; Maxx Richard Rahman
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 提出AgentPLM,通过推理增强解码和对比智能体策略优化,使预训练蛋白质语言模型能够利用外部生物物理反馈进行在线纠错,在多项蛋白质设计任务上取得最优结果。
Journal ref Workshop on Generative and Agentic AI for Biology, 43rd International Conference on Machine Learning (ICML 2026)
让结果说话:LLM行为基准测试的复制优先范式
机构 * Cylingo team(Cylingo团队)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出复制优先范式,通过可靠性、跨仪器复制、历史足迹校准和预注册预测四个正交属性验证LLM行为评估工具,并在情感陪伴任务中测试,发现聚合分数掩盖的模型退化。
Baichuan-M4:面向持续照护的临床级医疗智能体系统
机构 * Baichuan AI(百川智能) ; THUBPM Group, Tsinghua University(清华大学THUBPM课题组)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出Baichuan-M4临床级医疗大模型,通过统一运行时、持续照护强化学习框架和临床工具层三大支柱构建智能体系统,在多项医疗评估中取得领先结果,幻觉率降至3.3%。
PSEBench: 一个用于评估大语言模型在患者安全事件分类中的可控且可验证的基准
机构 * Emory University(埃默里大学) ; Scale AI ; Mayo Clinic(梅奥诊所) ; Vanderbilt University Medical Center(范德比大学医学中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出基于政策条款卡的结构化构建方法,通过锚点驱动实例化和闭环验证生成带真实标签的叙事,并创建包含5074个案例的基准PSEBench,评估15个代表性LLM在患者安全事件分类中的能力。
大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Purdue University(普渡大学) ; Meta ; Apple(苹果公司) ; Wright State University(怀特州立大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。
ChartREG++:面向多样化指代线索和多目标指代的图表指代表达式定位基准与改进
机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 针对现有图表指代表达式定位基准的局限,提出支持多种定位形式、多目标指代、多样化线索和图表类型的基准,并利用代码驱动合成流水线生成像素级实例掩码,训练实例分割模型集成到多模态定位框架,显著提升性能。