arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-07 至 2026-08-07 共收录 122 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2608.05254 2026-08-07 cs.CL cs.SC 新提交 90%

Constraint-First Reasoning: A Training-Free Protocol for Exploiting Answer-Space Constraints in Mathematical Problem Solving

约束优先推理:一种在数学问题求解中利用答案空间约束的无训练协议

Hongbo Ma, Bangji Yang, Yunqian Selina Cheng, Jiajun Fan, Hanwen Zhang, Ge Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对大型语言模型解数学题易违反约束的问题,提出无训练的两阶段提示协议CFR,经多数据集及多维度实验验证可提升性能,是针对性的测试时干预措施。

Comments 53 pages, 5 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05802 2026-08-07 cs.CL cs.LG 新提交 87%

On-Policy Delta Distillation for Multilingual Math Reasoning

面向多语言数学推理的在线策略增量蒸馏

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.LG

AI总结 本研究针对多语言数学推理任务,提出OPD²方法,实验表明其在韩语、日语上性能提升显著,且能缩小英语与韩语的性能差距,凸显多语言数据的重要性。

Comments 9 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12519 2026-08-07 cs.CL cs.AI 版本更新 84%

Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models

通过可验证的推理过程监督获得正确答案:语言模型的可验证过程监督

Kyuyoung Kim, Kevin Wang, Yunfei Xie, Peiyang Xu, Peiyao Sheng, Chen Wei, Zhangyang Wang, Jinwoo Shin, Pramod Viswanath, Sewoong Oh

机构 * KAIST AI(KAIST人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Rice University(里士满大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Sentient Labs(Sentient实验室)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VPS框架,通过联合优化预测准确性和推理质量,在可验证领域使语言模型同时获得准确和可靠的推理能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01170 2026-08-07 cs.LG cs.AI cs.CL stat.AP stat.ML 版本更新 82%

Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning

在线推理校准:测试时训练使可泛化的符合性大语言模型推理

Cai Zhou, Zekai Wang, Menghua Wu, Qianyu Julie Zhu, Flora C. Shi, Chenyu Wang, Ashia Wilson, Tommi Jaakkola, Stephen Bates

机构 * Department of Electrical Engineering and Computer Science (MIT EECS)(麻省理工学院电气工程与计算机科学系) Computer Science and Artificial Intelligence Laboratory (MIT CSAIL)(麻省理工学院计算机科学与人工智能实验室) Laboratory for Information and Decision Systems (MIT LIDS)(麻省理工学院信息与决策系统实验室) Computational Science and Engineering (MIT CSE)(麻省理工学院计算科学与工程) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ORCA框架,通过测试时训练和符合性预测校准推理过程,提升大语言模型在分布变化下的效率和泛化能力,实验证明其在不同任务中具有更高的性能。

Comments Published as a conference paper at COLM 2026; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05168 2026-08-07 cs.AI cs.CL 新提交 81%

Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models

啄木鸟蒸馏:弱模型诊断强模型中的推理错误

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Woodpecker Distillation框架,通过弱模型的局部干预对比学习,修复强模型的推理错误,在数学推理基准上提升了强模型性能且优于直接模仿基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01997 2026-08-07 cs.LG cs.AI 版本更新 81%

On the Limits of Layer Pruning for Generative Reasoning in Large Language Models

关于生成推理中大语言模型层剪枝的极限

Safal Shrestha, Anubhav Shrestha, Aadim Nepal, Minwu Kim, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现层剪枝在分类任务中有效压缩模型但生成推理任务表现较差,揭示了剪枝对算法能力如算术和括号生成的影响,指出在受限条件下生成推理能力恢复有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06347 2026-08-07 cs.CL 新提交 79%

RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

RP-OPSD:基于推理枢轴引导的多语言推理迁移在线策略自蒸馏

Xinye Wang, Junxiao Liu, Shujian Huang

机构 * Nanjing University(南京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对多语言推理迁移中现有在线策略自蒸馏未优先考虑关键推理信号的问题,提出 RP-OPSD 方法,利用教师视图分布偏移引导特权蒸馏,在 17 种语言的数学推理基准上优于基线,提升了多语言推理能力。

Comments 16 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05541 2026-08-07 cs.AI 新提交 79%

Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

Hyper-ES:通过下降方向合并实现LLM推理的有效进化策略

Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Hyper-ES框架,通过梯度微调获取下降方向张成子空间,再用CMA-ES优化DARE-TIES合并系数,在数学推理任务上性能优于GRPO-LoRA,梯度更新量减少10%。

Comments 19 pages, 4 figures, 14 tables. Code: https://github.com/kuangrepi/Hyper-ES

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05687 2026-08-07 cs.CL cs.AI 新提交 73%

Answer First, Reason Later: Commitment Order in Diffusion LLMs

先给出答案,后进行推理:扩散大语言模型中的承诺顺序

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Hwiyeong Lee, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现扩散大语言模型(dLLMs)的任意顺序提交机制会导致推理失败,通过前沿门控承诺干预可恢复推理性能,同时保留并行解码优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03895 2026-08-07 cs.LG cs.AI cs.CL 版本更新 67%

All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training

自适应边界裁剪GRPO:确保有界比率以实现稳定且可推广的训练

Chi Liu, Xin Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ABC-GRPO通过自适应边界裁剪提升GRPO的灵活性和泛化能力,实现更稳定和可推广的训练效果。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04761 2026-08-07 cs.CL cs.AI 版本更新 62%

InsightEmb: Learning Action-Intent Embeddings for Agentic Insight Retrieval

InsightEmb:面向智能体洞察检索的动作-意图嵌入学习

Tsz Ting Chung, Jiangnan Li, Jie Zhou, Mo Yu

机构 * The Hong Kong University of Science and Technology(香港科技大学) WeChat AI, Tencent(腾讯微信人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对智能体洞察检索任务,提出对比嵌入框架InsightEmb,利用数学推理数据学习可迁移的检索几何结构,在无特定环境训练时优于现有模型,验证了匹配几何结构的跨域迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05371 2026-08-07 cs.LG 新提交 57%

Quantum-Structured World Models (QSWMs) for Predictive Latent Dynamics

用于预测潜在动力学的量子结构化世界模型(QSWMs)

Hailong Jiang, Emran Hossain, Feng Yu, Jianfeng Zhu, Guilin Zhang, Wulan Guo

机构 * Youngstown State University(扬斯敦州立大学) Kent State University(肯特州立大学) George Washington University(乔治·华盛顿大学)

专题命中 数学推理 :planning(abstract);分类 cs.LG

AI总结 本文提出量子结构化世界模型(QSWMs),研究量子启发结构对世界建模的作用,在基本元胞自动机上评估其变体,发现复值QSWM局部预测潜力良好但类密度矩阵变体存在长时序预测局限。

Comments 19 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 4 篇

2506.18203 2026-08-07 cs.CL 版本更新 70%

Shrinking the Generation-Verification Gap with Weak Verifiers

缩小生成-验证差距的弱验证器

Jon Saad-Falcon, E. Kelly Buchanan, Mayee F. Chen, Tzu-Heng Huang, Brendan McLaughlin, Tanvir Bhathal, Shang Zhu, Ben Athiwaratkun, Frederic Sala, Scott Linderman, Azalia Mirhoseini, Christopher Ré

机构 * Stanford University(斯坦福大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Together AI

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 Weaver通过结合多个弱验证器,有效缩小生成-验证差距,提升验证性能至接近理想验证器水平。

Comments Annual Conference on Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03327 2026-08-07 cs.AI 版本更新 57%

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

截图还是工具?在混合GUI-MCP计算机使用智能体中引出工具使用并管理多模态上下文

Siqi Fan, Minghao Li, Xiaoqian Ma, Wenhui Tan, Xiusheng Huang, Juntong Wu, Liujie Zhang, Shuo Shang, Weihang Chen

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对混合GUI-MCP计算机使用智能体,发现工具使用存在采用缺口,通过调整工具奖励与上下文压缩优化,提升了智能体性能并降低输入成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31134 2026-08-07 cs.AI 版本更新 57%

Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics

超越图书馆:用于自动形式化研究数学的智能体框架

Arshia Soltani Moakhar, Iman Gholami, Max Springer, Mahdi JafariRaviz, MohammadTaghi Hajiaghayi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种基于通用编码大语言模型的智能体自动形式化框架,通过多智能体管道和辅助引理技术,成功形式化了PutnamBench和STOC论文中的主要定理,其中两个证明无需额外公理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06166 2026-08-07 cs.CY 新提交 50%

What out-of-the-box LLMs can(t) do in law? A Turing test in Italian exams for lawyers, judges and notaries

开箱即用的大语言模型(LLM)在法律领域能(不能)做什么?针对意大利律师、法官和公证人考试的图灵测试

Germana Bertoli, Ilaria Amelia Caggiano, Francesca Lagioia, Riccardo Rovatti, Giovanni Sartor, Emiliano Troisi

专题命中 代码与定理证明 :planning(abstract)

AI总结 本研究通过意大利律师、法官、公证人考试的盲法图灵测试,评估开箱即用的主流LLM的法律能力,发现其在部分法律任务表现接近人类但公证人考试全部失败,明确了LLM法律能力的范围与边界。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 8 篇

2510.14538 2026-08-07 cs.AI cs.LG 版本更新 81%

Symbol Grounding in Neuro-Symbolic AI: A Gentle Introduction to Reasoning Shortcuts

神经符号AI中的符号接地:推理快捷方式的入门介绍

Emanuele Marconato, Samuele Bortolotti, Emile van Krieken, Paolo Morettin, Elena Umili, Antonio Vergari, Efthymia Tsamoura, Andrea Passerini, Stefano Teso

机构 * University of Trento(特伦托大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Sapienza University of Rome(罗马大学) University of Edinburgh(爱丁堡大学) Huawei Labs(华为实验室)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨神经符号AI中推理快捷方式的问题,分析其成因与影响,并提供解决方法与策略,以提升模型的可靠性和可信度。

Comments Published on JAIR (Integration of Logical Constraints in Deep Learning special track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21724 2026-08-07 cs.LG cs.AI 62%

FISformer: Replacing Self-Attention with a Fuzzy Inference System in Transformer Models for Time Series Forecasting

FISformer:在时间序列预测的Transformer模型中用模糊推理系统替代自注意力

Bulent Haznedar, Levent Karacan

机构 * Computer Engineering Department, Gaziantep University(加扎莱普大学计算机工程系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FISFormer通过模糊推理机制替代传统注意力机制,提升时间序列预测中对不确定性和非线性依赖的建模能力,实验显示其在准确性、鲁棒性和可解释性上优于现有Transformer变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06292 2026-08-07 cs.CL cs.SC 新提交 57%

NeSy-RAG: Neuro-Symbolic RAG for Explainable Question Answering

NeSy-RAG:用于可解释问答的神经符号检索增强生成框架

Jonas Gann, Michael Gertz

机构 * Heidelberg University(海德堡大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05864 2026-08-07 cs.AI 新提交 57%

Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

视觉感知不等于决策:多模态大语言模型能成为有效的首席执行官吗?

Yuyang Dai, Xueqing Peng, Yuxia Wang, Preslav Nakov, Zhuohan Xie

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究构建C-SUITEBENCH多模态基准,评估9个前沿模型作为CEO的决策能力,发现多模态输入可提升证据推理但会损害受限资源分配,揭示多模态智能体的视觉感知与受限行动是可分离瓶颈。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05545 2026-08-07 cs.CY cs.AI cs.HC 新提交 57%

Vibe Compiler: A Research-Logic Synthesis Tool That Runs without Prompt Engineering -Toward Enhancing Metacognition for Sustaining Agency in the Age of Generative AI-

Vibe Compiler:无需提示工程即可运行的研究逻辑综合工具——迈向生成式AI时代维持智能体的元认知

Riichiro Mizoguchi, Tomoki Aburatani, Kento Koike, Machi Shimmei

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对生成式AI可能侵蚀人类认知智能体的问题,提出基于综合-分析互惠模型的Vibe Compiler工具,通过16个学术参数的本体编译研究想法,以反思性问题引导研究人员,减少对复杂提示的依赖,提升AI辅助推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05205 2026-08-07 cs.AI 新提交 57%

Abstract Event Causal Rules: Induction and Application

抽象事件因果规则:归纳与应用

Ziwei Zheng, Peiqiong Chen, Bang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对现有实例级因果对泛化缺陷,提出抽象事件因果规则(AECR)及相关归纳系统,构建知识库并设计 AR-GCAE 模型注入 AECR,在 CGEP 任务中提升了事件因果推理与预测性能,尤其对稀有未见样本效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05169 2026-08-07 cs.CL 新提交 57%

ConWriter: Transition-Constrained Stateful Long-Form Story Generation with Lightweight Neuro-Symbolic Consistency Control

ConWriter:基于轻量级神经符号一致性控制的带状态长文本故事生成,受过渡约束

Jindong Li, Yang Yang, Zihao Liu, Yutao Yue, Menglin Yang

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有长故事生成方法易累积各类错误的问题,提出无训练框架ConWriter,通过维护故事状态、验证叙事过渡并结合风险信号实现一致性控制,在ConStory-Bench上完成多模型多任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02647 2026-08-07 cs.SE 版本更新 50%

From Guessing to Seeing: Enhancing LLM-Based Program Repair via Trace-Guided Multi-strategy Debate

通过多智能体辩论引导的运行时执行轨迹指导的自动程序修复

Jiaqing Wu, Tong Wu, Manqing Zhang, Yunwei Dong, Bo Shen

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出TraceRepair框架,利用运行时事实作为共享约束进行补丁验证,通过多智能体协作提高修复效率和泛化能力,实验显示其在修复缺陷和处理新 bug 数据集上表现优异。

Comments 13 pages, 4 figures, 10 tables. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 23 篇

2503.03556 2026-08-07 cs.CV cs.RO 版本更新 82%

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05151 2026-08-07 cs.CL cs.AI 新提交 81%

Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support

面向工业因果推理的模拟器驱动大语言模型:用于污水处理决策支持的工具使用、结构化注入及工厂可迁移检索

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University(奥尔堡大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究对比三种适配Qwen2.5-32B-Instruct模型的方法,在污水处理因果问答任务中,DRR检索器兼具高准确率、跨工厂迁移能力及训练高效性,优于其他方法与基线。

Comments 20 pages, 2 figures, 8 tables. Preprint submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05832 2026-08-07 cs.CL 新提交 79%

Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

利用层级推理和话语级目标奖励增强大型语言模型的社交智能

Xiaofeng Wang, Kakam Chong, Shuai Xiao, DeXin Kong, Qingyuan Tian, Chen Ju, Xu Yan, Shuai Zhao, Fei Huang, Rui Wang, Shuguang Han, jufeng chen

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.CL

AI总结 该研究针对LLMs社交互动不足的问题,提出TSR框架与LHRL-VGR算法,微调Qwen2.5-7B智能体后在SOTOPIA基准上超过GPT-4o基线7.32%,实现多智能体社交谈判的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18519 2026-08-07 cs.RO cs.AI 版本更新 79%

As You Wish: Mission Planning with Formal Verification using LLMs in Precision Agriculture

如您所愿:利用LLM在精准农业中进行形式化验证的任务规划

Marcos Abel Zuzuárregui, Stefano Carpin

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对自然语言歧义性,提出基于线性时序逻辑(LTL)反馈循环的LLM任务规划系统,通过双LLM分工实现规范生成与验证,提升精准农业任务规划的可靠性。

Journal ref Published in Proceedings of 2026 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26352 2026-08-07 cs.CL 版本更新 79%

RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

RICE-PO:将检索交互转化为推理智能体的信用信号

Mingchen Li, Hansi Zeng, Zhuo Qian, Jiatan Huang, Sunjae Kwon, Hamed Zamani, Hong Yu

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Texas Tech University(得克萨斯科技大学) University of Connecticut(康涅狄格大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出RICE-PO框架,通过将检索交互转化为局部学习信号,解决推理型检索智能体在训练中推理步骤的信用分配问题,在BRIGHT和BEIR上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06113 2026-08-07 cs.SE 新提交 78%

DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds

DCAS:解耦CLI智能体脚手架以在脚手架间内化规划能力

Kishanthan Thangarajah, Boyuan Chen, Ahmed E. Hassan

专题命中 规划推理 :planning(title,abstract)

AI总结 本文针对CLI智能体微调后跨脚手架性能下降问题,提出DCAS框架,通过解耦脚手架与后端实现跨脚手架评估,微调规划感知轨迹后模型在非训练脚手架下性能一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏