arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4109 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 266 篇

2607.05199 2026-07-07 cs.AI 新提交 85%

Reason, Reward, Refine: Step-Level Errors Corrections with Structured Feedback for Physics Reasoning in Small Language Models

推理、奖励、优化:面向小语言模型物理推理的带结构化反馈步级纠错方法

Raj Jaiswal, Dhruv Jain, Rishabh Dhawan, Sree Krishna Uppalapati, Shin'ichi Satoh, Tanuja Ganu, Rajiv Ratn Shah

机构 * IIIT Delhi(印度信息技术学院德里分校) IIT BHU(印度理工学院(巴纳拉斯印度教大学)) IIT Kanpur(印度理工学院坎普尔分校) NII Tokyo(日本国立情报学研究所) Microsoft Research India(微软印度研究院)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);verifier(abstract);分类 cs.AI

AI总结 针对小语言模型物理推理的步级错误传播问题,提出含结构化反馈的步级奖励框架,无需偏好数据,大幅提升推理准确率并降低各类错误占比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12402 2026-06-11 cs.RO cs.AI cs.CV 新提交 85%

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

DIRECT: 在具身规划器中何时何地分配测试时计算?

Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) NVIDIA(英伟达)

专题命中 测试时计算 :test-time compute(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 提出DIRECT路由框架,根据多模态场景上下文按提示分配计算资源,优化成功-成本帕累托前沿,实验表明不同缩放轴带来不同能力增益,在物理机器人上以更低延迟匹配或超越更强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11994 2026-08-13 cs.AI cs.CL 新提交 84%

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

面向高效测试时推理的声明级可靠性评估

Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang

机构 * Sina Weibo Inc.(新浪微博公司)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需训练的CLR框架,将测试时计算从解决方案采样重分配至声明级语义证伪,在匹配预算下于四个LLM及四个推理基准上提升了推理性能,减少了标记使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04962 2026-08-06 cs.LG cs.CL 新提交 84%

SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

SpecRoll:用于投机强化学习rollout的快慢校验器反馈自适应方法

Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui

机构 * VNU University of Engineering and Technology(越南国家大学河内理工大学) Viettel AI(越南电信人工智能公司)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SpecRoll是一种投机强化学习rollout引擎,通过快慢双时间尺度自适应结合相关校验机制,在5个1.5B-14B模型和3个数学推理数据集上,相比普通GRPO和FastGRPO实现了生成与端到端速度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 84%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 测试时计算 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21777 2026-06-23 cs.CL cs.AI 新提交 84%

CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks

CalVerT: 通过校准验证器遥测增强智能体在知识密集型任务中的行动与学习

Ashwin Vinod, Ying Ding, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CalVerT方法,通过向智能体状态添加校准的自信心分数和基础验证器分数,减少过度依赖参数知识或冗余检索,提升知识密集型问答的准确性和效率。

Comments Code: https://github.com/ashwinn-v/CalVerT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09926 2026-06-10 cs.LG cs.AI 新提交 84%

Sample Where You Struggle: Sharpening Base Model Reasoning via Entropy-Guided Power Sampling

在你挣扎处采样:通过熵引导的幂采样增强基础模型推理

Hong Guo, Nianhui Guo, Christoph Meinel, Haojin Yang

机构 * Hasso Plattner Institut(霍普夫纳研究所) German University of Digital Science(德国数字科学大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出熵引导的幂采样(EGPS),一种无需训练和验证器的采样方法,通过利用前向传播中的token级熵将MCMC移动定位到高熵区域,在多个基准上以高达12.6倍加速达到最优或并列最优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18532 2026-07-22 cs.CL 新提交 84%

Reasoning Fine-Tuning Induces Persistent Latent Policy States

推理微调诱导持久的潜在策略状态

Abir Harrasse, Michael Lan, Hunar Batra, Fateme Hashemi Chaleshtori, Chaithanya Bandi

机构 * University of Oxford(牛津大学) University of Utah(犹他大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL;CoT(comments)

AI总结 研究推理微调对语言模型的影响,将思维链推理建模为切换动态系统,通过时间感知对比表征学习等方法恢复潜在策略。发现推理微调使模型有更丰富的潜在策略组织,恢复的状态有功能意义,SDS引导的剪枝效果良好,为推理模型分析和控制提供新视角。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. 45 pages, including appendices; 24 figures and 12 tables. Code: https://github.com/withmartian/mi-cot

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交 83%

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27914 2026-07-31 cs.LG cs.SY eess.SY 新提交 83%

Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control

仅精确动作值不够:针对多区域VAV控制的推理模型的展开验证强化微调

Takumi Shioda, Kohei Terashima, Tatsuo Nagai

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京理科大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 该研究针对多区域VAV控制,测试前沿LLM的控制能力及TD3引导的RFT效果,发现RFT未产生持续改进,需先开展状态转移聚焦的监督微调。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08724 2026-07-10 cs.LG cs.RO 新提交 83%

Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference

潜在记忆宫殿:作为自回归变分推理的控制推理

Chuning Zhu, Eva Xu, Jose Barreiros, Krishnan Srinivasan, Paarth Shah, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Toyota Research Institute(丰田研究院)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

AI总结 研究将语言模型的推理能力应用于连续控制策略的问题,提出潜在记忆宫殿(LMP)方法,通过自回归潜在空间组织信息进行变分推理,推导强化学习技术优化下限,该方法在模拟和现实领域表现良好,还产生高性能动作分词器,为控制的潜在推理提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06764 2026-07-09 cs.AI 新提交 83%

Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1

用于ARC-AGI-1上抽象推理和泛化的经济高效智能体框架

Kabir Moghe, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 测试时计算 :reasoning(title);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI

AI总结 研究ARC-AGI-1上在严格预算下非思考模式的开放权重模型,构建智能体框架,包括探索者-定义者管道和反思协调器,通过特定架构提升基线成绩,分析了管道特性,确定思考工具是重要组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11537 2026-06-19 cs.AI cs.CE 新提交 83%

MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning

MoCA-Agent: 一种用于金融和数值推理的声明市场代码智能体

Abdelrahman Abdallah, AbdelRahim A. Elmadany, Sameh Al Natour, Hasan Cavusoglu, Adam Jatowt, Muhammad Abdul-Mageed

机构 * University of Innsbruck(因斯布鲁克大学) University of British Columbia(不列颠哥伦比亚大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出MoCA-Agent,通过声明级验证和代码生成解决金融表格问答中的数值推理错误,在十个基准上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05124 2026-08-06 cs.CL cs.AI cs.IT cs.LG eess.SP math.IT 新提交 82%

Chained Recursive Language Models for Multi-Iteration Reasoning

用于多轮迭代推理的链式递归语言模型

Purbesh Mitra, Sennur Ulukus

机构 * University of Maryland(马里兰大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM长上下文推理易传播早期错误的问题,提出Chained RLM推理架构,通过分阶段管理上下文提升多轮迭代推理准确率,验证其相比直接LLM回答的性能增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27823 2026-07-31 cs.CV 新提交 82%

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码

Lei Yang, Xinze Liu, Dayan Wu, Ding Wang, Hengjie Zhu, Zihao Zhang, Tianzhu Hu, Hanqi Wu, Peng Fu, Zheng Lin

专题命中 测试时计算 :verifier(title,abstract)

AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08116 2026-07-10 cs.NI 新提交 82%

MORES: Mobile Reasoning-as-a-Service via Distributed LLM Inference-Time Scaling

MORES:通过分布式大语言模型推理时间缩放实现移动推理即服务

Guanchen Liu, Hongyang Du, Kaibin Huang

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 研究针对大语言模型推理时间缩放的计算和内存开销问题,提出MORES框架,利用隐式推理递归结构及基于语义MoE的DRL算法优化资源分配,实现边缘设备协作推理,提升系统吞吐量约18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13918 2026-07-16 math.ST cs.AI cs.LG stat.TH 新提交 82%

Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings

大语言模型工具中的部分相关验证级联:凹对数优势、多项式可靠性和盲点上限

Jiangang Han

机构 * Independent researcher(独立研究者)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型工具中部分相关验证级联,将生成器错误接受率建模为潜在变量,给出理论。包括凹对数优势、多项式可靠性等特性,可测量,通过合成测试对比不同方法效果,指出实际应通过去相关而非加门提升可靠性。

Comments 14 pages, 2 figures. Code and synthetic-recovery experiments: https://github.com/jianganghan/harness-verifier-cascades

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16003 2026-08-18 cs.AI cs.CL 新提交 81%

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

先验审计-修复上下文调整大语言模型验证器阈值以趋向宽松

Parsa Mazaheri, Kasra Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现,LLM检查器上下文中的审计→修复事件会降低误报率,调整了验证器阈值趋向宽松,且该效应与负性不对称性预测相反,不随推理启用而消失。

Comments 12 pages, 2 figures, 4 tables. Code and analysis artefacts: https://github.com/parsa-mz/crtitxer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22385 2026-07-27 cs.AI cs.LG 新提交 81%

Agentic Root Cause Analysis through Evidence-Grounded Reasoning

通过基于证据的推理进行智能根本原因分析

Amaury Wei, Olga Fink

机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14552 2026-07-17 cs.CL cs.AI 新提交 81%

Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models

答案条件思维链降低大语言模型中的可验证推理蒸馏

Jungseob Lee, Seungyoon Lee, Suhyune Son, Dongyub Jude Lee, Sungbin Han, Sugyeong Eo, Heuiseok Lim

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型推理能力蒸馏中,答案条件思维链会降低训练数据质量,导致可验证推理准确性下降,损失随难度增加,机制是从答案反向合理化,危害是数据属性,建议盲目生成答案。

Comments 13 pages, 4 figures, 14 tables. Code: https://github.com/js-lee-AI/answer-leakage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09693 2026-07-14 cs.LG cs.AI 新提交 81%

Depth-Entropy Guided Sampling for Training-Free LLM Reasoning

用于无训练语言模型推理的深度熵引导采样

Zibin Meng, Peng Xie, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在提升无训练语言模型推理能力,提出深度熵引导采样(DEGS)方法,利用逐层熵坍缩作为质量信号,结合序列似然性与深度熵结构,在多个模型和基准测试中达到无训练最优精度,在域外和难题测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09560 2026-07-13 cs.AI cs.LG 新提交 81%

Beyond Fixed Representations: The Vocabulary and Verifier Gaps in Open-Ended AI

超越固定表示:开放式人工智能中的词汇与验证差距

Yuan Cao, Haiqian Yang

机构 * MIT(麻省理工学院)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 研究指出当前人工智能系统虽能力强但表示框架固定,构建开放式智能需新操作。通过词汇和验证差距刻画与真正开放式智能的距离,基于智能行为的认知转换区分不同类型转换,进而提出创新自主性阶梯及推进开放式人工智能的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06974 2026-07-09 cs.CL cs.LG 新提交 81%

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES:用于自我改进的语言模型推理的具有可学习选择的模块化指令内存

Ruilin Tong, Dong Gong

机构 * University of New South Wales(新南威尔士大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对LLMs测试时推理问题,提出MILES框架,通过动态扩展内存及正确性优化的内存组合,利用模块化内存单元与可学习选择头实现粗到细检索机制,实验表明该框架在性能、效率及权衡上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06720 2026-07-09 cs.AI cs.CL 新提交 81%

When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning

上下文搜索何时有用?基于反射驱动推理的采样复杂性理论

Yotam Wolf, Noam Wies, Amnon Shashua

机构 * The Hebrew University(希伯来大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究上下文搜索何时有用,通过将其建模为对推理轨迹的近似推理分析采样复杂性,表明反思能定位早期错误时可指数级改进,收益稳健可学习,还在强化学习抽象下验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22317 2026-06-23 cs.LG cs.AI 新提交 81%

Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model

课程强化学习可以激励LLMs超越基础模型的推理能力

Pengxiang Cai, Tianchen Fang, Xiaohan Li, Qingyuan Zeng, Guocong Li, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出边界感知课程强化学习方法,通过定位推理能力边界、针对性教师引导和强化学习巩固,在Qwen、Llama和DeepSeek上同时提升pass@1和pass@256,平均pass@256比基础模型提升9.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-06-09 cs.LG cs.AI 新提交 81%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V1, 15 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00685 2026-07-02 cs.MA 新提交 80%

M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning

M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化

Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15574 2026-08-18 cs.CV cs.AI 新提交 79%

Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study

视频-大语言模型(Video-LLM)问答中幻觉引用的检测:自验证流水线与验证器 ablation 研究

Yogesh Kumar

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 针对视频-LLM问答中引用幻觉问题,提出自验证流水线,用小型自然语言推理模型作稳定验证器,在对抗性错误前提问题上检测率达79%,并发布相关代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交 79%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13179 2026-08-14 cs.AI 新提交 79%

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配

Zechuan Wang, Siyuan Lu, Hongxuan Zhang, Linjian Mo, Chenyi Zhuang, Leilei Gan

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏