SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance
SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。
当评判者不应做决定时:证据锁定的非补偿选择界限在推理流程中限制大语言模型评判者的失效
机构 * School of Computing and Information Technology, University of Wollongong(伍伦贡大学计算与信息技术学院) ; CSIRO’s Data61(联邦科学与工业研究组织Data61研究院) ; School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息技术学院)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对推理流程中的LLM评判者,提出证据锁定的非补偿规则EL-DGR,在不改变评判者等条件下提升了GSM8K和HotpotQA任务性能,发现应限制评判者影响范围而非提升其准确率。
在软件问题解决的大语言模型智能体中耦合规划与情景记忆
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。
Comments 12 pages, 5 figures
网络物理系统中大语言模型智能体规划策略的战略评估
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 本研究针对网络物理系统,构建含40个异构产消者的智能电网基准,评估4种LLM规划架构,发现架构影响结果,应用截止可行性可显著降低遗憾。
HPFA:基于超图的大语言模型推理配对失败归因
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。
一致性并非质量:当人类共识并非真值时,对人类与大语言模型定性编码的盲专家验证
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究发现以人类共识为标准的一致性评估无法准确衡量LLM定性编码质量,盲专家验证显示部分LLM编码优于人类,提出了可迁移的验证协议与编码分工框架。
模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL
AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。
Comments WIP
基于推理增强语言模型的网络安全检测分类
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG
AI总结 该研究针对SOC警报疲劳问题,训练了思维链推理增强的分类器及校准器,在Windows终端检测任务上提升了良性与恶意召回率,且30B微调模型优于通用大模型。
已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化
机构 * Zhejiang University(浙江大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。
从似是而非到可付诸行动:关于大语言模型自我解释的立场
机构 * Utrecht University(乌得勒支大学) ; Scuola Normale Superiore(高等师范学校) ; University of Pisa(比萨大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 探讨大语言模型自我解释,指出其虽看似合理但忠实性存疑。从传统可解释人工智能角度识别评估局限,提出评估合理性与忠实性的指南,并强调评估应拓展到可操作性及相关应用,以支持不同利益相关者的明智决策和适当行动。
Comments 5 pages
地理空间基础模型的新兴范式:从预训练到智能推理
机构 * Google Public Sector(谷歌公共部门)
专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 研究地理空间基础模型的新兴范式,通过职责分离实现预训练与特定任务微调,探讨不同类型模型能力及实现考虑因素,提出模型适应策略分类法和框架,展望智能地理空间推理推动领域从感知到认知的发展。
Comments 18 pages, 4 figures. To appear in Lecture Notes in Computer Science (LNCS)
Journal ref Lecture Notes in Computer Science, Vol. 16446 (2026)
用于自动CAD生成的基础模型
机构 * BARCELONA Supercomputing Center(巴塞罗那超级计算中心) ; Universidad Pontificia Comillas(庞培法布拉大学) ; Chung-Ang University(中央大学) ; LUXEMBOURG Institute of Science and Technology(卢森堡科学技术研究所)
专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究利用统一评估管道和基准,对用于机械零件自动CAD生成的基础模型展开实证。介绍LLMForge框架,通过两种批判机制评估七个基础模型,展示了紧凑模型的效果,以及VLM批判的作用,还探讨了相关设计及影响。
Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems
面向LLM智能体的生成式技能组合
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Arizona State University(亚利桑那州立大学) ; Honda Research Institute USA(本田美国研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 提出SkillComposer方法,将技能组合形式化为任务条件技能序列预测,通过约束自回归解码器联合决定技能子集、数量和顺序,在真实技能库上训练并验证其提升下游任务成功率。
自我污名并非单一概念,但通用共情是:面向吸毒者的人物条件化LLM支持
机构 * Department of Information Science(信息科学系)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 针对吸毒者自我污名表达异质性问题,提出基于潜在剖面分析的四人物类型学,并用序列贝叶斯和循环神经网络从有限发帖历史中恢复人物类型,发现人物匹配响应虽能实现行为转变,但临床专家更偏好通用共情。
学习精炼隐藏状态以实现可靠的LLM推理
机构 * Tongyu0924
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出ReLAR框架,通过强化学习引导的潜在状态精炼,自适应调整推理步数和方向,提升复杂多步推理的准确性和稳定性,降低推理开销。
Comments Code is available at tongyu0924/Learning-to-Refine-Hidden-States
上下文模型预测生成:从语言模型到物理的开放词汇运动合成
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) ; School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。
超越Logprobs:基于LLM的文档字段提取的多信号置信度引擎
机构 * Perfios Software Solutions Pvt. Ltd.(Perfios软件解决方案私人有限公司)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 提出ExtractConf,通过双视角文档解析(字段引导与文档引导)的不一致性,融合多信号实现高可靠置信度估计,在DocILE上AUC达0.928,准确率99.1%。
Comments Extended version of a paper accepted (Oral) at the RobustifAI Workshop, IJCAI-ECAI 2026, Bremen, Germany. 9 pages, 5 figures, 2 tables
RL提升LLM推理能力的关键更新因素是什么?
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。
形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理
机构 * University of Michigan(密歇根大学) ; Amazon(亚马逊)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。
Comments Accepted to KDD 2026
解锁大语言模型代码修正的迭代反馈循环
机构 * Iowa State University(爱荷华州立大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究通过执行反馈迭代修正代码的能力,提出评估指标并分析推理与非推理模型在利用反馈上的差异,发现推理模型显著优于非推理模型,且语法和运行时错误比逻辑错误更易修正。
Comments 22 pages, 14th Computing Conference 2026
MARS: 用于并行LLM测试时扩展的边际对抗风险控制停止策略
机构 * Amazon(亚马逊) ; Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI
AI总结 提出MARS停止规则,通过监测中间检查点的聚合投票并利用对抗性边界估计未来投票变化,在保证准确率的同时节省25-47%的自一致性token。
PAEC:面向RLVR中LLM推理的位置感知熵校准
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出位置感知熵校准(PAEC),通过局部top-p熵和top-2候选竞争构建软掩码,并施加基于锚点的下界惩罚,防止决策相关位置熵崩溃,提升数学推理性能。
Comments 22 pages, 7 figures
三思而后行:基于意图引导推理的LLM位置预测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出IntentPOI框架,通过两阶段意图引导推理(先推断用户出行意图,再基于意图选择POI),将位置预测从直接轨迹匹配转化为意图推理,在三个真实数据集上超越11个基线。
从正确性到效用:基于增益的LLM推理前缀评估
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL
AI总结 提出前缀增益概念,训练前缀效用模型(PUM)通过成对排序目标评估推理前缀对成功率的提升,在数学推理任务中优于传统正确性评估。
何时深度思考:用于LLM推理的抑制性深思
机构 * University of Birmingham, United Kingdom(英国伯明翰大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出IDPR框架,通过抑制控制器根据快速答案决定是否启动慢速推理,在数学推理测试集上仅调用8.20%的慢速推理,准确率从47.90%提升至48.92%。
SPADE:自适应合成可执行环境中的自博弈
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Seoul National University(首尔大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Chicago(芝加哥大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);pretraining(abstract);language agent(abstract);分类 cs.CL、cs.AI
AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。
Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade
大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力
机构 * University of Chicago(芝加哥大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。
Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025
大型语言模型行为演化的映射与测量
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。
KGCaRe:结合自动知识图谱构建与大语言模型上下文检索的可解释复杂条件问答方法
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM与RAG处理复杂条件问答时在特定领域表现不佳的问题,提出KGCaRe混合方法,结合KG构建、迭代图遍历与神经检索,在多类LLM及数据集上优于现有基线。
PICTURE:通过揭示而非隐藏角色的知识缺失来增强大语言模型的心智理论能力
机构 * Korea University(高丽大学)
专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对大语言模型心智理论推理中事件隐藏导致的性能下降问题,提出PICTURE提示方法,通过在思维链中明确角色知识缺失,使模型在错误信念任务上性能提升7.3%