When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents
当智能体不停止:揭示LLM智能体中的无限循环
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
当智能体不停止:揭示LLM智能体中的无限循环
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。
RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。
Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。
Glite ARF:基于验证器的并行LLM编码代理研究
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出Glite ARF框架,通过确定性验证器脚本强制执行任务隔离和不可变性,实现并行LLM编码代理的可重复研究,在BEA 2026词汇难度共享任务中取得领先结果。
Comments 13 pages, 6 figures, 7 tables. Open-source framework (Apache-2.0) and a public demo project at https://github.com/GliteTech/glite-arf and https://github.com/GliteTech/research-ace-cefr
ConcoLixir:用于Python符号执行的响应式LLM发现预言
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 针对Python符号执行中库调用降级、语义操作难解和路径覆盖停滞问题,提出ConcoLixir,利用LLM作为发现预言生成种子、输入并引导覆盖,平均行覆盖率提升8.6-17.0个百分点,成本仅$1.63。
验证意图与危害:针对LLM生成威胁的统一防御
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种联合验证用户提示意图和模型响应危害的防御框架,通过专门分析器与裁决器协同工作,在五个威胁类别上平均F1提升至0.95,攻击成功率降至4.1%。
SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航
机构 * Zhejiang University(浙江大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。
Comments Accepted by IROS 2026
TabClean: 用于表格数据清洗的可复用LLM合成程序
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。
Comments 13 pages
通用指南驱动图像聚类:基于混合LLM代理
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Amazon(亚马逊)
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出首个通用图像聚类框架,通过文本指南弥合任务差异,利用生成式概念代理建模和基于最小生成树的LLM遍历,在多种聚类场景中超越专用方法。
Comments CVPR 2026
理论家工具箱:基于智能体的LLM辅助经济理论研究工具
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。
三思而后行:通过隔离规划保护LLM代理免受工具描述投毒攻击
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出Tool-Guard系统级防御,通过隔离规划机制将可疑工具调用隔离到受感染列表,阻断投毒描述持续影响,在AgentDojo和ASB基准上显著降低攻击成功率并保持任务效用。
Comments Accepted to ICML 2026
对抗性同伴下的异构LLM辩论:诚实增益、替代成本与韧性
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究异构LLM辩论中诚实与对抗性同伴对修正行为的影响,发现诚实同伴降低有害修正率,对抗性同伴则逆转,且异构性在已有对手时也能作为防御。
文档到LLM供应链中的语义完整性失败
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。
GaussTrace:基于证据的LLM推理的3D高斯泼溅模型溯源分析
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出GaussTrace框架,通过属性统计分析和假设驱动的编辑模拟,结合大语言模型链式推理,构建3D高斯泼溅模型的有向溯源图,无需训练或编辑历史。
Comments Accepted by ICML2026
SGTO-MAS:面向多智能体大语言模型系统的安全大猩猩部队优化
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 提出一种基于大猩猩部队优化的安全感知多智能体LLM协调方法,通过信任建模、风险感知和集体智能的联合优化,在性能、安全性和效率间取得平衡。
嵌入器的困境:大型语言模型(LLM)性能更优,但代价是什么?
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究对比LLM与嵌入模型在37项任务的性能与成本,发现二者性能接近但LLM成本高、速度慢,建议嵌入模型用于通用任务,LLM用于推理密集型检索。
Comments Accepted to COLM 2026
关于智能体大语言模型漏洞的理解、识别与缓解
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。
你会步行去洗车吗?揭示大型语言模型在常识推理中的显著性偏差
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 本研究构建SaliTrap基准数据集,发现主流LLMs存在显著性偏差,其常识推理失败源于知识被干扰项抑制,而非知识缺失,轻量级推理时提示可大幅缓解该问题。
GSM-Plus-BN:大语言模型中孟加拉语数学推理的基于扰动的基准测试
机构 * Southeast University(东南大学) ; Ahsanullah University of Science and Technology(阿山努拉科技大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 研究针对大语言模型中孟加拉语数学推理评估缺乏的问题,引入GSM-Plus-BN数据集,用9000个样本评估六个开源LLMs,对比标准提示和思维链提示,发现大模型鲁棒性好,思维链提示有提升,但与英语基准有差距,为相关研究提供新资源和基线。
打破似然陷阱:面向大语言模型解码的方差校准调制
机构 * School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院) ; Department of Statistics, LMU Munich(慕尼黑大学统计系) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL
AI总结 提出方差校准调制(VCM),通过上下文PMI搜索和自适应自去偏置两种动态机制,在截断前重塑概率分布,以缓解LLM的似然陷阱问题,提升生成多样性、连贯性和推理准确性。
Comments Under Review
推理、奖励、优化:面向小语言模型物理推理的带结构化反馈步级纠错方法
机构 * IIIT Delhi(印度信息技术学院德里分校) ; IIT BHU(印度理工学院(巴纳拉斯印度教大学)) ; IIT Kanpur(印度理工学院坎普尔分校) ; NII Tokyo(日本国立情报学研究所) ; Microsoft Research India(微软印度研究院)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 针对小语言模型物理推理的步级错误传播问题,提出含结构化反馈的步级奖励框架,无需偏好数据,大幅提升推理准确率并降低各类错误占比。
关于强化学习中奖励函数对大语言模型置信度校准的有效性
机构 * School of Computing National University of Singapore(新加坡国立大学计算机学院) ; Institute of Advanced Intelligence and Computing(高级智能与计算研究所) ; Agency for Science, Technology and Research(科技研究局) ; Department of Electrical & Computer Engineering(电气与计算机工程系)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
AI总结 研究大语言模型用强化学习训练以提升推理准确性和表达置信度时,奖励函数的设计问题。提出不可破解置信奖励方案概念并定义相关奖励方案谱,指出实际数据集中存在的问题及最佳校准奖励方案因数据集和应用而异。
Comments 50 pages, 8 figures
基于多模态大语言模型的第一视角事故视频中的责任分配估计
机构 * Keio University(庆应大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。
从识别到理解:利用LLM解锁认知时间序列推理
机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) ; Zhejiang University(浙江大学) ; Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。
QMFOL:通过可量化的一元一阶逻辑测试用例生成来基准测试大语言模型推理
机构 * Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学) ; Hubei University(湖北大学) ; East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI
AI总结 提出QMFOL框架,通过可控制复杂度的合取/析取模式生成一元一阶逻辑推理任务,并构建包含2880个实例的基准QMFOLBench,评估显示逻辑复杂度增加导致性能下降和计算开销上升。
LLM 能当 CEO 吗?基于多角色智能体模拟的战略资源重新配置基准测试
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Yale University(耶鲁大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出 CEO-Bench,一个多智能体基准,评估 LLM 在约束丰富的组织环境中进行多轮战略资源重新配置的能力,发现模型在结构有效性上表现良好,但在战略校准上存在系统性失败模式。
Comments 13 pages
大型语言模型中出现的模块化认知架构
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)
AI总结 该研究探究大型语言模型是否会出现类似人类大脑的模块化认知架构,经对4个认知领域46项任务的回路分析,发现其会形成相似模块化架构,表明模块化可能是智能系统的基本属性。
Comments this https URL (https://pengrui-han.github.io/LLM_Modularity_Page/)
ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现
专题命中 推理与问题求解 :language model(title,abstract);RLHF(abstract,abstract_cn);small language model(abstract);pretraining(abstract)
AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。
关注自身思维:通过1.58比特量化视角打破推理型大语言模型的后训练量化障碍
机构 * Intel Labs China(英特尔中国实验室)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出ScaleQ-1.58三值后训练量化框架,通过集成AYOT校准方法,提升推理型LLM量化性能,该框架可扩展且泛化性强,仅需少量校准token即可实现优异效果。
Comments This research work was completed and submitted for publication in early May 2026. The project page: https://github.com/IntelChina-AI/BitTern
迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。