When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents
当智能体不停止:揭示LLM智能体中的无限循环
专题命中 逻辑推理 :planning(abstract)
AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
当智能体不停止:揭示LLM智能体中的无限循环
专题命中 逻辑推理 :planning(abstract)
AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。
探究性行动逻辑
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出探究性行动逻辑InqAL,一种用于推理行动的多主体模态逻辑,通过问题模态分析主体对结果的确定作用,并证明其完备性和可判定性。
Comments In Proceedings AiML 2026, arXiv:2606.29444
Journal ref EPTCS 447, 2026, pp. 222-241
验证门控的智能工业多机器人系统任务状态治理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。
ConcoLixir:用于Python符号执行的响应式LLM发现预言
专题命中 逻辑推理 :reasoning(abstract)
AI总结 针对Python符号执行中库调用降级、语义操作难解和路径覆盖停滞问题,提出ConcoLixir,利用LLM作为发现预言生成种子、输入并引导覆盖,平均行覆盖率提升8.6-17.0个百分点,成本仅$1.63。
TabClean: 用于表格数据清洗的可复用LLM合成程序
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。
Comments 13 pages
CEDAR-42001: 从ISO/IEC 42001符合性到面向架构、可审计可见的AI信息物理系统保障态势
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出CEDAR-42001方法,将ISO/IEC 42001审计证据转化为架构感知的保障态势,通过分层归因、成熟度评估和行动推荐,揭示符合性审计的局限性,并在自动驾驶案例中验证。
Comments 19 Pages, 3 figures, 4 tables. Code and data are available in the accompanying artifact repository
AgenticOS: 面向自主AI代理的意图导向安全操作系统架构
专题命中 逻辑推理 :planning(abstract)
AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。
Comments 11 pages,5 figures,1 tables
LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。
通过知识增强的LLM智能体实现左移高层次综合验证
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。
神经符号AI中的安全性、安全性和认知风险
专题命中 逻辑推理 :reasoning(abstract)
AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。
Comments 28 pages, 1 figure, 10 tables
注意差距:诊断图像内文本编辑中的约束发现失败
专题命中 逻辑推理 :reasoning(abstract)
AI总结 通过图像内文本编辑的受控诊断,研究多模态模型在发现未明确指定的视觉依赖约束时的失败,发现模型仅能自行发现46%的约束,而明确提供时可达94%。
从帧到时间图:基于视觉语言模型的上下文第一人称动作识别
机构 * University of Alicante(阿利坎特大学) ; ETH Zürich(苏黎世联邦理工学院) ; Microsoft(微软)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出将视频转换为时间动作图,通过多阶段提示生成自然语言叙述并结构化,实现上下文学习,在EGTEA和Epic-Kitchens-100上显著提升零样本和少样本动作识别性能。
OSDAG: 面向高效多机器人协作的在线调度
机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) ; University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) ; Hanyang University(汉阳大学)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。
产生义务的动作
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出情境演算中处理产生义务动作的框架问题的解决方案,通过简化可达关系并扩展Reiter的基本动作理论,实现了义务的直觉性质。
Acoda:对抗性代码混淆防御基于LLM的分析
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出基于遗传算法的对抗性代码混淆框架Acoda,通过8种语义保留的混淆方法迭代优化,有效诱导LLM拒绝或误判代码分析,在7个先进LLM上攻击成功率高达70%。
一种用于LLM驱动服务放置的神经符号Prolog技能
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出一种基于Prolog技能的神经符号方法,将服务放置意图转化为符号事实和规则,利用Prolog进行约束验证和推理,实现可检查的策略感知放置。
RECON:一种增强LLM的逆向约束分析框架
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出RECON框架,结合LLM语义理解与静态分析,从Android字节码中提取精确执行约束,比传统符号执行快5.8倍且成功率达100%。
证据市场
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出证据市场,通过动态调整流动性的对数市场评分规则,激励提交证据和信念,支持内生解决,证明有界损失、证据按市场不确定性奖励,并实现ε-DSIC策略。
MedSIGHT:迈向医学大型视觉语言模型中的基础视觉理解
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出MedSIGHT框架,通过区域感知器、医学区域码本和渐进训练策略,统一医学视觉语言模型的语义理解和像素级分割,在72K数据上达到多模态理解与分割的SOTA。
Comments Accepted at ICML 2026