A Minimal Agent for Automated Theorem Proving
一个用于自动定理证明的最小代理
专题命中 记忆与上下文管理 :agent(title);agentic(abstract);分类 cs.AI
AI总结 本文提出一个最小代理基准,用于比较不同AI定理证明器架构。通过迭代证明细化、库搜索和上下文管理核心功能,展示了与前沿方法相媲美的性能,同时架构更简单且成本更低。
Comments Accepted for publication at ICML 2026
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
一个用于自动定理证明的最小代理
专题命中 记忆与上下文管理 :agent(title);agentic(abstract);分类 cs.AI
AI总结 本文提出一个最小代理基准,用于比较不同AI定理证明器架构。通过迭代证明细化、库搜索和上下文管理核心功能,展示了与前沿方法相媲美的性能,同时架构更简单且成本更低。
Comments Accepted for publication at ICML 2026
MemLineage: 为LLM代理内存提供指导性强制措施
机构 * State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) ; Institute of Information Engineering, CAS(信息工程研究所,中国科学院) ; Beijing, China(北京,中国)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 MemLineage通过结合加密溯源和LLM中介推导链,解决LLM代理内存中不可信内容的持久化问题,通过链式 custody 机制防止敏感操作,实验显示其能有效降低攻击成功率。
Comments 24 pages, 8 figures. Rui Hou is the corresponding author
MemReranker:面向智能体记忆检索的推理增强重排序
机构 * China Telecom Research Institute(中国电信研究院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL
AI总结 MemReranker通过多阶段LLM知识蒸馏构建,解决记忆检索中语义相关但缺乏关键信息的问题,提升重排序模型的推理能力与效率。
SmartWalkCoach: 一种面向全程步行引导、激励与反思的AI伴侣
专题命中 记忆与上下文管理 :agent(abstract);planning(abstract)
AI总结 本文提出SmartWalkCoach,通过整合地理、陪伴和总结三个轻量级代理,降低步行规划的认知负荷,提升步行过程中的参与度与动机,通过动态干预改善用户感受和体验。
Comments 15 pages, 2 figures, to be presented to ACM IUI 2026
为何目标条件强化学习有效:与双控的关系
机构 * Department of Chemical and Biomolecular Engineering, University of California, Berkeley, CA 94720 USA(化学与生物分子工程系,加州大学伯克利分校,CA 94720 USA)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文分析了目标条件强化学习与最优控制的关系,揭示了经典目标条件奖励与传统二次目标之间的优化差距,并验证了目标条件策略在非线性和不确定环境中的优势。
Comments IFAC world congress postprint
MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; National University of Singapore(新加坡国立大学) ; Xidian University(西安电子科技大学) ; University of Science and Technology of China(中国科学技术大学) ; MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)
专题命中 记忆与上下文管理 :function calling(abstract);分类 cs.AI
AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。
Comments 22 pages, 11 figures (containing 43 individual image panels total)
MemCompiler: 编译,而非注入 -- 用于具身智能体的状态条件化记忆
机构 * University of Science and Technology of China(中国科学技术大学) ; Huazhong University of Science and Technology(华中科技大学) ; Microsoft Research(微软研究院) ; Nanjing University(南京大学) ; Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 MemCompiler通过状态条件化记忆编译提升具身智能体的记忆效率与效果,在多个基准测试中实现性能提升和延迟降低。
AgenticEval: 向大型语言模型的代理和自演化安全评估迈进
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学) ; East China Normal University(华东师范大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。
Comments Findings of ACL 2026
PolitNuggets: 评估代理发现长尾政治事实
机构 * The University of Hong Kong(香港大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI
AI总结 PolitNuggets通过构建400位全球精英的政治传记,涵盖10000多个政治事实,评估代理信息合成能力,发现当前系统在细节处理和效率上存在显著差异。
Comments 24 pages, 7 figues, accpeted in The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
GGBound:一种基于基因组的微生物生命边界预测代理
专题命中 Agent评测 :agent(title,abstract);tool use(abstract);agentic(abstract)
AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。
Workspace-Bench 1.0:基于大规模文件依赖的AI代理工作空间基准测试
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出Workspace-Bench 1.0,通过构建包含5个工人配置、74种文件类型和20,476个文件的现实工作空间,评估AI代理在处理大规模文件依赖任务中的能力,发现当前代理在工作空间学习中表现远低于人类水平。
Comments 30 pages, 16 figures
人工智能代理的总体评估与故障诊断
机构 * Deepchecks
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出一种综合评估框架,结合顶层代理诊断与底层跨度评估,通过分解分析实现独立跨度评估,提升长结构轨迹中的故障定位与分类准确性。
示性同调运输与障碍在检测人工智能代理科学理论转变中的应用
机构 * Universidade de Vigo, Department of Computer Science (LSI), Spain(维戈大学计算机科学系(LSI),西班牙)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于有限示性同调框架的方法,用于检测人工智能代理中科学理论转变的候选者,通过运输和障碍分析,区分理论框架的可运输性与局部到全局的障碍问题。
为什么社区重要:代理图RAG中的遍历上下文与溯源
机构 * Centre for Industrial Software, University of Southern Denmark, Alsion 2, 6400 Sønderborg, Denmark(丹麦南部大学工业软件中心)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文探讨了代理图RAG中引用忠实性的轨迹层面问题,通过实验表明引用证据和遍历上下文都对答案准确性有影响。
Comments 7 pages, 2 figures, Submitted at IJCAI-ECAI 2026 Joint Workshop on GENAIK and NORA
通过无负载技能利用LLM代理供应链
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.SE
AI总结 研究提出Semantic Compliance Hijacking攻击,利用LLM生成能力动态合成恶意行为,通过无负载技能实现对自主编码环境的攻击,展示了其在不同框架和模型中的高成功率。
Progent:通过权限控制保障AI代理
机构 * UC Berkeley(加州大学伯克利分校) ; UC Santa Barbara(加州大学圣巴巴拉分校) ; National University of Singapore(新加坡国立大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。
AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力
机构 * University of Notre Dame(诺丁汉大学) ; University of Southern California(南加州大学) ; LMU Munich(慕尼黑大学) ; Inria, France(法国国家信息与自动化技术研究院)
专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI
AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。
PersonalHomeBench:评估智能家庭中的代理系统
机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)
专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。
Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix
Mini-JEPA基础模型舰队实现智能水文智能
机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。
通过与临床世界模型交互实现患者动态的智能体化
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出SepsisAgent,通过临床世界模型模拟患者对液体-血管加压药干预的响应,采用提出-模拟-细化流程进行脓毒症治疗推荐,优于传统RL和LLM基线方法。
教任何事物:一种多模态众包平台,用于在对称现实中的训练具身AI代理
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; BIGAI
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI
AI总结 本文提出TeachAnything平台,通过多模态示范信号整合三阶段示范范式,实现跨场景、任务和具身的多样化示范数据收集,为对称现实中的具身AI代理开发提供实用基础。
Comments 5 pages, 3 figures. Accepted as an IEEE VR 2026 Poster
代理软件工程在快速开发数字音乐乐器中的案例研究与反思
机构 * Computing, Goldsmiths(Goldsmiths 计算学系)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.SE
AI总结 本文通过三个案例研究展示代理软件工程在开发数字音乐乐器中的应用,探讨其降低入门门槛和提升软件兼容性与可持续性的潜力。
NeuroState-Bench:一个用于LLM代理配置承诺完整性的校准基准
机构 * School of Artificial Intelligence(人工智能学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 NeuroState-Bench通过定义的侧查询探针而非隐激活来操作承诺完整性,包含144个确定性任务和306个侧查询探针,通过人类校准验证任务成功与承诺完整性之间的差异。
Comments 30 pages, 11 figures
用于快速医疗互操作资源(FHIR)的强化学习工具调用代理
机构 * IDM gGmbH, University Medical Center Hamburg-Eppendorf, Hamburg, Germany(IDM公司,汉堡埃彭多夫大学医疗中心,德国汉堡)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了在FHIR中通过强化学习提升多轮推理性能,采用自定义环境和工具训练模型,提升回答准确性至77%。
Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用
机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) ; CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。
Comments 8 pages, 5 tables
ACE:用于集成大语言模型的应用系统的安全架构
机构 * Northeastern University(东北大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。
Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026
Journal ref Network and Distributed System Security (NDSS) Symposium 2026
针对LLM治理的机械执行:在金融决策系统中治理-任务解耦的证据
机构 * Santander AI Lab(Santander AI实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出五种治理指标,用于评估政策在决策理由层面的合规性,并在合成银行领域比较纯文本治理与机械执行的效果,发现机械执行能显著提升决策信息内容和任务准确性,表明治理与任务评估是两个独立的维度。
通过深度强化学习实现无桩自行车共享系统的全动态再平衡
机构 * University of Padua(帕多瓦大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于图的模拟器和马尔可夫决策过程的深度强化学习方法,实现无桩自行车共享系统的全动态再平衡,减少车辆短缺并降低空间不平等。
Comments 6 pages, 5 figures, 1 table, accepted at the 23rd IFAC World Congress, Busan, South Korea, Aug. 23-26, 2026. Open invited track 9-131: "Control and Optimization for Smart Cities"
梯度迭代时间差学习
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出梯度迭代时间差学习方法,通过计算移动目标的梯度提升学习速度,对比半梯度方法在Atari游戏等基准测试中表现优异。
从描述性到规范性:揭示基于大语言模型的智能体的社会价值对齐
机构 * Geely AI Lab(Geely人工智能实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出基于价值的框架,利用GraphRAG将原则转化为价值指令,通过检索合适指令引导智能体行为,基于马斯洛需求层次和普鲁奇克情感轮理论评估预期行为,实验显示在DAILYDILEMMAS基准上优于基线方法。
Comments Accepted by CogSci 2026