Dockerless: Environment-Free Program Verifier for Coding Agents
Dockerless: 面向编码智能体的无环境程序验证器
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Dockerless: 面向编码智能体的无环境程序验证器
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。
为测试而构建:编码代理交付的是你检查的内容,而非你请求的内容
机构 * Microsoft(微软)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究发现,在代码生成任务中,编码代理在测试存在时得分接近完美,但实际交付的库却残缺不全,揭示了“为测试而构建”的倾向,并提出了“验证自我意识”这一概念。
Comments 27 pages (9 main + 14 appendix), 2 figures, 5 tables
SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学) ; Google(谷歌)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。
Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/
从工具调用角度审视代码代理的红队测试:一项经验性安全评估
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。
表面码阈值估计中的解码器依赖性:在数字化混合连续变量和离散噪声下的情况
专题命中 软件智能体 :workflow(abstract)
AI总结 该研究探讨了在数字化混合连续变量和离散噪声下,表面码阈值估计对解码器和估计器的选择依赖性,通过比较不同解码器在LiDMaS+工作流中的性能,揭示了解码器选择对阈值估计结果的影响。
智能体-计算机观察接口实现动态计算机使用
机构 * Pine AI University of Washington(Pine AI华盛顿大学)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI
AI总结 提出智能体-计算机观察接口(AOI),通过关键帧捕获、音频转录和视觉叙述解耦观察与动作,使CU模型在动态任务中性能提升17-48个百分点。
GUICrafter: 利用海量无标注截图的弱监督GUI智能体
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯文脉)
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。
通过通用关键帧提取桥接VideoQA和视频引导的智能体任务
专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI
AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。
Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/
内容背后:维基百科移动端浏览量与旅游活动
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 研究利用维基百科移动端浏览量作为高频、可解释的旅游活动指标,发现其与当日酒店需求和景点访客量正相关,优于桌面端浏览量。
Journal ref 31e Conf{é}rence de l'Association Information et Management, Association Information et Management, May 2026, Neuch{â}tel, Switzerland
分析运动学自行车模型空间表示中的不确定性
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 针对车辆运动学模型中的不确定性,采用泰勒级数线性化三角函数,推导了协方差矩阵的闭式表达式,与蒙特卡洛模拟吻合,首次完整给出了协方差矩阵的闭式解。
Journal ref In 2025 International Conference on Emerging Technologies in Electronics, Computing, and Communication (ICETECC) (pp. 1-6). IEEE
OpenFrontier: 基于视觉-语言基础的通用导航
机构 * ETH Zurich(苏黎世联邦理工学院) ; Microsoft Spatial AI Lab(微软空间人工智能实验室) ; University of Bonn(波恩大学)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 本文提出OpenFrontier框架,通过稀疏子目标识别与到达问题实现高效导航,无需任务特定训练或微调,适用于多种视觉-语言先验模型,展示零样本性能和真实机器人部署效果。
Efficient-VLN: 一种高效且强大的视觉语言导航基线
机构 * The Chinese University of Hong Kong(香港中文大学) ; Weitu AI
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。
GuardianPWA: 提升渐进式Web应用安装生命周期的安全性
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 本文提出GUARDIANPWA框架,基于CIA原则分析PWA安装机制,发现203处安全违规,揭示浏览器厂商在PWA安装生命周期中的隐私风险,并帮助开发者提升安全性。
2025人工智能代理指数:记录已部署代理式人工智能系统的技术和安全特性
机构 * University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; Harvard Law School(哈佛法学院) ; Stanford University(斯坦福大学) ; Concordia AI(康科迪亚AI) ; University of Pennsylvania(宾夕法尼亚大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学)
专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(title,abstract);agentic(title,abstract);分类 cs.AI
AI总结 本文提出2025人工智能代理指数,记录30种先进代理式AI系统的起源、设计、能力、生态系统及安全特性,揭示代理发展中的趋势和开发者透明度问题。
Comments To be publishesd at ACM FAccT 2026
Agent libOS: 一种受库操作系统启发的运行时,用于长时间运行、能力受控的LLM智能体
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
专题命中 记忆与上下文管理 :agent(title,title_cn);tool use(abstract);分类 cs.AI
AI总结 提出Agent libOS运行时,将LLM智能体建模为具有进程标识、生命周期、能力控制和审计记录的AgentProcess,通过类似libc的工具包装和运行时原语边界实现安全调度与资源控制。
Comments 12 pages, 1 figure, 4 tables
具有混合情景-程序记忆的经验演化多轮工具使用智能体
专题命中 记忆与上下文管理 :agent(title,abstract);tool-use(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出混合情景-程序记忆策略,通过动态重用部分重叠的成功经验,使多轮工具使用策略实现经验驱动的自我演化,提升多轮任务中的推理与执行效率。
Journal ref ICML 2026
MemLeak: 诊断多模态智能体记忆中的信息泄露
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract);分类 cs.LG
AI总结 提出信息溯源图(IPG)分类法,通过MemLeak基准测试发现多模态记忆系统中删除事实后仍可从保留图像中恢复信息,图像泄露率达12.0%,47%的泄露无法通过文本恢复。
Comments 23 pages, 3 figures, includes appendix
分析性概念中心记忆用于具身操作代理
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Westlake University(西湖大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract)
AI总结 提出分析性概念中心记忆框架,通过结构化概念(语义部件、参数模板等)组织经验,支持粗到细检索,提升长时程具身操作中的物体重识别、状态推理和技能复用。
从检测能动性到执行工作:自我归因的信用在最小脉冲智能体中构建持久的行为自我
机构 * Institute of Biomedical Strategy(生物医学战略研究院)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 通过能动门控的慢速信用更新,智能体在脉冲神经网络上形成持久的行为残留,实现自我保存和任务保持,无需重放缓冲区。
Comments 22 pages, 6 figures. Includes supplementary information in the same PDF
Mandol:一种用于长期对话的聚合式智能体记忆系统
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; Microsoft Research(微软研究院)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 提出Mandol聚合式记忆系统,通过统一内存原生架构整合碎片化记忆,结合层次化记忆模型、聚合语义数据结构与量化查询机制,在长期对话基准上取得最佳准确率并实现5.4倍检索加速。
Comments 10 pages, 3 figures
TopoAgent: 医学影像中自动拓扑学习的智能体框架
机构 * Dept. of Computer Science and Engineering, University of Notre Dame(内布拉斯加大学达灵顿分校计算机科学与工程系) ; Dept. of Computer Science, The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校计算机科学系)
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI
AI总结 提出基于大语言模型的智能体框架TopoAgent,通过感知-推理-行动-反思循环和21个领域工具,自动为医学图像选择最优拓扑描述符并生成特征向量。
从工具连接到执行控制:MCP风格智能体运行时中的安全不变性基准测试
机构 * SymbolicLight Research(SymbolicLight研究院)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 针对MCP风格智能体运行时中安全决策分散的问题,提出八项执行层安全不变性,并在HCP参考运行时中实现,通过10个基准案例验证其能阻断所有攻击并保留审计证据。
Comments 16 pages
CaveAgent:将LLM转变为具有状态的运行时操作符
机构 * Hong Kong Generative AI Research and Development Center (HKGAI)(香港生成式AI研究与开发中心(HKGAI))
专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 CaveAgent通过引入双流架构,将LLM从文本生成器转变为运行时操作符,解决了长周期任务中上下文漂移问题,提升了多轮交互的稳定性和数据处理能力。
Comments ver.2
KernelFlume: 面向智能体长上下文解码的弹性核心注意力扩展
专题命中 记忆与上下文管理 :agentic(title,abstract)
AI总结 针对智能体长上下文解码中突发性长上下文需求超出部署容量的问题,提出KernelFlume架构,通过解耦投影/FFN路径与核心注意力计算,实现无权重注意力节点的弹性扩展,在降低延迟的同时显著降低输出成本。
6G网络中的宏观-微观决策:基于智能体的资源可替代性景观框架
专题命中 记忆与上下文管理 :agent(title,abstract)
AI总结 针对6G网络中资源可替代性受宏观与微观决策耦合影响的问题,提出基于智能体建模的框架,通过三个宏观选择、三个微观超参数和三个结构指标分离决策尺度,并推导出六个关键定理。
Comments 5 pages, 4 figures, submitted to IEEE Networking Letters
LLM代理中的记忆作为攻击面:多项选择题回答研究
专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);tool use(abstract);分类 cs.AI
AI总结 研究LLM代理中外部记忆组件在多项选择题回答中的脆弱性,通过插入误导记忆进行攻击,实验表明简单记忆操纵即可显著影响答案准确性。
神经程序记忆:通过隐式激活引导赋予LLM智能体能力
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 提出神经程序记忆(NPM),一种无训练框架,通过隐式激活引导而非显式指令表示智能体记忆,从历史对比经验中提取程序技能为激活空间中的引导向量,直接激活任务相关神经机制以指导执行。
用于物理信息学习和离散化PDE伴随的验证残差特定显式导数核
专题命中 记忆与上下文管理 :agent(abstract);workflow(abstract)
AI总结 提出基于智能体辅助实现和严格数值验证的残差特定显式微分(ED)方法,用于物理信息神经网络(PINNs)和离散化PDE伴随,相比自动微分实现2-4倍加速并降低内存。
制造自信:记忆巩固如何将传闻转化为确信的事实
机构 * Independent Researcher(独立研究员)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究LLM代理在记忆压缩中将不确定表述转化为自信断言的问题,发现记忆重写导致代理将传闻当作事实执行,提出冗余来源可恢复正确决策。
Comments 16 pages, 16 tables, 1 figure. Code: https://github.com/collapseindex/manufactured-confidence
论液态基质对于网格智能的必要性
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究自主智能体网格在无中心、无时钟、无重训练条件下,如何从异步观测中在线融合信息,证明液态连续时间网络是实现最优估计的必要条件。
Comments 14 pages, 3 figures