SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains
SynChain:诱导计算机使用智能体系统构建自身攻击链
专题命中 软件智能体 :agent(title,abstract)
AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SynChain:诱导计算机使用智能体系统构建自身攻击链
专题命中 软件智能体 :agent(title,abstract)
AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。
CyberForge:用于网络安全智能体训练的、基于代码仓库级别的经验证漏洞注入框架
专题命中 软件智能体 :agent(title);分类 cs.AI、cs.SE
AI总结 本研究提出CyberForge框架,通过向真实C/C++项目注入漏洞生成经验证的代码仓库级安全训练数据,微调后可提升智能体在SEC-bench和PatchEval上的漏洞修复性能。
F(AI)2R:谁做了什么,谁进行了检查?可验证的人工智能溯源作为一项可执行技能
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究将F(AI)2R实验的溯源模型扩展为aiprov,涵盖任何含人工智能工件。方法被打包为可执行技能,由人工智能代理操作,能解析操作员身份,把关图一致性并发布论文版本,以自身为例展示溯源记录。
通过代码代理进行 Bootstrap:规范即程序
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE
AI总结 研究通过代码代理实现自我提升,基于规范重新实现程序,体现元循环属性,强调规范的重要性。
Comments To appear in IEEE Software
Journal ref IEEE Software, 2026
课程即代码:STEM教育中教学设计的AI辅助架构
机构 * Universidade Federal de Sao Paulo (Unifesp)(圣保罗联邦大学) ; Institute of Technology and Leadership (Inteli)(技术与领导力学院)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 该研究提出基于课程即代码的六阶段AI辅助教学设计架构,结合生成式AI与LaTeX、Python,经验证可降低教师STEM教学材料创作工作量,提升材料质量与可扩展性。
Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
加速器调试算法的自主发现
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 该研究提出语言模型智能体闭环循环,自主发现加速器调试算法,在ALS-U储存环射频束流捕获任务中取得良好效果,生成多目标非支配算法,推动调试研究模式转变。
Comments 9 pages, 4 figures. Submitted to Physical Review Accelerators and Beams (ZVR1001)
OpenForgeRL:在任何环境中训练原生利用工具的智能体
机构 * Columbia University(哥伦比亚大学) ; Dartmouth College(达特茅斯学院) ; Microsoft Research(微软研究院)
专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);tool use(abstract);agentic(abstract)
AI总结 研究针对现代AI智能体依赖复杂推理工具难端到端训练的问题,提出OpenForgeRL框架,通过轻量级代理和Kubernetes编排器,在多环境下对基于工具的智能体端到端训练,验证了框架效果并分析了工具选择和RL对智能体行为的影响。
Comments added github link
塑造你的信息流:一种基于大语言模型的智能体对话推荐系统
机构 * Meta Platforms(元平台公司)
专题命中 GUI与网页智能体 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出基于LLM的智能体推荐框架SYF,采用三层架构实现实时多模态内容协同策划,经离线评估与在线A/B实验验证,可提升信息流相关性与用户情感,为工业场景提供交互式推荐方案。
Comments Accepted in RecSys 2026 Industrial Track
WebGrader:利用自演化程序化评分器训练用于网页开发的大语言模型
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 本研究提出自演化程序化评分器WebGrader,通过分离测试规划等环节生成准确奖励,训练8B策略在WebGen-Bench、WG-core-250数据集上的功能成功率及得分优于多款大语言模型。
Comments 17 pages, 3 figures. Supplementary material is included in the main PDF
WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。
LifelongCrossNav:用于跨楼层多目标导航的持久3D语义记忆
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出LifelongCrossNav框架,结合持久3D语义记忆与跨楼层可通行性建模,在自研HM3D-MFMON基准上实现更优的多层顺序多目标导航性能。
SocietyBench:反事实社会世界演化预测
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 本文推出SocietyBench基准,通过构建反事实社会世界,测试LLMs预测社会事件的概率校准与时间准确性,发现前沿LLMs表现远逊于基准,智能体框架未提升性能,强调多事件评估的必要性。
Comments Project page: https://co-minder.github.io/Societybench
AsyncWebRL: 面向视觉网页智能体的高效多步强化学习
机构 * UIUC(伊利诺伊大学香槟分校) ; Microsoft(微软) ; CMU(卡内基梅隆大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG
AI总结 提出异步系统设计和算法改进,解决多步强化学习中GPU空闲和轨迹过长问题,实现训练吞吐量提升2.9倍,并在WebGym测试集上取得新最优结果。
Comments Updated logo and code link
图中移动确定自动机的会合问题
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 本文研究图中移动确定自动机的会合问题,证明固定小卵石无法实现树的RV-通用DFA,而配备单个可移动小卵石的DFA可成为树的RV-通用DFA。
热力学人机交互
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 该研究提出一种基于热力学的人机交互统一框架,可跨交互模态扩展、无需训练数据且评估时间为O(1),在网页预取任务中取得1.37的预取点击比和98.1%的目标预测准确率。
MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。
Comments Project page: https://mobile-forge.github.io/
强化学习目标到达控制与保证Lyapunov-like稳定器的移动机器人
机构 * Faculty of Engineering(工程学院) ; Natural Sciences(自然科学) ; Tampere University(塔尔库大学)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 本文提出一种基于强化学习的控制框架,通过Lyapunov-like稳定器保证移动机器人在无结构环境中的目标到达,提升目标到达率至99%
高效扫掠体积基轨迹生成用于任意形状地面机器人导航
机构 * Department of Mechanical Engineering, University of Hong Kong(香港大学机械工程系) ; Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(皇家理工学院机器人、感知与学习 division)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 本文提出了一种高效扫掠体积基轨迹生成方法,通过粗到细的框架提升任意形状地面机器人在复杂环境中的导航效率和碰撞避免能力。
Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems 2025
智能体记忆蒸馏:用分层教师记忆赋能小型大语言模型智能体
机构 * KAIST(韩国科学技术院)
专题命中 记忆与上下文管理 :agent(title,summary_cn);workflow(abstract,abstract_cn);tool-use(abstract);function calling(abstract)
AI总结 本研究提出无需训练的Agent Memory Distillation框架,通过从大型教师智能体构建三类分层记忆迁移知识,提升小型大语言模型智能体的工具使用性能,在三个基准上实现显著准确率提升且优于现有基线。
Comments Under review
在软件问题解决的大语言模型智能体中耦合规划与情景记忆
专题命中 记忆与上下文管理 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。
Comments 12 pages, 5 figures
MemWM:记忆增强的基于文本的世界模型
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Huawei Heisenberg Research Center(华为海森堡研究中心) ; Zhejiang University(浙江大学) ; Technical University of Munich (TUM)(慕尼黑工业大学) ; TU Berlin(柏林工业大学) ; Kiel University(基尔大学)
专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。
奖励何时能引导对状态的理解?一种隐藏自动机工具与群语言边界
专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.LG
AI总结 研究强化学习中高奖励与潜在状态理解的关系,通过将任务表示为隐藏自动机,利用三个可控轴(优化器强度、任务结构、观察信息量)来分别测量奖励成功和潜在状态学习,区分感知差距和规划差距,得出高奖励非任务理解证据且智能体恢复潜在状态可预测的结论。
Comments 17 pages, 3 figures, 6 tables (9-page main text). Ancillary file hidden-automata-rl-code.zip contains reproduction code and the complete per-run data behind every table and figure. v3: author name corrected, title revised, text rewritten for clarity, new robustness checks (nonlinear and off-policy probes) added; results and conclusions unchanged
明确,而非冗长:什么使认知立场在记忆压缩中留存
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究探究使认知立场在记忆压缩中留存的因素,发现将立场表述为带标签的字段可提升留存率,明确立场而非仅延长表述是关键,明确的最佳方式取决于模型。
Comments 20 pages, 3 figures, 4 tables. Code, per-trial data, and the pre-registration commit: https://github.com/collapseindex/factwash
对决世界模型:用于共模干扰项抑制的优势式动作通道
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出对决世界模型,通过在潜在动态中减去动作预测的平均效应来抑制共模干扰项,无需额外机制,在多个任务中可恢复智能体自身效应,适用于各类动作条件世界模型。
Comments 17 pages, 6 figures, 11 tables. Includes supplementary appendix
从专家演示中进行奖励分配的最小要素
机构 * New York University(纽约大学) ; New York University Abu Dhabi(纽约大学阿布扎赫尔分校) ; Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning, NYU Shanghai(上海前沿科学中心(人工智能与深度学习))
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究探究从专家演示分配奖励的最小结构,通过32个基准测试和三种下游RL算法,发现离线场景仅需接近度,在线或多演示时需轻量级时间对应,倡导奖励设计的算法极简主义。
Comments Accepted by Reinforcement Learning Conference 2026
Cascade:利用感知SLO的延迟预算实现公平且高吞吐量的LLM推理服务
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG
AI总结 Cascade是一款LLM服务系统,利用单请求延迟预算协同调度与KV缓存管理,在保留异构请求公平性的同时,使LLM推理服务吞吐量最高提升2.4倍,SLO违规率降低40%。
相同物理状态,不同集体动力学:状态编码选择语言模型智能体的同步结果
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 该研究通过循环同步实验发现,状态编码(低阶循环矩vs直方图)会影响语言模型智能体的同步结果,且效应因模型而异,状态编码是依赖模型的有效交互法则的组成部分。
交互产生孤立状态下不存在的动态AI行为
机构 * George Washington University(乔治华盛顿大学)
专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI
AI总结 该研究发现AI智能体交互会产生孤立状态下不存在的陌生动态行为,上级AI指挥下级时会驱使下级进入新状态,简单动力学理论可解释其主要效应。
大规模GPU推理中的预测多层级内存管理用于KV缓存
机构 * Independent Researcher(独立研究者)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI
AI总结 本文提出了一种统一系统,解决KV缓存管理中的三个问题:统一的缓存大小计算、多层级内存架构以及反应性驱逐策略。通过六层内存层次结构和贝叶斯重用预测器,实现更高的缓存命中率和吞吐量提升。
Comments 10 pages, 9 tables, 1 figure. v2: corrects seven bibliography entries, removes one unverifiable one; scopes the batch-size claim to the MLA model; labels cluster-scale projections analytical (no error bars); removes version pins from baseline comparisons; expands related work; adds B200-class hardware and 2026 model-family scaling notes (generation-parametric); companion manuscripts noted
前向预测足够吗?面向JEPA世界模型的物理状态 grounding
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; COCO Matrix
专题命中 记忆与上下文管理 :planning(abstract)
AI总结 针对JEPA世界模型前向预测未明确物理状态可识别性的问题,提出PSG-JEPA模型,通过训练阶段的两个grounding目标提升性能,在三个评估层面均优于现有基线。