Fork, Explore, Commit: OS Primitives for Agentic Exploration
分支、探索、提交:用于代理探索的操作系统原语
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)
AI总结 本文提出分支上下文操作系统抽象,支持并行探索路径和原子提交回滚,通过BranchFS和branch系统调用实现,提升代理探索效率。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
分支、探索、提交:用于代理探索的操作系统原语
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)
AI总结 本文提出分支上下文操作系统抽象,支持并行探索路径和原子提交回滚,通过BranchFS和branch系统调用实现,提升代理探索效率。
受控网站交互用于代理AI的委托关键任务
机构 * Arizona State University(亚利桑那州立大学)
专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出一种受控网站交互设计,用于代理AI执行关键任务,通过细粒度访问控制机制提升安全性与效率。
动作代数在代理对世界的表示中的代数
机构 * Artificial Intelligence Research Centre (CitAI), Department of Computer Science, City St George's, University of London(人工智能研究与应用中心(CitAI)、计算机科学系、圣乔治学院、伦敦大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出从代理视角提取世界变换代数的框架,通过计算方法提取简单强化学习场景中的变换代数并分类,推广SBDRL的等变条件和解缠定义到任意代数的变换属性。
SODIUM:从开放网络数据到可查询数据库
机构 * UIUC(伊利诺伊大学香槟分校)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 研究针对需要整合多源网络数据的分析问题,提出SODIUM任务,通过系统化构建潜在数据库支持查询。开发SODIUM-Agent系统,采用ATP-BFS算法实现深度网络探索与结构化信息提取,准确率达91.1%。
AJAR:适应性突破架构用于红队测试
机构 * School of Cyber Science and Engineering(网络安全科学与工程学院)
专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL
AI总结 AJAR框架通过可调用MCP服务实现多轮突破算法,提升X-Teaming攻击成功率至76.0%,并在工具访问下优化攻击面。
Comments 7 pages, 3 figures. Code and data available at https://github.com/douyipu/ajar
Memento-Skills:让代理设计代理
机构 * Memento-Team(Memento团队)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 Memento-Skills是一种能够持续学习的通用大语言模型代理系统,通过经验自主构建、适应和改进任务特定代理,利用状态提示的强化学习框架和可重用的技能库实现持续学习。
Comments Memento-Skills Technical Report
迈向科学应用中可靠、安全和安全的LLM
机构 * Argonne National Laboratory(阿贡国家实验室)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文探讨了科学应用中LLM代理的安全与安全挑战,提出通过多代理系统生成领域特定对抗性安全基准,构建多层次防御框架以提升LLM可信度。
SOL-ExecBench:面向真实世界GPU内核的光速基准测试,针对硬件极限
机构 * NVIDIA
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 SOL-ExecBench通过235个CUDA内核优化问题,针对NVIDIA Blackwell GPU的硬件极限,提出基于Speed-of-Light(SOL)的基准测试方法,评估内核优化效果。
大语言模型能否生成有趣的数学研究问题?
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文探讨大语言模型能否生成有价值的前沿数学研究问题,通过生成665个微分几何问题并经人类验证,发现许多问题对专家而言尚属未知且具有独特研究价值。
ClawTrap:一种基于中间人攻击的红队框架,用于现实世界OpenClaw安全评估
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出ClawTrap,一种基于中间人攻击的红队框架,用于评估现实世界OpenClaw的安全性。该框架支持多种定制化攻击形式,提供可重复的管道流程,用于规则驱动的拦截、转换和审计。
Comments 8 pages, 5 figures, 2 tables. Preliminary technical report; quantitative experiments and extended evaluation to appear in v2
AutoResearch-RL:持续自我评估的强化学习代理用于自主神经架构发现
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 AutoResearch-RL通过强化学习代理持续自主发现神经网络架构和超参数,无需人工监督,通过验证位率指标优化策略,实现高效实验迭代。
Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions
摆脱离线悲观主义:用于安全前沿探索的向量场奖励塑造
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出向量场奖励塑造方法,通过梯度对齐和旋转向量项诱导持续安全前沿探索,验证了在连续导航任务中有效平衡安全与信息收集。
癫痫控制:整体脑动力学的均场控制
机构 * School of Mathematics and Information Science(数学与信息科学学院) ; Guangzhou University(广州大学) ; School of Sciences(科学学院) ; Great Bay University(大亚湾大学) ; Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力系统重点实验室) ; School of Mathematics and Statistics(数学与统计学学院) ; Huazhong University of Science and Technology(华中科技大学) ; Center for Mathematical Science(数学科学中心)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出基于图正则化的Koopman均场游戏框架,通过Reservoir Computing和Alternating Population and Agent Control Network实现脑神经动力学的非线性控制,有效抑制癫痫发作并保持脑功能拓扑结构。
Comments 22 pages, 7 figures
从日志到语言:学习用于基于LLM的推荐系统的最优 verbalization
机构 * University of Georgia(佐治亚大学) ; Netflix ; Capital One ; Hong Kong Polytechnic University(香港理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种数据驱动框架,通过强化学习学习最优 verbalization 方法,提升基于LLM的推荐系统表现,实验显示在Netflix数据集上推荐准确率提升达93%。
Comments Work in progress
基于VR数据开发校园枪击行为离散事件模拟器
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 本文提出一种数据驱动的离散事件模拟器,用于模拟校园枪击行为,通过VR数据学习枪手行为,评估机器人干预策略,实现高效安全干预策略的可扩展评估。
Comments Accepted for presentation at ANNSIM 2026. Camera-ready version. 13 pages, 4 figures, 4 tables
拍卖中相互依赖的复杂性
专题命中 Agent评测 :agent(abstract)
AI总结 研究拍卖设计中相互依赖模型的计算复杂性,分析在确定性和随机性设定下,优化 truthful 机制的近似比问题,推翻传统假设,提供高效算法和复杂性理论。
MicroVision:一个用于检测易受伤害道路使用者和微交通车辆的开放数据集和基准模型
机构 * Chalmers University of Technology(楚尔姆斯理工大学)
专题命中 Agent评测 :planning(abstract)
AI总结 本文提出MicroVision数据集,用于检测常见的易受伤害道路使用者和静止的微交通车辆,通过提供先进的基准模型提升交通安全和监控系统的能力。
在受限加性成本下分配家务:同时实现EFX、MMS和效率
专题命中 Agent评测 :agent(abstract)
AI总结 研究在受限加性成本下如何公平高效分配家务,提出同时满足EFX和MMS的算法,并证明其社会成本近似比为2,且最优。
Comments To appear in WWW 2026