Agentic Generation of AST Transformation Rules for Fixing Breaking Updates
用于修复破坏性更新的AST转换规则的智能体生成
专题命中 工具调用 :agentic(title,abstract);分类 cs.SE
AI总结 提出BigBag框架,通过智能体生成可复用的API级AST转换规则,修复依赖更新导致的编译错误,在BUMP基准上实现78.6%的修复率和跨项目33.3%的修复率。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
用于修复破坏性更新的AST转换规则的智能体生成
专题命中 工具调用 :agentic(title,abstract);分类 cs.SE
AI总结 提出BigBag框架,通过智能体生成可复用的API级AST转换规则,修复依赖更新导致的编译错误,在BUMP基准上实现78.6%的修复率和跨项目33.3%的修复率。
AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试
机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)
专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。
Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench
EComAgentBench:在分布式隐藏意图的长时任务上基准测试购物代理
机构 * Shopee
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出EComAgentBench基准,包含662个基于真实亚马逊产品的任务,要求代理在100次工具调用内从可见查询、工具门控配置文件和脚本化澄清中挖掘隐藏意图,验证候选产品并提交最终选择,通过类型化源标签评分归因失败。
我们能在多大程度上信任LLM搜索智能体?衡量对网络内容操纵的认可脆弱性
机构 * Center of Excellence for Generative AI, KAUST(KAUST生成式人工智能卓越中心) ; Jilin University(吉林大学) ; Zhejiang University(浙江大学) ; The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室 IDSIA-USI/SUPSI) ; NNAISENSE
专题命中 工具调用 :agent(abstract);分类 cs.CL
AI总结 提出SearchGEO框架,通过五类攻击模式和输出级指标评估13种LLM后端对网络内容操纵的认可脆弱性,发现攻击成功率从0%到31.4%不等,且不同后端对攻击模式的敏感性和部署框架的影响存在显著差异。
Comments 23 pages, 3 figures
CONDUCTOR: 一种用于不确定性感知配电网运行的LLM编排数字孪生
专题命中 工具调用 :tool use(abstract)
AI总结 提出CONDUCTOR,一种基于大语言模型编排的数字孪生系统,用于配电网运行,支持不确定性感知分析(概率安全评估、鲁棒校正调度等),在真实丹麦博恩霍尔姆60 kV配电网测试中,首次任务正确率达98.5%。
基于s(CASP)的复杂自主无人机任务执行与决策
专题命中 工具调用 :agent(abstract)
AI总结 提出使用s(CASP)回答集编程系统构建符号状态中心的无人机代理,在虚幻引擎5环境中实现基于约束的常识推理,支持多步骤自主行为并动态调整计划,确保决策正确可解释。
SAFARI: 通过主动调查扩展长时域智能体故障归因
机构 * Department of Engineering Sciences(工程科学系) ; Applied Mathematics, Northwestern University(应用数学,西北大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)
AI总结 提出SAFARI框架,用工具增强的诊断循环替代线性上下文加载,结合短期记忆解耦诊断准确性与上下文限制,在Who&When和TRAIL GAIA数据集上分别提升20%和19%,并在超出上下文窗口5倍时保持0.58精度。
Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026
智能体模型批判
机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
专题命中 规划决策 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。
AGORA:基于档案的智能体工作场所文档推理基准
机构 * Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Shanghai Qiji Zhifeng Co., Ltd.(上海奇绩智峰有限公司)
专题命中 规划决策 :agentic(title,abstract);分类 cs.CL
AI总结 提出AGORA基准,包含362个问题、8个领域共9664份真实文档(3.72亿词元),要求智能体在超大档案中主动搜索稀疏证据并推理答案,最强模型准确率仅59.4%。
FlowR2A: 学习奖励到动作分布用于多模态驾驶规划
机构 * The University of Hong Kong(香港大学) ; Changan Automobile(长安汽车)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 提出FlowR2A,通过流匹配解码器学习奖励条件动作分布,统一了基于评分和基于锚点的方法,实现密集监督与动态生成,在NAVSIM基准上取得最优结果。
Comments Project page: https://lixirui142.github.io/flowr2a-ad
Project Ariadne: 用于合成规划的提示条件路线生成
机构 * Yale University(耶鲁大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.LG
AI总结 提出解码器专用路线生成器Ariadne,通过提示-补全序列统一表示目标、约束和路线,在RetroCast/PaRoutes基准上,深度约束和所需叶子约束的Solv-0分别提升13.7和31.2点,推理时间远低于DESP。
Comments Code is available at https://github.com/ischemist/project-ariadne
RIFT-Bench:面向智能体AI系统的动态红队测试
机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究院) ; Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人研究有限公司)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 提出RIFT-Bench,一种基于图表示的动态红队测试方法,用于统一评估异构智能体AI系统的安全性,通过自动发现系统结构并部署自适应对抗攻击。
Comments Preprint
基于优化的多楼层场景自动驾驶地面车辆安全轨迹规划
机构 * Beijing Institute of Technology(北京理工大学) ; Tsinghua University(清华大学)
专题命中 规划决策 :planning(title,abstract)
AI总结 提出一种针对多楼层场景的轨迹规划框架,包括基于广义Voronoi图和多目标算法的任务规划模块,以及采用优化方法和热启动分层规划生成高质量轨迹的轨迹规划模块,并通过仿真验证可行性。
NavWM:一种用于前瞻性规划的统一导航世界模型
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北京航空航天大学) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 规划决策 :planning(title);agent(abstract)
AI总结 提出NavWM统一导航世界模型,通过潜在世界令牌提取几何与语义先验,结合锚点多模态轨迹预测框架生成多样化动作空间,利用视觉前瞻评估最优路径,在多种机器人数据集上显著提升未来状态生成与零样本导航成功率。
Comments 13 pages, 5 figures, accepted to ECCV 2026
通用指南驱动图像聚类:基于混合LLM代理
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Amazon(亚马逊)
专题命中 规划决策 :agent(title,abstract)
AI总结 提出首个通用图像聚类框架,通过文本指南弥合任务差异,利用生成式概念代理建模和基于最小生成树的LLM遍历,在多种聚类场景中超越专用方法。
Comments CVPR 2026
当检索指标误导:衡量长周期工具使用智能体中的策略信号
机构 * Amazon Web Services(亚马逊云服务)
专题命中 规划决策 :tool-use(title);分类 cs.AI、cs.CL、cs.LG
AI总结 研究发现精确匹配的检索召回率会低估下游策略效用,通过分类器实验表明检索到的策略子句与黄金子句在宏F1上无显著差异。
ChartWalker: 跨图表RAG任务的基准测试
专题命中 规划决策 :agent(abstract,abstract_cn);agentic(abstract)
AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。
分片世界模型:通用智能体的结构化认证
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(香港中文大学(深圳)数据科学学院)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 针对通用智能体在大世界场景下无法普遍胜任的问题,提出结构化认证框架,通过深度组合目标过滤特定转移,证明世界模型具有O(1/n)+O(δ)误差界,实现可认证部署。
Comments 30 pages, camera-ready version in ICML 2026
潜在桥:用于实时游戏智能体的连续慢-快通道
机构 * Pine AI ; University of Washington(华盛顿大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 针对实时游戏智能体,提出一种可学习的连续潜在桥(Latent Bridge),将慢速推理VLM的残差投影到快速反应VLM的输入嵌入空间,在7个Atari游戏和驾驶域中匹配或超越文本桥,且增益高度可预测。
ReM-MoA:推理记忆维持混合代理的扩展
机构 * University of Southern California(南加州大学) ; Iowa State University(爱荷华州立大学) ; Cisco AI Research(思科人工智能研究院)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出ReM-MoA框架,通过排名推理记忆和策展多样化记忆路由机制,解决混合代理架构随深度增加性能退化问题,在多个推理基准上持续优于现有方法。
可信AI的密码学有效性证书
机构 * Heriot-Watt University(赫瑞思-瓦特大学)
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。
有毒剧本:揭秘知识投毒对AI安全代理的影响
专题命中 规划决策 :agent(abstract);AI agent(abstract)
AI总结 研究揭示通过RAG注入单条有毒安全知识可系统性改变AI安全代理行为,提出验证边界(VB)分类法,并评估验证提示与多源检索的防御效果。
RoBoSR:面向具身机器人推理的结构化场景表示
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 提出RoBoSR,一种基于语义对象中心场景图的中间结构表示,将操作建模为逐步状态转换,实现因果推理和长期任务规划,并在零样本泛化中优于提示方法和经典TAMP基线。
JEDEL:用于早期药物发现的零样本DNA编码库设计
机构 * The ALBORADA Drug Discovery Institute, University of Cambridge(剑桥大学ALBORADA药物发现研究所)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出JEDEL框架,直接从活性配体的三维药效团表示生成可合成的DNA编码库,无需目标特异性再训练,在18个蛋白靶点上优于随机和多样性基线。
集成特征选择与哈里斯鹰优化用于女性性工作者可解释心理健康风险预测
机构 * Department of Information Sciences and Technology(信息科学与技术系) ; George Mason University(乔治·马歇尔大学) ; Department of Computer Science and Engineering(计算机科学与工程系) ; Jahangirnagar University(贾汗吉尔纳加尔大学) ; AIUB ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Dhaka University of Engineering and Technology(达卡工程与技术大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出集成ANOVA和互信息的特征选择与哈里斯鹰优化逻辑回归的混合模型,在3005名女性性工作者中实现95.78%准确率,识别创伤后应激、客户暴力和职业因素为抑郁主要贡献因素。
Comments Accepted and presented at the 2026 8th IEEE Symposium on Computers & Informatics (ISCI 2026). To appear in IEEE conference proceedings
EMAgnet:大规模博弈中策略梯度自我博弈的参数空间EMA正则化
机构 * Riot Games(拳头游戏) ; University of California, Irvine(加州大学尔湾分校) ; New York University(纽约大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出EMAgnet,通过指数移动平均(EMA)对策略参数进行自适应正则化,替代均匀分布正则化,在两人零和博弈中降低可剥削性。
Comments Accepted at NExT-Game 2026: New Frontiers in Game-Theoretic Learning (ICML 2026 Workshop). 13 pages, 2 figures,
神经符号驱动:基于规则忠实推理的驾驶VLA
机构 * Texas A&M University(德克萨斯农工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学) ; University of California, Riverside(加利福尼亚大学河滨分校) ; University of Pittsburgh(匹兹堡大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL
AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。
LaGO:面向在线强化学习的潜在动作引导
机构 * Siebel School of Computing(计算科学系) ; Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,美国) ; Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾) ; Institute of Information Science, Academia Sinica, Taiwan(信息科学研究所, Academia Sinica,台湾)
专题命中 规划决策 :planning(abstract,comments);分类 cs.AI
AI总结 提出LaGO框架,利用预训练大语言模型作为潜在动作先验,软引导在线策略优化,在离散和连续控制基准上显著提升奖励与成功率。
Comments 9 pages, 2 figures. Accepted at the ICML 2026 Workshop on Large Language Models for Planning (LM4Plan)
面向O-RAN的无人机轨迹优化自适应机器学习框架
机构 * school of Physics, Engineering and Technology, University of York(物理、工程与技术学院,约克大学) ; Radio Systems Research, Nokia Bell Labs(诺基亚贝尔实验室无线电系统研究部) ; School of Electrical and Electronic Engineering, University of Sheffield(电子与电气工程学院,谢菲尔德大学) ; Bradley Department of Electrical and Computer Engineering, Virginia Tech(布拉德利电气与计算机工程系,弗吉尼亚理工学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 提出一种集成增强持续迁移学习的无人机轨迹优化框架,通过模型选择机制从预训练库中迁移知识,减少适应时间,仿真表明收敛时间减少44%-56%。
Comments 16 pages, 12 figures, IEEE Transactions on Vehicular Technology
Journal ref 2026 IEEE Transactions on Vehicular Technology
AI Tokenomics:基础模型中的代币、计算与定价经济学
机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)
专题命中 规划决策 :workflow(abstract);分类 cs.AI
AI总结 本文提出AI代币经济学框架,研究代币在AI系统中的生成、消耗、定价、分配与优化,揭示代币支出与经济价值的区别,并指出开放研究方向。