Agentic Model Checking
代理模型检查
专题命中 工具调用 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.SE
AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
代理模型检查
专题命中 工具调用 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.SE
AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。
Mix-Quant: 量化预填,精准解码用于代理大语言模型
机构 * National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.CL
AI总结 本文提出Mix-Quant,一种简单有效的阶段感知量化框架,用于加速代理大语言模型的推理。通过在预填阶段应用高吞吐量NVFP4量化,同时保留BF16精度用于解码,从而在保持任务性能的同时显著提高效率,实现预填阶段高达3倍的速度提升。
MCP-Atlas:一个大规模的工具使用能力基准测试,使用真实的MCP服务器
机构 * National University of Singapore(新加坡国立大学) ; Scale AI
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出MCP-Atlas,一个用于评估工具使用能力的基准测试,基于真实MCP服务器,包含1000个由人类专家编写和验证的任务,覆盖36个真实MCP服务器和220种工具,通过任务级别的评估发现模型在工具调用和认知能力上的表现。
Comments 25 pages, 3 figures, 9 tables
MARS:模块化代理与反思搜索用于自动化AI研究
机构 * Google Cloud AI Research(谷歌云人工智能研究)
专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出MARS框架,通过预算感知规划、模块化构建和比较反思记忆解决复杂机器学习工程任务中的执行成本与性能归因问题,实现开放源代码框架在MLE-Bench上的最佳性能。
Comments Paper published at International Conference on Machine Learning (ICML 2026)
SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准
机构 * Kuaishou Technology(快手科技)
专题命中 工具调用 :agent(abstract);tool-use(abstract);workflow(abstract);agentic(abstract)
AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。
IndusAgent: 通过智能工具增强开放词汇工业异常检测
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; Santa Clara University(圣克拉拉大学) ; LongCat Team(LongCat团队) ; Independent Researcher(独立研究者) ; New York University(纽约大学) ; Sun Yat-sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; Stanford University(斯坦福大学) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
专题命中 工具调用 :agentic(title,abstract);agent(abstract)
AI总结 本文提出IndusAgent框架,通过整合视觉观测、高分辨率局部片段和专家正常性先验,提升开放词汇工业异常检测的零样本性能,验证了方法的鲁棒性和泛化能力。
声音代理科学需要对抗性实验
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI
AI总结 该研究探讨了代理辅助科学中对抗性实验的重要性,指出传统方法在科学发现中的局限性,并提出应以证伪优先的标准来评估代理生成的科学主张。
Comments Published at ICLR 2026 Workshop on Agents in the Wild
AMBER:一种用于Python中高性能基于代理建模的列式架构
专题命中 工具调用 :agent(title,abstract)
AI总结 本文提出AMBER,一种基于列式存储的Python框架,通过紧凑的视图API暴露种群操作,以减少解释器开销,从而提高交互式建模、校准和参数扫描的性能。
标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性
机构 * University of Chicago(芝加哥大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。
Comments 12 pages
从文本到声音:一个可重复和可验证的评估工具调用LLM代理的框架
机构 * Dialpad Inc.(Dialpad公司)
专题命中 工具调用 :tool use(abstract);分类 cs.CL
AI总结 本文提出了一种可重复和可验证的框架,用于评估基于语音的工具调用LLM代理,通过文本到语音转换和环境噪声模拟,无需重新标注工具模式和黄金标签,从而在不重新标注的情况下评估工具调用性能。
AI辅助的科学评估:气候变化案例研究
机构 * Potsdam Institute for Climate Impact Research (PIK), Member of the Leibniz Association(波茨坦气候影响研究所(PIK),莱比锡协会成员) ; Institute for Atmospheric and Climate Science, ETH Zurich(大气与气候科学研究所,苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; University of Miami(迈阿密大学) ; Centre for Environmental Policy, Imperial College London(伦敦帝国理工学院环境政策中心) ; Grantham Institute for Climate Change and Environment, Imperial College London(伦敦帝国理工学院气候变化与环境研究所) ; Energy, Climate and Environment Program, International Institute for Applied Systems Analysis(国际应用系统分析研究所能源、气候与环境项目)
专题命中 工具调用 :workflow(abstract);分类 cs.CL
AI总结 本文探讨了AI在科学评估中的应用,通过与气候科学领域13名科学家的合作,测试了基于Gemini的AI环境在评估大西洋经向翻转环流(AMOC)稳定性方面的效果,展示了AI在加速科学流程和提升报告质量方面的贡献,同时强调了专家补充和监督的重要性。
基于心跳的分层凭证:面向AI代理群的加密撤销机制
机构 * SentinelOne Inc.(SentinelOne公司)
专题命中 规划决策 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 本文提出了一种基于心跳的分层凭证协议,通过将凭证有效性与周期性父级存活证明绑定,实现无需网络连接的高效凭证撤销,显著减少了僵尸代理的存活时间并提升了验证效率。
从自动化到自主:分层代理原生网络架构(HANA)
机构 * AsiaInfo Technologies Limited(亚洲信息科技有限公司) ; Institute for AI Industry Research (AIR)(人工智能产业研究院) ; Tsinghua University(清华大学) ; Verimag
专题命中 规划决策 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出了一种分层多代理参考架构,旨在实现Level 4/5自主网络,通过引入代理自意识,统一战略规划与操作韧性,验证了其在5G核心环境中的有效性。
Comments This manuscript has been accepted by IEEE Networking Letters
Journal ref B. Wu, S. Wang, Y. Liu, Y. -Q. Zhang, J. Sifakis and Y. Ouyang, "From Automated to Autonomous: Hierarchical Agent-native Network Architecture (HANA)," in IEEE Networking Letters, 2026
OmniVL-Guard Pro: 一个增强工具的代理用于综合视觉-语言防伪
机构 * School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) ; Wuhan University, Wuhan, China(武汉大学) ; Lab for Intelligence and visiON (LION)(智能与视觉实验室) ; Xi'an Jiaotong University(西安交通大学)
专题命中 规划决策 :agent(title,abstract);agentic(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出OmniVL-Guard Pro,一种增强工具的代理,用于综合视觉-语言防伪,通过整合多种工具环境和引入新的强化学习方法,实现了开放世界中的线索驱动推理,并在多个任务上达到了最先进的性能。
Comments 29 pages
设计治理:为组织学习和可扩展自主性构建智能体AI
机构 * ESSEC Business School(ESSEC商学院) ; Accenture Research(埃森哲研究)
专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文探讨了智能体AI在组织学习和可扩展自主性中的设计与治理问题,通过案例研究展示了如何通过具体的架构和工作安排实现有效的治理,并总结了七条指导原则。
Comments 17 pages, 1 figure, 3 tables
MC-Risk:多组件风险场用于风险识别和运动规划
机构 * Technical University of Munich(慕尼黑技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; City University of Macau(澳门城市大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文提出MC-Risk,一种与规划器对齐的多组件风险场,用于早期、校准且类别感知的风险定位。该方法通过线性组合三个可解释模块,包括电机代理场、VRU风险场和道路惩罚场,并在RiskBench碰撞子集上进行了首次标准化定量评估,展示了最佳的风险定位和最早危险指示。
打破以用户为中心的代理:一个三方框架用于基于代理的推荐
专题命中 规划决策 :agent(title,abstract);agentic(abstract)
AI总结 本文提出一个三方框架TriRec,用于基于代理的推荐系统,旨在协调用户效用、物品曝光和平台层面的公平性,从而提高推荐系统的准确性和公平性。
面向目标的主动对话中规划的伪孪生网络
机构 * School of Computer Science and Technology(计算机科学与技术学院)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出了一种面向目标的主动对话规划方法,通过FF-BPSN网络实现对话路径规划,提升目标导向型主动对话系统的有效性。
Comments ICASSP2026
面向异构业务系统的超图企业代理推理器
机构 * SUPCON
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出HEAR,一种基于分层超图本体的企业代理推理器,通过分层图层和超边层实现结构化多跳分析,无需重新训练LLM,在供应链任务中达到94.7%的准确率,并展示出适应性和效率。
严格子目标执行:在分层强化学习中的可靠长 horizon 规划
机构 * Graduate School of Artificial Intelligence(人工智能研究生院) ; Ulsan National Institute of Science and Technology (UNIST)(釜山国立科学与技术研究所) ; Ulsan, South Korea(韩国釜山)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出严格子目标执行(SSE)框架,通过前沿经验回放(FER)分离不可达与可接受的子目标,提高高层决策效率,从而在长horizon任务中实现更可靠的规划。
Comments 10 pages for main, 26 pages for total, Accepted to ICLR 2026
Journal ref International Conference on Learning Representations (ICLR), 2026
一种适应地形的epsilon约束MPC用于不规则地形运动动力学规划
机构 * Laboratório de Engenharia de Sistemas e Robótica, Universidade Federal da Paraíba(系统与机器人工程实验室,帕拉伊巴联邦大学) ; School of Computer Science, University of Lincoln(计算机科学学院,林肯大学)
专题命中 规划决策 :planning(title,abstract)
AI总结 本文提出了一种适应地形的epsilon约束MPC方法,用于解决车辆在不规则地形上同时优化路径效率和姿态稳定性的规划问题,通过动态调整epsilon界限来实时探索帕累托前沿,并通过半参数模型结合分析车辆动力学和稀疏高斯过程来捕捉车辆-地形动力学。
通过城市级多目标优化实现私人和公共电动汽车充电堆的协同能力规划
专题命中 规划决策 :planning(title,abstract)
AI总结 本文提出了一种基于需求驱动的城市级电动汽车充电需求评估和充电堆容量规划框架,采用自底向上的估算方法量化电力需求,并利用Harris Hawks Optimization算法解决容量规划问题,通过2022-2030年中国重庆的案例研究,展示了充电需求的变化趋势和优化配置的综合性能。
Comments Following additional internal review, the authors identified possible errors associated with the results presented in Fig. B1, which may influence the validity of the related results interpretation and discussion sections. The manuscript is therefore withdrawn to allow comprehensive re-analysis and correction
通过分层子问题扩展和工作空间分解细化实现可扩展的多机器人运动规划
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Instituto Tecnológico Autónomo de México(墨西哥自治理工学院)
专题命中 规划决策 :planning(title,abstract)
AI总结 本文提出了一种多机器人运动规划方法,通过工作空间分解的离散搜索提高规划效率,核心方法是分层子问题扩展和工作空间分解细化,主要贡献是通过迭代优化工作空间表示来搜索更小的解耦配置空间。
Comments Accepted to WAFR 2026
MemGym: 一种长时间跨度的记忆环境用于LLM智能体
机构 * Rutgers University(罗杰斯大学) ; Capital One ; Princeton University(普林斯顿大学) ; Microsoft Research(微软研究院)
专题命中 规划决策 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.CL
AI总结 本文提出MemGym,一种用于评估LLM智能体记忆能力的基准测试环境,通过统一现有智能体 gym 和内部记忆基础管道,提供一个记忆推理接口。MemGym 包含五个评估赛道,涵盖四个智能体领域,能够独立评估记忆性能,排除推理、检索和工具使用能力的干扰。
AgentEscapeBench: 评估LLM代理在跨领域工具引导推理中的能力
机构 * Fudan University(复旦大学) ; Meituan Longcat Team(美团Longcat团队)
专题命中 规划决策 :agent(abstract);tool use(abstract);tool-use(abstract);分类 cs.AI
AI总结 本文提出AgentEscapeBench基准测试,用于评估LLM代理在非熟悉工作流和短程交互之外维持工具引导推理的能力,通过逃亡室风格的任务测试代理在显式长距离依赖约束下推断、执行和修订新工具使用程序的能力,结果显示代理在依赖深度增加时表现显著下降。
tutor-student 强化学习:一种动态课程以实现鲁棒的深度伪造检测
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Integrated Circuits, Peking University(北京大学集成电路学院) ; School of Information, Huazhong Agricultural University(华中农业大学信息学院) ; Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学先进技术网络研究院)
专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出了一种 tutor-student 强化学习框架,通过动态优化训练课程来提高深度伪造检测的鲁棒性和泛化能力。
Comments Accepted to CVPR 2026
Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)
基于可微世界模型的离线强化学习推理时间策略优化
机构 * Siebel School of Computing and Data Science(计算与数据科学学院) ; Department of Computer Sciences(计算机科学系) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Wisconsin Madison(威斯康星大学麦迪逊分校)
专题命中 规划决策 :planning(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出了一种在推理时间利用可微世界模型优化策略参数的方法,通过端到端的梯度计算提升离线强化学习的性能,同时探讨了推理时间适应的计算开销与收益的权衡。
ProCrit: 通过批评引导的修订实现自激发多视角推理用于多模态讽刺检测
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Baidu Inc.(百度公司) ; Zhipu AI(智谱AI)
专题命中 规划决策 :agent(abstract);agentic(abstract)
AI总结 本文提出ProCrit,一种通过批评引导的修订实现自激发多视角推理的框架,用于多模态讽刺检测,解决了现有方法依赖固定视角的问题,通过动态生成多视角分析并进行协同优化。
Demo-JEPA: 一种用于单次跨体态模仿的联合嵌入预测架构
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) ; University of Washington(华盛顿大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 本文提出Demo-JEPA,一种跨体态模仿框架,通过解耦示范意图与体态特定的执行,利用共享预测表示空间将源视觉示范转换为目标兼容的未来潜在轨迹,使目标代理通过规划实现这些子目标,从而在异构体态间实现灵活的模仿。
如果智能体能够想象?通过生成强化开放词汇人-物交互理解
机构 * Dream-X Team(Dream-X团队) ; Stanford University(斯坦福大学) ; National University of Singapore(新加坡国立大学) ; Independent Researcher(独立研究者) ; Case Western Reserve University(凯斯西储大学) ; UC Santa Cruz(加州大学圣克鲁兹分校)
专题命中 规划决策 :agent(abstract);agentic(abstract)
AI总结 本文提出ImagineAgent框架,通过生成式世界建模和工具增强强化学习,解决开放词汇人-物交互理解中的跨模态幻觉和视角限制问题,实现了高效且鲁棒的推理。