Agentic Model Checking
代理模型检查
专题命中 工具调用 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.SE
AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
代理模型检查
专题命中 工具调用 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.SE
AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。
Mix-Quant: 量化预填,精准解码用于代理大语言模型
机构 * National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.CL
AI总结 本文提出Mix-Quant,一种简单有效的阶段感知量化框架,用于加速代理大语言模型的推理。通过在预填阶段应用高吞吐量NVFP4量化,同时保留BF16精度用于解码,从而在保持任务性能的同时显著提高效率,实现预填阶段高达3倍的速度提升。
MCP-Atlas:一个大规模的工具使用能力基准测试,使用真实的MCP服务器
机构 * National University of Singapore(新加坡国立大学) ; Scale AI
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出MCP-Atlas,一个用于评估工具使用能力的基准测试,基于真实MCP服务器,包含1000个由人类专家编写和验证的任务,覆盖36个真实MCP服务器和220种工具,通过任务级别的评估发现模型在工具调用和认知能力上的表现。
Comments 25 pages, 3 figures, 9 tables
MARS:模块化代理与反思搜索用于自动化AI研究
机构 * Google Cloud AI Research(谷歌云人工智能研究)
专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出MARS框架,通过预算感知规划、模块化构建和比较反思记忆解决复杂机器学习工程任务中的执行成本与性能归因问题,实现开放源代码框架在MLE-Bench上的最佳性能。
Comments Paper published at International Conference on Machine Learning (ICML 2026)
SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准
机构 * Kuaishou Technology(快手科技)
专题命中 工具调用 :agent(abstract);tool-use(abstract);workflow(abstract);agentic(abstract)
AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。
IndusAgent: 通过智能工具增强开放词汇工业异常检测
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; Santa Clara University(圣克拉拉大学) ; LongCat Team(LongCat团队) ; Independent Researcher(独立研究者) ; New York University(纽约大学) ; Sun Yat-sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; Stanford University(斯坦福大学) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
专题命中 工具调用 :agentic(title,abstract);agent(abstract)
AI总结 本文提出IndusAgent框架,通过整合视觉观测、高分辨率局部片段和专家正常性先验,提升开放词汇工业异常检测的零样本性能,验证了方法的鲁棒性和泛化能力。
声音代理科学需要对抗性实验
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI
AI总结 该研究探讨了代理辅助科学中对抗性实验的重要性,指出传统方法在科学发现中的局限性,并提出应以证伪优先的标准来评估代理生成的科学主张。
Comments Published at ICLR 2026 Workshop on Agents in the Wild
AMBER:一种用于Python中高性能基于代理建模的列式架构
专题命中 工具调用 :agent(title,abstract)
AI总结 本文提出AMBER,一种基于列式存储的Python框架,通过紧凑的视图API暴露种群操作,以减少解释器开销,从而提高交互式建模、校准和参数扫描的性能。
标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性
机构 * University of Chicago(芝加哥大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。
Comments 12 pages
从文本到声音:一个可重复和可验证的评估工具调用LLM代理的框架
机构 * Dialpad Inc.(Dialpad公司)
专题命中 工具调用 :tool use(abstract);分类 cs.CL
AI总结 本文提出了一种可重复和可验证的框架,用于评估基于语音的工具调用LLM代理,通过文本到语音转换和环境噪声模拟,无需重新标注工具模式和黄金标签,从而在不重新标注的情况下评估工具调用性能。
AI辅助的科学评估:气候变化案例研究
机构 * Potsdam Institute for Climate Impact Research (PIK), Member of the Leibniz Association(波茨坦气候影响研究所(PIK),莱比锡协会成员) ; Institute for Atmospheric and Climate Science, ETH Zurich(大气与气候科学研究所,苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; University of Miami(迈阿密大学) ; Centre for Environmental Policy, Imperial College London(伦敦帝国理工学院环境政策中心) ; Grantham Institute for Climate Change and Environment, Imperial College London(伦敦帝国理工学院气候变化与环境研究所) ; Energy, Climate and Environment Program, International Institute for Applied Systems Analysis(国际应用系统分析研究所能源、气候与环境项目)
专题命中 工具调用 :workflow(abstract);分类 cs.CL
AI总结 本文探讨了AI在科学评估中的应用,通过与气候科学领域13名科学家的合作,测试了基于Gemini的AI环境在评估大西洋经向翻转环流(AMOC)稳定性方面的效果,展示了AI在加速科学流程和提升报告质量方面的贡献,同时强调了专家补充和监督的重要性。