Agentic Test-Time Scaling for WebAgents
代理测试时缩放 for WebAgents
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 CATTS 通过动态分配计算资源提升代理在 WebArena-Lite 和 GoBrowse 的性能,比 React 提高 9.1%,且更高效。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
代理测试时缩放 for WebAgents
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 CATTS 通过动态分配计算资源提升代理在 WebArena-Lite 和 GoBrowse 的性能,比 React 提高 9.1%,且更高效。
SemPlan:面向企业数据的基于大语言模型(LLM)查询的结构化语义规划基准测试
机构 * Universidade Federal de Ouro Preto (UFOP)(欧鲁普雷图联邦大学(UFOP))
专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究构建了SemPlan基准测试,对比四种架构在企业数据LLM查询语义规划中的表现,发现结构化语义规划架构(A3)正确率最高,不同架构在正确率、策略合规性、成本等方面存在权衡。
Comments 11 pages, 3 figures, 9 tables. Submitted to Transactions on Machine Learning Research (TMLR)
从预测到干预:基于大语言模型智能体的个性化餐级血糖调节
专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 针对精准营养中个性化血糖调节的挑战,提出融合生理学习与LLM智能体的系统,通过生理感知预测器和预测驱动优化智能体提升血糖预测准确率并降低血糖波动。
Comments Accepted in ACL 2026 Findings, 17 pages, 4 figures
Journal ref Findings of the Association for Computational Linguistics ACL 2026, pages 21629 to 21645
并非所有token都平等:面向智能体大语言模型系统的感知通胀路由
机构 * Stony Brook University(石溪大学) ; Wuhan University(武汉大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 针对智能体LLM系统的token通胀问题,提出四阶段路由框架InflationAgent,通过测量通胀、引入CBE信号、最大化SER并采用新鲜升级策略,在GSM8K上优于FrugalGPT。
AutoDesign:面向长视距智能体设计的元工具优化
机构 * Meituan(美团) ; MBZUAI(Mohamed bin Zayed University of Artificial Intelligence) ; Huazhong University of Science and Technology(华中科技大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 AutoDesign是符合人类设计先验的元工具优化框架,以论文转海报生成任务为实例,在PosterBench上性能优于Claude Design,集成其学习的DesignHarness可提升代码智能体性能,且获人类最高偏好。
Comments Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign
从提示到路面通过时间:代理场景到计划推理中的时间定位
机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及) ; C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS) ; M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人) ; IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)
专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 本研究探讨了在代理间通信中引入时间条件是否能保持或增强推理的一致性,而不会降低语义或逻辑一致性,并通过BDD-X数据集的curated子集评估了三种具有递增时间整合的规划器架构。结果表明,时间条件改变了推理风格,但并未在标准NLP正确性指标上产生统计显著改进,但定性分析揭示了预测危险推理、稳定纠正行为和战略分歧。
不确定性作为规划信号:面向目标导向对话的多轮决策
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出CUP框架,通过结合语言模型与结构化规划,解决目标导向对话中不确定性与信息获取之间的平衡问题,提升对话成功率并减少交互轮次。
Comments COLM 2026
InSight-doc:面向长文档理解的智能体视觉感知框架
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Huawei(华为)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。
SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 规划决策 :planning(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。
Comments Accepted at COLM 2026
CAi Copilot:通过意图驱动的智能体工作流减少分子设计中的操作工作量
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanjing University(南京大学)
专题命中 规划决策 :agentic(title);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 CAi Copilot是面向专家的意图驱动智能体,通过三层架构整合分子设计分散工具,在45项任务中整体性能最优,得分84.59,可将设计意图转化为可追溯工作流。
APQF:基于智能体分析引导的结构化剪枝与混合精度量化及自适应微调
机构 * Iowa State University(爱荷华州立大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 APQF是结合LLM引导与分析支撑的自动化剪枝量化框架,在ImageNet等数据集上实现高压缩比且精度接近基线,优于现有联合剪枝量化方法。
Comments 22 pages, 7 figures
EASy:迈向高效的基于大语言模型的智能体系统
机构 * Monash University(莫纳什大学)
专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。
Comments Preprint
AI智能体中的贝叶斯推理与动机推理
专题命中 规划决策 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究发现AI智能体的结论受先验信念影响,相同数值数据因框架不同会得出不同结论,揭示了委托其决策存在依赖未指定先验的风险。
长周期推理代理用于竞赛级数学问题求解
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; MMLab ; The Chinese University of Hong Kong(香港中文大学) ; ICMAT Spanish National Research Council(西班牙国家科研 council) ; The High School Affiliated to Renmin University of China(中国人民大学附属高中) ; Ren Hui Academy of Beijing(北京润辉学院)
专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出Intern-S1-MO,通过多轮分层推理和OREAL-H框架,突破IMO级数学问题的上下文限制,实现26/35分的优异成绩。
APPO: 智能体程序策略优化
机构 * University of Science and Technology of China(中国科学技术大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图) ; Southern University of Science and Technology(南方科技大学)
专题命中 规划决策 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.LG
AI总结 提出APPO方法,通过细粒度分支和程序级优势缩放改进智能体强化学习的信用分配,在13个基准上平均提升近4个点。
Comments 25 pages, including 14 pages of main text and 11 pages of appendix; work in progress
套娃智能体:展开子智能体以进行长期机器学习工程
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 针对机器学习工程长期决策难题,提出套娃智能体框架,将问题解决分解为协调层次结构,高级协调器发指令,低级子智能体执行,开发有效训练范式,实验证明该方法有效且可扩展,能提升性能。
通过基于证据的推理进行智能根本原因分析
机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。
Comments 21 pages, 9 figures
Molt:用于智能体强化学习的可扩展原生 PyTorch 训练框架
机构 * NVIDIA(英伟达)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG
AI总结 研究针对智能体强化学习中算法修改成本高的问题,提出原生 PyTorch 训练框架 Molt,其代码简洁,智能体是普通程序,通过异步循环训练策略,在全异步协议下性能与先进堆栈相当,且开源提供资源。
Comments tech report for Molt
JANUS:预见长期智能体安全中的潜在风险
专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 研究长期智能体安全潜在风险,提出JANUS框架,通过多智能体模拟合成轨迹,经预测与裁决耦合任务学习共享策略,用CoAA-RL联合优化,所产生的Vanguard模型提升了智能体安全防护及任务完成率。
人工智能旅游会议:基于大语言模型代理的团体旅行规划
机构 * NTT, Inc.(日本电报电话公司)
专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 提出基于大语言模型代理的团体旅行规划框架AI Tour Meeting,通过自然语言讨论找满足约束和偏好的行程,提供相关配置接口实现灵活编排,可作模拟工具,还展示了系统验证等结果以证明其效用。
Comments The code is available at https://github.com/ntt-dkiku/ai-tour-meeting
关系隐藏状态强化学习中作为涌现行为的规划
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究无模型强化学习中规划作为涌现行为的现象,发现神经架构的隐藏状态结构是决定因素,关系隐藏状态网络能获规划机制,恢复环境转移结构并改进策略,解释了涌现规划现象并引发相关问题。
ETAS:一种用于智能体系统的效果类型化语言
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究针对智能体系统设计ETAS语言,核心方法是通过规范一致性分配类型并用行为索引跟踪计算,主要贡献是为智能体执行相关推理提供编程语言基础,涵盖授权、非确定性等方面,还实现了该语言并形式化相关性质。
指定委托自治边界:智能体人工智能的需求工程
机构 * Faculty of IT, Monash University(莫纳什大学信息科技学院) ; University of Duisburg-Essen(杜伊斯堡-埃森大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 研究智能体人工智能系统带来的需求工程问题,提出机构理由记录和智能体委托策略两个互补工件,通过分级建模权限,以医院出院协调智能体和自动代码审查智能体为例阐释框架,解决委托自治边界相关需求工程问题。
MCPEvol-Bench:跨MCP服务器动态演化对大语言模型智能体性能进行基准测试
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; State Key Laboratory of Complex & Critical Software Environment(复杂关键软件环境国家重点实验室) ; National Key Laboratory of Parallel and Distributed Computing(并行与分布式计算国家重点实验室)
专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 研究针对MCP服务器工具接口和功能持续演化致评估有缺陷的问题,引入MCPEvol-Bench基准测试,提出11种变异算子模拟工具演化,对12个先进大语言模型测试,发现前沿模型也难适应,凸显大语言模型驱动工作流程脆弱性,确立评估标准。
构建用于多模态来源科学数据提取的智能体框架
机构 * Microsoft Research(微软研究院) ; University of California, Davis(加州大学戴维斯分校) ; Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))
专题命中 规划决策 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。
分布转移下可靠长时代理上下文演化的范围验证
机构 * RedMind Research(红芯研究公司) ; National Taiwan University(国立台湾大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 研究长时代理上下文演化在分布转移下的验证问题,提出图正则化代理上下文演化方法(GRACE),通过维护指令为类型化语义图并在局部验证更新,实验表明该方法显著提升了严格可靠性。
Comments 18 pages, 3 figs
多任务智能强化学习的熵步长策略优化
机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。
TurnOPD:使在线策略蒸馏具有转向意识以实现高效的长期智能体训练
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯文言)
专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究针对在线策略蒸馏在长期智能体任务应用不足的问题,提出TurnOPD,通过自适应展开深度预算和渐进式转向归一化损失预算两个策略,在多任务实验中实现更高验证准确率,超越普通OPD,推进了准确率-时间前沿。
TACTIC-KG:面向网络威胁情报知识图谱构建的小型智能体团队
机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Telecom SudParis, Institute of Paris Polytechnic)
专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究针对网络威胁情报报告构建知识图谱的问题,提出TACTIC-KG框架,将任务分解给模块化专业语言模型智能体,用轻量级模型提升性能并降低成本,实验表明优于整体式模型。
Comments 20 pages, 2 figures, 10 tables
用于商业保险承保的具有对抗性自我批评的智能体人工智能
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对商业保险承保中AI可靠性问题,提出含对抗性自我批评机制的人在回路智能体系统,开发故障模式分类法。实验表明该机制降低幻觉率、提高准确率,还确保人类权威,为受监管领域安全部署AI提供模型。
Comments 9 pages, 8 figuers, 6 tables, Presented at 9th International Conference on Modern Computing, Networking and Applications (MCNA2026)
Journal ref 2026 International Conference on Modern Computing, Networking and Applications (MCNA)