MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment
MADE:用于自主模型部署的信念驱动双智能体协调机制
专题命中 工具调用 :agent(title,summary_cn);分类 cs.SE
AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
MADE:用于自主模型部署的信念驱动双智能体协调机制
专题命中 工具调用 :agent(title,summary_cn);分类 cs.SE
AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。
少量神经元可揭示大语言模型何时滥用工具:用于可靠工具使用的稀疏检测与选择性引导
专题命中 工具调用 :tool use(title);agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.CL
AI总结 本研究提出PRISMS框架,利用少量特定MLP神经元实现大语言模型工具使用故障的稀疏检测与选择性引导,可跨模型系列降低过度调用率、提升工具所需准确率。
Comments 21 pages, 4 figures. Includes supplementary material
聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体
专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI
AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。
PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。
Comments Accepted in Interspeech 2026
LLM智能体故障的实时检测与修复
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该研究提出基于LLM智能体步骤遥测的实时故障检测与修复系统,结合单类回声状态网络集成与确定性验证层,可高效检测并修复故障,提升任务成功率且成本极低。
Comments 16 pages, 5 figures. Code, data and demo: github.com/sunnydubey1111/agent-trajectory-sentinel Walkthrough: youtu.be/a05n_000klE
VC-Tooler:学习组合式与自适应视觉工具使用
专题命中 工具调用 :tool use(title,abstract);agentic(abstract)
AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。
AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI
AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。
模型作为工具:用于统一多模态视觉跟踪的智能体协调框架
机构 * Beihang University(北京航空航天大学)
专题命中 工具调用 :agentic(title,abstract)
AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。
Comments 21 pages, 15 Tables, 7 Figures
ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索
机构 * Nanyang Technological University(南洋理工大学) ; Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.CL
AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。
面向通用搜索智能体的跨域混合在线策略蒸馏
机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)
专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL
AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。
形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界
专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG
AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。
Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026
BiCAA:面向搜索增强智能体的双向信用分配
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。
Magnet:通过能力累积检测跨会话的AI滥用
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究针对AI集成体的跨会话滥用风险,提出Magnet方法,通过聚合跨会话累积的相关能力来检测此类滥用,填补了现有单会话检测的缺口。
SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。
UEmbed:统一稀疏与稠密多模态嵌入
机构 * CASIA(中国科学院自动化研究所) ; Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Yale University(耶鲁大学)
专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。
长视野搜索智能体的搜索行为与失败模式诊断
机构 * Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究通过轨迹级诊断区分长视野搜索智能体的检索与利用差距,发现搜索努力与答案质量弱相关,为优化深度研究系统提供了查询构建、证据管理等方向。
压缩下的控制:使用工具的智能体的可靠性边界
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究针对工具使用智能体的控制上下文压缩,提出CompressAgent基准,揭示压缩的非线性可靠性边界,发现压缩会引发工具执行等错误,需以可执行结果评估压缩效果。
Comments 12 pages, 5 figures; includes an appendix
先获取再探索:面向搜索智能体的持久工作空间上选择与提取解耦
机构 * Renmin University of China(中国人民大学) ; Xiaohongshu Inc.(小红书公司) ; National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究针对搜索智能体提出Fetch-then-Explore方法,将页面选择与证据提取解耦,在两个基准测试中提升了智能体的搜索性能,核心是通过持久工作空间实现页面复用与证据累积。
CoEvoKG:用自演进搜索智能体协同演进知识图谱
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 CoEvoKG框架将知识图谱作为训练任务源与智能体演进的持久证据记忆,联合训练任务生成器与搜索智能体,形成自演进与知识积累闭环,在六个问答基准上提升了三款骨干模型的准确率。
Comments 10 pages, 4 figures
RL-Lock:用于生成互锁组件的强化学习
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对现有互锁组件生成方法依赖手工启发式、难处理复杂案例的问题,研究人员提出强化学习框架RL-Lock,结合结构化动作分块与MCTS学习,高效生成互锁组件,在复杂场景表现更优。
DocNavRAG:面向复杂文档问答的、具有状态化证据构建能力的文档结构化图RAG
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 工具调用 :agentic(abstract);分类 cs.CL
AI总结 本文提出DocNavRAG,将文档结构组织为可导航图并维护证据状态,在四个文档QA基准上,相比最强基线平均提升答案质量7.8%、上下文充分性17.7%。
Comments 19 pages, 5 figures, 16 tables
Search-GRT:面向复杂问答任务优化的搜索智能体引导检索训练
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对LLM搜索的奖励稀疏问题,提出GRT方法,通过真实信息限制检索过程,在多跳问答等任务上实现超40%性能提升并提高训练效率。
Comments Accepted at Interspeech 2026
面向LLM智能体的实用在线KV缓存压缩:一项实证研究
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; LinkedIn(领英公司)
专题命中 工具调用 :agent(abstract);分类 cs.CL
AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。
虚拟化环境中的GPU性能分析:一项案例研究
专题命中 工具调用 :tool use(abstract)
AI总结 本文针对当前性能工具不支持虚拟GPU(vGPU)的问题,提出一款兼容Intel GVT-g的新型性能分析工具,通过软件追踪技术收集数据并生成指标,助力识别vGPU虚拟机的性能瓶颈。
Comments 18 pages, 12 figures, 5 tables
Journal ref Future Internet 2024, 16, 72
面向自主公式化阿尔法发现:进化计算视角
专题命中 工具调用 :agentic(abstract)
AI总结 本文从进化计算视角,提出自动化公式化阿尔法发现的统一分析与评估框架,为开发可靠的自主阿尔法发现系统奠定基础。
面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界
专题命中 工具调用 :tool-use(abstract)
AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。
基于数字孪生增强多尺度规划的智能体事件响应
专题命中 规划决策 :planning(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 该研究针对现有智能体事件响应方法的局限,提出结合决策论规划与LLM的多尺度方法,经实验验证可显著缩短恢复时间、提升恢复率。
Comments 31st European Symposium on Research in Computer Security (ESORICS) 2026
AgentSLABench:资源约束下智能体系统的评估与基准测试
专题命中 规划决策 :agentic(title);planning(abstract,abstract_cn);agent(abstract);AI agent(abstract)
AI总结 本研究提出AgentSLABench框架,在资源约束下评估自主AI智能体,通过多维度指标分析发现专用智能体表现优于通用基线,验证了效率调整成功率的重要性并开放相关资源。
Comments 7 pages, 2 figures, 9 tables. Code, sealed test sets, and profiling artifacts available at: https://github.com/MeherBhaskar/agentslabench
开放数字孪生生态中可验证AI智能体的神经符号参与治理
专题命中 规划决策 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。
Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)
动态环境下基于学习的运动规划:从基础算法到新兴范式
机构 * College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院) ; University of Connecticut(康涅狄格大学) ; Guangzhou Maritime University(广州海事大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Global College, Shanghai Jiao Tong University(上海交通大学全球学院) ; Wuyi University(五邑大学) ; South China University of Technology(华南理工大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本综述回顾2015至2025年动态环境下基于学习的运动规划代表性研究,提出学习作用分类法,分析相关影响因素,探讨安全可验证规划等开放挑战与未来方向。