MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment
MADE:用于自主模型部署的信念驱动双智能体协调机制
专题命中 工具调用 :agent(title,summary_cn);分类 cs.SE
AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
MADE:用于自主模型部署的信念驱动双智能体协调机制
专题命中 工具调用 :agent(title,summary_cn);分类 cs.SE
AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。
少量神经元可揭示大语言模型何时滥用工具:用于可靠工具使用的稀疏检测与选择性引导
专题命中 工具调用 :tool use(title);agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.CL
AI总结 本研究提出PRISMS框架,利用少量特定MLP神经元实现大语言模型工具使用故障的稀疏检测与选择性引导,可跨模型系列降低过度调用率、提升工具所需准确率。
Comments 21 pages, 4 figures. Includes supplementary material
聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体
专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI
AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。
PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。
Comments Accepted in Interspeech 2026
KRCA:一种基于智能体AI的超大规模微服务系统高效根因分析系统
专题命中 工具调用 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.SE
AI总结 提出KRCA系统,通过多阶段流水线(API级钻取、骨架因果图、记忆增强多智能体框架)实现超大规模微服务的高效根因定位与故障分类,AC@1达0.88和0.79,诊断时间减少77.3%。
LLM智能体故障的实时检测与修复
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该研究提出基于LLM智能体步骤遥测的实时故障检测与修复系统,结合单类回声状态网络集成与确定性验证层,可高效检测并修复故障,提升任务成功率且成本极低。
Comments 16 pages, 5 figures. Code, data and demo: github.com/sunnydubey1111/agent-trajectory-sentinel Walkthrough: youtu.be/a05n_000klE
认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架
机构 * Sichuan University(四川大学)
专题命中 工具调用 :agent(abstract);tool-use(abstract);planning(abstract);agentic(abstract)
AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。
VC-Tooler:学习组合式与自适应视觉工具使用
专题命中 工具调用 :tool use(title,abstract);agentic(abstract)
AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。
EPM-RL:电商产品映射的强化学习方法
机构 * AI Research, Enhans(AI研究,Enhans)
专题命中 工具调用 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出EPM-RL框架,通过强化学习提升电商产品映射的准确性和效率,解决传统方法依赖外部API和高成本的问题,实现私有部署和低成本运营。
Comments preprint
Journal ref Proceedings of the AAAI Symposium Series, vol. 9, no. 1, p. 227, 2026
AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI
AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。
相关性的新作用:在智能搜索中指导语料库交互
机构 * Tencent(腾讯) ; IIE-CAS(中国科学院计算技术研究所)
专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.CL
AI总结 研究提出相关性在智能搜索中作用新观点,介绍相关性感知的RipGrep搜索代理RARG,它能将相关性转化为语料库交互执行先验,提供从粗到细的相关性指导,在浏览问答和检索中提升准确性与效率,实现更快更可靠的搜索收敛。
Comments code is available at https://github.com/LeqsNaN/RARG
FinToolBench:评估LLM代理在真实金融工具使用中的表现
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Hunan University(湖南大学) ; Xiamen University(厦门大学) ; Tencent(腾讯) ; UCAS(中国科学技术大学) ; Tongji University(同济大学)
专题命中 工具调用 :tool use(title);agentic(abstract);分类 cs.AI
AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。
模型作为工具:用于统一多模态视觉跟踪的智能体协调框架
机构 * Beihang University(北京航空航天大学)
专题命中 工具调用 :agentic(title,abstract)
AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。
Comments 21 pages, 15 Tables, 7 Figures
ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索
机构 * Nanyang Technological University(南洋理工大学) ; Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.CL
AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。
面向通用搜索智能体的跨域混合在线策略蒸馏
机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)
专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL
AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。
形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界
专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG
AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。
Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026
BiCAA:面向搜索增强智能体的双向信用分配
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。
自进化推荐系统:基于LLM代理的端到端自主模型优化
机构 * Google Inc(谷歌公司)
专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于LLM代理的自进化推荐系统,通过端到端自动化流程自主优化模型,提升开发效率和性能。
Comments RecSys 2026
Magnet:通过能力累积检测跨会话的AI滥用
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究针对AI集成体的跨会话滥用风险,提出Magnet方法,通过聚合跨会话累积的相关能力来检测此类滥用,填补了现有单会话检测的缺口。
SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。
学习选择视觉上下文示例
机构 * University of Cincinnati(辛辛那提大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出LSD方法,通过强化学习构建最优演示集,提升多模态大语言模型在视觉回归任务中的表现,揭示了学习选择在视觉上下文学习中的必要性。
Comments 21 pages, 12 figure, accepted to Computer Vision and Pattern Recognition Conference (CVPR) 2026 Findings Track
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 9455-9465) 2026
UEmbed:统一稀疏与稠密多模态嵌入
机构 * CASIA(中国科学院自动化研究所) ; Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Yale University(耶鲁大学)
专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。
长视野搜索智能体的搜索行为与失败模式诊断
机构 * Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究通过轨迹级诊断区分长视野搜索智能体的检索与利用差距,发现搜索努力与答案质量弱相关,为优化深度研究系统提供了查询构建、证据管理等方向。
压缩下的控制:使用工具的智能体的可靠性边界
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究针对工具使用智能体的控制上下文压缩,提出CompressAgent基准,揭示压缩的非线性可靠性边界,发现压缩会引发工具执行等错误,需以可执行结果评估压缩效果。
Comments 12 pages, 5 figures; includes an appendix
多教师在线策略蒸馏中的行为杠杆不平衡
机构 * AntGroup(蚂蚁集团)
专题命中 工具调用 :tool-use(abstract);分类 cs.CL、cs.LG
AI总结 研究多教师在线策略蒸馏中行为杠杆不平衡问题,提出Soft Clamp方法,通过校准令牌级散度,减少模型过度调用工具情况,在保持决策准确率的同时,降低工具调用循环和重复调用,提升多教师OPD效果。
Comments 33 pages, 5 figures. Code and aggregate artifacts: https://github.com/shen-jiabin/topk-support-opd
GraphER: 一种高效的基于图的增强和重排序方法用于检索增强生成
机构 * Oracle AI
专题命中 工具调用 :agentic(abstract);分类 cs.CL、cs.LG
AI总结 GraphER通过利用数据组织结构捕捉超越语义相似性的接近关系,构建查询时的图结构并应用图排序技术,提升检索完整性,无需额外图基础设施,兼容标准向量存储。
先获取再探索:面向搜索智能体的持久工作空间上选择与提取解耦
机构 * Renmin University of China(中国人民大学) ; Xiaohongshu Inc.(小红书公司) ; National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 该研究针对搜索智能体提出Fetch-then-Explore方法,将页面选择与证据提取解耦,在两个基准测试中提升了智能体的搜索性能,核心是通过持久工作空间实现页面复用与证据累积。
CoEvoKG:用自演进搜索智能体协同演进知识图谱
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 CoEvoKG框架将知识图谱作为训练任务源与智能体演进的持久证据记忆,联合训练任务生成器与搜索智能体,形成自演进与知识积累闭环,在六个问答基准上提升了三款骨干模型的准确率。
Comments 10 pages, 4 figures
RL-Lock:用于生成互锁组件的强化学习
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对现有互锁组件生成方法依赖手工启发式、难处理复杂案例的问题,研究人员提出强化学习框架RL-Lock,结合结构化动作分块与MCTS学习,高效生成互锁组件,在复杂场景表现更优。
DocNavRAG:面向复杂文档问答的、具有状态化证据构建能力的文档结构化图RAG
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 工具调用 :agentic(abstract);分类 cs.CL
AI总结 本文提出DocNavRAG,将文档结构组织为可导航图并维护证据状态,在四个文档QA基准上,相比最强基线平均提升答案质量7.8%、上下文充分性17.7%。
Comments 19 pages, 5 figures, 16 tables