Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
Comments 50 pages, 42 figures. Project webpage available [here](https://agent-husky.github.io/)
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
Comments 50 pages, 42 figures. Project webpage available [here](https://agent-husky.github.io/)
专题命中 规划决策 :agent(title,abstract);planning(abstract)
Comments Added the application to human-agent interaction; added discussion with concurrent work
专题命中 规划决策 :planning(title);agent(abstract);multi-agent(abstract);autonomous agent(comments)
Comments To appear in the Proceedings of the 2024 International Conference on Autonomous Agents and Multiagent Systems (AAMAS)
专题命中 规划决策 :planning(title,abstract);autonomous agent(abstract)
Comments Course Project Report for CP:230 Motion Planning and Autonomous Navigation by Dr. Debasish Ghose
用于复杂序列决策任务的混合大语言模型增强强化学习智能体
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);tool-use(abstract);planning(abstract)
AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。
Comments This submission is withdrawn because the uploaded manuscript does not accurately reflect the intended structure or results. Several components referenced in the text are incomplete or not represented in the PDF, and the current version may mislead readers. The work is therefore withdrawn to maintain clarity of the record
PolyWorkBench:多语言长视野语言模型智能体基准测试
机构 * Beijing Jiaotong University(北京交通大学) ; Weixin AI, Tencent Inc(腾讯微云人工智能实验室)
专题命中 规划决策 :agent(abstract);tool use(abstract);tool-use(abstract);planning(abstract)
AI总结 研究多语言长视野工作流程中LLM智能体的表现,提出PolyWorkBench基准测试及结合多种评估方式的混合框架,发现最先进LLM智能体在多语言设置中性能降,强调联合建模语言变化和程序决策对智能体评估的重要性。
Comments 17 Pages, 5 figures
将搜索与推理解耦:面向LLM Agent的供应商无关的接地架构
机构 * DoorDash, Inc.(DoorDash公司)
专题命中 规划决策 :agent(title_cn,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出解耦搜索接地(DSG)架构,将搜索接地从推理模型中分离,通过MCP兼容网关实现供应商路由、缓存等控制,在降低成本和延迟的同时保持或提升准确性。
Comments 15 pages, Figure 8
SWE-Marathon: 智能体能否自主完成超长时程软件工作?
机构 * Abundant ; Zenity ; Harvard University(哈佛大学) ; University of Waterloo(滑铁卢大学) ; Gujarat Technological University(古吉拉特技术大学) ; Warping ; Stanford University(斯坦福大学) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Independent(独立) ; Refresh ; Soleda AI ; Near AI ; Georgia Tech(佐治亚理工学院) ; Comenius University in Bratislava(布拉迪斯拉发Comenius大学) ; UC San Diego(圣地亚哥大学) ; BenchFlow ; UC Santa Barbara(圣巴巴拉大学)
专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);workflow(abstract)
AI总结 提出SWE-Marathon基准,包含20个超长时程任务,平均消耗2720万token,评估智能体在规划、长上下文理解和记忆方面的能力,当前前沿编码智能体解决率低于30%。
TIP: on-policy distillation 中的 token 重要性
专题命中 规划决策 :planning(abstract,abstract_cn);agentic(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究探讨了在 on-policy 知识蒸馏中哪些 token 对学习信号最有用,提出了一种基于学生熵和教师-学生分歧的双轴分类方法,并通过实验验证了在有限内存条件下使用少量 token 进行蒸馏的有效性。
学习学习代理的偏好
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG;multi-agent(comments)
AI总结 本文研究学习代理偏好学习问题,通过分析在线学习者行为推断潜在奖励函数,探讨无 regrets 或收敛到最优 Boltzmann 策略的理论保证。
Comments Published at ICLR 2026, Workshop on Multi-Agent Learning and Its Opportunities in the Era of Generative AI. 9 pages main text
对抗鲁棒性增强方法研究:用于医疗决策任务的对抗鲁棒大语言模型智能体
机构 * Pace University(帕克大学)
专题命中 规划决策 :agent(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出ARSM-Agent框架,通过多模块协同提升医疗决策智能体的对抗鲁棒性与安全性,实验表明其在多种攻击下攻击成功率降低至8.7%。
Comments 5 pages, 2 figures, 1 table.Accepted for oral presentation at AINIT 2026
架构至关重要:在知识库中毒情况下比较RAG系统
专题命中 规划决策 :agentic(abstract,abstract_cn);agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG
AI总结 研究探讨了在知识库中毒情况下不同RAG架构的鲁棒性,发现架构设计对攻击成功率影响显著,MADAM-RAG在矛盾检测上表现最佳但仍有不足。
RunAgent:通过约束引导执行解释自然语言计划
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; NEC Laboratories America, Inc.(NEC美国实验室)
专题命中 规划决策 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)
AI总结 RunAgent通过约束引导执行解释自然语言计划,结合代理语言的显式控制构造,提升结构化工作流执行的可靠性。
SEARL:自进化智能体中策略与工具图记忆的联合优化
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学)
专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)
AI总结 SEARL通过构建结构化经验记忆实现策略与工具图记忆的联合优化,提升智能体在知识推理和数学任务中的实用性和效率。
Comments ACL 2026
人工智能代理的安全性考虑
机构 * Perplexity
专题命中 规划决策 :agent(abstract);AI agent(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文探讨了前沿AI代理的安全性问题,分析了代理架构对代码-数据分离、权限边界和执行可预测性的影响,并提出了针对间接提示注入、混淆代理行为和长流程级联故障的防护措施。
Comments This article is adapted from Perplexity's response to NIST/CAISI Request for Information 2025-0035. 91 Fed. Reg. 698 (Jan. 8, 2026). The originally submitted response can be found on the public docket at https://www.regulations.gov/comment/NIST-2025-0035-0505
对齐AI系统持续的脆弱性
机构 * University College London(伦敦大学学院)
专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);agentic(abstract)
AI总结 本文探讨了自主AI代理在文件系统访问、电子邮件控制和多步骤规划中的部署问题,提出ACDC、LAT等方法以解决AI安全四大难题,通过实验展示对抗性攻击的成功率及模型对齐测试结果。
Comments PhD thesis, University College London, 2025. 157 pages. Supervised by Ricardo Silva
AI模型能否相互指导?组织结构作为训练限制的探测器
机构 * Independent Researcher(独立研究员)
专题命中 规划决策 :agent(abstract);tool use(abstract);planning(abstract);multi-agent(abstract)
AI总结 本文研究AI模型通过ManagerWorker双agent流水线相互指导的有效性,发现强管理者指导弱工作者与单体强模型性能相近,但弱管理者指导弱工作者效果更差,揭示了多agent指导的潜力与限制。
DuCCAE:通过协作、增强和进化实现沉浸式对话的混合引擎
机构 * Baidu Inc(百度公司)
专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)
AI总结 DuCCAE通过解耦实时响应与异步代理执行,提升沉浸式对话的响应速度与任务能力,减少延迟并增强用户留存与复杂任务完成率。
对齐大型语言模型代理的理性与道德偏好:一种监督微调方法
机构 * Zicklin School of Business, CUNY Baruch College(纽约大学法学院) ; Amazon(亚马逊) ; Toulouse School of Economics(图卢兹经济学院)
专题命中 规划决策 :agent(abstract);AI agent(abstract);autonomous agent(abstract);multi-agent(abstract)
AI总结 本文通过监督微调方法对齐LLM代理的理性与道德偏好,揭示了代理在经济游戏中的系统性偏差,并展示了不同偏好结构对均衡结果的影响。
基准的几何学:通向通用人工智能的新路径
机构 * Przemyslaw Chojecki(独立研究者)
专题命中 规划决策 :agent(abstract);AI agent(abstract);tool use(abstract);planning(abstract)
AI总结 本文提出了一种基于几何框架的基准评估方法,通过自主AI尺度和GVU操作符,为通用人工智能的发展提供了新的理论视角。
机构 * IEEE
专题命中 规划决策 :autonomous agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);tool-use(abstract);planning(abstract)
Comments Accepted in EMNLP 2024 main conference
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);planning(abstract);multi-agent(abstract)
Comments This work is ongoing and we welcome your contribution!
专题命中 规划决策 :agent(abstract);AI agent(abstract);tool use(abstract);planning(abstract)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG;agent(journal_ref);multi-agent(journal_ref)
Journal ref Auton Agent Multi-Agent Syst 36, 26 (2022)
机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 规划决策 :agent(abstract,comments);AI agent(abstract);tool-use(abstract);multi-agent(abstract)
Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/
专题命中 规划决策 :planning(title,abstract);分类 cs.AI;agent(comments);multi-agent(comments)
Comments Approximate Computing, Multi-robot Systems, Multi-agent Systems, Good Enough Computing, Green Computing, Robot Path Planning, Energy-Efficient Computing
机构 * Department of Mechanical Engineering, Temple University(机械工程系, Temple 大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract)
Comments Submission under review at the 2026 IEEE/SICE International Symposium on System Integration (SII 2026)
ClawGym II:探索智能体控制框架下的黑盒强化学习
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; IQuest Research(智臻研究)
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究提出统一黑盒强化学习框架,通过沙箱基础设施、前缀树轨迹重建等技术,实现通用智能体的稳定可扩展优化,在ClawGym-Bench等任务上取得性能提升。
面向可访问性保持的多物体放置的语义与密度感知规划
专题命中 规划决策 :planning(title,abstract)
AI总结 针对在线多物体货架放置场景,提出SDPP方法,结合语义-密度评分与AM,在提升语义放置质量和货架密度的同时,减少可行位姿识别时间,适用于家庭货架存储场景。