Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
评估基于大语言模型的代理在多轮对话中的性能:一项调查
机构 * Microsoft(微软)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种基于PRISMA框架的系统方法,用于评估多轮对话中基于LLM的代理,通过两个分类系统定义评估内容和方法,涵盖任务完成、响应质量等关键维度。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
评估基于大语言模型的代理在多轮对话中的性能:一项调查
机构 * Microsoft(微软)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种基于PRISMA框架的系统方法,用于评估多轮对话中基于LLM的代理,通过两个分类系统定义评估内容和方法,涵盖任务完成、响应质量等关键维度。
编码与AI:从工业实践的反思到未来计算机科学与软件工程教育
机构 * R. B. Annis School of Engineering(R. B. Annis 工程学院) ; University of Indianapolis(印第安纳大学) ; E. S. Witchger School of Engineering(E. S. Witchger 工程学院) ; Marian University(玛丽安大学) ; University of Maryland Eastern Shore(马里兰大学东部分校) ; The Boehm Center for Systems and Software Engineering(Boehm 系统与软件工程中心)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文探讨了AI在工业实践中对软件开发的影响,分析了LLM工具带来的生产力提升与风险,并提出教育应转向问题解决和项目式学习以适应变化。
Comments 21 pages, 5 figures
非平稳环境下的离线强化学习预测
机构 * Bogazici University(博科西大学) ; University of Tübingen(图宾根大学) ; Ozyegin University(奥祖根大学) ; Osaka University(大阪大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 非平稳环境下的离线强化学习预测框架FORL,通过结合条件扩散和零样本时间序列模型,提升智能体在非平稳环境中的鲁棒性与性能。
Comments The Thirty-Ninth Annual Conference on Neural Information Processing Systems, NeurIPS 2025
反射预训练使生物序列模型实现token级自我修正
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of British Columbia(不列颠哥伦比亚大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Stony Brook University(石溪大学)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.CL
AI总结 本文提出反射预训练方法,通过生成辅助标记提升生物序列模型的token表达能力,实现token级自我修正和推理能力提升。
潜在学习:情景记忆通过使经验的灵活重用来补充参数学习
机构 * Google DeepMind(谷歌DeepMind) ; Department of Psychology, Stanford University(斯坦福大学心理学系)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出情景记忆可通过灵活重用经验来补充参数学习,提升泛化能力。
超越滑动窗口:在非马尔可夫环境中学习管理内存
机构 * CSAM School, University of the Witwatersrand(瓦茨堡大学CSAM学院) ; IBM Research(IBM研究院) ; Mila, Université de Montréal(蒙特利尔大学Mila)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出自适应堆叠元算法,通过维护较小的记忆堆栈,在非马尔可夫环境中减少计算和内存需求,同时有效管理记忆以避免过度删除重要经验。
FASTRIC:用于可验证大语言模型交互的提示规范语言
机构 * Department of Civil and Environmental Engineering(土木与环境工程系) ; California Institute for Telecommunications and Information Technology(电信与信息科技学院) ; Institute of Transportation Studies(交通研究学院) ; University of California, Irvine, CA 92697-3600(加州大学伊维德分校)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.SE
AI总结 FASTRIC通过显式化有限状态机构建可验证的大语言模型交互协议,揭示模型特定的规范正式程度范围,实现交互设计的系统化工程。
Comments 13 pages, 3 figures. Supplementary materials at https://doi.org/10.17605/OSF.IO/PV6R3
生成式人工智能在自适应系统中的应用:现状与研究路线图
机构 * Waseda University(早稻田大学) ; Southwest University(西南大学) ; Zhongguancun Laboratory(中关村实验室) ; Peking University(北京大学) ; Tokyo Institute of Technology(东京技术大学)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.SE
AI总结 本文探讨生成式人工智能在自适应系统中的应用现状与研究方向,分析其提升系统自主性和人机交互的潜力及挑战。
Comments Accepted by ACM Transactions on Autonomous and Adaptive Systems
为低成本温室系统设计一种 TinyML 强化学习方法以实现节能照明控制
机构 * North Dakota State University(北达科他州立大学) ; Biosystems Engineering(生物系统工程)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于 TinyML 的强化学习方法,用于低成本温室系统的节能照明控制,通过 Q 学习算法实现动态亮度调节,有效稳定不同光照水平。
Comments Copyright 2025 IEEE. This is the author's version of the work that has been accepted for publication in Proceedings of the 5. Interdisciplinary Conference on Electrics and Computer (INTCEC 2025) 15-16 September 2025, Chicago-USA. The final version of record is available at: https://doi.org/10.1109/INTCEC65580.2025.11256135
DeepPersona: 一个用于扩展深度合成人设的生成引擎
机构 * UCSD(加州大学圣地亚哥分校) ; KU Leuven(鲁汶大学) ; SJTU(上海交通大学) ; University of Michigan(密歇根大学) ; Denison University(德尼森大学) ; Amazon(亚马逊) ; Meta
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 DeepPersona通过双阶段分类学引导方法生成深度合成人设,提升LLM个性化和人类模拟的准确性与多样性。
Comments add an author[Update], 12 pages, 5 figures, accepted at LAW 2025 Workshop (NeurIPS 2025) Project page: https://deeppersona-ai.github.io/
Journal ref LAW 2025 Workshop, NeurIPS 2025
在具有潜在状态的模拟器中选择信念状态近似
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种在具有潜在状态的模拟器中选择信念状态近似的方法,通过归约条件分布选择任务,探讨了两种不同的形式化方法及其在不同roll-out方法下的表现差异。
弱监督潜在模型用于任务特定的视觉语言控制
机构 * Industrial AI Lab, Hitachi America, Ltd.(日立美国有限公司工业人工智能实验室)
专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种任务特定的潜在动态模型,利用目标状态监督学习动作诱导位移,以提高空间定位任务中的视觉语言控制性能。
利用跨用户交流打破协作语言代理组
机构 * Princeton University(普林斯顿大学) ; Sentient
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 MURMUR通过生成真实用户交互,揭示了跨用户污染攻击对多用户语言代理的威胁,并提出基于任务的聚类作为初步防御措施。
Comments 20 pages, 7 figures
机构 * University of Würzburg(乌尔姆大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
机构 * Institute for Intelligent Networked Systems, Northeastern University London(智能网络系统研究所,东北大学伦敦分校) ; Department of Engineering, King’s College London(工程系,伦敦大学国王学院)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL、cs.LG
Comments Conference submission; Under review
机构 * Department of Computer Science, Tulane University(Tulane大学计算机科学系) ; Shanghai Center for Mathematical Science, Fudan University(复旦大学上海数学科学中心)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
Journal ref NeurIPS 2025 Poster
机构 * Center for Data Science, Peking University(数据科学中心,北京大学) ; State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) ; Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学)
专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI、cs.LG
Comments Accepted by NeurIPS 2025 as a Spotlight paper
Journal ref NeurIPS 2025 (Spotlight)
机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、信息科学研究所)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
机构 * UC Berkeley(伯克利大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
机构 * Vanderbilt University(范德比大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
Comments Proceeding of the 39th Conference on Neural Information Processing Systems (NeurIPS'25). Code would be available at https://github.com/scope-lab-vu/ESCORT
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
Comments Accepted to the EXAIT Workshop at ICML 2025, and ICoIAS 2025
机构 * IBM Research(IBM研究院)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.SE
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学科学国家重点实验室) ; School of Mathematics and Information Science, Zhongyuan University of Technology(中原工学院数学与信息科学学院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
Comments 31 pages, 8 figures
机构 * SAP, Singapore(新加坡SAP)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
机构 * KAIST(韩国科学技术院)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG
Comments Accepted to NeurIPS 2025
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
Comments Reinforcement Learning Journal 2025
机构 * Brown University(布朗大学) ; UC Berkeley(伯克利大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
机构 * The University of New South Wales(新南威尔士大学) ; CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL、cs.LG
Comments 17 pages, 11 figures, title updated
机构 * Department of Mechanical Engineering, Tandon School of Engineering, New York, USA(机械工程系,工程学院,美国纽约) ; Department of Mechanical Engineering, Delft University of Technology, Delft, Netherlands(机械工程系,代尔夫特理工大学,荷兰代尔夫特)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG