Efficient Multi-round LLM Inference over Disaggregated Serving
高效多轮LLM推理的解耦服务
专题命中 记忆与上下文管理 :autonomous agent(abstract);planning(abstract)
AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。
Comments ICML 2026
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
高效多轮LLM推理的解耦服务
专题命中 记忆与上下文管理 :autonomous agent(abstract);planning(abstract)
AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。
Comments ICML 2026
Mi-Memory:一种用于个人人工智能的生命周期内存框架
专题命中 记忆与上下文管理 :agent(abstract,comments);分类 cs.AI
AI总结 研究针对个人人工智能从聊天交互拓展至多设备持续服务的需求,提出Mi-Memory生命周期内存框架,围绕四个角色构建,通过共享审计合约及相关工件家族实现,经实例化角色在评估中取得一定成果,迈向可审计等特性的内存系统。
Comments Project page: https://darwin-agent.github.io/Mi-Memory/
一种辨别演算:决策相关洞察、序列价值与遗忘作为高阶学习
机构 * Independent AI Researcher, Zürich, Switzerland(独立AI研究员,瑞士苏黎世)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 研究在生成式AI丰富候选洞察下,稀缺的辨别、行动及遗忘能力问题。构建围绕特定对象的框架,提出APOHA理论。通过在肥胖治疗决策世界测试,表明自适应遗忘能降决策后悔、优化记忆,价值感知遗忘有优势。
Comments 17 pages, 5 figures. Includes a pre-registered empirical study (30 seeds x 100 iterations) and a reference implementation; a companion interactive demo is available from the author
心智理论效用:心理化机制的形式化规范
机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所) ; Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 提出心智理论效用(ToM-U)框架,通过局部认知世界模型(LEWM)形式化推断他人信念的计算问题,定义结构、推理过程及失败痕迹,区别于贝叶斯心智理论等方法。
量子自适应智能体的降维方法
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 研究量子自适应智能体,引入路由-截断-修复过程,将熵量子记忆优势转化为内存维度降低,通过时间矩阵乘积态表示等操作,经保真度-散度证书量化权衡,实现基准自适应过程的维度显著降低且保持行为高保真。
Comments 4 + 2 pages main text, 23 page supplement
从确定性定律看认知视界:一个唯名玩具理论的启示
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 研究引入唯名玩具理论,将信息收集主体建模为物理系统,发现其存在认知视界,主体只能同时得知特定可观测量的值,有不相容测量,系统完整状态不可知,此结果调和了测量不确定性,即便理论本质经典,也为认知视界研究带来启示。
Comments 29+11 Pages, 4 Figures, minor changes to Appendix A
人工智能代理起草转化影响摘要的实际评估
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究针对CTSA项目人工整理学者研究影响耗时久且难扩展的问题,构建人工参与的AI代理。该代理为学者整理证据档案、起草影响摘要,经评估,在CTSA中心工作流程中表现良好,能提高效率、实现队列规模影响报告。
Comments 15 pages, 5 figures, 2 tables. Submitted to the Journal of Clinical and Translational Science. Code: https://github.com/mo-arvan/scholar-dossier-agent
助手还是执行者?使用通用人工智能代理时学生的信任、控制与委托遗憾
机构 * Department of Computer Science(计算机科学系) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 研究探讨用户使用通用人工智能代理时的委托遗憾问题,通过大学生完成不同任务的对照研究,发现参与者按任务校准信任,不可逆与外部可见性影响信任撤回,代理无预览执行行动时委托遗憾常现,为代理设计提供了相关启示。
Comments 10 pages, 3 figures
人工智能代理中的操作幻觉与安全漂移
专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);agentic(abstract)
AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。
EvoClaw: 评估AI代理在持续软件演化中的表现
机构 * USC(美国斯克利普斯大学) ; UCR(加州大学河滨分校) ; UCSD(加州大学圣地亚哥分校) ; Army Research Office(陆军研究办公室) ; Stanford(斯坦福大学) ; Princeton(普林斯顿大学) ; Haven ; OpenHands
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 针对现有基准测试忽视软件演化中时间依赖和技术债务的问题,提出EvoClaw基准,通过从提交日志重建可验证里程碑DAG,评估AI代理在持续开发中维持系统完整性和限制错误累积的能力。
Comments ICML 2026
FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI
AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。
Comments Project Page: https://filmworld-ai.github.io
AEVAL:从轶事性到确定性的智能体技能工作流测试
机构 * nvidia(NVIDIA公司)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究针对智能体技能工作流测试缺乏确定性和可重复性的问题,提出AEVAL框架,通过执行器与评分器分离等方法,实现确定性、可重复的测试,给出分层修复建议,能将虚假通过率转换为可重复失败信号并记录修复过程。
Comments 8 pages, 1 figure, 1 table, accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems
生物安全基准测试 - 监测:病原体基因组监测中人工智能代理的可验证基准
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 研究针对病原体基因组监测瓶颈从数据生成转向分析的问题,提出BioSecBench-Surveillance基准测试,含100项评估,通过提供人类分析师的数据和背景来测试AI代理,给出不同模型配置的测试结果,为衡量AI代理能否胜任基因组监测提供标准。
跨智能体活动归因:关联大语言模型智能体间的异步攻击
专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI
AI总结 研究跨大语言模型智能体的异步攻击归因问题,提出异步归因指纹向量($A^2FV$)协议,构建SCD-v1基准,实验表明$A^2FV$在活动关联上表现良好,确立跨智能体活动归因作为保护大语言模型智能体的独特评估层。
Comments 22 pages, 5 figures. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026
迈向可审计的欺诈检测:结合图特征、模型解释和智能案例调查
机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究欺诈检测系统,通过分层管道结合多种方法,包括梯度提升分类器等。在PaySim数据集上实验,各组件在特定条件下起作用,如校正后图特征等未提升全测试集平均精度,但在部分子集有作用,调查代理表现不佳,还标记了其错误。
Comments 14 pages, 3 figures. Code available at https://github.com/rahil1303/auditable-fraud-investigation
故事塑造智能体:大语言模型行为中的叙事先验
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; North Carolina State University(北卡罗来纳州立大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 研究探索大语言模型行为中叙事框架的影响,通过构建游戏识别叙事先验,发现其解释行为方差能力强且与任务成功相关,还明确跨叙事角色效应源于行为锚点,框架可推广并产生改进跨叙事转移的角色选择方法。
Comments Accepted at COLM 2026. 10 pages, 3 figures, 16 tables in appendix
可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试
机构 * Texas Tech University(德克萨斯技术大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。
SAAG:结构化智能体评估与基础
机构 * Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) ; Indian AI Research Organization(印度人工智能研究组织)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 研究针对智能体调用评估问题,提出SAAG级联诊断框架,将其分解为三个阶段进行评估,能实现迭代自我修复。经实验,结构化反馈可提高参数精度、减少值幻觉,表明阶段分解诊断评估对提升智能体调用可靠性很关键。
Comments Accepted to KnowFM @ ACL 2026 workshop (Non-Archival). 16 pages in total
深度主从问题的新深度伽辽金方法
机构 * Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣巴巴拉分校统计学与应用概率系) ; Fintech Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)金融科技方向)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG
AI总结 研究连续时间下主从问题的数值求解,提出深度主从演员评论家算法(DeepPAAC),可处理多维情况及约束,通过五个案例研究神经网络架构等因素对求解器收敛的影响。
AgentDebugX:用于大语言模型代理中故障可观测性、归因和恢复的开源工具包
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Toronto(多伦多大学) ; Google(谷歌公司) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究大语言模型代理故障调试难题,提出开源框架AgentDebugX,其核心DeepDebug通过多轮诊断定位根源,在基准测试中表现出色,能修复更多失败任务,还通过多种方式公开工作流程并提供错误中心。
AGENTS4GEOS:用于开源多物理场模拟的智能体平台
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 研究针对多物理场模拟计算需求及训练数据集瓶颈,提出基于模型上下文协议的Agents4GEOS智能体框架,借助52个领域感知工具及协调器,自动化日常任务,助力专家专注工作挑战。
Comments 14 pages, 11 Figures
让机器消失:停止将人与代理关系称为寄生关系
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文指出将人类与对话代理关系称为寄生关系是误用,该术语原指单向、非辩证的虚构关系,导致对复杂现象的简化和误判,需重新认识人与代理的社会性。
人工智能原生生物技术公司需要部门吗?人工智能驱动药物研发的公司世界模型基准测试
机构 * Noah AI Research(诺亚人工智能研究)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 研究人工智能原生生物技术公司组织模式,提出公司世界模型,用含45个案例的虚拟实验室基准测试,比较多种架构,发现价值转换架构表现优,核心操作原语应是资产到价值状态而非静态组织结构图,不过研究仅限虚拟实验室。
Comments Working paper. Includes public no-label benchmark cases and dry-lab evaluation artifacts. No wet-lab, patient-level, clinical, regulatory, or investment validation is claimed
超越解决率:非功能性质量研究
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.SE
AI总结 研究对比新旧模型在存储库级修复任务中生成补丁的非功能性质量,通过两个案例研究,用CodeQL等工具评估,发现新模型解决实例更多,但非功能性指标无一致改善,旨在推动对模型软件工程能力的全面评估。
PARSE: 面向专业领域LLM Agent的溯源感知检索净化
机构 * Data Science Institute(数据科学研究所)
专题命中 Agent评测 :agent(title_cn);分类 cs.CL
AI总结 针对真实企业文档中提示注入攻击难以防御的问题,提出PARSE方法,通过分类句子注入可能性、提取结构化事实并验证一致性,将攻击成功率从25.4%降至15.6%,同时保持86.9%的实用性。
Comments 8 pages, 3 figures, 2 tables
基于前沿LLM的智能体可以克服自然表型的本体策展瓶颈
机构 * Renaissance Computing Institute, University of North Carolina(北卡罗来纳大学雷丁计算研究所) ; Neuromatch, USA(美国Neuromatch)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文使用前沿大型语言模型作为智能体策展人,在自包含工作空间中利用本体和注释指南进行表型注释,其性能达到人类策展人之间的变异性范围,显著优于传统NLP工具。
Comments 7 pages, 2 figures
需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配
机构 * Department of Computer Science(计算机科学系) ; Technion, Israel(技术ion, 以色列) ; Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG
AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。
SENTINEL:面向基础模型基于具身代理的安全性评估多级形式框架
机构 * Northwestern University, USA ; University of Southern California, USA ; College of William \& Mary
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 SENTINEL通过形式时序逻辑多级验证框架,系统性评估基础模型具身代理在模拟环境中的物理安全性。
回收评估:有损记忆比空记忆更糟糕
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究发现,语言模型保留错误结论而丢弃推导过程的记忆会导致更差表现,提出“源优先”策略通过保留可重算源来恢复可纠正性,并在多种记忆系统和真实对话中验证。
Comments 36 pages, 5 figures, 23 tables. v5: table/float layout fixes and a corrected stray typo in Table 21 (n/a cells); no changes to results or text
CircuitKIT:用于机理可解释性的电路发现、评估和应用工具包
专题命中 Agent评测 :workflow(abstract);分类 cs.CL、cs.LG
AI总结 介绍CircuitKIT工具包,用于机理可解释性的电路分析。它通过可序列化表示连接工作流程,提供发现算法、声明式接口、电路诊断及应用模块,为电路分析提供通用基础设施,解决了现有方法碎片化问题。