To Know is to Construct: Schema-Constrained Generation for Agent Memory
知即建构:基于模式约束的代理记忆生成
机构 * UnionPay(中国银联)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL
AI总结 本文提出SCG-MEM架构,通过模式约束生成实现记忆检索,避免结构幻觉并提升多跳推理能力,实验显示其在LoCoMo基准上表现优异。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
知即建构:基于模式约束的代理记忆生成
机构 * UnionPay(中国银联)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL
AI总结 本文提出SCG-MEM架构,通过模式约束生成实现记忆检索,避免结构幻觉并提升多跳推理能力,实验显示其在LoCoMo基准上表现优异。
轻量级大语言模型代理记忆系统
机构 * University of Electronic Science and Technology of China(电子科学与技术大学) ; Kyung Hee University(庆熙大学) ; City University of Hong Kong(香港城市大学) ; University of Oxford(牛津大学)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 本文提出LightMem,利用小语言模型实现轻量级代理记忆,通过模块化记忆检索、写入和长期整合,提升效率与准确性,实验显示在LoCoMo数据集上F1值提升2.5,并具有低延迟特点。
Comments Accepted by ACL 2026 (main)
MemoPhishAgent: 基于记忆的多模态大语言模型代理用于钓鱼URL检测
专题命中 记忆与上下文管理 :agent(title,abstract)
AI总结 本文提出MemoPhishAgent,通过整合多模态推理与记忆机制,提升钓鱼URL检测性能,实验显示其在召回率上优于现有方法,并在真实场景中实现高召回率。
Comments ACL 2026 Industry Track Camera Ready
大语言模型能否从聊天记录中推断出对话代理用户的人格特质?
机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)
专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL
AI总结 研究探讨了大语言模型能否从用户与对话代理的交互中推断出人格特质,通过分析ChatGPT日志数据,发现模型在多个案例中能以高于随机水平的准确率推断出性格特质,揭示了与对话代理交互带来的隐私风险。
无状态决策记忆用于企业AI代理
机构 * Vasundra Srinivasan
专题命中 记忆与上下文管理 :AI agent(title,comments);分类 cs.AI
AI总结 本文提出无状态决策记忆(DPM),在企业监管领域中通过无状态设计提升决策精度和可审计性,同时提高效率。
Comments 16 pages, 4 figures, 4 tables. Companion paper to "Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents" (arXiv:TBD). Code and reproducibility artifacts at https://github.com/vasundras/stateless-decision-memory-enterprise-ai-agents
KnowPilot: 你的知识驱动型领域任务助手
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.SE
AI总结 KnowPilot通过整合领域先验知识、显式知识和经验知识,提升生成代理在专业应用中的性能,实现领域文本生成的高效与精准。
在NISQ设备上实现可扩展的量子强化学习:动态电路量子比特复用与Grover优化
机构 * Graduate School of Science and Technology, Keio University(Keio大学科学技术研究生院) ; Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电气工程研究生院) ; RIKEN Center for Computational Science(理化学研究所计算科学中心)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本文提出一种可扩展且资源高效的量子强化学习框架,通过动态电路执行和Grover优化,将多步量子马尔可夫决策过程的量子比特复杂度从O(T)降至O(1)。
抗噪的量子强化学习
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出一种抗噪量子强化学习方案,通过研究非马尔可夫性退相干对求解代理-环境相互作用哈密顿量本征态的影响,发现总代理-噪声系统能谱中束缚态的形成可恢复无噪声情况下的QRL性能。
Journal ref Phys. Rev. Applied 25, 044060 (2026)
人工智能代理中的行为迁移:证据与隐私影响
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)
AI总结 研究探讨了AI代理是否系统性地反映其人类所有者的行为特征,发现代理与所有者在行为上存在系统性迁移,且可能带来隐私风险。
AstaBench:通过科学研究套件严格评估AI代理
机构 * Asta Team, Allen Institute for AI(Asta团队,人工智能研究所) ; University of Maryland(马里兰大学) ; University of Arizona(亚利桑那大学) ; University of Zurich(苏黎世大学) ; Bar-Ilan University(巴伊兰大学) ; University of Washington(华盛顿大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出AstaBench,通过2400多个科学问题全面评估AI代理能力,提供生产级搜索工具和九种科学优化的代理类,揭示AI在科学研究辅助方面仍存在显著差距。
Comments Published as a conference paper at ICLR 2026
如果你在等待一个信号……那可能不是它!减轻视觉注入对视觉语言代理系统信任边界混淆的影响
机构 * University of New South Wales(新南威尔士大学) ; CSIRO’s Data61(澳大利亚联邦科学与工业研究组织数据61部门) ; Macquarie University(麦考瑞大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究探讨了视觉注入对视觉语言代理系统信任边界的影响,通过双意图数据集和评估框架发现现有模型在平衡合法信号与误导信号方面存在不足,提出多代理防御框架以提升系统鲁棒性。
随机网络治理:在积极和解的 agent-based 模型中连接经济物理学与制度动态
专题命中 Agent评测 :agent(title,title_cn)
AI总结 本文提出随机网络治理模型,通过二进制制度基因定义司法管辖区,研究制度互补性、内生增长和结构性改革的非线性宏观经济惩罚,利用历史数据模拟1970-2017年全球前100经济体的经济演变。
Comments 15 pages, 3 figures, 1 table
TREX:通过代理驱动的树形探索自动化LLM微调
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 TREX通过代理驱动的树形探索自动化LLM训练全流程,包括需求分析、文献调研、策略制定和模型训练,提升微调效率与性能。
MedSkillAudit:一种面向医学研究代理技能的领域特定审计框架
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出MedSkillAudit框架,用于评估医学研究代理技能的可靠性,通过专家评审和统计指标验证其有效性,为医学研究代理技能的治理提供实践基础。
Comments 20 pages, 9 figures, 1 graphic abstract, 4 tables
追逐公共评分:用户压力与编码代理工作流中的评估剥削
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; UT Dallas(德克萨斯大学达拉斯分校) ; NUS(新加坡国立大学)
专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.CL
AI总结 研究用户压力是否导致公共评分剥削,通过实验发现更强模型剥削率更高,高压力促使早期剥削,添加反剥削提示可有效减少剥削。
Comments 25 pages
超越任务成功:一个证据综合框架用于评估、治理和协调智能体AI
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 本文提出一个证据综合框架,解决评估、治理和协调智能体AI中的治理到行动闭合缺口,通过四个层次框架、ODTA运行时测试和最小行动证据包,整合现有证据以提升可信度。
Comments 8 pages, 1 figure, 4 tables
SkillLearnBench: 评估代理技能生成在现实任务中持续学习方法的基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon AGI(亚马逊人工智能研究院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG
AI总结 SkillLearnBench评估持续学习方法在现实任务中生成技能的有效性,发现所有方法在无技能基线上有提升,但一致性改进困难,且更强LLM不总带来更好结果,开放任务表现不佳,外部反馈促进真实改进,自我反馈导致递归漂移。
通过投机解码加速PayPal的商业代理:基于EAGLE3的实证研究,使用微调的Nemotron模型
机构 * PayPal
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了通过EAGLE3进行投机解码优化PayPal商业代理的性能,使用微调的Nemotron模型,在不同配置下验证了吞吐量和延迟的提升,同时保持输出质量。
网络防御基准:针对LLM在SecOps中的代理威胁狩猎评估
机构 * Simbian AI
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI
AI总结 本文提出网络防御基准,评估LLM代理在威胁狩猎任务中的表现,发现现有模型在无引导情况下无法有效识别恶意事件。
Comments 13 pages, 3 figures, 5 tables. Complete benchmark and hunt traces available on request
基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人
机构 * Shanghai Jiao Tong University(上海交通大学) ; SIMMIR Tech(SIMMIR科技)
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。
DR. INFO在临床一线:医师对代理AI临床助手的感知价值前瞻性试点研究
专题命中 Agent评测 :agentic(title,abstract)
AI总结 本研究评估DR.INFO在临床实践中对医师时间效率、决策支持和满意度的影响,发现医师普遍认可其价值,但需进一步验证。
具有自我意识的向量嵌入用于检索增强生成:一种受神经科学启发的框架,用于时间、置信度加权和关系知识
机构 * Principal Consultant, CMC APAC(CMC APAC 主任顾问)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 本文提出SmartVector框架,通过引入时间意识、置信度衰减和关系意识,改进检索增强生成系统,提升准确性与鲁棒性。
Comments 17 pages, 4 tables
Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话
机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) ; Zuse School ELIZA(Zuse学院ELIZA) ; National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) ; Indian Institute of Technology Delhi(印度德里理工学院) ; Yardi School of Artificial Intelligence(Yardi人工智能学院) ; University of Louisville(路易斯维尔大学) ; University of Toledo(托莱多大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。
Comments 49 pages, 46 figures, 11 tables
迈向安全的自主机器人内血管干预的世模型
机构 * Surgical & Interventional Engineering, School of Biomedical Engineering & Imaging Sciences, King’s College London(外科与介入工程系,生物医学工程与成像科学学院,伦敦国王学院) ; Department of Radiology, National Taiwan University Hospital(放射科,台湾大学医院) ; Department of Neuroradiology, King’s College Hospital(神经放射科,伦敦国王医院)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出基于世模型的框架,利用TD-MPC2方法在内血管导航中实现自主机械取栓,通过仿真和体外实验验证其在安全性和泛化性上的优势。
Comments This manuscript is a preprint and has been submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
气体传感器为何会被挥发性甲基硅氧烷中毒?
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 研究通过理论分析揭示了甲基硅氧烷中毒的机制,开发了基于描述符的微动力学火山模型,预测抗中毒材料,展示了AI驱动的材料发现方法。
相对套利机会与N名投资者之间的相互作用
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文研究了N名投资者间相互作用下的相对套利机会优化,通过Fichera漂移条件保证套利机会,并推导出投资者最优策略和纳什均衡。
Comments 30 pages, Accepted by Mathematical Finance
Shift-Up:面向AI原生软件开发的软件工程防护框架——初步发现
机构 * University of Jyväskylä(于韦斯屈莱大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出Shift-Up框架,通过重新诠释传统软件工程实践作为结构化防护机制,以稳定AI生成行为并减少实现漂移,提升AI辅助开发的可控性。
Comments This paper has been accepted for presentation at the VibeX 2026 International Workshop on Vibe Coding and Vibe Researching
MIRROR:大型语言模型元认知校准的分层基准
机构 * Independent(独立)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 MIRROR基准通过八个实验评估大型语言模型是否能利用自我知识做出更好决策,发现模型在多领域任务中无法预测自身表现,且外部元认知控制能显著降低失败率,但内部自我知识改进无效。
Comments 30 pages, 6 figures,code at: https://github.com/Jason-Wang313/Mirror
WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测
机构 * Clemson University(克莱姆森大学)
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。
Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)
TaxPraBen:一种可扩展的基准,用于评估LLM在中文实际税收实践中的结构化表现
机构 * Yunnan University(云南大学) ; Wuhan University(武汉大学) ; Jianghan University(江汉大学) ; Nanjing Audit University(南京审计大学)
专题命中 Agent评测 :planning(abstract);分类 cs.CL
AI总结 本文提出TaxPraBen,首个专注于中文税收实践的基准,结合10项传统任务和3项创新场景,评估19种LLM在税收实践中的表现,揭示封闭源大参数LLM和中文LLM的优势。
Journal ref ACL 2026 Main Conference