Parthenon Law: A Self-Evolving Legal-Agent Framework
Parthenon Law: 一种自我进化的法律智能体框架
机构 * tapntell.ai
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 本文提出Parthenon框架,通过分解模型、工具、知识等组件并引入反泄漏学习循环,使法律领域的大语言模型智能体能够从经验中自我进化,显著提升法律事务处理性能。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Parthenon Law: 一种自我进化的法律智能体框架
机构 * tapntell.ai
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 本文提出Parthenon框架,通过分解模型、工具、知识等组件并引入反泄漏学习循环,使法律领域的大语言模型智能体能够从经验中自我进化,显著提升法律事务处理性能。
MiniPIC: 少于100行代码的灵活位置无关缓存
机构 * IBM Research(IBM研究院)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出MiniPIC,通过无位置编码KV缓存和用户控制缓存重用原语,在vLLM中实现多种位置无关缓存方法,显著提升预填充吞吐量并降低首个令牌延迟。
Comments 13 pages, 5 figures
与你合作得更好:将用户修正编译为编码代理的运行时强制
机构 * University of Notre Dame(圣母大学) ; IBM Research(IBM研究院) ; Tencent AI Lab(腾讯AI实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG
AI总结 提出TRACE方法,通过将用户修正编译为原子规则并在运行时强制执行,显著减少编码代理在后续任务中的偏好违反,优于纯记忆方法。
超越韧性——公民提升的概念框架
专题命中 软件智能体 :agent(abstract)
AI总结 提出“公民提升”概念,定义城市从冲击中恢复后功能容量提升的状态,并构建基于拓扑、制度和判断三个慢变量及一个快情感通道的概念框架。
NavWAM:用于目标条件视觉导航的导航世界动作模型
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(国立信息学研究所) ; AIRoA ; ATR
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。
Comments Project page: https://dachii-azm.github.io/navwam/
Goal2Pixel: 将目标锚定到像素以实现视觉语言导航
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。
Comments 8 pages
SMSR:针对持久化LLM代理系统中运行时内存投毒的认证防御
机构 * Independent Researcher(独立研究者)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 提出SMSR防御框架,通过写入时HMAC签名和查询时随机化内存消融与基于判决的多数投票,首次为多会话内存投毒攻击提供认证鲁棒性保证。
MemRefine: 基于LLM引导的压缩用于长期智能体记忆
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院)
专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 提出MemRefine框架,利用LLM判断事实内容,通过删除、合并和保留操作将记忆库压缩到固定预算内,在多个基准上保持下游性能并优于基于规则的基线。
记忆即服务 (MaaS):面向合作智能体的目的绑定记忆中介
专题命中 记忆与上下文管理 :agentic(abstract,comments);agent(abstract);workflow(abstract)
AI总结 提出记忆即服务 (MaaS) 框架,通过目的绑定的记忆中介机制,在合作编程智能体间平衡记忆共享效用与隐私泄露风险,实验表明现有检索方法存在严重隐私泄露。
Comments Accepted to the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE @ KDD 2026)
具有反射和控制的交互随机系统的扩散近似
专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract)
AI总结 研究一类具有反射和控制的交互随机系统的扩散近似,通过扩散缩放建立到Ornstein-Uhlenbeck型反射随机微分方程组的分布收敛,并用数值例子展示在人群动力学和神经群体动力学中的应用。
Comments 21 pages, 2 figures
如果LLM具有类人属性,那么《帝国时代II》也具有
机构 * Microsoft(微软公司) ; The University of York(约克大学)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 通过训练简单神经网络于《帝国时代II》,论证LLM的拟人属性在经验上非唯一,提出应假设LLM非独特性而非拟人属性来设计实验。
Comments Fixed corollary 1, added stat sig
量子代理的信息增益与测量扰动
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 将量子测量推广至量子代理,其记忆可存储经典或量子信息,发现量子代理能获取更多信息但代价是更大的测量扰动,并通过实验表征了这种权衡。
二硫化钼和二硫化钨中缺陷的积极面及一种通用的化学处理协议用于缺陷钝化
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 研究揭示硫空位作为激子陷阱,提出通过硫醇或硫化物与路易斯酸结合的通用处理协议,提升光致发光275倍并保持载流子迁移率。
SARC:一种用于代理AI系统的架构治理框架
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);multi-agent(abstract)
AI总结 本文提出SARC框架,通过将约束作为第一类规范对象,实现对代理AI系统运行时的治理,减少硬约束违规并提升可审计性。
Comments Working Paper
用于语义控制系统再综合的智能体MPC
机构 * University of Tokyo(东京大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 提出智能体MPC框架,通过集成大语言模型智能体实现上下文感知的语义自适应控制综合,在自动驾驶场景中验证其根据个人偏好或社交情境(如避让应急车辆)调整控制的能力。
Comments 7 pages, 5 figures
跨尺度科学挑战的AI智能体基准测试
机构 * Yale University(耶鲁大学) ; Broad Institute of MIT and Harvard(布罗德研究所) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Northeastern University(东北大学) ; Northwestern University(西北大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 提出SciAgentArena基准,含约200个交互式任务,评估AI智能体在真实科研场景中的能力,发现其在数据分析中有效,但在创新探索和开放问题上表现不均。
Comments 6 figures
EpiBench:人工智能代理在表观基因组学分析中的可验证评估
机构 * LatchBio
专题命中 Agent评测 :AI agent(title);workflow(abstract);分类 cs.AI
AI总结 提出EpiBench基准,通过106个评估任务测试AI代理在表观基因组学工作流中的决策能力,发现最佳系统GPT-5.5/Pi通过率仅45%,失败多因缺乏深度科学判断。
从被动生成到主动调查:一种主动的科学同行评审代理
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Technical University of Darmstadt(达姆施塔特工业大学通用知识处理实验室) ; National Research Center for Applied Cybersecurity ATHENE, Germany(德国国家应用网络安全研究中心 ATHENE) ; School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL
AI总结 提出ProReviewer,一种基于LLM的主动科学同行评审代理,将评审建模为马尔可夫决策过程,通过结构化评审日志引导主动调查,在五个质量维度上平均得分最高,优于现有方法。
探索智能体口音如何影响K-12小组学习中的人机协作
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 研究通过33名教师的实验,发现GenAI语音智能体的不同口音(英式、印度式、非裔美式)影响其被感知为工具或同伴,进而影响信任、参与和依赖。
将基于智能体的捕食者-猎物模型调谐至洛特卡-沃尔泰拉动力学
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究通过调整环境与种群参数,使基于智能体的捕食者-猎物模型产生类似洛特卡-沃尔泰拉方程的周期性振荡,并利用基于特征的损失函数优化参数。
Comments 12 pages, 3 figures
用于配电缺陷检测的多模态智能体:基础模型评估
机构 * Quan Quan
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。
多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。
探索系统思维方法应对失控风险
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 本文运用STECA、STPA和FRAM三种系统安全方法分析前沿实验室编码智能体场景,发现模型级评估可能遗漏治理责任、反馈回路和操作变异等风险,主张将模型评估与系统级危害分析和操作保证相结合。
Comments Accepted to the Technical AI Governance Workshop at ICML 2026
Agents' Last Exam
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对AI系统在专业领域缺乏经济性部署的问题,提出Agents' Last Exam (ALE)基准,通过250+专家协作构建覆盖13个行业集群55个子领域的1000+长期真实经济任务,当前最难层级平均通过率仅2.6%。
Comments Project website: https://agents-last-exam.org Code: https://github.com/rdi-berkeley/agents-last-exam
波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测
机构 * AI Lab, SLB(SLB人工智能实验室) ; Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。
Comments 8 pages (main text), 28 pages total including appendix. 9 figures, 7 tables
DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体
机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) ; Department of Applied Mathematics, Hong Kong Polytechnic University(应用数学系,香港理工大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出包含641个真实数据科学问题的基准DSAEval,涵盖多模态环境感知、多查询交互和多维评估,系统评估13个先进LLM智能体,发现Claude-Sonnet-4.5综合最优,多模态感知提升视觉任务性能2.04%-11.30%。
解析斑马鱼幼体捕食行为的深度强化学习训练RNN代理
机构 * California Institute of Technology(加州理工学院) ; Harvard University(哈佛大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文通过深度强化学习训练RNN代理,研究斑马鱼幼体捕食行为,揭示生态和能量约束如何影响适应性行为,发现简单模型能复现真实捕食行为,并通过虚拟实验验证约束和环境对捕食动态的影响。
Journal ref Proceedings of the 9th Conference on Cognitive Computational Neuroscience (2026)
RogueAI: 一种用于检测对话中授权AI欺骗的逆向图灵测试
机构 * AILab, MIGe, University of Trieste(的里雅斯特大学) ; Computational Statistics and Machine Learning, Istituto Italiano di Tecnologia(意大利理工学院) ; DIA, University of Trieste(的里雅斯特大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 提出RogueAI,一种通过玩家与两个LLM代理的对话游戏来检测授权欺骗的逆向图灵测试,并引入AutoRogueAI扩展。实验发现简单启发式方法准确率75.6%,而人类仅56.6%,表明人类忽略关键信号。
大型语言模型驱动的AI系统中自主渗透能力的涌现
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Concordia AI ; Shanghai Innovation Institute(上海创新研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对现有评估方法不透明、场景简化等问题,构建包含两级目标服务器和通用代理框架的自主渗透评估体系,测试19个LLM发现成功率10.7%-69.3%,且能力随模型整体能力提升。
DailyReport: 一个用于评估搜索代理在日常搜索任务上的开放式基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 提出DailyReport基准,包含150个开放式日常搜索任务和3546个级联评分标准,通过分解子任务和维度评估,揭示当前搜索代理系统仍未能满足用户期望。