arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-22 至 2026-07-22 共收录 195 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 13 篇

2602.14516 2026-07-22 cs.DC 版本更新 67%

Efficient Multi-round LLM Inference over Disaggregated Serving

高效多轮LLM推理的解耦服务

Wenhao He, Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu

专题命中 记忆与上下文管理 :autonomous agent(abstract);planning(abstract)

AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18975 2026-07-22 cs.AI 新提交 61%

Mi-Memory: A Lifecycle Memory Framework for Personal AI

Mi-Memory:一种用于个人人工智能的生命周期内存框架

Xule Liu, Hanlin Teng, Chao Li, Yanan Ni, Shuo Lu, Audrey Wang, Yijun Liu, Yunfei Wang, Xiaofeng Li, Xian Yi, Yuanfa Li, Kang Zhao, Jian Liang, Yuxuan Chen, Jinyuan Chen, Heng Qu, Kun Shao, Jian Luan

专题命中 记忆与上下文管理 :agent(abstract,comments);分类 cs.AI

AI总结 研究针对个人人工智能从聊天交互拓展至多设备持续服务的需求,提出Mi-Memory生命周期内存框架,围绕四个角色构建,通过共享审计合约及相关工件家族实现,经实例化角色在评估中取得一定成果,迈向可审计等特性的内存系统。

Comments Project page: https://darwin-agent.github.io/Mi-Memory/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18275 2026-07-22 cs.GT cs.AI 新提交 57%

A Calculus of Discernment: Decision-Relevant Insight, Sequence Value, and Forgetting as Higher-Order Learning

一种辨别演算:决策相关洞察、序列价值与遗忘作为高阶学习

Suyash Mishra

机构 * Independent AI Researcher, Zürich, Switzerland(独立AI研究员,瑞士苏黎世)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究在生成式AI丰富候选洞察下,稀缺的辨别、行动及遗忘能力问题。构建围绕特定对象的框架,提出APOHA理论。通过在肥胖治疗决策世界测试,表明自适应遗忘能降决策后悔、优化记忆,价值感知遗忘有优势。

Comments 17 pages, 5 figures. Includes a pre-registered empirical study (30 seeds x 100 iterations) and a reference implementation; a companion interactive demo is available from the author

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12721 2026-07-22 cs.AI 版本更新 57%

The Theory of Mind Utility: Formal Specification of a Mentalizing Mechanism

心智理论效用:心理化机制的形式化规范

Nikolos Gurney, Stacy Marsella

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所) Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出心智理论效用(ToM-U)框架,通过局部认知世界模型(LEWM)形式化推断他人信念的计算问题,定义结构、推理过程及失败痕迹,区别于贝叶斯心智理论等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19156 2026-07-22 quant-ph cond-mat.stat-mech 新提交 50%

Dimension Reduction for Quantum Adaptive Agents

量子自适应智能体的降维方法

Rishi Sundar, Thomas J. Elliott

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究量子自适应智能体,引入路由-截断-修复过程,将熵量子记忆优势转化为内存维度降低,通过时间矩阵乘积态表示等操作,经保真度-散度证书量化权衡,实现基准自适应过程的维度显著降低且保持行为高保真。

Comments 4 + 2 pages main text, 23 page supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17581 2026-07-22 quant-ph physics.hist-ph 交叉投稿 50%

Epistemic Horizons From Deterministic Laws: Lessons From a Nomic Toy Theory

从确定性定律看认知视界:一个唯名玩具理论的启示

Johannes Fankhauser, Tomáš Gonda, Gemma De les Coves

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究引入唯名玩具理论,将信息收集主体建模为物理系统,发现其存在认知视界,主体只能同时得知特定可观测量的值,有不相容测量,系统完整状态不可知,此结果调和了测量不确定性,即便理论本质经典,也为认知视界研究带来启示。

Comments 29+11 Pages, 4 Figures, minor changes to Appendix A

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 36 篇

2607.16989 2026-07-22 cs.CL cs.AI cs.DL cs.HC 版本更新 90%

Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries

人工智能代理起草转化影响摘要的实际评估

Mohammad Arvan, Amber E. Osterholt, Bailee Rue, Yuvaneswaren R. Sureshbabu, Krishna R. Patel, Rebecca T. Feinstein, Bethany C. Bray, Niranjan S. Karnik

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对CTSA项目人工整理学者研究影响耗时久且难扩展的问题,构建人工参与的AI代理。该代理为学者整理证据档案、起草影响摘要,经评估,在CTSA中心工作流程中表现良好,能提高效率、实现队列规模影响报告。

Comments 15 pages, 5 figures, 2 tables. Submitted to the Journal of Clinical and Translational Science. Code: https://github.com/mo-arvan/scholar-dossier-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18257 2026-07-22 cs.HC cs.AI 新提交 89%

Assistant or Actor? Student Trust, Control, and Delegation Regret When Using a General-Purpose AI Agent

助手还是执行者?使用通用人工智能代理时学生的信任、控制与委托遗憾

Shiva Pochampally, Shengwei An, Yan Chen

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究探讨用户使用通用人工智能代理时的委托遗憾问题,通过大学生完成不同任务的对照研究,发现参与者按任务校准信任,不可逆与外部可见性影响信任撤回,代理无预览执行行动时委托遗憾常现,为代理设计提供了相关启示。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18366 2026-07-22 cs.AI cs.CL cs.CY 新提交 86%

Operational Hallucination and Safety Drift in AI Agents

人工智能代理中的操作幻觉与安全漂移

Shasha Yu, Fiona Carroll, Barry L. Bentley

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13428 2026-07-22 cs.SE cs.AI 版本更新 86%

SWE-Milestone: Evaluating AI Agents on Continuous Software Evolution

EvoClaw: 评估AI代理在持续软件演化中的表现

Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang

机构 * USC(美国斯克利普斯大学) UCR(加州大学河滨分校) UCSD(加州大学圣地亚哥分校) Army Research Office(陆军研究办公室) Stanford(斯坦福大学) Princeton(普林斯顿大学) Haven OpenHands

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对现有基准测试忽视软件演化中时间依赖和技术债务的问题,提出EvoClaw基准,通过从提交日志重建可验证里程碑DAG,评估AI代理在持续开发中维持系统完整性和限制错误累积的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交 85%

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16345 2026-07-22 cs.SE cs.AI cs.LG cs.PF 版本更新 85%

AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows

AEVAL:从轶事性到确定性的智能体技能工作流测试

Tejas Singh Anand, Yuet Ying Christina Wang, Wanting Jiang, Steve Masson, Tian Zheng, Bingjie Zhou

机构 * nvidia(NVIDIA公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究针对智能体技能工作流测试缺乏确定性和可重复性的问题,提出AEVAL框架,通过执行器与评分器分离等方法,实现确定性、可重复的测试,给出分层修复建议,能将虚假通过率转换为可重复失败信号并记录修复过程。

Comments 8 pages, 1 figure, 1 table, accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19262 2026-07-22 cs.AI 新提交 83%

BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance

生物安全基准测试 - 监测:病原体基因组监测中人工智能代理的可验证基准

Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对病原体基因组监测瓶颈从数据生成转向分析的问题,提出BioSecBench-Surveillance基准测试,含100项评估,通过提供人类分析师的数据和背景来测试AI代理,给出不同模型配置的测试结果,为衡量AI代理能否胜任基因组监测提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18826 2026-07-22 cs.CR cs.AI 新提交 83%

Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents

跨智能体活动归因:关联大语言模型智能体间的异步攻击

SangJin Park, Myungsub Choi, Jineok Kim, Minseung Kang

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 研究跨大语言模型智能体的异步攻击归因问题,提出异步归因指纹向量($A^2FV$)协议,构建SCD-v1基准,实验表明$A^2FV$在活动关联上表现良好,确立跨智能体活动归因作为保护大语言模型智能体的独特评估层。

Comments 22 pages, 5 figures. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19266 2026-07-22 cs.LG cs.AI 新提交 81%

Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation

迈向可审计的欺诈检测:结合图特征、模型解释和智能案例调查

Rahil Sharma

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究欺诈检测系统,通过分层管道结合多种方法,包括梯度提升分类器等。在PaySim数据集上实验,各组件在特定条件下起作用,如校正后图特征等未提升全测试集平均精度,但在部分子集有作用,调查代理表现不佳,还标记了其错误。

Comments 14 pages, 3 figures. Code available at https://github.com/rahil1303/auditable-fraud-investigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18566 2026-07-22 cs.CL cs.AI 新提交 81%

The Story Shapes the Agent: Narrative Priors in LLM Behavior

故事塑造智能体:大语言模型行为中的叙事先验

Yixuan Wang, James Lester, Shashank Srivastava

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究探索大语言模型行为中叙事框架的影响,通过构建游戏识别叙事先验,发现其解释行为方差能力强且与任务成功相关,还明确跨叙事角色效应源于行为锚点,框架可推广并产生改进跨叙事转移的角色选择方法。

Comments Accepted at COLM 2026. 10 pages, 3 figures, 16 tables in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18485 2026-07-22 cs.CR cs.AI 新提交 79%

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试

Jie Li

机构 * Texas Tech University(德克萨斯技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18245 2026-07-22 cs.AI 新提交 79%

SAAG: Structured Agent Assessment and Grounding

SAAG:结构化智能体评估与基础

Ritvik Garimella, Vedant Khandelwal, Anvi Kohli, Amit Sheth

机构 * Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) Indian AI Research Organization(印度人工智能研究组织)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对智能体调用评估问题,提出SAAG级联诊断框架,将其分解为三个阶段进行评估,能实现迭代自我修复。经实验,结构化反馈可提高参数精度、减少值幻觉,表明阶段分解诊断评估对提升智能体调用可靠性很关键。

Comments Accepted to KnowFM @ ACL 2026 workshop (Non-Archival). 16 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04309 2026-07-22 math.NA cs.LG cs.NA 版本更新 79%

DeepPAAC: A New Deep Galerkin Method for Principal-Agent Problems

深度主从问题的新深度伽辽金方法

Michael Ludkovski, Changgen Xie, Zimu Zhu

机构 * Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣巴巴拉分校统计学与应用概率系) Fintech Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)金融科技方向)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 研究连续时间下主从问题的数值求解,提出深度主从演员评论家算法(DeepPAAC),可处理多维情况及约束,通过五个案例研究神经网络架构等因素对求解器收敛的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18754 2026-07-22 cs.AI cs.CL 新提交 79%

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AgentDebugX:用于大语言模型代理中故障可观测性、归因和恢复的开源工具包

Kunlun Zhu, Xuyan Ye, Zhiguang Han, Yuchen Zhao, Bingxuan Li, Weijia Zhang, Muxin Tian, Xiangru Tang, Pan Lu, James Zou, Jiaxuan You, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) Google(谷歌公司) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究大语言模型代理故障调试难题,提出开源框架AgentDebugX,其核心DeepDebug通过多轮诊断定位根源,在基准测试中表现出色,能修复更多失败任务,还通过多种方式公开工作流程并提供错误中心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18557 2026-07-22 physics.geo-ph 新提交 78%

AGENTS4GEOS: agentic platform for open-source multi-physics simulation

AGENTS4GEOS:用于开源多物理场模拟的智能体平台

Adriano M. A. Côrtes, Roberto M. Velho, Fernando A. Rochinha, Alvaro L. G. A. Coutinho, Mauricio Araya-Polo, Hervé Gross

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 研究针对多物理场模拟计算需求及训练数据集瓶颈,提出基于模型上下文协议的Agents4GEOS智能体框架,借助52个领域感知工具及协调器,自动化日常任务,助力专家专注工作挑战。

Comments 14 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05197 2026-07-22 cs.HC cs.CY 78%

Ghosting the Machine: Stop Calling Human-Agent Relations Parasocial

让机器消失:停止将人与代理关系称为寄生关系

Jaime Banks

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文指出将人类与对话代理关系称为寄生关系是误用,该术语原指单向、非辩证的虚构关系,导致对复杂现象的简化和误判,需重新认识人与代理的社会性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18696 2026-07-22 cs.AI 新提交 70%

Do AI-Native Biotechs Need Departments? Benchmarking Company World Models for AI-Driven Drug Development

人工智能原生生物技术公司需要部门吗?人工智能驱动药物研发的公司世界模型基准测试

Yinan Wang

机构 * Noah AI Research(诺亚人工智能研究)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究人工智能原生生物技术公司组织模式,提出公司世界模型,用含45个案例的虚拟实验室基准测试,比较多种架构,发现价值转换架构表现优,核心操作原语应是资产到价值状态而非静态组织结构图,不过研究仅限虚拟实验室。

Comments Working paper. Includes public no-label benchmark cases and dry-lab evaluation artifacts. No wet-lab, patient-level, clinical, regulatory, or investment validation is claimed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18462 2026-07-22 cs.SE 新提交 70%

Beyond Resolved Rate: A Non-Functional Quality Study

超越解决率:非功能性质量研究

Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 研究对比新旧模型在存储库级修复任务中生成补丁的非功能性质量,通过两个案例研究,用CodeQL等工具评估,发现新模型解决实例更多,但非功能性指标无一致改善,旨在推动对模型软件工程能力的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17467 2026-07-22 cs.CR cs.CL 版本更新 70%

PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents

PARSE: 面向专业领域LLM Agent的溯源感知检索净化

Aaditya Pai

机构 * Data Science Institute(数据科学研究所)

专题命中 Agent评测 :agent(title_cn);分类 cs.CL

AI总结 针对真实企业文档中提示注入攻击难以防御的问题,提出PARSE方法,通过分类句子注入可能性、提取结构化事实并验证一致性,将攻击成功率从25.4%降至15.6%,同时保持86.9%的实用性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28965 2026-07-22 cs.AI 版本更新 70%

Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes

基于前沿LLM的智能体可以克服自然表型的本体策展瓶颈

James P. Balhoff, Hilmar Lapp

机构 * Renaissance Computing Institute, University of North Carolina(北卡罗来纳大学雷丁计算研究所) Neuromatch, USA(美国Neuromatch)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文使用前沿大型语言模型作为智能体策展人,在自包含工作空间中利用本体和注释指南进行表型注释,其性能达到人类策展人之间的变异性范围,显著优于传统NLP工具。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06605 2026-07-22 cs.LG 版本更新 70%

How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配

Shai Feldman, Yaniv Romano

机构 * Department of Computer Science(计算机科学系) Technion, Israel(技术ion, 以色列) Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12985 2026-07-22 cs.AI 版本更新 70%

SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents

SENTINEL:面向基础模型基于具身代理的安全性评估多级形式框架

Simon Sinong Zhan, Philip Wang, Yao Liu, Yiyan Peng, Zinan Wang, Qineng Wang, Zhian Ruan, Xiangyu Shi, Xinyu Cao, Frank Yang, Zhenyang Ni, Kangrui Wang, Ruohan Zhang, Huajie Shao, Manling Li, Qi Zhu

机构 * Northwestern University, USA University of Southern California, USA College of William \& Mary

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 SENTINEL通过形式时序逻辑多级验证框架,系统性评估基础模型具身代理在模拟环境中的物理安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25449 2026-07-22 cs.CL cs.AI cs.LG 版本更新 67%

Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One

回收评估:有损记忆比空记忆更糟糕

Alex Kwon

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究发现,语言模型保留错误结论而丢弃推导过程的记忆会导致更差表现,提出“源优先”策略通过保留可重算源来恢复可纠正性,并在多种记忆系统和真实对话中验证。

Comments 36 pages, 5 figures, 23 tables. v5: table/float layout fixes and a corrected stray typo in Table 21 (n/a cells); no changes to results or text

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19317 2026-07-22 cs.LG cs.CL cs.ET 新提交 62%

CircuitKIT : Circuit Discovery, Evaluation, and Application Toolkit for Mechanistic Interpretability

CircuitKIT:用于机理可解释性的电路发现、评估和应用工具包

Pratinav Seth, Hem Gosalia, Aditya Kasliwal, Vinay Kumar Sankarapu

专题命中 Agent评测 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 介绍CircuitKIT工具包,用于机理可解释性的电路分析。它通过可序列化表示连接工作流程,提供发现算法、声明式接口、电路诊断及应用模块,为电路分析提供通用基础设施,解决了现有方法碎片化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏