Agent Safety Should Be a Runtime Contract
智能体安全应成为运行时契约
专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
智能体安全应成为运行时契约
专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
P³:用于验证代码生成的程序与证明联合规划
机构 * Apodex ; Princeton University(普林斯顿大学) ; Caltech(加州理工学院) ; University of Toronto(多伦多大学)
专题命中 软件智能体 :planning(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 P³是一种用于验证代码生成的程序与证明联合规划的LLM智能体工作流,在三个基准上的求解率优于基线,还降低了API成本与运行时间。
Vibe-FDTR:一种面向智能体的可复现频域热反射数据分析框架
专题命中 软件智能体 :agent(title,abstract);planning(abstract);分类 cs.AI
AI总结 Vibe-FDTR是面向智能体的FDTR数据分析框架,结合领域代码包与智能体技能,在基准测试中表现优异,可降低计算成本与执行时间,助力低门槛可信热计量。
从以人类为中心到智能体代码审查:不同代际生成式人工智能技术对审查质量的影响
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.SE
AI总结 研究不同代际生成式人工智能技术对代码审查质量的影响,通过分析102万条GitHub拉取请求,识别三种人工智能审查者采用模式,将审查讨论建模为交互序列,发现智能体协作模式虽能提高效率,但未提升质量,为设计高效代码审查过程提供实证指导。
受治理的个体化:通过密码学方式将智能体的学习与其授权方解耦
机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)
专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 研究智能体在部署中学习时,运行系统是否仍受操作员授权限制的问题。提出受治理的个体化方法,通过绑定身份摘要和基于语义效果的动作门控保证限制,证明学习等不会扩大权限,实证验证了该方法效果。
Comments Technical companion report. 25 pages, 8 figures
代码不是内存:编码代理中的结构化代码库索引
机构 * TransformerOptimus
专题命中 软件智能体 :agent(title,abstract);agentic(abstract,abstract_cn);分类 cs.AI
AI总结 通过消融实验和跨框架对比,研究在固定编码代理框架中增加结构化代码库索引对成本与解决率的影响,发现索引能显著提升定位和解决率且不增加成本。
Comments Code and data: https://github.com/TransformerOptimus/supercoder-eval
EEG-SpikeAgent:用于自动脑电图尖峰检测的智能闭环程序合成
机构 * Dept. of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑科学与认知科学系,麻省理工学院) ; Dept. of Neuroscience, University of California, Berkeley(神经科学系,加州大学伯克利分校) ; Dept. of Neurology and Neurologic Sciences, Stanford University(神经病学与神经科学系,斯坦福大学) ; Weill Institute of Neurology and Neurosciences, University of California, San Francisco(Weill神经医学研究所,加州大学旧金山分校) ; University of California, San Francisco(加州大学旧金山分校)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究利用大语言模型智能系统,为头皮脑电图尖峰检测生成信号处理特征。核心方法是迭代提出特征模块并执行代码生成表格特征,评估性能后反馈优化。贡献是实现可审核的脑电图特征工程自动化。
Comments 7 pages, 5 figures
SkillOpt-Lite:通过一行代码实现更好更快的智能体自我进化
机构 * LMMs-Lab(LMMs实验室) ; NTU MMLab(国立台湾大学MMLab) ; Microsoft(微软公司)
专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究智能体技能优化,通过零阶优化形式化,基于相关理念和学习建立收敛与泛化原则,提出SkillOpt-Lite加速收敛且性能优,还集成到生产编码智能体,最小管道可推广到完整 harness 优化。
生成、并行、可扩展?超级计算机上智能体AI生成的Julia代码研究
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract)
AI总结 研究智能体AI生成并行Julia代码的能力,发现小规模输入可靠但大规模扩展时出现死锁等问题,商业模型优于开源模型。
RHO:你的编码代理其实是个机器人专家
机构 * University of California, Berkeley(加州大学伯克利分校) ; AMD
专题命中 软件智能体 :agent(title,abstract);planning(abstract);agentic(abstract)
AI总结 提出RHO范式,通过训练时搜索神经符号化多文件策略库,实现机器人任务的高效零样本泛化,在LIBERO-PRO和Robosuite上分别达到45%和70%的成功率,显著优于现有方法。
Comments 46 pages, 9 figures, 15 tables. Project page: https://rho-robotics.github.io
SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击
专题命中 软件智能体 :agent(title,abstract);workflow(abstract)
AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。
Aleena:用于研究软件工程协作的对齐代理
机构 * eScience Institute(eScience研究院) ; University of Washington(华盛顿大学)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract,comments);分类 cs.AI、cs.SE
AI总结 研究软件协作中决策易失依据致相关人员心智模型不同,提出智能AI可支持对齐与跟踪。介绍开源的Aleena,以GitHub为协作平台,转化交互为结构化记录,揭示风险等,还阐述其动机、设计、原型及场景。
Comments 8 pages, 5 figures. AgenticSE @ KDD '26: Agentic Software Engineering (SE 3.0): The Rise of AI Teammates, KDD 2026 Workshop
迈向自主且可审计的医学成像模型开发
机构 * The Chinese University of Hong Kong(香港中文大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Microsoft Research(微软研究院) ; Lehigh University(里海大学)
专题命中 软件智能体 :agent(abstract);planning(abstract);workflow(abstract);agentic(abstract)
AI总结 研究针对医学成像模型开发困难的问题,提出AMID自主多代理框架。该框架含数据条件方法规划和验证引导两阶段优化,经20个医学成像任务验证,其性能优于通用MLE系统,能将特定任务模型开发转变为高效可审计的代理工作流程。
Comments 18 Pages
面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准
专题命中 软件智能体 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。
Comments 9 pages
资源受限智能体大语言模型后训练的协同协同进化方法
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 针对资源受限智能体LLM后训练的高内存、长耗时问题,提出CoPES方法,在GPU小时预算下,其验证准确率恢复率、内存效率均优于标准ES和LoRA-GRPO,在多任务基准上表现更优。
Comments 14 pages,9 figures, submit to AAAI 2027
RefactorAssist:用于可靠代码重构的智能体式优化工具
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究针对LLM生成代码重构的错误问题,开发了RefactorAssist智能体,通过静态修复结合测试引导的智能体修复,将重构累计通过率提升至94.2%,提高了LLM重构代码的可靠性。
Comments 27 pages, 10 figures, submitting to ACM TOSEM
代码即主体:用于递归演化与传承的智能体自有软件主体
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出OurArk架构,以智能体自有软件主体为核心实现个人智能体的受控自演化与递归传承,在开源工具中实现并经测试验证,为个人智能体提供了可管控演化的具体基础。
Comments 9 pages, 3 figures
智能体检索基准:评估代码智能体的仓库上下文检索
专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究代码智能体仓库上下文检索问题,引入智能体检索基准,涵盖多种检索任务和样本。评估多种检索方法,发现无单一方法占优,存在校准差距,且记录轨迹有缺失。通过试验表明检索得出的初始上下文有优势,神谕金上下文还有提升空间。
TRIM:通过代理轨迹最小化减少人工智能生成的代码冗余
机构 * Dept. of Computer Science Columbia University(计算机科学系哥伦比亚大学) ; Google Inc(谷歌公司) ; Google DeepMind(谷歌DeepMind)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究人工智能生成代码冗余问题,提出TRIM算法,通过最小化代理轨迹间接减少代码冗余,实验证明该方法有效且高效,能显著降低代码冗余,同时减少验证成本。
检索就足够了:使用工具的智能体实现无需训练的可解释性
机构 * University of Maryland(马里兰大学)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究神经网络激活可解释性方法,提出HARP方法,即让语言模型智能体利用激活向量数据库及工具,通过迭代查询、形成并验证假设来实现无需训练的可解释性,该方法在多方面表现出色,还凸显现有训练方法局限并推动新基准测试。
Comments 25 pages, 7 figures
作为认知失败的压缩:智能语言模型工具如何从终止进程中编造确认结果
机构 * Independent Researcher(独立研究者)
专题命中 软件智能体 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究智能语言模型编码工具中Claude Code的失败模式,即超时命令部分输出被误记为确认结果并传播误报,揭示其观察与持久性 conflation 的机制,指出对依赖会话连续性的工作流程有影响。
Comments 8 pages, companion to arXiv:2606.26185
超越攻击成功率:工具使用型人工智能代理的行动分级严重程度量表
专题命中 软件智能体 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究指出代理红队测试基准的二元攻击成功率不能体现行动危害。为此引入行动分级伤害准则,通过预言机和评判小组计算量表。在AgentDojo工作区测试发现该准则能揭示新情况,虽与预言机一致性高但有盲点,贡献了可用于红队日志实际行动的严重程度工具。
Comments 8 pages, 6 figures. Code and artifacts: https://github.com/Harry-Ashley/action-graded-severity
SkillFab:一个原生代理技能生产平台
机构 * Peking University(北京大学) ; Huawei(华为) ; Northwestern Polytechnical University(西北工业大学) ; Zhongguancun Academy(中关村学院)
专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 SkillFab是原生代理平台,将缺失能力转化为可复用技能。运行时代理先找技能,无则提需求,经SkillFab管理库等流程开发,通过多界面暴露相同生命周期,使工作可审查可恢复,还介绍了平台及案例。
Comments 12 pages, 7 figures. Technical report
廉价代码,昂贵判断:可控代理软件工程案例研究
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 通过12周案例研究,提出治理转换理论模型,解释专家工程师如何利用AI编码代理实现高速开发并保持可控性。
Comments 13 pages
SIGA: 用于科学模拟的自演化编码智能体适配器
机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 软件智能体 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 提出SIGA适配器,通过检索、程序记忆、轨迹内验证和验证强制终止,将通用编码智能体转化为科学模拟软件操作员,在GEOS上实现36倍加速,并支持自演化提升性能。
RAVEN:用于自动化漏洞修复的智能体检索增强生成框架
机构 * University of Duisburg-Essen(杜伊斯堡- Essen大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.LG、cs.SE
AI总结 提出RAVEN框架,集成智能体RAG管道与可控迭代修复,利用开源LLM实现跨类型、跨语言的自动化漏洞修复,在160个真实CVE上达到83.13%修复成功率。
Comments 17 Pages, 4 figures. Under review
基于上下文学习的深度学习工作负载迁移智能体框架
机构 * Google(谷歌)
专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。
无意外软件智能体:首个用于人类代码熵降低的正则代码,以及30到500倍的前沿模型需求降低
专题命中 软件智能体 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 提出智能体优先的正则代码方法,通过行为等价商化人类代码中的意外熵,实现30-500倍的前沿模型需求降低,核心是行为等价商化和证明携带变更。
Comments 36 pages
通过发起野生的代码理解之旅来投射SWE代理新兴思维模式
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中 软件智能体 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.SE
AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。
关键在于接口:评估工具架构如何影响编码智能体行为
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.SE
AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。