SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains
SynChain:诱导计算机使用智能体系统构建自身攻击链
专题命中 软件智能体 :agent(title,abstract)
AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SynChain:诱导计算机使用智能体系统构建自身攻击链
专题命中 软件智能体 :agent(title,abstract)
AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。
MetaVideoAgent:面向长视频理解的自动视频智能体进化框架
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; ByteDance(字节跳动)
专题命中 软件智能体 :agent(title,abstract)
AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。
Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent
SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界
专题命中 软件智能体 :agent(title,abstract)
AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。
ORB5X v1.0:一个使用智能AI构建的性能可移植的全局电磁陀螺动力学PIC C++/Kokkos代码
专题命中 软件智能体 :agentic(title);workflow(abstract)
AI总结 本文介绍ORB5X,它是ORB5的C++/Kokkos版本,保留了原Fortran代码的数学模型与算法,通过替换模块和数组提升性能可移植性,经测试与原代码精度相近,且能在多种设备上编译运行。
在Lean中构建肖尔算法:对RSA - 2048和P - 256的量子攻击的智能形式化
专题命中 软件智能体 :agentic(title,abstract)
AI总结 研究在Lean中对肖尔算法及其变体进行形式化,采用智能形式化方法让软件代理分析、编写代码及修复证明,建立数学基础用于分析RSA - 2048和P - 256加密设置下的量子攻击,为量子密码分析及算法设计验证助力。
Comments 21 pages, including appendix; 2 figures
从工具到教师构建的队友:使用LearnAdapt智能工作室和PedOS 1.1 Lumina进行无代码教学插件创作
专题命中 软件智能体 :agentic(title,abstract)
AI总结 该研究针对教师和研究人员难以定制教育AI的问题,介绍了基于PedOS 1.1 Lumina的LearnAdapt智能工作室,它能让非编码人员用英语描述学习交互,完成插件创作、安全检查等,展示了从提示到证据捕获的完整生命周期,实现从固定工具到教师构建队友的转变。
Comments 3 pages, 1 figure, Accepted into the 27th International Conference on Artificial Intelligence in Education Interactive Events Track
ARTEMIS: 基于智能体引导的可靠性感知时间掩码演化用于不完美监督的视频息肉分割
机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, Ministry of Education(东南大学教育部新一代人工智能技术及其跨学科应用重点实验室) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; School of Medicine, Case Western Reserve University(凯斯西储大学医学院)
专题命中 软件智能体 :agent(title,abstract)
AI总结 提出ARTEMIS框架,利用视觉语言智能体选择可靠时间锚点,结合SAM2传播和可靠性感知鲁棒学习,从不完美监督(点、涂鸦、少量密集标签)中学习高质量视频息肉分割掩码,在多个基准上达到最优性能。
PhantomSkill: 代理技能生态系统中的恶意代码注入
专题命中 软件智能体 :agent(title,abstract)
AI总结 提出PhantomSkill攻击框架,通过VulMask技术将恶意行为隐藏在技能的辅助资源中,利用漏洞形状的实现绕过检测,在保持良性功能的同时降低警告和恶意软件检测率。
并非所有技能都有用:测量与修复智能体知识
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Purdue(普渡大学) ; NVIDIA(英伟达)
专题命中 软件智能体 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 提出ASSAY框架,通过随机掩码测量技能因果贡献,分离技能生成与筛选,在推理时抑制负面技能,显著提升LLM智能体任务完成率。
Comments 18 pages, 5 figures
HDRAgent: 一种用于多曝光HDR成像的智能体框架
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; Shenzhen Research Institute, Northwestern Polytechnical University(西北工业大学深圳研究院) ; Zhejiang University(浙江大学) ; Camera Group, DJI(大疆相机部门)
专题命中 软件智能体 :agentic(title);agent(abstract)
AI总结 提出首个智能体驱动的HDR成像框架HDRAgent,通过细粒度上下文知识匹配、感知-失真反馈机制和智能体引导的生成对齐策略,自适应选择重建策略,减少复杂动态场景中的鬼影和局部伪影。
无CVE的漏洞:管理AI编码智能体中授权与权限之间的持续差距
专题命中 软件智能体 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.CL
AI总结 该研究针对AI编码智能体中授权与权限的持续差距,提出智能体姿态漏洞(APV)的概念,区分其与相关风险,提供定义、模式、生命周期等内容,为相关安全管理提供可操作框架。
通过工具工程分发安全控制
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究商业AI编码代理安全控制分发问题,通过分阶段测试方法,利用SHarD工具在多种代理配置上测试,证明三类安全控制可通过单个命令嵌入分发,效果与直接安装商业代理相同,还提出相关框架特征及后续研究问题。
ICAE-Bench:将编码智能体评估为交互式项目构建者
机构 * Meituan(美团)
专题命中 软件智能体 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI
AI总结 研究针对编码智能体在交互式项目构建中作用转变,现有基准未跟上的问题,提出ICAE-Bench基准。从模糊需求出发,经自动化用户智能体模拟动态范式,引入避免需求模糊性、确保用户模拟质量、公平评估开放式仓库的关键设计。
PhoenixRepair:重新思考软件代理中的修复策略探索
机构 * Zhejiang University(浙江大学) ; Huazhong University of Science and Technology(华中科技大学) ; Huawei CodeArts Model Team(华为代码艺术模型团队)
专题命中 软件智能体 :agent(abstract,abstract_cn);multi-agent(abstract);分类 cs.AI
AI总结 研究针对现有软件代理修复策略探索不足的问题,提出PhoenixRepair多代理框架,通过多位置采样、迭代反思优化等扩大搜索空间,实验表明该框架在解决率和故障定位精度上有提升,实现了7.8%的相对改进及76.0%的最高解决率Pass@1。
Comments 14 pages, 5 figures
WebDesignIter:用于仓库级前端代码生成的协同进化设计知识
专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);分类 cs.SE
AI总结 研究针对前端开发仓库级代码生成问题,提出WebDesignIter框架,通过持久知识图谱融合设计知识与仓库结构,分两阶段工作,实验证明其相比基线和通用编码代理有优势,凸显设计知识对仓库级代码生成的重要性。
语言模型智能体中的奖励黑客:重新审视AI安全网格世界
机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI
AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。
Comments 28 pages, 16 figures, 13 tables
CyberForge:用于网络安全智能体训练的、基于代码仓库级别的经验证漏洞注入框架
专题命中 软件智能体 :agent(title);分类 cs.AI、cs.SE
AI总结 本研究提出CyberForge框架,通过向真实C/C++项目注入漏洞生成经验证的代码仓库级安全训练数据,微调后可提升智能体在SEC-bench和PatchEval上的漏洞修复性能。
循环并非可靠性保障:智能代码修复的状态约束证据与类型化修订契约
机构 * Alibaba Cloud(阿里云)
专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.CL
AI总结 研究编码智能体中生成-测试-修订循环的可靠性问题,通过实验揭示相关差距及问题,提出证据约束的类型化循环契约并实例化其可机械执行子集,实现规范与工件,非证明修复能力提升等。
Comments 11 pages, 4 figures, 6 tables
面向验证的25万行以上遗留气象模拟代码的AI辅助GPU移植
专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract)
AI总结 本文以遗留Fortran气象模拟代码CReSS为例,提出面向验证的AI辅助GPU移植工作流,为162个内核生成经数值验证的GPU实现,获5.1倍应用级加速,还检测到5个内核的数值不一致。
Comments 11 pages, 1 figure, 3 tables. Submitted to AgenticAI4HPC 2026
CAMB v2:用于高精度巡天的宇宙学功率谱
专题命中 软件智能体 :AI agent(summary_cn,abstract)
AI总结 该研究针对即将到来的CMB和大尺度结构巡天需求,对CAMB进行重大更新,通过新处理超球贝塞尔函数等方法,为透镜化CMB和物质功率谱提供快速高精度预测,满足收敛目标,还探讨了相关约定依赖性,新算法和代码由LLMs或AI agents在人类监督下开发。
Comments 25 pages, 4 figures. Code available at https://github.com/cmbant/camb
打破数据库锁定:用于数据库绕过的高性能存储读取器的智能再生
机构 * Cornell University(康奈尔大学)
专题命中 软件智能体 :agentic(title);分类 cs.AI
AI总结 研究分析工作负载面临的数据访问瓶颈问题,提出Jailbreak方法,利用大语言模型辅助代码合成绕过数据库引擎直接读取存储文件,在PostgreSQL和MySQL上评估,性能显著提升,证明该方法可打破数据库系统数据锁定。
Comments To be presented at AIDB 2026 (co-located with VLDB)
从对话到贡献:开源软件中编码代理的特征分析
专题命中 软件智能体 :agent(title);分类 cs.SE
AI总结 研究开源软件中开发者与人工智能编码代理聊天交互和后续开发协作的关系,通过收集大量会话及关联仓库历史等进行分析,发现小仓库AI使用多,采用后贡献者有变化,还揭示了开发者对AI代码的看法及相关担忧,为开源开发实践提供见解。
Comments 10 pages, 3 figures
为编码智能体学习全局可复用技能
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.AI、cs.SE
AI总结 研究针对编码智能体技能进化的过拟合与泛化问题,提出GSE框架,通过技能关系图、聚类整合与回放验证优化,在多个编码任务与智能体上实现性能提升,效果显著。
GenOS:AI代码生成中语义鲁棒性的组合式证书
专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 GenOS是针对AI代码生成语义鲁棒性的概率操作语义,通过马尔可夫核与等价关系确保工作流中组件替换的安全性,经实验验证其鲁棒性界与兼容性可测性。
LLM修复智能体中的验证证据:通过的测试究竟在多大程度上能检验缺陷?
专题命中 软件智能体 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 本研究以BSG-VA方法分析LLM修复智能体的验证证据,发现近半数阳性测试无缺陷区分信息,缺陷对比反馈可减少证据不足的部署,其效果幅度仍需进一步验证。
软件工程流水线中编码代理的基于执行的安全测试
机构 * Nanjing University(南京大学) ; Nanyang Technological University(南洋理工大学) ; Hainan University(海南大学)
专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.AI、cs.SE
AI总结 研究针对软件工程流水线中编码代理的安全问题,提出基于执行的红队测试框架,利用沙盒证据探测安全边界,将不安全操作嵌入工作负载并借助执行预言机优化,通过实验大幅增加不安全执行验证率,凸显编码代理需更强安全测试。
Comments Preprint. 12 pages, 6 figures
IssueTrojanBench:针对恶意问题请求对人工智能编码代理进行基准测试
机构 * Concordia University(康科德大学)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究针对恶意问题请求对人工智能编码代理进行基准测试,通过构建包含多种攻击类别和交付向量的新型基准IssueTrojanBench,发现现代编码代理存在关键漏洞,强调需更强安全机制保护。
Comments 10 pages, 4 figures, 4 tables
PerfAgent:用于仓库级代码优化的分析器引导迭代优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM(IBM公司) ; Michigan State University(密歇根州立大学)
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。
使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器
机构 * Innopolis University(因诺波利斯大学) ; Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE
AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。
验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。