Hedwig: Dynamic Autonomy for Coding Agents Under Local Oversight
Hedwig:在局部监督下编码代理的动态自主性
专题命中 软件智能体 :coding agent(title,abstract)
AI总结 Hedwig通过动态调整自主性水平,减少开发者与编码代理协作中的摩擦,提升任务执行效率。
Comments accepted to ACM CAIS 2026 demo track
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
Hedwig:在局部监督下编码代理的动态自主性
专题命中 软件智能体 :coding agent(title,abstract)
AI总结 Hedwig通过动态调整自主性水平,减少开发者与编码代理协作中的摩擦,提升任务执行效率。
Comments accepted to ACM CAIS 2026 demo track
单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起
机构 * The Hong Kong Polytechnic University(香港理工大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。
LongMemEval-V2:评估长期代理记忆以成为经验丰富的同事
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 LongMemEval-V2通过451个手动整理的问题评估代理记忆系统是否能帮助代理在定制环境中获取经验,采用上下文收集方法并提出两种记忆方法,实验显示AgentRunbook-C在准确率上表现最佳。
Comments Work in Progress
分类器上下文旋转:通过上下文长度监控性能退化
机构 * Anthropic Fellows Program(Anthropic fellows项目)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。
表征LLMs在解决现实世界GitHub问题中的故障模式
专题命中 软件智能体 :program repair(abstract);分类 cs.SE
AI总结 本文通过评估三种先进模型在SWE-bench Verified数据集上的表现,揭示了LLMs在复杂修复任务中故障模式的分类,发现策略制定和逻辑综合是错误率最高的阶段,而故障定位错误率最低,同时揭示了不同模型在鲁棒性和成本上的差异。