arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-13 至 2026-05-13 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 5 篇

2605.11495 2026-05-13 cs.HC 78%

Hedwig: Dynamic Autonomy for Coding Agents Under Local Oversight

Hedwig:在局部监督下编码代理的动态自主性

Tanjal Shukla, K. J. Kevin Feng, Leijie Wang, Mohammad Rostami, Amy X. Zhang

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 Hedwig通过动态调整自主性水平,减少开发者与编码代理协作中的摩擦,提升任务执行效率。

Comments accepted to ACM CAIS 2026 demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL 62%

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12493 2026-05-13 cs.CL 57%

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

LongMemEval-V2:评估长期代理记忆以成为经验丰富的同事

Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 LongMemEval-V2通过451个手动整理的问题评估代理记忆系统是否能帮助代理在定制环境中获取经验,采用上下文收集方法并提出两种记忆方法,实验显示AgentRunbook-C在准确率上表现最佳。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12366 2026-05-13 cs.AI 57%

Classifier Context Rot: Monitor Performance Degrades with Context Length

分类器上下文旋转:通过上下文长度监控性能退化

Sam Martin, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic fellows项目)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12270 2026-05-13 cs.SE 57%

Characterizing the Failure Modes of LLMs in Resolving Real-World GitHub Issues

表征LLMs在解决现实世界GitHub问题中的故障模式

Yanjie Jiang, Yian Huang, Guancheng Wang, Junjie Chen, Hui Liu, Lionel Briand

专题命中 软件智能体 :program repair(abstract);分类 cs.SE

AI总结 本文通过评估三种先进模型在SWE-bench Verified数据集上的表现,揭示了LLMs在复杂修复任务中故障模式的分类,发现策略制定和逻辑综合是错误率最高的阶段,而故障定位错误率最低,同时揭示了不同模型在鲁棒性和成本上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏