What Makes a Good Bug Report for an AI Agent?
什么是适合人工智能代理的优质错误报告?
专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.SE
AI总结 研究自动化程序修复代理的优质错误报告,通过统计建模和受控消融分析发现,代理受益于具体可执行且定位好的信息,与人类优质报告有别,如自然语言重现步骤等对代理作用不大,不同模型处理缺失信息方式有差异。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
什么是适合人工智能代理的优质错误报告?
专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.SE
AI总结 研究自动化程序修复代理的优质错误报告,通过统计建模和受控消融分析发现,代理受益于具体可执行且定位好的信息,与人类优质报告有别,如自然语言重现步骤等对代理作用不大,不同模型处理缺失信息方式有差异。
超越攻击成功率:工具使用型人工智能代理的行动分级严重程度量表
专题命中 软件智能体 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究指出代理红队测试基准的二元攻击成功率不能体现行动危害。为此引入行动分级伤害准则,通过预言机和评判小组计算量表。在AgentDojo工作区测试发现该准则能揭示新情况,虽与预言机一致性高但有盲点,贡献了可用于红队日志实际行动的严重程度工具。
Comments 8 pages, 6 figures. Code and artifacts: https://github.com/Harry-Ashley/action-graded-severity
AnyPoC:用于可扩展LLM基于Bug检测的通用证明-概念测试生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 软件智能体 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 AnyPoC通过多代理框架生成可执行的证明-概念测试,以验证候选Bug报告,提升自动化Bug检测的实用性。
警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击
专题命中 软件智能体 :agentic(title,abstract)
AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。
Comments Website: https://sites.google.com/view/agentic-botnets/home
打破数据库锁定:用于数据库绕过的高性能存储读取器的智能再生
机构 * Cornell University(康奈尔大学)
专题命中 软件智能体 :agentic(title);分类 cs.AI
AI总结 研究分析工作负载面临的数据访问瓶颈问题,提出Jailbreak方法,利用大语言模型辅助代码合成绕过数据库引擎直接读取存储文件,在PostgreSQL和MySQL上评估,性能显著提升,证明该方法可打破数据库系统数据锁定。
Comments To be presented at AIDB 2026 (co-located with VLDB)
ORCAID:用于深度强化学习策略的基于斜规则的连续动作解释
机构 * TU Wien(维也纳技术大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 针对强化学习中连续动作空间下可解释性难题,提出ORCAID方法,通过高效斜决策树训练算法,经三阶段分割搜索提取基于规则的可解释策略,在多环境评估中表现良好,能保持性能并提升原深度强化学习策略。
Comments 33 pages, 8 figures, accompanying source code available at https://gitlab.tuwien.ac.at/ignacio.lopez/ORCAID
DPO-F+:使代码修复反馈与开发者偏好对齐
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。
Comments 10 pages, 2 figures
公平稳定资源共享的动态访问定价控制
专题命中 软件智能体 :autonomous agent(abstract)
AI总结 研究不同价格敏感度用户在动态定价下的共存问题,提出基于非单调价格函数的新动态定价方案,该方案能让各类用户更公平共存,通过研究非线性常微分方程刻画平衡点及吸引域,数值模拟验证了方案有效性。
Comments 41 pages, 7 figures
C-BerryTrans:用于贝里曲率驱动反常霍尔和能斯特电导率第一性原理计算的C++代码
专题命中 软件智能体 :workflow(abstract)
AI总结 研究利用C++代码C-BerryTrans进行贝里曲率驱动的反常霍尔和能斯特电导率第一性原理计算,通过提取数据、评估曲率并并行化处理,在多种铁磁材料上测试,结果与报告数据相符,为相关研究提供有力工具。
Comments arXiv admin note: substantial text overlap with arXiv:2504.00123, arXiv:2505.19280