On Accelerating Grounded Code Development for Research
在研究中加速基于事实的代码开发
机构 * Nirvawireless
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出框架,使代码代理能即时访问研究库和技术文档,从而加速专业领域中的代码代理应用。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
在研究中加速基于事实的代码开发
机构 * Nirvawireless
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出框架,使代码代理能即时访问研究库和技术文档,从而加速专业领域中的代码代理应用。
GitHub Actions CI/CD 工作流中 AI 机器人足迹的可靠性
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 研究分析了AI机器人在GitHub Actions CI/CD工作流中的可靠性,发现不同AI机器人成功率差异显著,且高频的AI PR可能影响工作流可靠性。
Comments 5 pages, 3 figures. Submitted to the 23rd International Conference on Mining Software Repositories (MSR 2026) Mining Challenge
CADMAS-CTX: 多智能体委托中的上下文能力校准
机构 * Beijing JIAOTONG University(北京交通大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出CADMAS-CTX框架,通过上下文条件后验概率实现多智能体委托中的能力校准,结合不确定性惩罚提升鲁棒性,实验表明其在GAIA和SWE-bench基准上显著优于静态方法。
HiveMind: 为并发LLM代理工作负载提供操作系统启发的调度
机构 * Sperix Labs(Sperix实验室) ; VIA Cybersecurity Lab(VIA网络安全实验室) ; KNUST(科罗纳大学) ; Quantum and Assistive Technologies Lab(量子与辅助技术实验室)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 HiveMind通过引入五个操作系统启发的调度原语,解决并发LLM代理在共享API端点时的资源竞争问题,显著降低失败率并减少浪费计算。
Workstream: 一个面向AI增强工程流程的本地优先开发者指挥中心
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 Workstream通过整合多个工具的数据,提供AI读熟度评分和审查智能分析,提升开发者工作效率和响应速度。
Comments 6 pages, 3 figures, 5 tables. Open source: https://github.com/happybhati/workstream
当代理变得沉默:LLM文档合成中的输出生成能力与格式-成本分离
机构 * Sperix Labs(Sperix实验室) ; VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科诺斯大学) ; GCTU, Ghana(加纳格茨大学) ; NCA, Ghana(加纳国家计算机学院)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出OGC衡量输出生成能力,证明格式-成本分离定理,并提出自适应策略选择框架,通过实验验证理论,减少生成token并消除输出停滞问题。
分布式人类身份:通过认知复制和机器人躯体实现的AI赋能多存在
机构 * Faculty of Design and Creative Technologies, Auckland University of Technology(设计与创意技术学院,奥克兰技术大学)
专题命中 软件智能体 :software agent(abstract);分类 cs.AI
AI总结 本文提出多存在身份框架,通过认知、行为和情感属性的复制,实现AI赋能的多场景存在,突破传统物理躯体限制,提升身份一致性与文化相关性,探讨其在专业、教育、医疗等领域的应用与伦理挑战。
Comments 30 pages, 1 figure, 4 tables. cs.AI under Computer Science category
COMPASS:评估LLM代理在约束优化中的表现
机构 * Harvard University(哈佛大学) ; Apple(苹果公司) ; Virginia Tech(弗吉尼亚理工学院) ; UIUC(伊利诺伊大学香槟分校) ; UC Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.LG
AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。
El Agente Forjador:面向量子模拟的任务驱动代理生成
机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Department of Chemistry, University of Toronto(多伦多大学化学系) ; Department of Materials Science & Engineering, University of Toronto(多伦多大学材料科学与工程系) ; Department of Chemical Engineering & Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) ; Acceleration Consortium(加速联盟) ; Vector Institute for Artificial Intelligence(人工智能矢量研究所) ; Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute (CIFAR)) ; NVIDIA
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出El Agente Forjador框架,通过四阶段流程自主生成和复用计算工具,提升量子化学和动力学任务的准确性与效率。
基于记忆的绘制:双轨迹编码提升LLM代理跨会话回忆
机构 * Tufts University(塔夫茨大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出双轨迹编码方法,通过将事实与具体场景描述结合,提升LLM代理在跨会话中的回忆能力,实验显示在时间推理、知识更新追踪和多会话聚合方面有显著提升。
Comments 16 pages, 2 tables, 2 figures
SWE-Shepherd:推进基于强化学习的代码代理的PRMs
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 本文提出SWE-Shepherd框架,通过引入过程奖励模型为代码代理提供密集的步骤级监督,提升代码代理在大型代码库中的交互效率和动作质量。
Comments Code is available at https://github.com/mahirlabibdihan/swe-shepherd
面向离散操作条件的工业预测性维护多头注意力融合网络
机构 * North Carolina State University(北卡罗来纳州立大学)
专题命中 软件智能体 :repository(abstract);分类 cs.LG
AI总结 本文提出一种多头注意力融合神经网络,用于在动态变化的操作条件下进行工业预测性维护,通过融合退化趋势、离散操作状态和残余噪声,提升预测准确性。
基于信用的ICPC风格编码:当代理必须为每个决定付费
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出USACOArena,通过引入严格的信用经济机制,使代理在决策时考虑成本,解决资源受限下的高效编码问题。
Comments Accepted by ICLR 2026
SemEval-2026任务3:基于维度的方面情感分析(DimABSA)
机构 * Yuan Ze University(元智大学) ; University of Göttingen(哥廷根大学) ; Imperial College London(伦敦帝国学院) ; University of Pretoria(比勒陀利亚大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; Central Police University(中央警察大学) ; Yunnan University(云南大学) ; Lomonosov Moscow State University(莫斯科国立大学) ; Skoltech(斯科尔科沃科学技术学院) ; AIRI(人工智能研究所) ; Maseno University(马塞诺大学) ; UCLA(加州大学洛杉矶分校) ; National Research Council Canada(加拿大国家研究委员会)
专题命中 软件智能体 :repository(abstract);分类 cs.CL
AI总结 本文提出SemEval-2026任务3,旨在通过建模valence-arousal(VA)维度改进传统ABSA,引入DimStance任务以扩展ABSA至公共议题讨论,包含两个赛道和三个子任务,提出连续F1指标评估。
从幻觉到结构雪球效应:约束解码在LLM反思中的对齐税
机构 * Saarland University(萨尔大学)
专题命中 软件智能体 :repository(abstract);分类 cs.CL
AI总结 研究探讨了在开放式推理任务中,约束解码通过强制结构反思是否能避免错误传播,发现反而引发结构雪球效应,并揭示了约束解码的对齐税问题。
在复杂系统中弥合安全与安全性的方法:基于模型的SAFT-GT工具链
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 本文提出基于模型的SAFT-GT工具链,用于解决复杂系统中安全与安全性的挑战,通过攻击-故障树生成和模型组合方法,提升系统安全性和可靠性,通过用户研究验证其有效性。
人类整合,代理修复:代理撰写的拉取请求在实践中是如何被引用的
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 研究通过分析AIDev数据集中的代理撰写的拉取请求引用,揭示了人类与代理之间引用意图的分类,发现人类主要用于构建新功能,而代理用于修复错误,且引用的拉取请求生命周期更长,审查时间更长。
Comments Accepted to MSR Mining Challenge paper
SKILLFOUNDRY:从异构科学资源构建自演化智能体技能库
机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院Ray and Stephanie Lane计算生物学系) ; Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 SKILLFOUNDRY通过自演化框架将异构资源转化为验证过的智能体技能包,提升科学代理在基准和领域任务中的性能,扩展覆盖范围,为更强大的科学代理提供基础。
Android持续集成中的仪器测试:实践、模式与性能
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 研究Android持续集成中仪器测试的实践、模式及性能,发现仅10.6%的仓库使用仪器测试,常用社区组件或自定义脚本设置模拟器,不同设置方式在可靠性、效率和成本上有差异。
Comments Accepted at the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST 2026)
从行业声明到实证现实:代码审查代理在拉取请求中的实证研究
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 本文通过分析代码审查代理(CRAs)在拉取请求中的表现,探讨其对合并成功率的影响,发现CRAs生成的反馈质量与PR废弃率密切相关,需人类监督以提高代码审查效果。
Comments Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026
自动化生成网络安全演练场景
专题命中 软件智能体 :software agent(abstract);分类 cs.SE
AI总结 本文提出自动生成功能性IT系统网络安全场景的方法,生成多种标准的演练场景,并开源了模拟环境和包含10万个样本的数据库。
生成代码难以理解的条件是什么?评估AI代理在真实世界中的Python代码能力
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 本研究通过分析AI生成的Python代码,发现其主要为初级水平,但特定任务可能需要高级技能来理解和维护。
AutoStan:通过预测反馈实现自主的贝叶斯模型改进
机构 * Thurgau Institute for Digital Transformation (TIDIT)(图尔高数字转型研究所)
专题命中 软件智能体 :coding agent(abstract);分类 cs.LG
AI总结 AutoStan通过预测反馈机制,使CLI编码代理自主构建并迭代改进Stan中的贝叶斯模型,展示了无需搜索算法或领域指令即可处理多样化贝叶斯建模问题的能力。
你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架
机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。
AVO:用于自主进化搜索的代理变异算子
机构 * NVIDIA
专题命中 软件智能体 :coding agent(abstract);分类 cs.LG
AI总结 AVO通过自主代理实现变异操作,取代传统进化搜索中的固定突变和交叉操作,展示了在多头注意力中发现超越cuDNN和FlashAttention-4的优化结果。
TrustFlow:基于主题的向量声誉传播用于多智能体生态系统
专题命中 软件智能体 :software agent(abstract);分类 cs.AI
AI总结 TrustFlow通过主题门控转移运算符在交互图中传播声誉,采用多维声誉向量提升精度,有效抵御Sybil攻击和声誉洗白。
Comments 14 pages, 3 figures, demo at https://robutler.ai
AI代理中的非标准误差
机构 * School of Management, University of Texas at Dallas(德克萨斯大学达拉斯分校管理学院)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 研究AI代理在相同数据和问题下是否产生相同结果,发现其存在显著非标准误差,源于代理间分析选择的不确定性。不同模型家族在方法偏好上存在系统差异,同行评审对分散影响有限,但接触高质量论文可大幅缩小估计范围。
Comments 45 pages
VeriGrey:灰盒代理验证
机构 * National University of Singapore(新加坡国立大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出VeriGrey方法,通过工具调用序列反馈函数驱动测试过程,发现LLM代理中隐含的提示注入漏洞,并在实际案例中验证其有效性。
达尔文戈德尔机器:自我改进代理的开放性进化
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出达尔文戈德尔机器,通过迭代修改自身代码并验证改进,实现自我提升,提升代码能力并在多个基准测试中取得显著成绩。
Comments Code at https://github.com/jennyzzt/dgm
社交证明在馅饼中:社交证明对软件下载的(非)影响
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 研究通过两个实验发现,社交证明对软件下载和开发者参与度无显著影响。