CA2: Code-Aware Agent for Automated Game Testing
CA2: 一种基于代码的自动化游戏测试代理
专题命中 软件智能体 :agent(title,abstract);分类 cs.LG、cs.SE
AI总结 CA2通过利用调用栈信息提升游戏测试效率,相比传统方法更有效定位目标函数,实现更精准的测试策略学习。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
CA2: 一种基于代码的自动化游戏测试代理
专题命中 软件智能体 :agent(title,abstract);分类 cs.LG、cs.SE
AI总结 CA2通过利用调用栈信息提升游戏测试效率,相比传统方法更有效定位目标函数,实现更精准的测试策略学习。
神经数据无厌倦:评估代理AI的数据重用基准测试
机构 * HHMI Janelia Research Campus(HHMI贾能利亚研究中心)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.LG
AI总结 本文探讨了代理AI在神经数据重用中的应用,通过八篇研究论文评估了通用编码代理在处理多模态数据和任务解码中的表现,发现其在子任务中表现良好,但难以实现端到端无错误解决方案,提出了数据共享的最佳实践。
Comments v2: Added forgotten acknowledgments section
Articraft: 一种可扩展的拟人化3D资产生成代理系统
机构 * University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学)
专题命中 软件智能体 :agentic(title,abstract)
AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。
Comments Project page: https://articraft3d.github.io/
GEAR:基于遗传算法的自主研究代理
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; AI Center-Toronto, Samsung Electronics(多伦多AI中心,三星电子) ; York University(约克大学)
专题命中 软件智能体 :agentic(title);分类 cs.AI
AI总结 GEAR通过多路径搜索提升自主研究代理效果,采用群体搜索策略保持多个 promising 方向,通过突变和交叉探索新想法,优于传统方法。
SWE-Chain:基于链式发布级包升级的编码代理基准测试
机构 * The Chinese University of Hong Kong(香港中文大学) ; Independent(独立) ; ELLIS ; Technical University of Darmstadt(达姆施塔特技术大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Monash University(墨尔本大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 SWE-Chain通过链式发布级包升级评估编码代理,包含12个升级链和155个版本过渡,揭示当前代理在连续维护中的不足。
Vibe Code Bench:评估AI模型在端到端Web应用开发中的表现
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出Vibe Code Bench,通过100个Web应用规格和964个浏览器工作流评估AI模型在端到端应用开发中的性能,揭示了可靠开发仍为前沿挑战,并提出评估协议和人类对齐研究。
Comments 23 pages, 8 figures. Accepted to ACM CAIS 2026. Live leaderboard: https://www.vals.ai/benchmarks/vibe-code. Benchmark first released Nov 2025
BRIDGE: 在领域引导的程序合成中构建表示
机构 * California Institute of Technology(加州理工学院) ; Amazon(亚马逊)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG
AI总结 BRIDGE通过多艺术ifacts程序合成框架提升Lean验证正确性,结合代码、规范和定理证明领域,提高生成效率和正确率。
Comments 41 pages, 10 figures, 3 tables. Preprint
基于比较的梯度估计的顺序资源交易
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文研究了两个贪心理性代理在有限资源类别中进行顺序多议题交易的问题,提出基于比较的算法通过接受/拒绝反馈估计对方梯度,确保交易互惠并最终收敛到帕累托前沿。