Noncooperative Human-AI Agent Dynamics
非合作人机智能体动力学
专题命中 软件智能体 :AI agent(title,abstract);agent(title)
AI总结 本文研究了人工智能代理与人类决策者在战略环境中的非合作互动动力学,通过不同预期效用与前景理论代理的组合,探讨混合群体竞争中的涌现行为。
Comments 41 pages
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
非合作人机智能体动力学
专题命中 软件智能体 :AI agent(title,abstract);agent(title)
AI总结 本文研究了人工智能代理与人类决策者在战略环境中的非合作互动动力学,通过不同预期效用与前景理论代理的组合,探讨混合群体竞争中的涌现行为。
Comments 41 pages
意图形式化:在AI代理时代可靠编码的重大挑战
机构 * Microsoft Research(微软研究院)
专题命中 软件智能体 :AI agent(title);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文探讨意图形式化作为解决AI生成代码与用户意图间差距的关键挑战,提出通过形式化规范提升软件可靠性的方法,并指出验证规范的瓶颈及未来研究方向。
Comments 10 pages
ProofWright: 向 CUDA 的代理形式验证迈进
专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE
AI总结 ProofWright 通过整合自动形式验证与 LLM 代码生成,为 CUDA 核心提供内存安全、线程安全和语义正确性保证,验证了 74% 的生成内核,发现传统测试遗漏的细微错误。
CodeScout: 一种有效的强化学习代码搜索代理训练方法
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出CodeScout,通过强化学习方法训练仅使用标准Unix终端的代码搜索代理,实验证明其在多个基准测试中优于大型语言模型。
FailureMem: 一种面向故障的多模态框架用于自主软件修复
机构 * Nanjing University(南京大学) ; SenseTime(秒速) ; The Chinese University of Hong Kong(香港中文大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。
当规范出现时:长期远 horizon 编码代理中忠实度损失的基准测试
机构 * Purdue University(普渡大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出一个基准测试,研究在逐步披露目标设计时,编码代理中忠实度损失(SLUMP)的变化,通过20篇最新ML论文和371个可验证组件评估不同平台的实现忠实度。
AgentFactory: 通过可执行子代理积累与重用实现自我进化框架
机构 * Peking University(北京大学) ; Hong Kong Polytechnic University(香港理工大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出AgentFactory,通过保存可执行子代理代码而非文本经验实现自我进化,使子代理在反馈中持续优化,提升任务执行效率和鲁棒性,实现能力持续积累。
联邦计算作为代码(FCaC):通过设计实现主权意识系统
专题命中 软件智能体 :workflow(abstract)
AI总结 本文提出FCaC架构,通过编译权威和委派为可验证的加密 artifacts,解决跨组织和司法边界联邦系统中主权约束执行问题,引入虚拟联邦平台实现去中心化协作。
Comments 22 pages, 5 figures