AIDA: An Active Inference-based Design Agent for Audio Processing Algorithms
专题命中 软件智能体 :agent(title,abstract);分类 cs.LG
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 软件智能体 :agent(title,abstract);分类 cs.LG
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
Comments 26 pages, 14 figures
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
Comments Tabula Rasa, Chess engine, Learning Fast and Slow, Reinforcement Learning, Alpha Zero
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
Comments Proceedings of the 3rd World Congress on Social Simulation (WCSS2010), 5-9 Sep, Kassel, Germany, 2010. arXiv admin note: substantial text overlap with arXiv:1305.7437
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
Comments Energy and Buildings 43(10), 2882-2892, 2011
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
Comments 44 pages, 1 figure, Appendix
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击
专题命中 软件智能体 :agentic(title,abstract)
AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。
Comments Website: https://sites.google.com/view/agentic-botnets/home
SIAgent:通过LLM驱动的眼手运动意图理解实现VR中的空间交互代理
专题命中 软件智能体 :agent(title,abstract)
AI总结 SIAgent通过LLM驱动的意图识别与代理执行,实现VR中基于自然眼手运动的高容忍度交互框架。
Comments Virtual reality, spatial interaction, intent recognition, agent-based execution, large language models
KAT-Coder-V2.5技术报告
机构 * KwaiKAT Team(快手KwaiKAT团队)
专题命中 软件智能体 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。
Comments 24 pages, 5 figures
面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复
机构 * School of Software Design and Data Science(软件设计与数据科学学院) ; Seneca Polytechnic(森纳学院) ; Advanced Micro Devices Canada(加拿大先进微器件公司)
专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。
Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication
ClawHub安全信号:当VirusTotal、静态分析和SkillSpector意见不一致时
机构 * OpenClaw Foundation USA(OpenClaw基金会美国) ; NVIDIA United Kingdom(NVIDIA英国分公司) ; NVIDIA USA(NVIDIA美国)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究ClawHub中67,453个公开技能版本,通过VirusTotal、静态启发式分析和NVIDIA SkillSpector三种扫描器的分歧,揭示智能体技能安全需要分层治理而非单一扫描器决策。
Comments 10 pages, 1 figure, 7 tables, 1 supplimentary dataset
通过可追溯性视角理解自动化程序修复智能体:一项实证研究
机构 * Columbia University(哥伦比亚大学) ; IBM Research(IBM研究院)
专题命中 软件智能体 :tool use(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。
Comments Accepted for publication (ISSTA '26)
AI生成Python重构拉取请求中的质量和安全信号
机构 * University of Michigan-Flint(密歇根大学弗林特分校) ; University of Michigan-Dearborn(密歇根大学戴尔本分校)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本研究通过分析AIDev数据集中的Python重构拉取请求,探讨了AI生成代码对代码质量和安全性的影响,发现AI提交在22.5%的案例中提升了质量属性,但同时也引入了新的代码问题,提出了24种重构操作的分类和安全门控的重要性。
为通用智能体构建的治理机制
机构 * IBM
专题命中 软件智能体 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文提出了一种模块化的政策-as-code层,用于在不微调模型的情况下,通过与通用大语言模型智能体结合,实现可预测、可审计且符合合规要求的行为,在复合工作流中无需为每个领域重新构建智能体。
EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Fudan University(复旦大学) ; Central South University(中南大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。
Comments Accepted by ICML 2026
单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起
机构 * The Hong Kong Polytechnic University(香港理工大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。
自演化软件代理
机构 * University of Trento(特伦托大学)
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出自演化软件代理,结合BDI推理与大语言模型,使代理能自主进化目标、推理和可执行代码。实验显示代理可自主发现新目标并生成行为,验证了LLM驱动进化的可行性与局限性。
你不需要公共测试来生成正确代码
机构 * WSO2(WSO2公司)
专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出DryRUN框架,通过让大语言模型自主生成测试输入并模拟执行,避免依赖公共测试用例,从而减少过自信偏差并提升代码生成效率。
Comments 9 pages, 6 figures
SWE-QA: 语言模型能否回答仓库级代码问题?
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.CL、cs.SE
AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。
Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench
带有多模验证器的认证程序合成
机构 * National University of Singapore(新加坡国立大学) ; Neapolis University Pafos(纳皮奥斯大学帕福斯)
专题命中 软件智能体 :agentic(abstract,abstract_cn);workflow(abstract);分类 cs.AI、cs.SE
AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。
Wink: 代码代理中行为失误的恢复
机构 * Meta Platforms, Inc.(Meta平台公司)
专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 Wink通过异步自我干预系统有效恢复代码代理的行为失误,减少工具调用失败和人工干预需求。
在开源Android和iOS开发中采用AI编码代理的影响
机构 * Lahore University of Management Sciences(拉合尔管理科学大学)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文首次研究了AI编码代理在开源Android和iOS开发中的影响,发现Android项目接收更多AI生成PR且接受率更高,同时任务类别和时间变化对PR解决有显著影响。
Comments Accepted at MSR 2026 Mining Challenge track
Code2MCP: 将代码仓库转化为MCP服务
机构 * Sun Yat-sen University(中山大学) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; Southeast University(东南大学)
专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.LG、cs.SE
AI总结 Code2MCP通过自动化将GitHub仓库转换为MCP兼容服务,解决现有MCP工具池不足的问题,促进MCP协议的普及与应用。
AIDev:研究GitHub上的AI编码代理
机构 * Queen's University(女王大学)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 AIDev是一个大规模数据集,包含来自五个AI代理的GitHub pull requests,用于研究AI在软件工程中的应用、开发者生产力及人机协作。
工作流与代理在代码翻译中的比较
机构 * Code Metal
专题命中 软件智能体 :autonomous agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究比较了工作流与代理方法在MATLAB到HDL代码翻译中的效果,发现代理方法在语法修复和提升模拟覆盖率方面表现更优。
Journal ref NeurIPS 2025 Fourth Workshop on Deep Learning for Code
aiXiv:一个由AI科学家生成的下一代开放获取生态系统
专题命中 软件智能体 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 aiXiv是一个由AI科学家生成的下一代开放获取生态系统,通过多代理架构和API接口,实现人类与AI科学家的协同,提升AI生成科研内容的质量和传播效率。
Comments Preprint under review. Code is available at https://github.com/aixiv-org. Website is available at https://aixiv.science