AgentArmor: Enforcing Program Analysis on Agent Runtime Trace to Defend Against Prompt Injection
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; ByteDance(字节跳动)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) ; DAMO Academy, Alibaba group(阿里巴巴集团大模型研究院) ; Hupan Lab(虎扑实验室) ; National Key Laboratory of General Artificial Intelligence, Peking University(北京人工智能 general artificial intelligence 国家重点实验室) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)
专题命中 软件智能体 :agentic(title,abstract);planning(abstract);分类 cs.AI
Comments ICCV 2025. Code: https://github.com/Gen-Verse/Paper2Video
专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.CL
机构 * University of Notre Dame(诺丁汉大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI
机构 * Institute for Theoretical Particle Physics and Cosmology (TTK)(理论粒子物理与宇宙学研究所) ; RWTH Aachen University(亚琛工业大学) ; German Aerospace Center (DLR)(德国航空航天中心) ; Kavli Institute for Cosmology(卡弗里宇宙研究所) ; University of Cambridge(剑桥大学) ; Center for Computational Astrophysics(计算天体物理学中心) ; Flatiron Institute(Flatiron研究所) ; Department of Astrophysical Sciences(天体物理科学系) ; Princeton University(普林斯顿大学)
专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI
Comments Code: https://github.com/santiagocasas/clapp, Streamlit app: https://classclapp.streamlit.app
机构 * Meta
专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI
机构 * IBM Research Europe(IBM欧洲研究院)
专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract);分类 cs.CL
专题命中 软件智能体 :agent(title,abstract);tool-use(abstract);分类 cs.AI
机构 * University of Bristol(布里斯托大学) ; iGent AI
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI
Comments Submitted as a preprint to NeurIPS 2025
专题命中 软件智能体 :planning(title,abstract);agent(abstract);分类 cs.CL
Comments Code available at: https://github.com/agarwalishika/TreeInstruct Accepted at EMNLP'24 Findings
专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.SE
Comments Conference paper, 7 pages, 6 figures, 1 table
Journal ref Proceedings of the 17th International Conference on Industrial Informatics (INDIN2019). Helsinki, Finland, IEEE Computer Society Press, pp.1558-1563
限制编码代理执行代码何时有用?一种机制×代理设计消融研究
机构 * Rochester Institute of Technology(罗切斯特技术学院)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE;agentic(comments)
AI总结 研究现代编码代理不同工具表面有效性,通过在特定任务上对两种代理进行三臂消融实验,发现最便宜工具表面由任务机制和代理设计共同决定,主要成本信号是缓存调整成本而非通过率。
Comments 9 pages (excluding references), 4 figures, 4 tables. Accepted to the Agentic Software Engineering (SE 3.0) Workshop at KDD 2026 (non-archival)
你的代码代理可以与你一同成长,借助结构化记忆
机构 * Tsinghua University(清华大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。
Comments Code Agent
TENET:迈向仓库级代码生成的测试驱动开发的第一步
机构 * Purdue University(普渡大学) ; Microsoft Office AI(微软办公人工智能)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)
AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。
Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)
RigorBench: 自主AI编码代理中工程过程纪律的基准测试
专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。
Comments 9 pages, 7 tables, 1 figure
协调人机AI软件交付:三种软件现代化项目的回顾纵向实地研究
机构 * Taller Technologies(塔勒技术)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);planning(abstract);workflow(abstract)
AI总结 研究通过回顾三个软件现代化项目,分析AI与人类协作在软件交付各阶段的效果,发现嵌入协调工作流的AI能显著提升效率与覆盖率。
Comments 18 pages, 4 figures, 12 tables
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);multi-agent(abstract)
Comments Code: https://github.com/HKUDS/AutoAgent
CLAUDE.md 为何不断膨胀?智能体编码中的灾难性记忆
机构 * South Park Commons(南公园社区)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该研究针对智能体编码中提示文件无限制膨胀的问题,提出通过提示注释消除多余指令,可使现实中智能体指令遵循能力提升多达23.1%。
DAC-Pose:用于姿态引导人体生成的双智能体协作框架
机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)
AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。
Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose
Change2Task:从仓库变更到可执行编码智能体任务与环境
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG、cs.SE
AI总结 Change2Task系统基于仓库历史将已合并拉取请求转为编码智能体任务,在5类任务中实现79.6%验证成功率,比基准多恢复29.2%任务,可减少流程支出10.8%。
Comments 15 pages, 7 figures, and 15 tables, including appendices
当智能体市场到来时
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)
AI总结 本文提出可编程市场系统diagon,作为智能体认知劳动市场的制度设计实验平台,研究发现市场交换能带来生产力提升,但效果强烈依赖于制度结构。
科学代码是为谁而设?在代理编写的代码中维护人类可读的地标
专题命中 软件智能体 :agent(title,abstract);agentic(abstract)
AI总结 研究在科学家采用编码代理后,代码维护假设瓦解的问题,核心方法是通过多种调查及工作流程,发现科学家发明“地标策略”标记代码,指出明确划分人类可读与代理上下文能利于科学代码的开发、记录与维护。
Comments Position piece submitted to Infrastructure @ CSCW 26 workshop
ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击
专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract)
AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。
RIME:实现大规模智能后期制作
机构 * Dartmouth College(达特茅斯学院)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 研究针对音乐后期制作问题,引入RIME框架,利用POEMS工具包生成配对数据,评估多模态语言模型,展示其通过监督微调提升智能体性能,是迈向迭代音乐智能体、变革音乐制作的早期步骤。
RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。
不要责怪大语言模型:脚手架演化如何塑造编码代理质量
机构 * Queen’s University Canada(加拿大女王大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究编码代理中脚手架演化对其质量的影响。通过固定模型、仅改变脚手架,对Qwen Code CLI的35个连续版本进行评估,追踪质量波动与开发模式及架构组件的关系。
FormulaCode: 评估在大规模代码库上进行代理优化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; California Institute of Technology(加州理工学院) ; Cornell University(康奈尔大学)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。
Comments ICML Camera Ready Version
迈向人工智能代理驱动的粒子输运模拟:PHITS的人工智能辅助工作流程实现
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)
AI总结 研究针对蒙特卡罗粒子输运代码使用复杂的问题,提出将人工智能助手和代理应用于PHITS的策略,准备了两组人工智能就绪资源,经五个示范任务验证,表明提供适当资源和规则时人工智能代理可处理复杂工作流程,支持捆绑资源使用通用人工智能工具。
Comments 30 pages, 3 figures, and 2 tables, including 2 appendices
CORE-Bench:智能体编程时代代码检索的综合基准
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。