arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3188 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3188 篇

2508.01249 2025-11-19 cs.CR cs.AI cs.CL cs.LG cs.SE 83%

AgentArmor: Enforcing Program Analysis on Agent Runtime Trace to Defend Against Prompt Injection

Peiran Wang, Yang Liu, Yunfei Lu, Yifeng Cai, Hongbo Chen, Qingyou Yang, Jie Zhang, Jue Hong, Ye Wu

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13472 2025-10-21 cs.SE cs.AI cs.CL cs.LG 83%

CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation

Xinchen Wang, Pengfei Gao, Chao Peng, Ruida Hu, Cuiyun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) ByteDance(字节跳动)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09632 2025-09-09 cs.CV cs.AI 83%

Preacher: Paper-to-Video Agentic System

Jingwei Liu, Ling Yang, Hao Luo, Fan Wang, Hongyan Li, Mengdi Wang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) DAMO Academy, Alibaba group(阿里巴巴集团大模型研究院) Hupan Lab(虎扑实验室) National Key Laboratory of General Artificial Intelligence, Peking University(北京人工智能 general artificial intelligence 国家重点实验室) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 软件智能体 :agentic(title,abstract);planning(abstract);分类 cs.AI

Comments ICCV 2025. Code: https://github.com/Gen-Verse/Paper2Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01312 2025-09-03 cs.CL 83%

TableZoomer: A Collaborative Agent Framework for Large-scale Table Question Answering

Sishi Xiong, Ziyang He, Zhongjiang He, Yu Zhao, Changzai Pan, Jie Zhang, Zhenhe Wu, Shuangyong Song, Yongxiang Li

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19322 2025-08-28 eess.IV cs.AI cs.CV 83%

AT-CXR: Uncertainty-Aware Agentic Triage for Chest X-rays

Xueyang Li, Mingze Jiang, Gelei Xu, Jun Xia, Mengzhao Jia, Danny Chen, Yiyu Shi

机构 * University of Notre Dame(诺丁汉大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05728 2025-08-11 astro-ph.IM astro-ph.CO cs.AI cs.MA 83%

CLAPP: The CLASS LLM Agent for Pair Programming

Santiago Casas, Christian Fidler, Boris Bolliet, Francisco Villaescusa-Navarro, Julien Lesgourgues

机构 * Institute for Theoretical Particle Physics and Cosmology (TTK)(理论粒子物理与宇宙学研究所) RWTH Aachen University(亚琛工业大学) German Aerospace Center (DLR)(德国航空航天中心) Kavli Institute for Cosmology(卡弗里宇宙研究所) University of Cambridge(剑桥大学) Center for Computational Astrophysics(计算天体物理学中心) Flatiron Institute(Flatiron研究所) Department of Astrophysical Sciences(天体物理科学系) Princeton University(普林斯顿大学)

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

Comments Code: https://github.com/santiagocasas/clapp, Streamlit app: https://classclapp.streamlit.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21142 2025-07-30 cs.CR cs.AI 83%

Privacy Artifact ConnecTor (PACT): Embedding Enterprise Artifacts for Compliance AI Agents

Chenhao Fang, Yanqing Peng, Rajeev Rao, Matt Sarmiento, Wendy Summer, Arya Pudota, Alex Goncalves, Jordi Mola, Hervé Robert

机构 * Meta

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02986 2025-07-09 cs.CL 83%

GAF-Guard: An Agentic Framework for Risk Management and Governance in Large Language Models

Seshu Tirupathi, Dhaval Salwala, Elizabeth Daly, Inge Vejsbjerg

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21055 2025-05-28 cs.AI 83%

Agent-Environment Alignment via Automated Interface Generation

Kaiming Liu, Xuanyu Lei, Ziyue Wang, Peng Li, Yang Liu

专题命中 软件智能体 :agent(title,abstract);tool-use(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15228 2025-05-20 cs.AI 83%

A Self-Improving Coding Agent

Maxime Robeyns, Martin Szummer, Laurence Aitchison

机构 * University of Bristol(布里斯托大学) iGent AI

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments Submitted as a preprint to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11709 2024-11-08 cs.CL cs.MA 83%

Instruct, Not Assist: LLM-based Multi-Turn Planning and Hierarchical Questioning for Socratic Code Debugging

Priyanka Kargupta, Ishika Agarwal, Dilek Hakkani-Tur, Jiawei Han

专题命中 软件智能体 :planning(title,abstract);agent(abstract);分类 cs.CL

Comments Code available at: https://github.com/agarwalishika/TreeInstruct Accepted at EMNLP'24 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.01413 2021-08-04 cs.SE 83%

IASelect: Finding Best-fit Agent Practices in Industrial CPS Using Graph Databases

Chandan Sharma, Roopak Sinha, Paulo Leitao

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.SE

Comments Conference paper, 7 pages, 6 figures, 1 table

Journal ref Proceedings of the 17th International Conference on Industrial Informatics (INDIN2019). Helsinki, Finland, IEEE Computer Society Press, pp.1558-1563

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10569 2026-07-14 cs.SE cs.AI cs.LG 新提交 83%

When Does Restricting a Coding Agent to execute_code Help? A Regime $\times$ Agent-Design Ablation

限制编码代理执行代码何时有用?一种机制×代理设计消融研究

Hong Yang, Qi Yu, Travis Desell

机构 * Rochester Institute of Technology(罗切斯特技术学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE;agentic(comments)

AI总结 研究现代编码代理不同工具表面有效性,通过在特定任务上对两种代理进行三臂消融实验,发现最便宜工具表面由任务机制和代理设计共同决定,主要成本信号是缓存调整成本而非通过率。

Comments 9 pages (excluding references), 4 figures, 4 tables. Accepted to the Agentic Software Engineering (SE 3.0) Workshop at KDD 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13258 2026-03-17 cs.LG cs.AI cs.SE 83%

Your Code Agent Can Grow Alongside You with Structured Memory

你的代码代理可以与你一同成长,借助结构化记忆

Yi-Xuan Deng, Xiaoqin Liu, Yi Zhang, Guo-Wei Yang, Shuojin Yang

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。

Comments Code Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24148 2026-08-17 cs.SE cs.AI 版本更新 82%

TENET: One Step Toward Test-Driven Development for Repository-Level Code Generation

TENET:迈向仓库级代码生成的测试驱动开发的第一步

Yiran Hu, Shanchao Liang, Nan Jiang, Yi Wu, Lin Tan

机构 * Purdue University(普渡大学) Microsoft Office AI(微软办公人工智能)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。

Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 82%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20028 2026-03-23 cs.SE cs.AI 82%

Orchestrating Human-AI Software Delivery: A Retrospective Longitudinal Field Study of Three Software Modernization Programs

协调人机AI软件交付:三种软件现代化项目的回顾纵向实地研究

Maximiliano Armesto, Christophe Kolb

机构 * Taller Technologies(塔勒技术)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);planning(abstract);workflow(abstract)

AI总结 研究通过回顾三个软件现代化项目,分析AI与人类协作在软件交付各阶段的效果,发现嵌入协调工作流的AI能显著提升效率与覆盖率。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05957 2025-10-10 cs.AI cs.CL 82%

AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents

Jiabin Tang, Tianyu Fan, Chao Huang

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);multi-agent(abstract)

Comments Code: https://github.com/HKUDS/AutoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11095 2026-08-12 cs.AI cs.LG cs.SE 新提交 82%

Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding

CLAUDE.md 为何不断膨胀?智能体编码中的灾难性记忆

Kushal Chakrabarti

机构 * South Park Commons(南公园社区)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究针对智能体编码中提示文件无限制膨胀的问题,提出通过提示注释消除多余指令,可使现实中智能体指令遵循能力提升多达23.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 82%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28591 2026-07-31 cs.SE cs.CL cs.LG 新提交 82%

Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

Change2Task:从仓库变更到可执行编码智能体任务与环境

Haomin Qi, Xingliang Wang, Xuanqi Gao, Baihui Sang, Xin Zhang, Minghua Ma, Pengfei Gao, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 Change2Task系统基于仓库历史将已合并拉取请求转为编码智能体任务,在5类任务中实现79.6%验证成功率,比基准多恢复29.2%任务,可减少流程支出10.8%。

Comments 15 pages, 7 figures, and 15 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06688 2026-07-30 cs.CE 版本更新 82%

Diagon: A Programmable Testbed for AI-Agent Cognitive Labor Markets

当智能体市场到来时

Xuan Liu, Haoyang Shang, Haojian Jin

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)

AI总结 本文提出可编程市场系统diagon,作为智能体认知劳动市场的制度设计实验平台,研究发现市场交换能带来生产力提升,但效果强烈依赖于制度结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25975 2026-07-29 cs.HC 新提交 82%

Who is scientific code for? Maintaining human-readable landmarks in agent-written code

科学代码是为谁而设?在代理编写的代码中维护人类可读的地标

Elle O'Brien

专题命中 软件智能体 :agent(title,abstract);agentic(abstract)

AI总结 研究在科学家采用编码代理后,代码维护假设瓦解的问题,核心方法是通过多种调查及工作流程,发现科学家发明“地标策略”标记代码,指出明确划分人类可读与代理上下文能利于科学代码的开发、记录与维护。

Comments Position piece submitted to Infrastructure @ CSCW 26 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24964 2026-07-29 cs.CR 新提交 82%

ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments

ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击

Zixuan Wu, Cristina Nita-Rotaru

专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract)

AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19605 2026-07-24 cs.SD 版本更新 82%

RIME: Enabling Large-Scale Agentic Music Post-Production

RIME:实现大规模智能后期制作

Noah Schaffer, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 研究针对音乐后期制作问题,引入RIME框架,利用POEMS工具包生成配对数据,评估多模态语言模型,展示其通过监督微调提升智能体性能,是迈向迭代音乐智能体、变革音乐制作的早期步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18575 2026-07-22 cs.CR 新提交 82%

RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery

RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证

Muxi Lyu, Karen Shieh, Yiwei Hou, Hao Wang, Koushik Sen, David Wagner

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03691 2026-07-22 cs.SE cs.AI cs.LG 版本更新 82%

Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality

不要责怪大语言模型:脚手架演化如何塑造编码代理质量

Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

机构 * Queen’s University Canada(加拿大女王大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究编码代理中脚手架演化对其质量的影响。通过固定模型、仅改变脚手架,对Qwen Code CLI的35个连续版本进行评估,追踪质量波动与开发模式及架构组件的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 82%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11309 2026-07-14 physics.comp-ph 新提交 82%

Toward AI-Agent-Driven Particle Transport Simulations: Implementation of AI-Assisted Workflows for PHITS

迈向人工智能代理驱动的粒子输运模拟:PHITS的人工智能辅助工作流程实现

Tatsuhiko Sato, Shintaro Hashimoto, Tatsuhiko Ogawa, Takuya Furuta, Yuho Hirata, Seiki Ohnishi, Yasuhito Sakaki, Nobuhiro Shigyo

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)

AI总结 研究针对蒙特卡罗粒子输运代码使用复杂的问题,提出将人工智能助手和代理应用于PHITS的策略,准备了两组人工智能就绪资源,经五个示范任务验证,表明提供适当资源和规则时人工智能代理可处理复杂工作流程,支持捆绑资源使用通用人工智能工具。

Comments 30 pages, 3 figures, and 2 tables, including 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11864 2026-07-14 cs.IR 版本更新 82%

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

CORE-Bench:智能体编程时代代码检索的综合基准

Fuwei Zhang, Yanzhao Zhang, Mingxin Li, Dingkun Long, Lexiang Hu, Pengjun Xie, Zhao Zhang, Fuzhen Zhuang

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏