arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-21 至 2026-07-21 共收录 23 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 23 篇

2604.00594 2026-07-21 cs.AI 版本更新 88%

Agent psychometrics: Task-level performance prediction in agentic coding benchmarks

代理心理测量:在代理编码基准中的任务级性能预测

Chris Ge, Daria Kryvosheieva, Daniel Fried, Uzay Girit, Kaivalya Hariharan

机构 * Massachusetts Institute of Technology(麻省理工学院) Fulcrum Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 86%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 软件智能体 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18161 2026-07-21 cs.SE cs.AI cs.OS 新提交 84%

TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization

TRIM:通过代理轨迹最小化减少人工智能生成的代码冗余

Alex Mathai, Shobini Iyer, Aleksandr Nogikh, Petros Maniatis, Franjo Ivancic, Junfeng Yang, Baishakhi Ray

机构 * Dept. of Computer Science Columbia University(计算机科学系哥伦比亚大学) Google Inc(谷歌公司) Google DeepMind(谷歌DeepMind)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究人工智能生成代码冗余问题,提出TRIM算法,通过最小化代理轨迹间接减少代码冗余,实验证明该方法有效且高效,能显著降低代码冗余,同时减少验证成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16448 2026-07-21 cs.LG cs.AI 新提交 84%

Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent

检索就足够了:使用工具的智能体实现无需训练的可解释性

Sriram Balasubramanian, Soheil Feizi

机构 * University of Maryland(马里兰大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究神经网络激活可解释性方法,提出HARP方法,即让语言模型智能体利用激活向量数据库及工具,通过迭代查询、形成并验证假设来实现无需训练的可解释性,该方法在多方面表现出色,还凸显现有训练方法局限并推动新基准测试。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18057 2026-07-21 cs.SE 新提交 83%

Test Coverage Analysis of Agentic Pull Requests

智能拉取请求的测试覆盖分析

Atish Kumar Dipongkor, Talank Baral, Wing Lam, Kevin Moran

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 研究人工智能编码代理生成的拉取请求的测试覆盖情况,分析4882个相关请求,发现代理包含测试更改比例低,现有测试覆盖不足,代理编写测试仅在少数请求中提升覆盖,错误处理结构测试严重不足,为此提出相关改进措施。

Comments 12 pages, to appear 42nd International Conference on Software Maintenance and Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17937 2026-07-21 cs.SE 新提交 83%

When and How Context Rot Appears in Coding Agents: A White-Box Study of Agent Skills in Code Auditing

在长上下文情况下代理技能如何失效:代码审计中的白盒研究

Yue Xue

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 研究长上下文下代码审计中代理技能失效问题,通过改变上下文分类故障位置,对比不同条件下Codex等运行情况,发现长上下文影响大,不同任务表现有别,外部检查表效果好,编码代理支架有帮助,给出故障分类和实证案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16740 2026-07-21 cs.SE 新提交 83%

Agentic Code Review in the Terminal: A Trajectory-Level Analysis of Behavior, Cost, and Human-Alignment

终端中的智能代码审查:行为、成本和人工对齐的轨迹级分析

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

专题命中 软件智能体 :agentic(title,abstract);planning(abstract);分类 cs.SE

AI总结 研究终端环境中智能代码审查的行为、成本等,基于审查者轨迹分析,发现智能审查者审查精度高但有探索等开销,成功审查与规划等有关,凸显轨迹感知和成本敏感评估对未来此类系统的好处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06752 2026-07-21 cs.SE 版本更新 83%

Pomona: Continuous Code Quality Improvement via Small, Agentic Pull Requests at Bloomberg

Pomona:通过小型自动化变更实现彭博社的持续代码质量改进

David Williams, Angelos Evripiotis, Serkan Kirbas, Harry Morgan, Sergey Magidovich, Peter Wainwright, Federica Sarro

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 提出Pomona轻量级代理工具,通过扫描和修复技能自动发现并修复代码问题,生成约10行差异的小型PR,经一个月团队部署和10名高级工程师问卷评估,17个PR中15个成功合并,中位关闭时间低于2小时,8/10工程师愿意采用。

Comments 6 pages, 2 figures, 1 table, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 82%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17722 2026-07-21 cs.SE 新提交 79%

KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes

KernelDiag:基于代理的内核崩溃根本原因诊断

Weijing Wang, Zan Wang, Dong Wang, Haichi Wang, Junjie Chen

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 针对Linux内核崩溃根本原因诊断难的问题,提出KernelDiag框架,通过日志到代码映射及专门代理进行结构化因果推理,在KGYM基准测试中表现出色,优于现有方法,为自动内核根本原因诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13125 2026-07-21 cs.CV cs.AI 版本更新 79%

Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

Boogu-Image-0.1:提升开源统一多模态理解与生成能力

Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17363 2026-07-21 physics.plasm-ph 新提交 78%

ORB5X v1.0: a performance-portable global electromagnetic gyrokinetic PIC code in C++/Kokkos built using Agentic AI

ORB5X v1.0:一个使用智能AI构建的性能可移植的全局电磁陀螺动力学PIC C++/Kokkos代码

Mohsen Sadr, Emmanuel Lanti, Alexey Mishchenko, Xin Wang, Laurent Villard

专题命中 软件智能体 :agentic(title);workflow(abstract)

AI总结 本文介绍ORB5X,它是ORB5的C++/Kokkos版本,保留了原Fortran代码的数学模型与算法,通过替换模块和数组提升性能可移植性,经测试与原代码精度相近,且能在多种设备上编译运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06411 2026-07-21 cs.SE cs.AI cs.CL 版本更新 78%

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试

Evgeny Shilov

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.CL、cs.SE

AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。

Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-07-21 cs.SE cs.AI 新提交 73%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18213 2026-07-21 cs.CL cs.SE 新提交 62%

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro:编码语言模型已知道该修剪什么

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye, Yuting Chen, Kai Cai, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。

Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16632 2026-07-21 cs.SE cs.AI 新提交 62%

CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents

CLOSER-Bench:评估硬件代理的预算跨阶段设计封闭性

Peilong Zhou, Zhirong Chen, Cangyuan Li, Haoyu Gao, Kaiyan Chang, Ziming Qu, Ying Wang

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究硬件代理跨阶段设计封闭性评估难题,提出CLOSER-Bench协议,通过配对任务记录调用,测量多方面指标。经试点和验证揭示差距,构建加速器,促使将硬件封闭视为预算顺序决策问题。

Comments 6 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 62%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14335 2026-07-21 cs.CR cs.AI cs.SE 版本更新 62%

Is "Knowing It's Malicious Enough?" Evaluating LLMs for Fine-Grained Malware Behavior Auditing

“知道它足够恶意吗?”评估用于细粒度恶意软件行为审计的大语言模型

Xinran Zheng, Xingzhi Qian, Yiling He, Shuo Yang, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型用于恶意软件审计可靠性不明问题,引入MalEval诊断框架,通过配对代码库与审计报告提供基本事实,经中间表示压缩代码库,映射输出到证据链,分解审计为四阶段任务,评估发现大语言模型在审计中有诸多问题,为后续可靠工作流程研究提供参考。

Comments Paper has beed accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17957 2026-07-21 cs.SE 新提交 57%

DepRepair: LLM-Based Source-Code Repair for Dependency Breaking Changes

DepRepair:基于大语言模型的针对依赖项破坏更改的源代码修复

Shenghao Yang, Bo Lu, Yaochen Liu, Yu Kang, Qiongfang Zhang, Chetan Bansal, Saravan Rajmohan, Minghua Ma

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究软件项目因第三方库更新致依赖项破坏更改的问题,提出DepRepair单调用大语言模型方法,通过证据过滤器、用法定位器和子类别感知指南,基于结构化上游证据修复,在DepBench基准测试中取得高可执行通过率。

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16721 2026-07-21 cs.LG 新提交 57%

Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding

一半的专家,全部的代码:用于编码的专家混合语言模型的一次性领域剪枝

Anik Jha

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 研究针对编码任务的专家混合语言模型,通过五种策略对两个模型进行剪枝,探究能移除多少及哪些专家。发现移除一半专家在代码基准测试无损失,损害多在编码外,但获胜策略因模型而异,还揭示了困惑度等问题及剪枝与量化的关系,强调需 per - model 验证。

Comments 15 pages, 3 figures. Code and pruned checkpoints: github.com/anik-jha/moep

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21372 2026-07-21 cs.AI 版本更新 57%

NEMO: Execution-Aware Optimization Modeling via Autonomous Coding Agents

NEMO: 通过自主编码代理实现执行感知的优化建模

Yang Song, Anoushka Vyas, Zirui Wei, Sina Khoshfetrat Pakazad, Henrik Ohlsson, Graham Neubig

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12428 2026-07-21 cs.CR 版本更新 56%

Trust but Verify? Uncovering the Security Debt of Autonomous Coding Agents

信任但要验证?揭示自主编码代理的安全债务

A H M Nazmus Sakib, Dipayan Banik, Murtuza Jadliwala

专题命中 软件智能体 :agent(abstract);agentic(comments)

AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18176 2026-07-21 astro-ph.IM physics.flu-dyn 新提交 50%

Per Astronomix ad Astra: High-Order Differentiable (Magneto)hydrodynamics with Energy-Conserving Self-Gravity

从天文到星际:具有能量守恒自引力的高阶可微(磁)流体动力学

Leonard Storcks, Nils Thuerey, Tobias Buck

专题命中 软件智能体 :agentic(abstract)

AI总结 介绍用Python/JAX编写的可微(磁)流体动力学模拟器astronomix,利用自动微分实现逆建模等,在单GPU运行时表现良好且可扩展,还提出新自引力方案及相关智能技术提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏