arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3217 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3217 篇

2607.26819 2026-07-30 cs.SE cs.AI 新提交 62%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07195 2026-07-29 cs.SE cs.LG 版本更新 62%

Automated Modernization of Machine Learning Engineering Notebooks for Reproducibility

机器学习工程笔记本的自动化现代化进程以实现可重现性

Bihui Jin, Kaiyuan Wang, Pengyu Nie

机构 * University of Waterloo(滑铁卢大学) Google(谷歌公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 本文提出MLEModernizer,通过LLM驱动的框架自动化现代化工机器学习工程笔记本,以恢复其在不断变化的环境中的可重现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21677 2026-07-27 cs.SE cs.AI 新提交 62%

Enhancing SLMs for Sustainable Code Optimization in Radio-Astronomy

增强小型语言模型以实现射电天文学中的可持续代码优化

Elisa Chiarotto, Jingbo Li, P. Chris Broekema, Rob V. van Nieuwpoort

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21672 2026-07-27 cs.SE cs.AI cs.CV 新提交 62%

Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images

像素换程序?关于将源代码作为文本和图像的输入令牌计费的跨供应商案例研究

Ronak Bhalgami

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究将源代码作为文本和图像时商业API如何计费,通过可重复案例研究,涵盖五种编程语言、多种源长度及多个模型别名,得出不同模型的图像与文本比率及收支平衡行为差异,还发布了重现研究所需的资料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21641 2026-07-27 cs.SE cs.AI 新提交 62%

Tool-Guided Retrieval-Augmented Repair for Securing LLM-Generated C Code

用于保护大语言模型生成的C代码的工具引导检索增强修复

Vidyut Sriram, Saatvik Pradhan, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究大语言模型生成C代码可靠性问题,提出结合编译诊断、CodeQL静态分析等及检索先前修复模式的分析与修复工作流程,在相关C编程任务上评估,该方法有效降低了基线模型的编译失败率和安全缺陷率,提升了代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20972 2026-07-24 cs.AI cs.SE 新提交 62%

Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents

传递而非存储:线索锚定工作记忆作为编码代理的一种约束属性

Swapnanil Saha

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究编码代理记忆问题,提出基于认知文献的两层设计理论及线索锚定记忆模型,通过实际编码任务评估,表明传递而非存储是关键,可靠记忆通道应让代理无需思考,给出相关实验结果及贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20908 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习

Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Cisco AI Research(思科人工智能研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-07-24 cs.AI cs.LG 新提交 62%

MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18356 2026-07-22 cs.SE cs.AI 新提交 62%

CODENS: Transforming Code Changes into Living, Accessible, and Queryable Documentation

CODENS:将代码变更转化为生动、可访问且可查询的文档

Abdelhak Kelious, Chyrine Tahri, Eliot Bardet

机构 * CAPSENS

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究如何在快速发展代码库中维护文档,提出CODENS系统,它从拉取请求构建知识图,经语义提取等操作,通过三种检索模式展示知识,保留变更历史并集成评估指标,在项目中评估效果良好,但在文档综合方面有挑战。

Comments Accepted at the 26th ACM Symposium on Document Engineering (DocEng 2026). DOI: 10.1145/3820755.3832807

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18213 2026-07-21 cs.CL cs.SE 新提交 62%

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro:编码语言模型已知道该修剪什么

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye, Yuting Chen, Kai Cai, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。

Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16632 2026-07-21 cs.SE cs.AI 新提交 62%

CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents

CLOSER-Bench:评估硬件代理的预算跨阶段设计封闭性

Peilong Zhou, Zhirong Chen, Cangyuan Li, Haoyu Gao, Kaiyan Chang, Ziming Qu, Ying Wang

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究硬件代理跨阶段设计封闭性评估难题,提出CLOSER-Bench协议,通过配对任务记录调用,测量多方面指标。经试点和验证揭示差距,构建加速器,促使将硬件封闭视为预算顺序决策问题。

Comments 6 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 62%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14335 2026-07-21 cs.CR cs.AI cs.SE 版本更新 62%

Is "Knowing It's Malicious Enough?" Evaluating LLMs for Fine-Grained Malware Behavior Auditing

“知道它足够恶意吗?”评估用于细粒度恶意软件行为审计的大语言模型

Xinran Zheng, Xingzhi Qian, Yiling He, Shuo Yang, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型用于恶意软件审计可靠性不明问题,引入MalEval诊断框架,通过配对代码库与审计报告提供基本事实,经中间表示压缩代码库,映射输出到证据链,分解审计为四阶段任务,评估发现大语言模型在审计中有诸多问题,为后续可靠工作流程研究提供参考。

Comments Paper has beed accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15205 2026-07-17 cs.SE cs.AI 新提交 62%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01211 2026-07-17 cs.SE cs.AI 版本更新 62%

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

性能优化基准测试是否可靠地衡量编码智能体?

Zhi Chen, Zhensu Sun, Yuling Shi, David Lo, Lingxiao Jiang

机构 * Singapore Management University(新加坡管理大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究审计了三个仓库级性能优化基准(GSO、SWE-Perf、SWE-fficiency),发现参考补丁的可复现性差、评分规则导致排名不一致,且多数任务已被公开提交解决,揭示了聚合排名掩盖的性能差距。

Comments 12 pages, 7 figures. Public data: https://github.com/chenzhi-cz/performance-optimization-benchmark-reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13091 2026-07-16 cs.SE cs.AI 新提交 62%

Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework

通过累积行为规则实现自我改进的人工智能编码代理:一个闭环框架

Aditya Aggarwal, Nahid Farhady Ghalaty

机构 * Microsoft(微软)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究基于大语言模型的编码代理重复犯错问题,提出闭环框架,将审查评论编码为行为规则,经实验验证其能转移审查重点、降低错误复发率且跨接口转移,实现跨会话学习且不更新权重,积累人类工程智慧。

Comments Already presented and accepted in - 32nd ICE IEEE/ITMC Conference (ICE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19387 2026-07-15 cs.SE cs.AI 版本更新 62%

Interpretable and Verifiable Hardware Generation with LLM-Driven Stepwise Refinement

可解释且可验证的硬件生成:基于LLM驱动的逐步细化

You Li, Samuel Mandell, David Z. Pan

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) USA(美国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出结合LLM创造力与形式化方法可解释性的硬件生成框架,通过迭代应用变换规则将设计规范转换为正确性有保证的RTL程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11565 2026-07-14 cs.LG cs.AI physics.flu-dyn 新提交 62%

Heuristic Learning for Active Flow Control Using Coding Agents

使用编码智能体的主动流动控制启发式学习

Paul Garnier, Jonathan Viquerat, Elie Hachem

机构 * Mines Paris - PSL University Centre for Material Forming (CEMEF) CNRS(巴黎矿业 - 巴黎文理研究大学材料成型中心(CEMEF)法国国家科学研究中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究主动流动控制中控制器设计难题,提出用编码智能体直接搜索显式可执行反馈律的启发式学习范式及受限协议,经多基准评估,其启发式控制器性能优、可解释,是传统强化学习的可靠互补替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23449 2026-07-13 cs.AI cs.CR cs.SE 版本更新 62%

Beyond Embeddings: Interpretable Feature Extraction for Binary Code Similarity

超越嵌入:用于二进制代码相似性的可解释特征提取

Charles E. Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * Defence Research and Development Canada(加拿大国防研究与发展署) McGill University(麦吉尔大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究二进制代码相似性检测问题,利用基于语言模型的智能体对汇编代码结构化推理分析生成可解释特征,无需匹配训练,在跨架构和跨优化任务中召回率表现良好,结合嵌入优于现有技术,实现准确性、可扩展性和可解释性共存。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07980 2026-07-10 cs.SE cs.AI 新提交 62%

3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse

人工智能时代关于代码审查的3100种观点:从从业者话语中构建因果理论

Shyam Agarwal, Courtney Miller, Christian Kästner, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究人工智能对代码审查的影响,通过收集从业者话语构建因果模型,明确审查是控制点,团队决定编码代理对软件影响,转化相关命题,还提供LLM辅助灰色文献理论构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07946 2026-07-10 cs.SE cs.LG 新提交 62%

DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks

DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体

Wenqi Huang, Charley Lee, Leonard Tng, Serena Ge

机构 * Datacurve

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。

Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06482 2026-07-08 cs.CL cs.AI 新提交 62%

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

野外数据分析:针对现实世界数据复杂性对大语言模型进行基准测试

So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen

机构 * Fujitsu Research of America(富士通美国研究院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对大语言模型在数据分析基准测试无法反映现实情况的问题,引入DataGovBench基准测试,含表格问答和表格洞察两个任务,通过实验发现现有模型有性能差距,为推进相关研究提供挑战基准。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06341 2026-07-08 cs.FL cs.AI cs.SE 新提交 62%

Harnessing Code Agents for Automatic Software Verification

利用代码智能体进行自动软件验证

Shuangxiang Kan, Shuanglong Kan, Sebastian Ertel

机构 * Singapore Management University, Barkhausen Institut(新加坡管理大学, 巴克豪森研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究利用大语言模型代码智能体进行自动软件验证,将引理交给智能体自由选择方法并置于验证框架,该方法简单有效,能完全覆盖目标引理,在多维度评估中表现出色,可自动为软件开发编写证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22504 2026-07-08 cs.CR cs.AI cs.SE 新提交 62%

Lingering Authority: Revocable Resource-and-Effect Capabilities for Coding Agents

挥之不去的权限:面向编码智能体的可撤销资源与效果能力

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对编码智能体中临时权限残留问题,提出PORTICO监控器,通过可撤销能力生命周期管理,在保持任务成功率的同时消除越权副作用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05188 2026-07-07 cs.LG cs.SE 新提交 62%

Latent Programming Horizons in Coding Agents

编码智能体中的潜在编程视界

André Silva, Han Tu, Martin Monperrus

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04729 2026-07-07 cs.CR cs.AI cs.SE 新提交 62%

RustMizan: A Compilable, Contamination-Aware Benchmarking Framework for Rust Vulnerabilities

RustMizan:用于Rust漏洞的可编译、污染感知基准测试框架

Tarek Elsayed, Shiping Yang, Eunsong Koh, Sanika Goyal, Vincent Huang, Paul Ngo, Nathan Young, Mohammad Omidvar Tehrani, Alvyn Kang, Arnell Kang, Zeyu Chen, Angélica Moreira, Xuan Feng, Angel X. Chang, Nick Sumner, Steven Y. Ko

机构 * Simon Fraser University(西蒙弗雷泽大学) Trinity University(特里尼蒂大学) Microsoft Research(微软研究院) Amii(阿米国际)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对现有Rust漏洞分析基准不足,介绍RustMizan框架,含可编译代码变体及注释,用配对突变框架测试,给出不同模型在该框架下的测试结果。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02389 2026-07-03 cs.AI cs.CR cs.SE 新提交 62%

Steerability via constraints: a substrate for scalable oversight of coding agents

通过约束实现可操控性:编码智能体可扩展监督的基础

Thomas Winninger

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出通过访问控制、网络策略和工具强制编码规范等传统工程管理方法约束编码智能体,以降低人类监督成本并提升安全性;实验表明约束基板使后门检测召回率从54.5%提升至90.9%。

Comments Accepted to the Deep Learning for Code Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01418 2026-07-03 cs.SE cs.AI cs.HC 新提交 62%

Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 Rollout of Claude Code and GitHub Copilot CLI

命令行AI编码代理的采用与影响:微软2026年初推出Claude Code和GitHub Copilot CLI的研究

Emerson Murphy-Hill, Jenna Butler, Alexandra Savelieva

机构 * Microsoft(微软)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究微软2026年初推出Claude Code和GitHub Copilot CLI时,数万名工程师的采用模式、留存因素及对代码合并的影响,发现社交网络驱动首次使用,编码活跃度关联留存,采用者合并PR数量增加约24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00990 2026-07-02 cs.SE cs.AI 新提交 62%

SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests

SWE-Doctor: 通过多面缺陷复现测试的运行时诊断引导软件工程智能体

Yaoqi Guo, Yang Liu, Jie M. Zhang, Yun Ma, Yiling Lou, Zhenpeng Chen

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SWE-Doctor,通过生成多面缺陷复现测试并执行调试,构建运行时诊断记录,结合定位信息指导补丁生成,在SWE-bench Verified和Pro上平均解决率分别达75.7%和59.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29957 2026-06-30 cs.SE cs.AI 62%

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

SWE-Together:在交互式用户会话中评估编码代理

Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

机构 * Meta

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SWE-Together基准,从真实用户-代理编码会话中重建多轮交互任务,并利用基于LLM的用户模拟器评估编码代理的协作能力,发现强代理成功率更高且干预更少。

详情

展开后加载摘要…

URL PDF HTML 收藏