arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 462 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 462 篇

2607.16721 2026-07-21 cs.LG 新提交 57%

Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding

一半的专家,全部的代码:用于编码的专家混合语言模型的一次性领域剪枝

Anik Jha

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 研究针对编码任务的专家混合语言模型,通过五种策略对两个模型进行剪枝,探究能移除多少及哪些专家。发现移除一半专家在代码基准测试无损失,损害多在编码外,但获胜策略因模型而异,还揭示了困惑度等问题及剪枝与量化的关系,强调需 per - model 验证。

Comments 15 pages, 3 figures. Code and pruned checkpoints: github.com/anik-jha/moep

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-07-20 cs.AI 新提交 57%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 31 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15143 2026-07-17 cs.CR cs.HC cs.SE 新提交 57%

Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents

设置完成,现在你已被攻破:利用设置指令攻击人工智能编码代理

Aadesh Bagmar, Pushkar Saraf

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究人工智能编码代理在安装包时因不验证依赖项而面临的供应链攻击,通过编辑项目设置文档即可发动攻击。对前沿模型在多场景下测试,发现安装安全性取决于工具与模型组合,还存在多种检测问题,提出预安装检查可弥补大部分安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13085 2026-07-16 cs.CR cs.AI 新提交 57%

Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing

架构之前的基线:评估用于自主渗透测试的编码代理

Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

机构 * Kroda Labs(Kroda实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对自主渗透测试,以默认编码CLI代理为基线,在XBOW基准上用不同模型运行,比较不同框架结果及模型扩展效果,发现专业框架有提升,普通代理也能解决不少问题,新模型可提升同一框架,强调未来评估应报告模型匹配的普通代理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12784 2026-07-15 cs.RO cs.LG 新提交 57%

Directional Constraints for Efficient Exploration in Safe Reinforcement Learning

安全强化学习中高效探索的方向约束

Paolo Magliano, Puze Liu, Jan Peters, Davide Tateo, Raffaello Camoriano

机构 * Dipartimento di Automatica e Informatica, Politecnico di Torino(自动控制与信息工程系,都灵理工大学) Tongji University, Shanghai Research Institute for Intelligent Autonomous Systems(同济大学,上海智能自主系统研究院) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Intelligent Autonomous Systems Group, TU Darmstadt(智能自主系统组,达姆施塔特工业大学) Lund University(隆德大学) Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 针对安全强化学习中约束学习降低速度和性能的问题,提出扩展ATACOM框架的ATACOM-DC方法,通过引入方向约束区分动作,改善安全与性能权衡,在模拟机器人控制任务中评估,分析约束违反成本和任务性能。

Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026. 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12301 2026-07-15 cs.SE cs.MA 新提交 57%

XScientist: A Git-Like Research Protocol for Long-Running Autonomous Scientific Discovery

XScientist:用于长期自主科学发现的类似Git的研究协议

Jixiang Luo

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究针对自主研究系统的问题,提出XScientist这一类似Git的研究协议和操作系统,核心方法是将运行视为可移植工件并导出相关协议,主要贡献是使自主科学从单次演示走向可重现、可审查和可分叉的研究基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11111 2026-07-14 cs.SE 新提交 57%

Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution

修复前先了解:用于软件问题解决的基于问答的仓库知识获取

Haotian Lin, Silin Chen, Xiaodong Gu, Yuling Shi, Chengxi Pan, Jiaqi Ge, Mengfan Li, Jianghong Huang, Mengchieh Chuang, Beijun Shen, Haibing Guan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究针对基于大语言模型的编码代理解决软件问题易因仓库理解不足出错的问题,提出ACQUIRE框架,通过问答驱动在修复前获取仓库知识,经两阶段解耦知识获取与补丁生成,实验证明该框架能提升问题解决准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10712 2026-07-14 cs.CR cs.AI cs.DL 新提交 57%

Distributed Denial of Science: How Indirect Data Poisoning of AI Systems Can Industrialize Scientific Fraud

分布式科学否认:人工智能系统的间接数据投毒如何使科学欺诈产业化

Bálint Gyevnár, Atoosa Kasirzadeh, Nihar B. Shah

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究探讨人工智能时代科学欺诈新形式,即间接数据投毒。对手 corrupt 开放数据集上传,使自主研究代理处理后传播欺诈。通过多话题、多系统实验发现投毒成功率高而检测率低。提出科学家角色和数据溯源审计措施,后者可有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08182 2026-07-10 cs.CV cs.AI 新提交 57%

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07882 2026-07-10 cs.SE 新提交 57%

Bug Report Specification Refinement with Trajectory Guidance for Automated Program Repair

基于轨迹引导的自动程序修复的错误报告规范细化

S M Farah Al Fahim, Md Nakhla Rafi, Md Ahasanuzzaman, Zeyang Ma, Dong Jae Kim, Shaowei Wang, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究针对自动程序修复中错误报告规范不完善的问题,提出TrajSpec方法,通过轨迹引导收集证据并组织成三级表示,经审查生成细化报告,实验表明该方法能有效提高修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05785 2026-07-08 cs.SE 新提交 57%

Can Large Language Models Generate Observability-Aware Code?

大语言模型能否生成可观测性感知代码?

Yongliang Tao, Hongyu Zhang, Pengfei Gao, Minghua Ma, Zhiyu Fan, Yu Kang, Jue Zhang, Si Qin, Liqun Li, Qingwei Lin, Saravan Rajmohan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究大语言模型生成的代码在可观测性方面的表现,通过恢复工件和注入故障评估代理生成系统的源级诊断语义与运行时故障信号,发现两者存在差距,引入的技能改进有限,指出当前评估或忽视可观测性这一软件质量维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交 57%

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05076 2026-07-07 cs.SE cs.FL 新提交 57%

Can Code Specify a System Precisely Enough to Formally Verify It?

代码能否精确指定系统以进行形式化验证?

Jean-Jacques Dubray

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究评估生产软件支付工作流,通过手工模型验证核心协议正确性,发现故障处理差距并修复;生产支付沙盒探针暴露问题;还复制了关于大语言模型规范可靠性受合同结构而非语言影响的结论。

Comments 25 pages, 3 figures, 5 tables. Artifacts and reference models at https://github.com/jdubray/SysMoBench-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05068 2026-07-07 cs.SE cs.CY 新提交 57%

When AI Is Wrong on Purpose: How Students Respond to Buggy GenAI Code

当人工智能故意出错时:学生如何应对有缺陷的生成式人工智能代码

Victor-Alexandru Pădurean, Kaitlin Riegel, Alkis Gotovos, Jyotika Mahapatra, Ahana Ghosh, Paul Denny, Juho Leinonen, James Prather, Adish Singla

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究如何调整以提示为中心的编程活动,通过向正确解决方案注入真实可运行的错误,分析学生对自然发生的提示相关故障和故意注入错误的行为,发现学生对不同错误源反应不同,二者共同支持有用的生成式人工智能工作流程。

Comments ICER'26 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03935 2026-07-07 cs.AI 新提交 57%

Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions

harness感知自进化:共同进化模型权重、harness和任务解决方案

Haochen Luo, Yi Huang, Sichun Luo, Fengyuan Liu, Lei Li, Zefa Hu, Junlan Feng, Qi Liu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Jiutian Research, China Mobile(中国移动九天研究院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 研究提出HASE框架,通过单模型在多轮动作空间生成任务解决方案或编辑harness组件。能使单模型匹配高性能模型文本分类性能,在alpha因子挖掘中超越基线,还能修复评估组件,在算法发现中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03332 2026-07-07 cs.SE 新提交 57%

AtomicCommitBench: Can Coding Agents Reconstruct Commit Histories from Squashed Patches?

原子提交基准测试:编码代理能否从压缩补丁中重建提交历史?

Zhihao Lin, Mingyi Zhou, Li Li

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究编码代理从压缩补丁重建提交历史的问题,将任务形式化为有重放要求的块到提交分区,构建基准测试并评估,发现自然重建比重放检查等难,部分方法表现较好,还找出常见失败模式及改进方法。

Comments 21 pages, 6 figures, benchmark paper on coding agents and software engineering; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02949 2026-07-07 cs.SE 新提交 57%

BeSpec: Behavior-Level Specification Alignment for Code Generation

BeSpec:用于代码生成的行为级规范对齐

Qinghua Xu, Guancheng Wang, Boxi Yu, Lionel Briand

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02857 2026-07-07 cs.CR cs.SE 新提交 57%

MOSAIC: Knowledge-Guided CLI Command Composition Attack in LLM Coding Agents

MOSAIC:大语言模型编码代理中知识引导的命令行命令组合攻击

Jiangrong Wu, Huaijin Wang, Yihao Zhang, Yuhong Nan, Shuai Wang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究大语言模型编码代理中CLI命令组合风险,提出知识引导框架MOSAIC,从漏洞等提取命令状态行为总结成攻击路径,实例化开发者工作流程,通过多实验得高攻击成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02684 2026-07-07 cs.SE 新提交 57%

Can Coding Agents Implement Missed Compiler Optimizations? Evaluating LLM Agents on LLVM Peephole Optimizations

编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理

Hongxu Xu, Chunhao Liao, Xintong Zhou, Chengnian Sun

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02606 2026-07-07 cs.SE 新提交 57%

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance

ChainSWE:在多漏洞软件维护中对编码代理进行基准测试

Qirui Jin, Lingching Tung, Kenan Li, Qiyang Shi, Yushi She, Huanzhong Jia, Harrison Zhao, Kejing Xia, Zhenbang Du, Yikai Zhang, Jiaxin Pei, Zhenyu Zhang, Zhen Qi, Yuyan Duan, Wenke Lee, Zijian Jin

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究针对语言模型代理在多漏洞软件维护中的评估问题,引入ChainSWE基准,通过收集Python项目问题链进行评估,发现链长度增加时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24530 2026-07-07 cs.CL 新提交 57%

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

NatureBench: 编码智能体能达到Nature系列论文已发表SOTA水平吗?

Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang

机构 * Horizon Research(地平线研究) Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 提出跨学科基准NatureBench,包含90个来自Nature系列论文的任务,评估AI编码智能体在真实科学问题上的发现能力。最强模型仅在17.8%任务上超越SOTA,失败主因是方法选择错误和计算预算不足。

Comments Add results of GLM-5.2 and MinMax-M3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02294 2026-07-03 cs.SE 新提交 57%

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

编码代理在猜测:测量欠指定DevOps指令中的动作边界违规

Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01883 2026-07-03 cs.CL 新提交 57%

PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation

PairCoder++:结对编程作为验证代码驱动的多模态与结构化工件生成的通用范式

Junhao Chen, Xiang Li, Mingjin Chen, Boran Zhang, Henghaofan Zhang, Yibin Xu, Yuehan Cui, Fangsheng Weng, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * THU(清华大学) PKU(北京大学) PolyU, Hong Kong(香港理工大学) USTC(中国科学技术大学) UESTC(电子科技大学) Tongji University(同济大学) Tianjin University(天津大学) Independent Researcher(独立研究者) Guangming Lab(光明实验室) BAAI(北京智源人工智能研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 提出PairCoder框架,通过驱动者和导航者两个智能体结对编程,利用工具链反馈验证代码生成,在17个基准测试中显著提升可验证工件的生成质量。

Comments Accepted by ACL 2026. Project Page: https://yisuanwang.github.io/PairCoder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交 57%

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26979 2026-07-03 cs.SE 新提交 57%

How Much Static Structure Do Code Agents Need? A Study of Deterministic Anchoring

代码智能体需要多少静态结构?关于确定性锚定的研究

Zhihao Lin, Mingyi Zhou, Yizhuo Yang, Li Li

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究轻量级静态分析(如调用图、继承层次)作为确定性锚定,通过注入结构注释提高代码智能体导航的可复现性和稳定性,发现锚定效果依赖粒度与仓库特性。

Comments Accepted to the ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026). 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01213 2026-07-02 cs.SE 新提交 57%

RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue

RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究

Zhihao Lin, Mingyi Zhou, Zhensu Sun, Yizhuo Yang, Renyu Yang, David Lo, Li Li

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00895 2026-07-02 cs.CL 新提交 57%

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

机构 * KR Labs(KR实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) TU Wien(维也纳工业大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31630 2026-07-01 cs.LG 新提交 57%

Calibration, Not Compilation: Detecting and Repairing Misspecified Probabilistic Programs Written by Language Models

校准,而非编译:检测和修复语言模型编写的错误指定概率程序

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS RIKEN AIP South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31182 2026-07-01 cs.AI 新提交 57%

AI-Assisted Discovery of Convex Relaxations via Dual Agents

通过双智能体实现凸松弛的AI辅助发现

Sungyoon Kim, Mert Pilanci

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出一种双智能体自动研究范式,通过编码智能体提议约束、理论智能体验证并搜索反例,结合区间算术验证,改进了两个优化常数的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22593 2026-07-01 cs.SE cs.CR 新提交 57%

On Good Authority: Release-Authority Measurement for Registry-Mediated Package Ecosystems

论良好权威:注册中心中介的包生态系统的发布权威度量

Igor Santos-Grueiro

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 提出一种前驱感知的发布权威记录,通过比较发布路径证据(发布者、仓库、工作流、来源、签名、中介)识别策略触发的发布路径不连续性,经npm等五个生态系统的审计样本验证,触发策略可有效筛选需审查的发布。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏