arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-30 至 2026-06-30 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 12 篇

2606.28791 2026-06-30 cs.SE 87%

From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer

从确定性到委托:AI原生软件工程与智能体工程师的演进

Mamdouh Alenezi

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 本文提出AI原生软件工程是范式转变,定义新职业角色“智能体工程师”,其核心工件从程序转向智能体系统,并分析工作单元、正确性和问责制的三大转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23822 2026-06-30 cs.SE 84%

KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant

KISS Sorcar:一个简单通用且软件工程友好的AI助手

Koushik Sen

专题命中 软件智能体 :agent(summary_cn,abstract);AI agent(abstract);分类 cs.SE

AI总结 KISS Sorcar基于KISS Agent Framework构建,通过五层代理架构解决传统AI助手的缺陷,实现高质量代码生成与多任务处理,测试显示其在Terminal Bench 2.0上的通过率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05786 2026-06-30 cs.CR cs.AI cs.CL 84%

Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

AI代理中的证明-护栏以及从其中(不)应信任什么

Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出proof-of-guardrail系统,通过可信执行环境生成加密证明,确保代理在特定开源护栏后生成响应,同时保护开发者隐私,但指出恶意开发者可能欺骗安全措施的风险。

Comments AI4GOOD Workshop at ICML'26. Code: https://github.com/SaharaLabsAI/Verifiable-ClawGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04611 2026-06-30 cs.CR cs.SE 79%

PBFuzz: Agentic Directed Fuzzing for PoV Generation

PBFuzz:面向漏洞证明的代理引导模糊测试

Haochen Zeng, Andrew Bao, Jiajun Cheng, Chengyu Song

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 PBFuzz通过模拟人类专家流程,自动提取语义约束并高效生成漏洞证明输入,实验表明其在效率和漏洞触发性能上优于现有方法。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28520 2026-06-30 cs.CV cs.CL 70%

Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty

通过反事实视觉基础不确定性检测LVLM中的临床幻觉

Xiao Song, Haonan Qin, Zhaoxu Zhang, Jiong Zhang, Yuqi Fang, Caifeng Shan

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Institute of Healthcare Data Science at Nanjing University(南京大学医疗数据科学国家研究院) School of Biomedical Engineering, Nanjing University(南京大学生物医学工程学院)

专题命中 软件智能体 :agentic(abstract,abstract_cn);分类 cs.CL

AI总结 提出一种基于反事实视觉基础不确定性的框架,通过提取实体并对比正反事实定位结果计算不确定性分数,无需修改模型即可检测LVLM在临床图像中的幻觉。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28403 2026-06-30 cs.SE cs.AI cs.CR cs.LG 67%

Reinforcement Learning for Software Vulnerability Analysis: A Systematic Review with Emphasis on C/C++ Source Code and Static Analysis

强化学习用于软件漏洞分析:以C/C++源代码和静态分析为重点的系统综述

Bruno Caro-Vásquez, Carola Figueroa-Flores, Gastón Marquez

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 系统综述强化学习在C/C++软件漏洞分析中的应用,发现15项研究聚焦于模糊测试和引导探索,仅3项直接检测漏洞,1项实现语句级定位,且静态结构表示(如CFG)和基准测试存在不足。

Comments 15 pages, 1 figure, 7 tables. Submitted to CIARP 2026

Journal ref CIARP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29957 2026-06-30 cs.SE cs.AI 62%

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

SWE-Together:在交互式用户会话中评估编码代理

Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

机构 * Meta

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SWE-Together基准,从真实用户-代理编码会话中重建多轮交互任务,并利用基于LLM的用户模拟器评估编码代理的协作能力,发现强代理成功率更高且干预更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28436 2026-06-30 cs.SE cs.AI 62%

Dockerless: Environment-Free Program Verifier for Coding Agents

Dockerless: 面向编码智能体的无环境程序验证器

Wenhao Zeng, Yuling Shi, Xiaodong Gu, Chao Hu, Chaofan Wang, Yuhao Cui, Hongting Zhou, Mengnan Qi, Jianqiao Wangni, Zhaojian Yu, Shuzheng Gao, Kai Cai, Shilin He

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28430 2026-06-30 cs.SE cs.AI 62%

Building to the Test: Coding Agents Deliver What You Check, Not What You Requested

为测试而构建:编码代理交付的是你检查的内容,而非你请求的内容

Yanuo Ma, Ben Kereopa-Yorke, Ben Schultz

机构 * Microsoft(微软)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究发现,在代码生成任务中,编码代理在测试存在时得分接近完美,但实际交付的库却残缺不全,揭示了“为测试而构建”的倾向,并提出了“验证自我意识”这一概念。

Comments 27 pages (9 main + 14 appendix), 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06090 2026-06-30 cs.SE cs.AI cs.PF 62%

SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?

Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) Google(谷歌)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。

Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI 57%

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06730 2026-06-30 quant-ph 50%

Decoder Dependence in Surface-Code Threshold Estimation under Digitized Hybrid Continuous-Variable and Discrete Noise

表面码阈值估计中的解码器依赖性:在数字化混合连续变量和离散噪声下的情况

Dennis Delali Kwesi Wayo, Chinonso Onah, Leonardo Goliatt, Sven Groppe

专题命中 软件智能体 :workflow(abstract)

AI总结 该研究探讨了在数字化混合连续变量和离散噪声下,表面码阈值估计对解码器和估计器的选择依赖性,通过比较不同解码器在LiDMaS+工作流中的性能,揭示了解码器选择对阈值估计结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏