arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-20 至 2026-08-20 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 15 篇

2512.14012 2026-08-20 cs.SE cs.AI cs.HC 版本更新 90%

Professional Software Developers Don't Vibe, They Control: AI Agent Use for Coding in 2025

专业软件开发者不随性,他们掌控:2025年AI代理在编程中的使用

Ruanqianqian Huang, Avery Reyna, Sorin Lerner, Haijun Xia, Brian Hempel

机构 * Cornell University(康奈尔大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了2025年经验丰富的软件开发人员如何利用AI代理进行编程,发现开发人员通过保持自主权和专业知识来控制代理行为,以确保软件质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18167 2026-08-20 cs.AI cs.SE 新提交 86%

Adversarial Review: Structured Disagreement for Grounded Agentic Code Review

对抗评审:基于结构化分歧的 grounded 智能体代码评审

Eric S. Qiu, Joyce Gill

机构 * Cornell University(康奈尔大学) Stanford University(斯坦福大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出对抗评审(AR)协议,仅用3个智能体实现结构化分歧的协作代码评审,在LiveCodeBench、SWE-PRBench等基准上优于多智能体基线,证明无需大量智能体即可完成高效代码评审。

Comments Accepted to ICML 2026 Workshop on DL4C

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18389 2026-08-20 cs.AI 新提交 84%

A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations

锯齿状前沿:评估代码智能体对语义保留转换的鲁棒性

Hasan Najib Mahmud (1), Shreya Gupta (2), Isha Chaudhary (3), Nathaniel Enis (1), Ravi Mangal (1), Gagandeep Singh (3), Corina Pasareanu (4) ((1) Colorado State University, (2) Microsoft, (3) University of Illinois Urbana-Champaign, (4) Carnegie Mellon University)

专题命中 软件智能体 :agent(summary_cn,abstract);agentic(abstract);分类 cs.AI

AI总结 该研究评估AI代码智能体对语义保留代码转换的鲁棒性,发现其存在锯齿状鲁棒性前沿,mini-SWE agent更鲁棒,顶级模型仍易受此类扰动影响,引发部署可靠性担忧。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 82%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18565 2026-08-20 cs.SE 新提交 79%

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

SemaPLC:一种基于项目、经验证门控的PLC代码生成智能体框架

Yanlun Tu, Huacan Wang, Ziyue Zhou, Jie Zhou, Ningyan Zhu, Ge Chen, Wangyi Chen, Tengfei Zhou, Yifan Zhou, Dasheng Yang, Xiaofeng Mou, Hui Zhang, Yi Xu

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 SemaPLC是基于项目、经验证门控的PLC代码生成智能体框架,通过外部检查确认任务完成,在多模型的POU任务及项目上下文任务中均表现最优,动态行为测试得分显著高于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16934 2026-08-20 cs.AR cs.CL 版本更新 79%

SeqFeed: Improving Agentic RTL Code Generation with Sequential Behavior Feedback

SeqFeed:通过顺序行为反馈改进智能体RTL代码生成

Yuxin Du, Juxin Niu, Tao Hu, Xi Wang, Zhe Jiang, Nan Guan

专题命中 软件智能体 :agentic(title,abstract);分类 cs.CL

AI总结 针对智能体RTL代码生成的时序信息传递难题,本研究提出含SeQuery和SeGraph机制的SeqFeed,通过满足三项反馈要求提升LLM的RTL代码生成通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18280 2026-08-20 cs.SE cs.AI cs.CL cs.LG 新提交 77%

What Makes Software Issue Resolution Tasks Difficult for Agents?

什么因素导致软件问题解决任务对智能体而言难度较高?

Ebtesam Al-Haque, Brittany Johnson

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究提出测量框架,基于CoderForge-Preview数据集的实证分析,发现软件问题解决任务难度可通过静态特征预测,核心驱动因素为补丁碎片化与代码库规模,为构建难度可控的智能体评估基准奠定基础。

Comments To appear in ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18840 2026-08-20 cs.RO cs.CV 新提交 67%

Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction

超越布局与关节运动:面向具身交互的使用驱动型代码场景

Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

机构 * Meituan(美团)

专题命中 软件智能体 :agent(abstract);agentic(abstract)

AI总结 针对现有代码场景生成方法未建模场景功能使用的问题,提出RoomWright框架,通过使用驱动型物体推理与代码智能体实现可执行、可编辑的仿真就绪3D场景,为具身AI与策略学习提供交互式环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-20 cs.AI cs.CL cs.HC cs.LG cs.MA 版本更新 67%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07625 2026-08-20 cs.AR cs.MA 版本更新 67%

HINT: Toward an Executable Hardware-Intent Representation Layer for LLM-Driven RTL Generation

HINT:面向大语言模型驱动的RTL生成的可执行硬件意图表示层

Tairan Cheng, Yi Liu, Dongsheng Zuo, Zhengyuan Shi, Hongji Zhang, Xiangfei Hu, Maoshuo He, Hao Yan, Qiang Xu

专题命中 软件智能体 :agent(abstract);workflow(abstract)

AI总结 本文提出HINT可执行硬件意图表示层,用于LLM驱动的RTL生成,在7个算子案例中全量生成合规可综合RTL,面积较人工实现及直接C2RTL结果显著降低,还验证了其在各类复杂设计中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25692 2026-08-20 cs.SE cs.LG 版本更新 62%

A Configuration-First Framework for Reproducible, Low-Code Machine Learning: a Localization Use Case

一种面向可重复、低代码定位的配置优先框架

Tim Strnad (Jožef Stefan Institute, Slovenia), Blaž Bertalanič (Jožef Stefan Institute, Slovenia), Carolina Fortuna (Jožef Stefan Institute, Slovenia)

机构 * Jožef Stefan Institute(乔塞夫·斯蒂芬研究所)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本文提出了一种低代码、配置优先的框架,通过版本化配置和自动化流程提升定位任务的可重复性和效率。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-20 cs.AI 版本更新 57%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15232 2026-08-20 cs.SE 版本更新 57%

When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling

当代理失效:对LLM代理中bug的全面研究与自动化标记

Niful Islam, Ragib Shahriar Ayon, Deepak George Thomas, Shibbir Ahmed, Mohammad Wardat

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。

Comments Accepted at ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18129 2026-08-20 math.OC cs.MA 新提交 50%

Simulation-Optimization of Systems of Optimizers: Exploiting the Inner Optimization's Geometry

优化器系统的模拟优化:利用内部优化的几何结构

Zhou He

专题命中 软件智能体 :agent(abstract)

AI总结 该研究针对优化器系统(SOSO)的模拟优化,提出利用内部优化几何结构的 PRIME 求解器,在多类测试平台上实现了优异性能,大幅降低了方差,为模拟优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16911 2026-08-20 stat.CO cs.PL 版本更新 50%

r2py: AI-Assisted Conversion of R Statistical Packages to Python

r2py:用于AI辅助将R统计包转换为Python的框架

Yufei Cai, Jun Li

专题命中 软件智能体 :agentic(abstract)

AI总结 本文提出r2py,这是Claude Code环境中首个七阶段AI辅助方法,可将R包系统转换为数值保真的原生Python库,在KernSmooth包上实现的r2py_kernsmooth通过518项测试,有效数字一致性达6-10位。

Comments v2: substantially extended. Adds a second case study (rpart) reached through R's.Call() interface, and a five-phase prologue reconstructing the portion of R's C API the package uses so its original C compiles without R. v1 covered KernSmooth only. Title shortened

详情

展开后加载摘要…

URL PDF HTML 收藏