arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 189 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 189 篇

2604.14228 2026-07-03 cs.SE cs.AI cs.CL cs.LG 版本更新 90%

Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems

深入Claude代码:当今及未来AI代理系统的设计空间

Jiacheng Liu, Xiaohan Zhao, Xinyi Shang, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学VILA实验室) University College London(伦敦大学学院)

专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文分析Claude代码架构及其与OpenClaw的对比,揭示驱动设计的五个人类价值观,并探讨未来AI代理系统的六个开放设计方向。

Comments Tech report. Code at: https://github.com/VILA-Lab/Dive-into-Claude-Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19138 2026-08-05 cs.CR cs.AI cs.LG cs.SE 版本更新 90%

AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection

AgenticSCR: 一种用于检测初期漏洞的自主代理安全代码审查

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

机构 * The University of Melbourne(墨尔本大学) Monash University(莫纳什大学)

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(title);agent(abstract);multi-agent(abstract)

AI总结 AgenticSCR通过结合LLMs、自主决策和语义记忆,有效检测预提交阶段的初期漏洞,优于传统SAST工具和静态LLM基线。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE'26 Industry-Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08348 2026-08-12 cs.CL 版本更新 90%

Bayesian-Agent: Posterior-Guided Skill Evolution Across LLM Agent Harnesses

Bayesian-Agent:面向LLM Agent框架的后验引导技能演化

Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Wenjie Zhang, Zhichao Shi, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 软件智能体 :agent(title,title_cn);分类 cs.CL

AI总结 提出Bayesian-Agent框架,将可复用技能视为假设,通过后验分布指导技能演化(如修补、拆分、压缩等),在多个基准上显著提升性能,表明Agent技能演化应视为后验引导的框架优化。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04226 2026-06-08 cs.MA cs.AI 版本更新 89%

SW-$A^2$-Bench: Benchmarking Autonomous Software Agent Generation for Agentic Web

SW-$A^2$-Bench: 面向智能体网络的自主软件智能体生成基准测试

Linyao Chen, Bo Huang, Qinlao Zhao, Shuai Shao, Zhi Han, Zicai Cui, Ziheng Zhang, Guangtao Zeng, Wenzheng Tang, Yikun Wang, Yuanjian Zhou, Zimian Peng, Yong Yu, Weiwen Liu, Hiroki Kobayashi, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) Singapore University of Technology and Design(新加坡科技设计大学) Queen’s University(女王大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出首个软件智能体生成基准SW-$A^2$-Bench,通过编码智能体自动将代码仓库转化为自主软件智能体,评估生成智能体的忠实性与互操作性,以扩展智能体网络规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04661 2026-08-07 cs.SE 版本更新 88%

An Exploratory Study of Agent Plans for Agentic AI Coding Tools in Open-Source Software

面向开源软件中智能体式AI编码工具的智能体计划探索性研究

Muhammad Auwal Abubakar, Seyedmoein Mohsenimofidi, Jai Lal Lulla, Jie M. Zhang, Christoph Treude, Sebastian Baltes, Matthias Galster

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);分类 cs.SE

AI总结 本文通过筛选36710个GitHub仓库识别出85个Markdown智能体计划文件,研究其支持的软件工程工作类型与提供的执行指导,明确其是研究人-智能体工作流任务意图的丰富工件。

Comments 14 pages, 2 figures, 4 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00594 2026-07-21 cs.AI 版本更新 88%

Agent psychometrics: Task-level performance prediction in agentic coding benchmarks

代理心理测量:在代理编码基准中的任务级性能预测

Chris Ge, Daria Kryvosheieva, Daniel Fried, Uzay Girit, Kaivalya Hariharan

机构 * Massachusetts Institute of Technology(麻省理工学院) Fulcrum Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06849 2026-08-13 cs.AI cs.CL 版本更新 88%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 软件智能体 :agent(title,summary_cn);分类 cs.AI、cs.CL

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17381 2026-06-29 econ.EM stat.ML 版本更新 88%

An Auditable AI Agent Loop for Empirical Economics: A Case Study in Forecast Combination

一个可审计的AI代理循环用于实证经济学:以预测组合为例

Minchul Shin

专题命中 软件智能体 :agent(title,abstract);AI agent(title);workflow(abstract)

AI总结 提出一个开源代理循环架构,结合搜索后留出评估,使实证规范搜索透明化,在预测组合案例中独立代理搜索找到优于原始研究基准的方法。

Comments 36 pages, no figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23169 2026-06-09 q-bio.QM 版本更新 87%

PRAXIS: Case-distilled and code-verified AI agents for biological research

PRAXIS:用于生物学研究的案例提炼与代码验证的AI智能体

Zhenyu Ma, Yuyang Song, Chunyi Yang, Jingyi Zhu, Limei Xu, Min Xiao, Xukai Jiang

专题命中 软件智能体 :AI agent(title);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 提出PRAXIS框架,通过文献学习和案例提炼将研究经验转化为结构化长期记忆,支持生物计算任务中的问题定义、对象验证、方法选择等,实验表明基于案例的学习提升了复杂生物研究任务的方法选择、错误抑制和工作流组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22256 2026-08-07 cs.SE cs.AI 版本更新 86%

Agentic Software Issue Resolution with Large Language Models: A Survey

基于大语言模型的代理软件问题解决:综述

Zhonghao Jiang, David Lo, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)

专题命中 软件智能体 :agentic(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 86%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 软件智能体 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03117 2026-07-07 cs.SE cs.AI 版本更新 86%

ARISE: A Repository-level Graph Representation and Toolset for Agentic Program Repair and Fault Localization

ARISE:面向智能体程序修复与故障定位的仓库级图表示及工具集

Shahd Seddik, Fahd Seddik, Amirrezza Esmaeili, Mahdieh Sadatbenis, Fatemeh Fard

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对现有图智能体缺乏过程内数据流建模的问题,提出多粒度程序图工具集ARISE,支持语句级数据流切片查询,大幅提升智能体故障定位与程序修复性能。

Comments v2: extended analysis, more experiments, additional authors added

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20412 2026-07-07 cs.SE cs.AI cs.OS 版本更新 86%

kAgent: An execution-guided crash resolution agent for the Linux kernel

kAgent:一种用于Linux内核的执行引导式崩溃修复代理

Alex Mathai, Chenxi Huang, Suwei Ma, Jihwan Kim, Hailie Mitchell, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Junfeng Yang, Baishakhi Ray

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Google Inc.(谷歌公司) Google DeepMind(谷歌DeepMind)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对Linux内核崩溃修复难题,以内核开发者修复方式为灵感构建kAgent及支持工具栈,通过检查日志等步骤修复崩溃,消融特性定量分析,评估显示其能有效修复多种崩溃。

Comments Accepted to ICML, 2026; in the Deep Learning for Code Workshop. This paper was previously circulated as "CrashFixer"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26963 2026-06-16 cs.OS cs.DC cs.LG cs.MA 版本更新 85%

MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems

MARS:面向异构智能体系统的高效自适应协同调度

Yifei Wang, Hancheng Ye, Yechen Xu, Cong Guo, Chiyue Wei, Qinsi Wang, Dongting Li, Tingjun Chen, Hai "Helen" Li, Danyang Zhuo, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 提出MARS协同调度系统,通过统一信息流全局协调GPU推理与CPU工具执行,解耦准入与执行防止资源过载,并采用智能体中心调度器最小化端到端延迟,实验显示延迟降低5.94倍。

Comments 14 pages, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14037 2026-07-17 cs.SE cs.AI cs.CY cs.LG 版本更新 85%

Early Adoption of Agentic Coding Tools by GitHub Projects

GitHub项目对智能编码工具的早期采用

Maliha Noushin Raida, Daqing Hou

机构 * Rochester Institute of Technology(罗切斯特技术学院)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究GitHub项目对智能编码工具的早期采用情况,通过分析大量智能PR,探究采用情况、项目生产力及协作模式,发现多数仓库采用少,小项目参与度高,生产力差异大,人机协作以单人监督为主,为相关管理提供实证依据。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15854 2026-08-04 cs.SE cs.AI 版本更新 84%

Agentic Synthesis against Counterexample-Supplemented Sketches

针对反例补充草图的智能合成

Muness Castle, Eric Rubeck

机构 * Independent(独立研究者)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对编码智能体修复失败示例易留隐患的问题,提出针对反例补充草图的智能合成方法,通过人类给出草图、智能体生成实现,依据反例修正并保留代码,经实验验证该方法能减少返工,承载审查策略。

Comments 32 pages, 5 displayed figures (4 distinct screenshots). Includes the CatSynth artifact supplement. Code and captured experiment artifacts: https://github.com/open-horizon-labs/counterexample-supplemented-sketches Clarifies the two-check CESS method and Developer change authority; adds the protocol-correct CatSynth rerun and replaces the prior withheld-case headline

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22917 2026-07-31 cs.AI cs.LG cs.MA 版本更新 84%

Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams

智能体团队工作区:面向长期存在的编码智能体团队的自动化持久工作区

Shouren Wang

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对Claude Code等大语言模型智能体在长期工作流程中存在的问题,提出ATWZ,通过围绕其原生智能体团队构建基于文件系统的操作层,保存智能体工作状态等,解决相关问题并减少提示编写工作量。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16617 2026-07-27 cs.SE cs.AI 版本更新 84%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03316 2026-07-24 cs.SE cs.AI 版本更新 84%

Is Agentic Code Review Helpful? Mining Developers' Feedback to CodeRabbit Reviews in the Wild

智能代码审查有用吗?挖掘开发者对CodeRabbit在实际应用中代码审查的反馈

Hong Yi Lin, Mingzhao Liang, Patanamon Thongtanunam, Kla Tantithamthavorn

机构 * The University of Melbourne(墨尔本大学) Monash University(莫纳什大学)

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 以CodeRabbit为例对智能代码审查进行实证研究,通过大量代码审查与开发者反馈数据,揭示其审查结果及被拒原因,还探索预测审查被拒的方法,指出改进空间与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21744 2026-07-22 cs.SE cs.AI q-bio.BM 版本更新 84%

Agentic AI-assisted coding offers a unique opportunity to instill epistemic grounding during software development

智能AI辅助编码为软件开发过程中注入认知基础提供了独特契机

Magnus Palmblad, Jared M. Ragland, Benjamin A. Neely

机构 * Center for Proteomics and Metabolomics, Leiden University Medical Center(蛋白质组学与代谢组学中心,莱顿大学医学中心) National Institute of Standards and Technology - Charleston(国家标准与技术研究院-查尔斯顿)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究以蛋白质组学为例,提出社区管理的领域范围认知基础文档用于智能AI辅助编码。核心方法是文档编码硬约束和约定参数。主要贡献是助力非领域专家生成优质代码等,增强各方信心并让领域专家参与定制软件开发。

Comments Letter, 12 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14563 2026-07-13 cs.SE cs.CL 版本更新 84%

Remember Your Trace: Memory-Guided Long-Horizon Agentic Framework for Consistent and Hierarchical Repository-Level Code Documentation

记住你的踪迹:一种基于记忆的长周期代理框架,用于一致且分层的仓库级代码文档

Suyoung Bae, Jaehoon Lee, Changkyu Choi, YunSeok Choi, Jee-Hyong Lee

机构 * Sungkyunkwan University(成均馆大学) University of Oslo(奥斯陆大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.SE

AI总结 MemDocAgent通过依赖感知遍历引导和记忆引导代理交互,生成统一上下文的仓库级代码文档,实现高效且一致的文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30560 2026-07-01 cs.LG cs.AI cs.PF 版本更新 84%

TraceLab: Characterizing Coding Agent Workloads for LLM Serving

TraceLab: 表征用于LLM服务的编码代理工作负载

Kan Zhu, Mathew Jacob, Chenxi Ma, Yi Pan, Stephanie Wang, Arvind Krishnamurthy, Baris Kasikci

机构 * University of Washington(华盛顿大学) Wuhan University of Technology(武汉理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 通过收集4300个编码代理会话(含35万LLM步骤和43万工具调用)的真实轨迹,分析发现长自主循环、长上下文短输出、多样化重尾工具调用及高但不完美前缀缓存命中率等特征,为优化服务提供具体方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06216 2026-06-25 cs.SE cs.AI 版本更新 84%

Agentic Software Engineering: Foundational Pillars and a Research Roadmap

代理软件工程:基础支柱与研究路线图

Ahmed E. Hassan, Hao Li, Dayi Lin, Bram Adams, Tse-Hsun Chen, Yutaro Kashiwa, Dong Qiu

机构 * Queen's University(女王大学) Concordia University(Concordia大学) Nara Institute of Science and Technology(奈ara科学和技术研究院) Huawei Canada(华为加拿大)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 提出代理软件工程(SE 3.0)时代,以“面向人类的SE”和“面向代理的SE”双重模式为基础,重新定义软件工程支柱,并设计代理命令环境(ACE)和代理执行环境(AEE)两种工作台,实现双向人机协作,推动从代理编码到真正代理软件工程的演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17548 2026-06-08 cs.SE cs.AI 版本更新 84%

Rethinking Code Review in the Age of AI: A Vision for Agentic Code Review

重新思考AI时代的代码审查:面向代理代码审查的愿景

Hüseyin Özgür Kamalı, Erdem Tuna, Vahid Haratian, Eray Tüzün

机构 * Microsoft(微软) Ankara University(安卡拉大学) Bilkent University(比尔肯特大学)

专题命中 软件智能体 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了在AI时代代码审查的演变,提出了一种结合专门代理和人类控制的质量闸门的AI驱动代码审查流程,旨在提升代码审查的效率和可靠性。

Comments Submitted to ACM Transactions on Software Engineering Methodology (TOSEM). A shorter version of this work has been presented at ICSE-JAWs 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14690 2026-07-02 cs.SE 版本更新 84%

Harness Engineering for Agentic AI Coding Tools: An Exploratory Study

配置代理AI编码工具:探索性研究

Matthias Galster, Seyedmoein Mohsenimofidi, Jai Lal Lulla, Muhammad Auwal Abubakar, Christoph Treude, Sebastian Baltes

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文探讨了代理AI编码工具的配置机制,分析了多种工具的配置方法,发现Context Files主导配置,并提出AGENTS.md作为通用标准。

Comments 10 pages, 7 figures, 3 tables, based on "Configuring Agentic AI Coding Tools: An Exploratory Study" published in Proceedings of the 3rd ACM/IEEE International Conference on AI-powered Software (AIware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09290 2026-08-12 cs.SE 版本更新 83%

OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review

OpenCodeReview:面向成本效益型智能体代码评审的非确定性转确定性方案

Zhengfeng Li, Lei Zhang, Xianwei Wu, Zhengqi Zhuang, Yingjie Xu, Boge Wang, Shaofei Zhu, Chuan Wang, Peng Zhao, Xinyu Zheng, Guoping Rong

专题命中 软件智能体 :agent(title,abstract);tool use(abstract);分类 cs.SE

AI总结 OpenCodeReview针对LLM代码评审智能体的非确定性与上下文局部性缺陷,通过在三个流水线节点注入确定性,在AACR-Bench上实现SEM-F1提升且大幅降低令牌消耗,性能优于主流编码智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27380 2026-08-11 cs.CV cs.AI 版本更新 83%

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法

Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

机构 * CUHK(香港中文大学) USTC(中国科学技术大学) SCUT(华南理工大学) HKU(香港大学) NTU(南洋理工大学) PKU(北京大学) SJTU(上海交通大学) CMU(卡内基梅隆大学) THU(清华大学) HUST(华中科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。

Comments 15 pages, 3 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26275 2026-08-05 cs.CL 版本更新 83%

SPEAR: Code-Augmented Agentic Prompt Optimization

SPEAR: 代码增强的智能体提示优化

Mengyin Lu, Cong Feng, Huimin Han, Guangming Lu, Yu Sun, Xiaonan Ding, Shihui Long, Fengyi Li, Tanvi Motwani

机构 * LinkedIn Corporation(领英公司)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 提出SPEAR方法,将代码执行作为智能体工具进行提示优化,通过Python沙箱实现结构错误分析,并在工业任务和基准测试中取得显著提升。

Comments 19 pages, 3 figures, EMNLP 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26563 2026-07-29 cs.SE 版本更新 83%

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

TrajAudit:智能体编码系统的自动化故障诊断

Minxing Wang, Xiaofei Xie, Yintong Huo

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09833 2026-07-28 cs.HC cs.AI cs.CY 版本更新 83%

CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks

CollabSkill: 评估真实世界任务中的人机协作

Yijia Shao, Zora Zhiruo Wang, Neel Ahuja, Yicheng Wang, Bowen Liu, Diyi Yang

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Rochester(罗切斯特大学) Individual Researcher(独立研究者)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 提出CollabSkill框架,通过配对真实工人与AI代理执行职业任务,利用贝叶斯技能评级系统量化人机贡献,揭示Claude Code排名第一且实践经验是协作技能的主要驱动力。

Comments 10 pages of main paper, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏