arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-10 至 2026-07-10 共收录 8 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 8 篇

2607.08043 2026-07-10 cs.SE cs.AI 新提交 84%

Aleena: Alignment Agent for Research Software Engineering Collaborations

Aleena:用于研究软件工程协作的对齐代理

Kshitij Dani, Cordero Core, Landung Setiawan, Carlos Garcia Jurado Suarez, Anshul Tambay, Vani Mandava, Anant Mittal

机构 * eScience Institute(eScience研究院) University of Washington(华盛顿大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract,comments);分类 cs.AI、cs.SE

AI总结 研究软件协作中决策易失依据致相关人员心智模型不同,提出智能AI可支持对齐与跟踪。介绍开源的Aleena,以GitHub为协作平台,转化交互为结构化记录,揭示风险等,还阐述其动机、设计、原型及场景。

Comments 8 pages, 5 figures. AgenticSE @ KDD '26: Agentic Software Engineering (SE 3.0): The Rise of AI Teammates, KDD 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08691 2026-07-10 cs.SE cs.AI cs.IR 新提交 73%

ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation

ProjAgent:用于仓库级代码生成的过程相似性检索

QiHong Chen, Aaron Imani, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学伊文斯分校)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究仓库级代码生成问题,提出ProjAgent系统,将目标函数分解为中间推理步骤,通过代理工作流程检索相似过程行为的函数,结合语义检索构建丰富上下文,并利用静态分析反馈循环修复代码,实验表明该方法有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07744 2026-07-10 cs.SE 新提交 70%

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization

PERFOPT-Bench:评估软件性能优化中的编码代理

Yingyun Cui, Yi Xie, Piaohong Wang, Jiawei Ma, Bo Liu, Liangliang Cao

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 该研究介绍PERFOPT-Bench基准,用于评估软件性能优化中编码代理的完整性能工程循环。通过7个长期任务评估7个不同的代理堆栈,发现优化性能取决于工作负载,原始加速作基准分数不安全,还提出中继试验可恢复额外空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08028 2026-07-10 cs.AI cs.CL cs.SE 新提交 69%

From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

从提示到契约:用于可审计企业大语言模型代理的 harness 工程

Joongho Ahn, Moonsoo Kim

机构 * AI Leadership Research Center(人工智能领导力研究中心)

专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI、cs.CL、cs.SE

AI总结 研究针对企业大语言模型应用从原型到产品化的需求,提出 harness 工程方法,在韩国企业数据切片上实例化并评估三个问题,包括契约保留、模型替换检查及代码执行效果,形成可将原型转为可审计应用的工程模式。

Comments 32 pages, 6 figures, 16 tables. Reference implementation and evaluation artifacts: https://github.com/hammerbaki/enterprise-llm-agent-harness (archived at https://doi.org/10.5281/zenodo.21269426)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07980 2026-07-10 cs.SE cs.AI 新提交 62%

3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse

人工智能时代关于代码审查的3100种观点:从从业者话语中构建因果理论

Shyam Agarwal, Courtney Miller, Christian Kästner, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究人工智能对代码审查的影响,通过收集从业者话语构建因果模型,明确审查是控制点,团队决定编码代理对软件影响,转化相关命题,还提供LLM辅助灰色文献理论构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07946 2026-07-10 cs.SE cs.LG 新提交 62%

DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks

DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体

Wenqi Huang, Charley Lee, Leonard Tng, Serena Ge

机构 * Datacurve

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。

Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08182 2026-07-10 cs.CV cs.AI 新提交 57%

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07882 2026-07-10 cs.SE 新提交 57%

Bug Report Specification Refinement with Trajectory Guidance for Automated Program Repair

基于轨迹引导的自动程序修复的错误报告规范细化

S M Farah Al Fahim, Md Nakhla Rafi, Md Ahasanuzzaman, Zeyang Ma, Dong Jae Kim, Shaowei Wang, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究针对自动程序修复中错误报告规范不完善的问题,提出TrajSpec方法,通过轨迹引导收集证据并组织成三级表示,经审查生成细化报告,实验表明该方法能有效提高修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏