arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3217 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3217 篇

2602.10085 2026-05-22 cs.AI 57%

CODE-SHARP: Continuous Open-ended Discovery and Evolution of Skills as Hierarchical Reward Programs

CODE-SHARP: 连续开放发现和演化的技能作为层次奖励程序

Richard Bornemann, Pierluigi Vito Amadori, Antoine Cully

机构 * Imperial College London(帝国理工学院伦敦分校) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出CODE-SHARP框架,通过基础模型自主发现和演化技能作为层次奖励程序,实现通用智能体政策的从零开始强化学习,无需预定义奖励,有效学习长周期技能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21810 2026-05-22 cs.AI cs.MA 57%

Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents

Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理

Zijian Du, Nathaniel Pinckney

机构 * NVIDIA

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21497 2026-05-22 cs.CR cs.AI 57%

Autonomous LLM Agents & CTFs: A Second Look

自主大语言模型代理与CTF:再看一次

Youness Bouchari, Matteo Boffa, Marco Mellia, Idilio Drago, Thanh Minh Bui, Dario Rossi

机构 * Politecnico di Torino(托尔托纳理工大学) Università di Torino(托尔托纳大学) Huawei Technologies France(华为法国技术)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文重新审视了大语言模型代理在自动化进攻性安全任务中的表现,通过在30个基于网络的CTF挑战中测试不同架构的代理,发现通用代理在性能上与定制架构相当,并揭示了当前代理在某些类别中的持续障碍。

Comments Accepted at DeMeSSAI Workshop @ IEEE EuroS&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14594 2026-05-20 cs.CL 57%

The Wikidata Query Logs Dataset

Wikidata查询日志数据集

Sebastian Walter, Hannah Bast

机构 * University of Freiburg(弗赖堡大学) University of Freiburg Department of Computer Science(弗赖堡大学计算机科学系)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出了一个包含335,000个问题-查询对的Wikidata查询日志(WDQL)数据集,该数据集通过真实世界中的SPARQL查询构建,无需模板生成查询,且规模是现有类似数据集的11倍多。通过代理方法去匿名化、清理和验证查询,生成对应的自然语言问题,用于训练问答方法。

Comments Accepted for publication at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19369 2026-05-20 cs.SE 57%

When to Answer and When to Defer: A Decision Framework for Reliable Code Predictions

何时回答,何时延迟:一种可靠代码预测的决策框架

Ravishka Rathnasuriya, Wei Yang

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出了一种决策框架,用于在代码预测中可靠地判断何时回答何时延迟,通过整合不确定性估计、模型校准和工具基于的延迟处理,提高代码模型的可靠性。

Comments In Proceedings of the 48th IEEE/ACM International Conference on Software Engineering- New Idea and Emerging Results Track (ICSE-NIER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19102 2026-05-20 cs.SE 57%

Prompt Optimization for LLM Code Generation via Reinforcement Learning

通过强化学习优化LLM代码生成的提示

Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. Ajila

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17926 2026-05-19 cs.SE 57%

LLM-Based Static Verification of Code Against Natural-Language Requirements: An Industrial Experience Report

基于大语言模型的代码对自然语言要求的静态验证:一项工业经验报告

Zhi Quan Zhou, Dave Towey, Tsong Yueh Chen

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出一种基于大语言模型的两阶段工作流,用于在智能汽车网络安全案例中验证代码是否符合自然语言要求,通过引入结构化中间表示减少幻觉和输出变异,提升静态分析的准确性与解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17907 2026-05-19 cs.CV cs.AI 57%

One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译

Yang Li, Weize Li, Quan Yuan, Congzhang Shao, Guiyang Luo, Yunqi Ba, Xuanhan Zhu, Xinyuan Ding, Xiaoyuan Fu, Jinglin Li

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。

Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22151 2026-05-18 cs.CV cs.CL 57%

MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models

MultiMat: 多模态程序合成用于基于过程的材料生成

Jonas Belouadi, Tamy Boubekeur, Adrien Kaiser

机构 * University of Mannheim(曼海姆大学) Adobe Research(Adobe研究)

专题命中 软件智能体 :workflow(abstract);分类 cs.CL

AI总结 MultiMat利用大规模多模态模型实现多模态程序合成,提升生成过程材料图的效率与视觉质量,优于纯文本基线方法。

Comments Accepted at ICLR 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15669 2026-05-18 cs.LG 57%

Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

Rule2DRC:用于DRC脚本合成的LLM代理基准测试

Jinuk Kim, Junsoo Byun, Donghwi Hwang, Seong-Jin Park, Hyun Oh Song

机构 * Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系) Neural Processing Research Center(神经处理研究所以) Samsung Electronics Co., Ltd(三星电子公司)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 Rule2DRC是一个大规模基准,用于评估DRC脚本生成代理,包含1000个规则到脚本任务和13921个用于执行评分的评估芯片布局。它提供了一种通过DRC执行结果衡量功能正确性的评估流程,并引入SplitTester生成区分性测试用例以提升Best-of-N选择性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15601 2026-05-18 cs.SE quant-ph 57%

Bayesian Sequential Verification for Budget-Aware Quantum Program Testing

基于预算的量子程序测试的贝叶斯顺序验证

Lei Zhang

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出一种基于预算的量子程序测试方法,通过贝叶斯假设检验流程减少测量成本,适用于高成功概率的量子程序。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14859 2026-05-18 cs.CR cs.AI 57%

Do Coding Agents Understand Least-Privilege Authorization?

编码代理是否理解最小特权授权?

Zheng Yan, Jingxiang Weng, Charles Chen, Dengyun Peng, Ethan Qin, Jiannan Guan, Jinhao Liu, Qiming Yu, Yixin Yuan, Fanqing Meng, Carl Che, Mengkang Hu

机构 * Evolvent AI Research Team(Evolvent AI研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究编码代理是否能自主推断最小特权授权边界,提出Sufficiency-Tightness Decomposition方法,提升敏感任务成功率并降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01089 2026-05-18 cs.AI 57%

CodeDistiller: Automatically Generating Code Libraries for Scientific Coding Agents

CodeDistiller:自动为科学编码代理生成代码库

Peter Jansen, Samiah Hassan, Pragnya Narasimha

机构 * University of Arizona(亚利桑那大学) Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 CodeDistiller通过自动提炼科学GitHub仓库代码,生成经过验证的领域特定代码库,提升科学发现系统实验的准确性与完整性。

Comments 8 pages, 3 figures, 3 tables. Accepted to ACL 2026 (Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21104 2026-05-15 cs.LG cs.PL 57%

BRIDGE: Building Representations In Domain Guided Program Synthesis

BRIDGE: 在领域引导的程序合成中构建表示

Robert Joseph George, Carson Eisenach, Udaya Ghai, Dominique Perrault-Joncas, Anima Anandkumar, Dean Foster

机构 * California Institute of Technology(加州理工学院) Amazon(亚马逊)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 BRIDGE通过多艺术ifacts程序合成框架提升Lean验证正确性,结合代码、规范和定理证明领域,提高生成效率和正确率。

Comments 41 pages, 10 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11186 2026-05-15 cs.MA cs.AI math.OC 57%

Sequential Resource Trading Using Comparison-Based Gradient Estimation

基于比较的梯度估计的顺序资源交易

Surya Murthy, Mustafa O. Karabag, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文研究了两个贪心理性代理在有限资源类别中进行顺序多议题交易的问题,提出基于比较的算法通过接受/拒绝反馈估计对方梯度,确保交易互惠并最终收敛到帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13740 2026-05-14 cs.LG 57%

Learning POMDP World Models from Observations with Language-Model Priors

从观测中学习POMDP世界模型:利用语言模型先验

Valentin Six, Frederik Panse, Mathis Fajeau, Lancelot Da Costa, Mridul Sharma, Alfonso Amayuelas, Tim Z. Xiao, David Hyland, Philipp Hennig, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) IRIIS University of California, Santa Barbara(加州大学圣芭芭拉分校) University of Tübingen(图宾根大学) University of Oxford(牛津大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出Pinductor,利用语言模型先验从少量观测-动作轨迹学习POMDP模型,实现高效世界模型学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13139 2026-05-14 cs.SE 57%

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle

SWE-Cycle:在完整问题解决周期中对齐代码代理的基准测试

Hao Guan, Lingyue Fu, Shao Zhang, Yaoming Zhu, Kangning Zhang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zhang, Yong Yu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出SWE-Cycle基准测试,评估代码代理在环境重建、代码实现和测试生成等任务中的能力,揭示了在端到端任务中处理跨阶段依赖和保持代码质量的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 57%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08017 2026-05-14 cs.SE 57%

Collaborator or Assistant? How AI Coding Agents Partition Work Across Pull Request Lifecycles

合作者还是助手?AI编码代理如何在拉取请求生命周期中分配工作

Young Jo, Chung, Safwat Hassan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究AI编码代理在拉取请求生命周期中如何分配工作,通过分析工具的协作-助手光谱,探讨操作权与合并治理的分离,提出分类学、状态机和可重复实验包。

Comments 10 pages, 8 figures, AIWare 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12366 2026-05-13 cs.AI 57%

Classifier Context Rot: Monitor Performance Degrades with Context Length

分类器上下文旋转:通过上下文长度监控性能退化

Sam Martin, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic fellows项目)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12275 2026-05-13 cs.SE cs.PL 57%

Minimalistic Terminal Editor for Julia Programming -- MinTEJ: A Friendly Approach for a Scientific Programmer

为Julia编程语言设计的极简终端编辑器--MinTEJ:面向科学程序员的友好方法

Poornachandratejasvi Laxman Bhattar, Payal V. Dahiwale, Krishnarjunulu Thota, Anurag Sharma

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出MinTEJ,一种基于终端的Julia编辑器,采用顺序模式交互架构,整合文件管理、代码编辑、执行和调试,降低认知负荷和错误率。

Comments 15 Pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI 57%

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10500 2026-05-12 cs.AI 57%

SkillEvolver: Skill Learning as a Meta-Skill

SkillEvolver: 技能学习作为元技能

Genrui Zhang, Erle Zhu, Jinfeng Zhou, Caiyan Jia, Hongning Wang

机构 * Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 SkillEvolver通过元技能迭代生成、部署和优化领域特定技能,无需重新训练即可直接应用于任何智能体,其学习目标是技能的文本和代码而非模型权重,通过元技能自身作为技能加载,提升技能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07237 2026-05-12 cs.CL 57%

Teaching Language Models to Think in Code

教语言模型用代码思考

Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN科技)

专题命中 软件智能体 :planning(abstract);分类 cs.CL

AI总结 本文提出ThinC框架,通过代码自身进行推理而非依赖自然语言,提升了数学问题解决能力,其在多个基准测试中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08621 2026-05-12 cs.SE 57%

EvidenT: An Evidence-Preserving Framework for Iterative System-Level Package Repair

EvidenT: 一个证据保留的系统级包修复框架

Chenyu Zhao, Minghua Ma, Shenglin Zhang, Zeshun Huang, Yongqian Sun, Chetan Bansal, Saravan Rajmohan, Dan Pei

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出EvidenT框架,通过证据管理与工具执行解耦,解决系统级包修复中的依赖和环境配置问题,实验显示其在RISC-V包修复中表现优异,且在不同架构上具有良好的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02175 2026-05-12 cs.AI 57%

Intervention Complexity as a Canonical Reward and a Measure of Intelligence

干预复杂性作为规范奖励和智能的度量

Brendan McCane

机构 * School of Computing University of Otago(计算学院奥塔哥大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出干预复杂性作为智能的规范度量,具有环境衍生性、普遍性、最小性、敏感性和成就偏好等性质,通过资源函数定义通用奖励,并探讨智能的双维度表征及计算可性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08382 2026-05-12 cs.CR cs.CL cs.CY 57%

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07769 2026-05-11 cs.SE 57%

Coding Agents Don't Know When to Act

编码代理不知何时行动

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究发现当前编码代理在处理过时bug报告时频繁错误修改代码,提出需显式引导无行动以避免技术债务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06125 2026-05-08 cs.SE 57%

Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution

打破、过时或缺失?基于项目级测试演变的基准测试

Ye Shang, Quanjun Zhang, Haichuan Hu, Chunrong Fang, Liang Xiao, Zhenyu Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出TEBenchmark,首个项目级测试演变基准,评估系统自主识别需修改的测试、确定新测试需求并生成测试补丁的能力,揭示测试演变任务的性能上限。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05980 2026-05-08 cs.AI 57%

TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering

TACT: 通过激活引导缓解编码代理中的过度思考与过度行动

Yuan Sui, Yulin Chen, Yibo Li, Xue Jiang, Yufei He, Yihong Dong, Xiaoxin He, Tianyu Gao, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Meta

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出TACT方法,通过激活引导检测并缓解编码代理中的过度思考和过度行动问题,提升任务解决效率和准确性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏