arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-21 至 2026-04-21 共收录 16 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 16 篇

2604.17464 2026-04-21 cs.SE cs.AI 86%

Project Prometheus: Bridging the Intent Gap in Agentic Program Repair via Reverse-Engineered Executable Specifications

普罗米修斯计划:通过反向工程可执行规范弥合代理程序修复中的意图差距

Yongchao Wang, Zhiqiu Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出普罗米修斯框架,通过规范推断而非代码生成解决代理程序修复中的意图差距问题,实现了93.97%的正确补丁率和74.4%的救援率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17288 2026-04-21 cs.AR cs.AI 83%

Clover: A Neural-Symbolic Agentic Harness with Stochastic Tree-of-Thoughts for Verified RTL Repair

Clover:一种基于随机树-of-thoughts的神经符号代理体系用于验证RTL修复

Zizhang Luo, Yansong Xu, Runlin Guo, Fan Cui, Kexing Zhou, Mile Xia, Hongyuan Hou, Yuhao Luo, Yun Liang

机构 * Peking University(北京大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 Clover通过结构化搜索代码操作解决RTL修复问题,结合LLM和符号求解器动态调度任务,实现高可靠性修复,修复率高达96.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19555 2026-04-21 cs.CR cs.AI 83%

SOK: A Taxonomy of Attack Vectors and Defense Strategies for Agentic Supply Chain Runtime

SOK:代理供应链运行时的攻击向量和防御策略分类

Xiaochong Jiang, Shiqi Yang, Wenting Yang, Yichen Liu, Cheng Ji

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文系统化了现有研究,提出统一的运行时框架,区分数据和工具供应链攻击,并识别出病毒代理循环现象,主张采用零信任运行时架构。

Comments Published at ICLR 2026 Workshop on AI for Mechanism Design and Strategic Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16520 2026-04-21 cs.HC 82%

AgentClick: A Skill-Based Human-in-the-Loop Review Layer for Terminal AI Agents

AgentClick: 一个基于技能的人机协作审查层用于终端AI代理

Haomin Zhuang, Hanwen Xing, Xiangliang Zhang

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract)

AI总结 AgentClick通过浏览器界面提供结构化交互,降低非专家用户与AI代理协作的门槛,提升效率和质量。

Comments Accepted to ACM CAIS 2026 System Demonstrations. Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16314 2026-04-21 cs.SE 79%

Software Self-Extension with SelfEvolve: an Agentic Architecture for Runtime Code Generation

软件自我扩展与SelfEvolve:一种用于运行时代码生成的代理架构

Md Asif Iqbal Fahim, Oluwadamilola Adebayo, Alessio Ferrari

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出SelfEvolve架构,通过自主生成和整合新功能实现运行时自我扩展,展示其在11个任务中达到92.7%的准确率,优于现有基线方法。

Comments 6 pages, 1 figure, accepted at 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems, April 13--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16584 2026-04-21 cs.SE cs.AI cs.PL 79%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 软件智能体 :agentic(abstract,abstract_cn);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16021 2026-04-21 cs.SE cs.AI 73%

Neurosymbolic Repo-level Code Localization

神经符号层面的代码定位

Xiufeng Xu, Xiufeng Wu, Zejun Zhang, Yi Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出KA-LCL问题,引入KA-LogicQuery基准测试,展示现有方法在无命名提示下的性能下降,提出LogicLoc框架结合LLM和Datalog实现精确代码定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17364 2026-04-21 cs.AI cs.MA cs.PL 70%

LLM-Guided Strategy Synthesis for Scalable Equality Saturation

基于大型语言模型的策略合成用于可扩展的等式饱和

Chenyun Yin, Youwei Xiao, Yuze Luo, Yuyang Zou, Yun Liang

机构 * Peking University(北京大学) School of Integrated Circuits(集成电路学院)

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出EggMind框架,通过领域特定语言EqSatL和LLM引导的代理工作流,高效合成可重用的等式饱和策略,提升资源质量平衡,减少成本和内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17795 2026-04-21 cs.CL cs.AI cs.LG cs.MA cs.SE 70%

What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations

什么使AI研究可重复?可执行知识图谱作为科学知识表示

Yujie Luo, Zhuoyun Yu, Xuehai Wang, Yuqi Zhu, Ningyu Zhang, Lanning Wei, Lun Du, Da Zheng, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出可执行知识图谱(xKG),通过整合文献中的代码片段和技术洞察,提升AI研究的可重复性,实验显示其在PaperBench上性能提升显著。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 62%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15220 2026-04-21 cs.CL 57%

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

隐私崩溃:良性微调可能在语言模型中破坏上下文隐私

Anmol Goel, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) TU Darmstadt(图腾达姆斯塔特大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) University of Tübingen(图宾根大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 研究发现语言模型在良性微调过程中可能因训练数据中的细微模式导致上下文隐私崩溃,揭示了当前安全评估在专用代理部署中的关键缺口。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07591 2026-04-21 cs.CL 57%

Creating ConLangs to Probe the Metalinguistic Grammatical Knowledge of LLMs

创建ConLangs以探测LLMs的元语言语法知识

Chihiro Taguchi, Richard Sproat

机构 * University of Notre Dame(诺特达美大学) Sakana AI(萨卡纳人工智能) Notre Dame, IN, USA(印第安纳州诺特达美) Tokyo, Japan(日本东京)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 本文提出IASC系统,通过LLMs生成构造语言,探讨LLMs对语言和语言学概念的理解能力,实验显示不同LLM和语言规范在形态语法能力上有显著差异。

Comments 53 pages, 18 tables, 3 figures. Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17092 2026-04-21 cs.SE 57%

AI Observability for Developer Productivity Tools: Bridging Cost Awareness and Code Quality

AI可观性用于开发者生产力工具:弥合成本意识与代码质量

Happy Bhati, Twinkll Sisodia

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出一种统一的AI可观性方法,通过实时跟踪token、配置模型定价库、响应验证和成本分析,构建单一仪表板,提升开发者生产力工具的成本与代码质量理解。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16736 2026-04-21 cs.AI 57%

When Agents Go Quiet: Output Generation Capacity and Format-Cost Separation for LLM Document Synthesis

当代理变得沉默:LLM文档合成中的输出生成能力与格式-成本分离

Justice Owusu Agyemang, Michael Agyare, Miriam Kobbinah, Nathaniel Agbugblah, Prosper Addo

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科诺斯大学) GCTU, Ghana(加纳格茨大学) NCA, Ghana(加纳国家计算机学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出OGC衡量输出生成能力,证明格式-成本分离定理,并提出自适应策略选择框架,通过实验验证理论,减少生成token并消除输出停滞问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16336 2026-04-21 cs.HC cs.AI cs.MA 57%

Distributed Human Identity: AI-Enabled Multi-Existence Through Cognitive Replication and Robotic Embodiments

分布式人类身份:通过认知复制和机器人躯体实现的AI赋能多存在

A S M Touhidul Islam, John Tookey

机构 * Faculty of Design and Creative Technologies, Auckland University of Technology(设计与创意技术学院,奥克兰技术大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本文提出多存在身份框架,通过认知、行为和情感属性的复制,实现AI赋能的多场景存在,突破传统物理躯体限制,提升身份一致性与文化相关性,探讨其在专业、教育、医疗等领域的应用与伦理挑战。

Comments 30 pages, 1 figure, 4 tables. cs.AI under Computer Science category

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24647 2026-04-21 cs.LG stat.ML 57%

Can LLMs Beat Classical Hyperparameter Optimization Algorithms? A Study on autoresearch

LLMs能否超越经典超参数优化算法?对autoresearch的研究

Fabio Ferreira, Lucca Wobbe, Arjun Krishnakumar, Frank Hutter, Arber Zela

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Freiburg(弗赖堡大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Prior Labs(Prior实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文通过autoresearch平台比较经典HPO算法与LLM方法在优化小型语言模型超参数时的表现,发现经典方法在避免内存故障方面更优,而LLM在代码编辑能力上有所提升,但未完全超越经典方法,提出Centaur混合方法结合经典算法和LLM优势,取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏