arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 462 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 462 篇

2606.26978 2026-06-26 cs.SE 新提交 57%

To Run or Not to Run: Analyzing the Cost-Effectiveness of Code Execution in LLM-Based Program Repair

运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益

Zhihao Lin, Junhua Zhu, Mingyi Zhou, Xin Wang, Zhensu Sun, Renyu Yang, David Lo, Li Li

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 通过分析SWE-bench上的代理轨迹和端到端修复尝试,发现代码执行在LLM程序修复中普遍使用但效益不均,限制执行可节省成本且不影响修复成功率。

Comments Accepted to the ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026). 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26578 2026-06-26 cs.AI 新提交 57%

EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling

EvoOptiGraph:基于图结构生成的弱点驱动协同进化优化建模

Qingcan Kang, Mingyang Liu, Xiaojin Fu, Shixiong Kai, Tao Zhong, Mingxuan Yuan

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 提出EvoOptiGraph框架,通过图结构表示混合整数线性规划并应用进化算子生成多样实例,结合监督微调和强化学习实现数据与模型的协同进化,显著提升优化建模的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26094 2026-06-25 cs.LG 新提交 57%

RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments

RevengeBench: 从行为实验中逆向工程代码空间策略

Babak Rahmani, Sebastian Dziadzio, Joschka Strüber, Sergio Hernández-Gutiérrez, Matthias Bethge

机构 * Tübingen AI Center(图宾根人工智能中心)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 提出RevengeBench基准,通过行为轨迹和可控实验逆向工程LLM生成的策略代码,验证恢复质量在34-72%之间,并能提升下游对战胜率。

Comments 12 pages, 5 figures, 22 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25879 2026-06-25 cs.DC cs.AI 新提交 57%

AI-Assisted Computational Reproducibility on the FABRIC Testbed

AI辅助计算可复现性在FABRIC试验台上的研究

Komal Thareja, Paul Ruth, Berent Aldikacti, Michael Zink

机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 利用FABRIC试验台和LLM编码助手LoomAI,通过三个跨领域案例研究,展示了AI辅助工作流将复现实验的工作量减少约4-6倍,但在分析阶段仍需人工指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25550 2026-06-25 cs.SE 新提交 57%

On the Viability of Requirements Generation From Code: An Experience Report

从代码生成需求的可行性:经验报告

Alexander Korn, Jone Bartel, Max Unterbusch, Andreas Vogelsang

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文通过实验评估基于LLM和RAG的代理方法从源代码生成需求,发现LLM无法可靠生成未实现需求、高质量需求或引入需求气味,且单一人工难以检测气味,表明该方法尚不可行。

Comments Accepted for publication at the 13th International Workshop on Artificial Intelligence and Requirements Engineering (AIRE'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25195 2026-06-25 cs.CR cs.AI 新提交 57%

SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward

SoK:AI安全代码生成:进展、陷阱与前进之路

Rupam Patir, Keyan Guo, Haipeng Cai, Hongxin Hu

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24834 2026-06-24 cs.AI 新提交 57%

Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

多轮LLM对话中NFR评估的准确性与满意度

Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal, Collin McMillan, Sepideh Ghanavati

机构 * University of Maine(缅因大学) University of Notre Dame(圣母大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。

Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24026 2026-06-24 cs.AI 新提交 57%

Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

语言模型代理能否成为机械可解释性中有用的电路解释器?

Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao

机构 * George Mason University(乔治梅森大学) The Ohio State University(俄亥俄州立大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 研究语言模型代理在机械可解释性中自动解释已定位电路的能力,提出HyVE方法,通过迭代观察、假设生成和因果验证生成组件级解释,实验表明代理有潜力但可靠验证仍是关键障碍。

Comments 23 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23752 2026-06-24 cs.SE 新提交 57%

ESAA-Conversational: An Event-Sourced Memory Layer for Continuity, Handoff, and Curation Across Heterogeneous LLM Coding Agents

ESAA-Conversational:一种用于异构LLM编码智能体之间连续性、交接和策管的事件溯源记忆层

Elzo Brito dos Santos Filho

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 提出ESAA-Conversational架构,通过事件溯源实现跨多个LLM编码智能体的共享会话记忆,解决会话状态漂移问题,支持连续性、交接和策管。

Comments 11 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23403 2026-06-23 cs.AI 新提交 57%

Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

Litmus: 零标注、代码驱动的AI系统评估指标规范

Prajjwal Gupta, Prasang Gupta, Vishal Bhutani, Apoorva Sharma, Sumanth Chundru, Waqar Sarguroh, Kevin Paul

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 提出Litmus系统,通过分析源代码自动生成评估指标,无需人工标注,在三个真实AI流水线上优于基线方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23321 2026-06-23 cs.CL 新提交 57%

Tmax: A simple recipe for terminal agents

Tmax: 终端智能体的简单配方

Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

机构 * Allen Institute for AI(人工智能研究院) University of Washington(华盛顿大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 提出Tmax配方,通过新颖分类法生成数据并结合结果奖励的强化学习,在9B参数下达到27%的Terminal-Bench 2.0性能,超越先前更大模型。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22704 2026-06-23 cs.CR cs.SE 新提交 57%

VeriPort: Automated and Verified Patch Backporting at Scale

VeriPort: 自动化且经过验证的大规模补丁回溯

Jonah Ghebremichael, Wenxin Jiang, Mikola Lysenko, Benjamin Barslev Nielsen, William Enck, Alexandros Kapravelos

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 提出VeriPort系统,自动化将安全补丁回溯到受影响的所有版本,并通过证据链验证补丁有效性和功能保留,在BackportBench上达到95.3%成功率,比现有方案高22.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20173 2026-06-19 cs.SE 新提交 57%

Qiskit Code Migration with LLMs

使用大语言模型进行Qiskit代码迁移

Jose Manuel Suarez, Luis Mariano Bibbo, Joaquin Bogado, Alenandro Fernandez

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 针对量子软件开发套件版本演进导致的代码维护问题,提出结合大语言模型与检索增强生成(RAG)的混合方法,利用自动生成的迁移场景分类体系引导模型,实现Qiskit代码跨版本自动迁移,有效减少幻觉并提升迁移建议质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20158 2026-06-19 cs.SE 新提交 57%

N-Version Programming with Coding Agents

使用编码代理的N版本编程

Javier Ron, Benoit Baudry, Martin Monperrus

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文在当代AI编码代理背景下重新审视N版本编程,通过Knight-Leveson实验评估代理系统、模型和实现语言的多样性对故障模式的影响,发现常见模式故障,但多数投票三版本单元显著降低故障数,证明该策略的工程实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19644 2026-06-19 cs.SE 新提交 57%

Prompt Quality and Pull Request Outcomes: A Stage-Based Empirical Study of LLM-Assisted Development

提示质量与拉取请求结果:基于阶段的LLM辅助开发实证研究

Richard Sserunjogi, Daniel Ogenrwot, John Businge

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 通过分析265个开发者与ChatGPT的交互,研究提示结构(上下文、具体性、验证)对LLM辅助开发中代码生成、采纳和集成深度的影响,发现不同维度在不同阶段有不同作用。

Comments 48 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19319 2026-06-18 cs.MA cs.AI cs.DB 新提交 57%

Data Intelligence Agents: Interpreting, Modeling, and Querying Enterprise Data via Autonomous Coding Agents

数据智能代理:通过自主编码代理解释、建模和查询企业数据

Anoushka Vyas, Aarushi Dhanuka, Sina Khoshfetrat Pakazad, Henrik Ohlsson

机构 * C3 AI

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 提出Data Intelligence Agents (DIA)系统,由三个自主编码代理组成,通过执行、验证和修复工件来压缩数据集成工作流,在七个SQL基准测试中达到或超越最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16769 2026-06-16 cs.AI 新提交 57%

Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

Skill-to-LoRA:从使用技能到学习行为以实现令牌高效的LLM智能体

Tianyi Zhang, Zhonghao Qi

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出Skill-to-LoRA方法,将技能文本转换为LoRA适配器,替代运行时注入技能文档,在SWE-Skills-Bench上提升通过率并降低令牌成本。

Comments Preprint. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16545 2026-06-16 cs.CL 新提交 57%

Can LLM Coding Agents Reason About Time Series?

LLM 编码智能体能否推理时间序列?

Filip Rechtorík, Ondřej Dušek, Zdeněk Kasner

机构 * Institute of Formal and Applied Linguistics, Faculty of Mathematics and Physics, Charles University(查尔斯大学数学与物理学院形式与应用语言学研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 研究 LLM 编码智能体在时间序列分析中的能力,发现代码访问可提升性能达 10%,但仍有 22-34% 错误,并分析了推理差距。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16540 2026-06-16 q-bio.QM cs.LG q-bio.BM q-bio.GN 新提交 57%

MultiMolecule: a modular ecosystem for biomolecular sequence-model workflows

MultiMolecule: 一个用于生物分子序列模型工作流的模块化生态系统

Zhiyuan Chen

机构 * DanLing Team(丹 Ling 团队)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 提出MultiMolecule开源生态系统,通过标准化接口整合RNA、DNA和蛋白质序列模型,提供53个模型族实现、112个检查点和16个数据集资源,支持模型复用、评估和生物预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15349 2026-06-16 cs.CY cs.AI 新提交 57%

LearnOpt: Recovering the Latent Cognitive Structure of Standardized Examinations via Knowledge Graphs and Constrained Optimization

LearnOpt: 通过知识图谱和约束优化恢复标准化考试的潜在认知结构

Joy Bose, Om Thomas

机构 * Independent Researchers(独立研究者)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 提出LearnOpt框架,利用知识图谱和约束优化从历史试题中恢复潜在认知结构,生成个性化学习计划;在NEET和JEE Advanced考试数据上验证了潜在结构的稳定性和可检测的转变。

Comments 26 pages, 2 figures, 6 tables. Code, data, and calibration tooling: https://github.com/joyboseroy/learnopt. Datasets on HuggingFace: joyboseroy/neet-skill-tags-2016-2024, joyboseroy/jee-advanced-skill-tags-2016-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15348 2026-06-16 q-bio.NC cs.AI 新提交 57%

Intrinsic Computational Functionalism and Simulated Consciousness

内在计算功能主义与模拟意识

Ryota Kanai, Shuqin Ma

机构 * Araya Inc.(Araya公司) School of Philosophy, Fudan University(复旦大学哲学学院) Sussex Centre for Consciousness Science, University of Sussex(Sussex大学意识科学中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文从内在计算功能主义出发,提出机制丰富的规范结构,论证若意识是计算构成的,则任何满足内在因果-计算实现关系的系统(生物、人工或模拟)都实现相同的意识相关属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13392 2026-06-15 cs.AI 新提交 57%

MiniMax Sparse Attention

MiniMax 稀疏注意力

Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Jinkai Hu, Jiayao Li, Rui Gao, Zekun Li, Songquan Zhu, Jingkai Zhou, Pengyu Zhao

机构 * MiniMax Peking University(北京大学) NVIDIA(英伟达) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12329 2026-06-11 cs.AI 新提交 57%

PROJECTMEM: A Local-First, Event-Sourced Memory and Judgment Layer for AI Coding Agents

PROJECTMEM:面向AI编码代理的本地优先、事件溯源记忆与判断层

Ripon Chandra Malo, Tong Qiu

机构 * University of Utah(犹他大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出PROJECTMEM,一种本地优先、事件溯源的记忆与判断层,通过记录事件日志并生成紧凑摘要,帮助AI编码代理避免重复错误,实现记忆即治理。

Comments 12 pages, 5 figures, 1 table. Code: https://github.com/riponcm/projectmem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11476 2026-06-11 cs.SE 新提交 57%

SentTrack: Sentiment-Driven Bottleneck Detection in GitHub Issue Repositories

SentTrack: GitHub问题仓库中情感驱动的瓶颈检测

Xinyu Hu, Ali Behbahani, Daniel Moon, Yaren Dogan, Nasir U. Eisty

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 提出SentTrack双管道框架,结合大语言模型摘要与ABCDE交互分类,从约9000个GitHub问题线程中检测社会技术瓶颈,发现49%线程停滞,仅13%解决,并通过加权评分引擎优先处理高摩擦讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11447 2026-06-11 cs.CL 新提交 57%

AI Coding Agents Can Reproduce Social Science Findings

AI编码智能体能够复现社会科学研究结果

Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi, Atoosa Kasirzadeh, Joshua Tucker

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本研究构建SocSci-Repro-Bench基准测试,评估Claude Code和Codex两个前沿编码智能体在221项社会科学任务中的复现能力,发现它们能复现大部分结果,且Claude Code表现更优,同时提示框架会影响确认性规范搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11416 2026-06-11 cs.CR cs.AI 新提交 57%

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁

Yukuan Zhang, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11356 2026-06-11 physics.ao-ph cs.DC cs.SE physics.comp-ph 新提交 57%

An Ocean Model Ported by a Large Language Model: Experience and Lessons from FESOM2 (Fortran to C to C++/Kokkos)

大型语言模型移植海洋模型:FESOM2(Fortran到C再到C++/Kokkos)的经验与教训

Nikolay V. Koldunov, Suvarchal K. Cheedela, Sergey Danilov, Dmitry Sidorenko, Sebastian Beyer, Thomas Jung

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文展示利用LLM将FESOM2海洋模型从Fortran移植到C再到C++/Kokkos,通过两阶段翻译、严格字面转换和逐级验证,在数周内保持物理准确性并实现GPU加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10933 2026-06-10 cs.AI 新提交 57%

Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming Languages

前沿编码代理使用元编程适应不熟悉的编程语言

Aman Sharma, Sushrut Thorat, Paras Chopra

机构 * Lossfunk

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 研究评估LLM编码代理在陌生语言上的表现,发现强代理通过元编程(如用Python生成目标语言代码)适应,禁止此策略性能大幅下降,而弱代理无法从中受益。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09867 2026-06-10 cs.AR cs.AI 新提交 57%

EstRTL: Functional Estimation Guided RTL Code Generation

EstRTL:功能估计引导的RTL代码生成

Qi Xiong, Renzhi Chen, Bowei Wang, Yuqing Xiong, Libo Huang, Lei Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Defense Innovation Institute, Academy of Military Science (AMS)(军事科学院创新院) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Key Laboratory of Advanced Microprocessor Chips and Systems, Changsha, China, and College of Computer Science and Technology, National University of Defense Technology, Changsha, China(先进微处理器芯片与系统重点实验室,长沙,中国,和国防科技大学计算机科学与技术学院,长沙,中国) Defense Innovation Institute, AMS, Beijing, China and Qiyuan Lab, Beijing, China(军事科学院创新院,北京,中国和启元实验室,北京,中国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出EstRTL框架,通过静态功能评分估计,结合生成、评估和修正三阶段范式,提升LLM生成RTL代码的功能正确性,在通用LLM上正确率提升3.2%-9.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07999 2026-06-09 cs.AI 新提交 57%

Efficient Skill Grounding via Code Refactoring with Small Language Models

通过小型语言模型的代码重构实现高效技能落地

Sera Choi, Wonje Choi, Saehun Chun, Daehee Lee, Jooyoung Kim, Chaeun Lee, Honguk Woo

机构 * KAIST(韩国科学技术院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏