arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 194 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 194 篇

2503.07215 2026-08-12 cs.SE cs.PL 版本更新 57%

The CodeInverter Suite: Structure- and Data-Aware Binary Decompilation with Efficient LLMs

CodeInverter工具套件:基于结构与数据感知及高效大语言模型的二进制反编译技术

Peipei Liu, Jian Sun, Rongkang Sun, Li Chen, Zhaoteng Yan, Xiaoling Zhang, Dawei Wang, Dapeng Sun, Peizheng Zhang, Dan Li

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 针对现有LLM反编译方法在结构重构、数据恢复等方面的不足,本文提出含CIW、CID、CIMs的CodeInverter套件,经实验验证可显著提升反编译性能,CIM-6.7B达最优效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28069 2026-08-11 cs.AI 版本更新 57%

SemPIC: Learning Semantic Position-Independent KV Caches

SemPIC:学习语义位置无关的键值缓存

Hui Xie, Peng Xiao, Yutong Deng, Shuoran Dou, Jian Yang, Jinyang Guo

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 SemPIC通过训练启用LoRA的Writer编译文档KV,结合KV梯度检查点,提升了长上下文场景下的KV缓存性能,平均微F1值达0.60,接近全重计算效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-11 cs.AI 版本更新 57%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-07 cs.CL 版本更新 57%

Same Task, Different Work: Prompt-Induced Waste in Coding Agents

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01518 2026-08-07 cs.SE 版本更新 57%

Probe to Generate: Program Variant-Guided Test Augmentation for Repository-Level Repair Benchmarks

基准测试足够强大吗?基于突变的诊断和回归套件的增强

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出STING框架,通过语义改变的程序变体增强回归测试,提高基准测试的可靠性。实验显示,77%的实例存在至少一个存活变体,测试覆盖率提升,修复率下降,揭示了基准测试的不足。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08652 2026-08-07 cs.AI 版本更新 57%

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05551 2026-08-06 cs.SE 版本更新 57%

Automated Code Review Assignments: An Alternative Perspective of Code Ownership on GitHub

自动化代码审查分配:GitHub上的代码所有权另一种视角

Jai Lal Lulla, Raula Gaikovina Kula, Christoph Treude

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究分析GitHub CODEOWNERS功能的使用情况,发现其能提升代码审查效率和流程稳定性,但应用仍不广泛。

Comments 19 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18048 2026-08-06 cs.SE cs.ET 版本更新 57%

Augmenting software engineering with AI - The ai4se taxonomy and its use

用人工智能增强软件工程:ai4se分类法及其应用

Ina K. Schieferdecker

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文针对MDSE应用受限问题,提出ai4se分类法,展望SE中利用MDSE结构优势与AI可扩展性的大模型愿景,并探讨人机协作的配对建模范式以提升软件质量。

Comments 32 pages, 4 figures, 7 tables, final revision after review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00450 2026-08-05 cs.HC cs.SE 版本更新 57%

Revibing Code from Papers: Reimplementing HCI Artifacts

从论文中重构代码:重新实现人机交互(HCI)人工制品

Eytan Adar, Yoonjoo Lee, Nina Lei, Q. Vera Liao, Weirui Peng

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本研究利用智能体AI技术直接从HCI研究论文重构交互式软件,提出重构性指标,经UIST论文验证可生成强基线代码,有望改变HCI研究人工制品的生产评估方式。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14061 2026-08-04 cs.SE 版本更新 57%

LLM Agents Can See Code Repositories

LLM智能体能够查看代码仓库

Dongjian Ma, Silin Chen, Yufei Yang, Yuling Shi, Yanfu Yan, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。

Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19338 2026-08-03 cs.AI 版本更新 57%

CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents

CodeRescue:用于编码智能体的预算校准恢复路由

Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang

机构 * University of Washington(华盛顿大学) New York University(纽约大学) ByteDance(字节跳动) Amazon(亚马逊)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究编码智能体失败后的预算部署问题,核心方法是将其制定为异构动作上的恢复路由并训练监督路由器,添加CRC层实现预算变化下的成本控制,主要贡献是校准前沿在多个方面优于基线,节省恢复成本。

Comments Withdrawn at the request of ByteDance because the manuscript was submitted before completing the company's required internal review and approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15755 2026-08-03 cs.SD cs.AI 版本更新 57%

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

AuEmoChat:用于对话语音合成的真实情感理解与呈现

Zhenqi Jia, Yuan Zhao, Aruukhan, Rui Liu, Haizhou Li

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 针对对话语音合成中情感表达不真实及多模态令牌干扰问题,提出AuEmoChat框架,通过AuEmoCodec学习情感令牌空间、AuEmoToMe合并冗余令牌,集成到模型并结合情感流匹配渲染语音,实验证明其性能优于现有基线。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15828 2026-07-31 cs.SE 版本更新 57%

Configuration Smells in AGENTS.md Files: Common Mistakes in Configuring Coding Agents

AGENTS.md 文件中的配置异味:配置编码代理的常见错误

Helio Victor F. dos Santos, Vitor Costa, Joao Eduardo Montandon, Luciana Lourdes Silva, Marco Tulio Valente

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文首次系统化编码代理配置文件(AGENTS.md/CLAUDE.md)的异味,通过灰文献综述和仓库挖掘识别出六种异味,并在100个开源仓库中验证其普遍性,其中Lint Leakage最常见(62%)。

Journal ref 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18119 2026-07-27 cs.AI 版本更新 57%

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?

Jing Ye, Yiwen Duan, Yonghong Yu, Victor Ma, Yang Gao, Xing Chen

机构 * ByteDance Inc.(字节跳动公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29108 2026-07-23 cs.CR cs.PL cs.SE 版本更新 57%

Symbolon: Symbolic Execution by Learning Code Transformation

Symbolon: 通过学习代码变换进行符号执行

Jie Zhu, Penghui Li, Zhongxuan Li, Chihao Shen, Ziyang Li, Yizheng Chen, Kexin Pei

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 提出Symbolon框架,自动学习多样化的代码变换并上下文敏感地应用,以缓解符号执行的路径爆炸和复杂约束问题,在32个真实程序上平均行覆盖率提升3.69倍,内存和求解时间分别降低29.2倍和123倍,并在Linux内核中发现21个新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21372 2026-07-21 cs.AI 版本更新 57%

NEMO: Execution-Aware Optimization Modeling via Autonomous Coding Agents

NEMO: 通过自主编码代理实现执行感知的优化建模

Yang Song, Anoushka Vyas, Zirui Wei, Sina Khoshfetrat Pakazad, Henrik Ohlsson, Graham Neubig

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01185 2026-07-17 cs.AI 版本更新 57%

"Skill Issues'': Data-Centric Optimization of Lakehouse Agents

技能问题:湖仓代理的数据中心优化

Nicole Rose Schneider, Davide Ghilardi, Giacomo Piccinini, Jacopo Tagliabue

机构 * University of Maryland(马里兰大学) Università Milano Bicocca(米兰Bicocca大学) Bauplan Labs(Bauplan实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 针对分支湖仓Bauplan上的编码代理,提出数据中心的优化流程,通过生成任务验证器对、在隔离沙箱中执行候选技能并利用追踪信号和程序化检查评分,将准确率提升31.9%。

Comments Pre-print of paper accepted at ADS @ VLDB 2026, Boston

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01043 2026-07-09 cs.SE 版本更新 57%

DPO-F+: Aligning Code Repair Feedback with Developers' Preferences

DPO-F+:使代码修复反馈与开发者偏好对齐

Zihan Fang, Yifan Zhang, Yueke Zhang, Kevin Leach, Yu Huang

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22956 2026-07-07 cs.SE 版本更新 57%

SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding

SWE-Manager:编码前选择并合成黄金方案

Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09290 2026-06-10 cs.SE cs.CE cs.MA 版本更新 57%

ToolRosella: Translating Code Repositories into Standardized Tools for Scientific Agents

ToolRosella: 将代码仓库翻译为科学智能体的标准化工具

Shimin Di, Xujie Yuan, Hanghui Guo, Chaoqian Ouyang, Yongxu Liu, Ling Yue, Zhangze Chen, Libin Zheng, Jia Zhu, Shaowu Pan, Jian Yin, Yong Rui, Min-Ling Zhang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 提出ToolRosella框架,通过仓库分析、工具接口构建、执行测试和迭代修复,自动将异构科学代码仓库转化为标准化、可被智能体调用的工具,在122个仓库上达到61.5%的转换成功率,下游任务成功率为84.0%。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20242 2026-06-10 cs.CY cs.AI cs.RO 版本更新 57%

BadRobot: Jailbreaking Embodied LLM Agents in the Physical World

BadRobot: 在物理世界中越狱具身LLM智能体

Hangtao Zhang, Chenyu Zhu, Xianlong Wang, Ziqi Zhou, Changgan Yin, Minghui Li, Lulu Xue, Yichen Wang, Shengshan Hu, Aishan Liu, Peijin Guo, Leo Yu Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Beihang University(北航) Griffith University(格里菲斯大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。

Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io

Journal ref International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05138 2026-06-09 cs.AI 版本更新 57%

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

可执行世界模型在编码智能体时代的ARC-AGI-3应用

Sergey Rodionov

机构 * SingularityNET

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。

Comments 13 pages. Accepted for publication at AGI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17948 2026-06-08 cs.CR cs.AI cs.MA 版本更新 57%

RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs

RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络

Parteek Jamwal, Minghao Shao, Boyuan Chen, Achyuta Muthuvelan, Asini Subanya, Boubacar Ballo, Kashish Satija, Mariam Shafey, Mohamed Mahmoud, Moncif Dahaji Bouffi, Pasindu Wickramasinghe, Siyona Goel, Yaakulya Sabbani, Hakim Hacid, Mthandazo Ndhlovu, Eleanna Kafeza, Sanjay Rawat, Muhammad Shafique

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12428 2026-07-21 cs.CR 版本更新 56%

Trust but Verify? Uncovering the Security Debt of Autonomous Coding Agents

信任但要验证?揭示自主编码代理的安全债务

A H M Nazmus Sakib, Dipayan Banik, Murtuza Jadliwala

专题命中 软件智能体 :agent(abstract);agentic(comments)

AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09174 2026-06-11 cs.HC 版本更新 56%

Demonstrating chart-plot: Closing the Last Mile of Academic Chart Generation

展示chart-plot:弥合学术图表生成的最后一英里

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Jiale Lao, Tingfeng Lan, Wei Chen

专题命中 软件智能体 :agentic(abstract,comments)

AI总结 提出chart-plot系统,通过风格感知代码生成、部署感知渲染循环和结构化编辑层,解决学术图表从代码到发表的质量差距问题。

Comments 7 pages, 6 figures. Submitted to the VLDB ADS 2026 Workshop: The Joint Workshop on Agentic Data Systems and Data-Centric AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04724 2026-08-14 cs.RO cs.CV 版本更新 50%

A GitOps-Driven Annotation Catalog for Fully Automatic Railway Operations

面向全自动铁路运行的GitOps驱动标注目录

Martin Köppel, Tobias Cronauer, Zekiye Ilknur-Öz, Sebastian Dubiel, Patrick Naumann, Philipp Neumaier

专题命中 软件智能体 :workflow(abstract)

AI总结 针对全自动铁路运行的标注数据管理难题,提出基于GitOps的轻量级元数据管理架构,结合Data-as-Code、CI/CD与SSG,实现以开发者为中心的工作流,保障可追溯性与合规性并自动生成数据集概览。

Journal ref 16th International Conference on Advanced Computer Information Technologies in Zlín, Czech Republic, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29545 2026-08-14 cs.CY cs.CR 版本更新 50%

Stand-Alone Complex or Vibercrime? Exploring the adoption and innovation of GenAI tools, coding assistants, and agents within cybercrime ecosystems

独立复杂或维伯犯罪?探索生成AI工具、编码助手和代理在网络犯罪生态系统中的采用与创新

Jack Hughes, Ben Collier, Daniel R. Thomas

专题命中 软件智能体 :agentic(abstract)

AI总结 本文通过创新理论和演化经济学分析网络犯罪生态系统,提出独立复杂和维伯犯罪概念,发现AI在现有低利润方案中有早期应用,但未造成广泛破坏。

Comments Updated with results on developments in the first half of 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17076 2026-08-12 cs.CR 版本更新 50%

SATLOCK: Handover-Coupled Scheduling for Weather-Resilient Quantum Key Distribution over LEO Constellations

SATLOCK:用于低地球轨道星座上抗天气量子密钥分发的切换耦合调度

Mohammad Arif Hossain, Md Jafrin Hossain

专题命中 软件智能体 :agent(abstract)

AI总结 研究低地球轨道卫星星座上量子密钥分发路由难题,提出SATLOCK框架,结合综合信道模型、整数线性规划和去中心化深度Q网络,评估不同竞争模式下性能,ILP给出吞吐量上限,DQN智能体学习策略但受跨需求协调限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28600 2026-08-11 quant-ph 版本更新 50%

SymFT: Universal Fault-Tolerant Quantum Circuit Simulation via Symbolic Clifford--Pauli Frames and Stabilizer Coordinates

SymFT:基于符号Clifford–Pauli框架和稳定子坐标的通用容错量子电路模拟

Wang Fang, Huazhe Lou, Riling Li

专题命中 软件智能体 :planning(abstract)

AI总结 SymFT是一款高吞吐量容错量子电路模拟器,通过符号Clifford–Pauli框架分解和自适应稳定子坐标规划优化采样,在多种量子电路上实现了比Stim、Clifft、SOFT更优的采样性能。

Comments 28 pages, 1 figure, 5 tables; v2: update benchmark results and related work. SymFT is the second-generation successor to SOFT, see GitHub repository: https://github.com/haoliri0/SOFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21015 2026-08-06 hep-ph 版本更新 50%

MadAgents

MadAgents通过智能代理提升MadGraph的使用效率

Tilman Plehn, Daniel Schiller, Nikita Schmal

专题命中 软件智能体 :agentic(abstract)

AI总结 MadAgents通过智能代理提升MadGraph的使用效率,简化了高能物理模拟流程,并加速了LHC研究。

Comments 59 pages, 3 figures, 1 table. v3: includes a Claude Code implementation with a self-improvement loop

详情

展开后加载摘要…

URL PDF HTML 收藏