arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3217 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3217 篇

2605.02815 2026-08-12 cs.CL 版本更新 57%

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

FlexSQL:灵活探索与执行打造更优的文本到SQL智能体

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10622 2026-08-12 cs.SE 新提交 57%

A Study of Cursorrules Files in GitHub Open Source Projects

GitHub开源项目中Cursorrules文件的研究

Shuang Sun, Jafar Akhoundali, Arina Kudriavtseva, Sengim Karayalcin, Olga Gadyatskaya

专题命中 软件智能体 :AI agent(abstract);分类 cs.SE

AI总结 本研究对GitHub开源项目中的.cursorrules文件开展实证研究,明确其分布、内容特征及与.mdc文件的主题连续性,揭示其多用于小型非专业项目的现状。

Comments Published in ICSOFT 2026. This is the author copy version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09248 2026-08-12 cs.AI 版本更新 57%

Emotion2Skill: Model-Internal Emotion Signals for Adaptive Skill Selection and Evolution

Emotion2Skill:用于自适应技能选择与演化的模型内部情绪信号

Bohan Lin, Hejia Geng, Xinyi Xie, Heng Zhou, Qinghua Xing, Bo Liu, Chen Zhang, Yudong Zhang

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 Emotion2Skill框架提取LLM内部情绪向量,将其融入技能选择与演化,在WebShop、ALFWorld上用Qwen3模型实现显著性能提升,验证了情绪表征作为智能体决策信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07440 2026-08-12 cs.AI 版本更新 57%

Blast Radius

爆炸半径

MY Pitsane, Hope Mogale

机构 * Algorithm Reconnaissance Division(算法侦察部) Mankind Research Labs(人类研究实验室) North-West University(西北大学) University of Pretoria(比勒陀利亚大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 针对智能体编码的令牌浪费问题,提出Blast Radius内存管理层,结合NECROPHORESIS与RDM实现可逆上下文驱逐,在7个OpenAI模型上降低令牌消耗17%-26%,提升编码可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07215 2026-08-12 cs.SE cs.PL 版本更新 57%

The CodeInverter Suite: Structure- and Data-Aware Binary Decompilation with Efficient LLMs

CodeInverter工具套件:基于结构与数据感知及高效大语言模型的二进制反编译技术

Peipei Liu, Jian Sun, Rongkang Sun, Li Chen, Zhaoteng Yan, Xiaoling Zhang, Dawei Wang, Dapeng Sun, Peizheng Zhang, Dan Li

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 针对现有LLM反编译方法在结构重构、数据恢复等方面的不足,本文提出含CIW、CID、CIMs的CodeInverter套件,经实验验证可显著提升反编译性能,CIM-6.7B达最优效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09799 2026-08-11 cs.SE 新提交 57%

SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories

SpecPath:在合同等价的规范历史中测试编码智能体

Yangfan Wu, Haozhe Wang, Huanyu Yang, Jianmin Ji, Fangzhen Lin

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 针对编码智能体的规范路径敏感性问题,提出SpecPath诊断评估方法,通过控制变量测试发现多数智能体在等价规范历史中存在行为不一致的问题,凸显需评估智能体对规范路径的鲁棒性。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09643 2026-08-11 cs.CR cs.LG 新提交 57%

Activation Probes Surface Code-Security Signals that the Model's Output Misses

激活探针:挖掘模型输出遗漏的表面代码安全信号

Ivan Wiryadi

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。

Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28069 2026-08-11 cs.AI 版本更新 57%

SemPIC: Learning Semantic Position-Independent KV Caches

SemPIC:学习语义位置无关的键值缓存

Hui Xie, Peng Xiao, Yutong Deng, Shuoran Dou, Jian Yang, Jinyang Guo

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 SemPIC通过训练启用LoRA的Writer编译文档KV,结合KV梯度检查点,提升了长上下文场景下的KV缓存性能,平均微F1值达0.60,接近全重计算效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-11 cs.AI 版本更新 57%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07364 2026-08-10 cs.AI cs.CY 新提交 57%

Curriculum as Code: An AI-Assisted Architecture for Instructional Design in STEM Education

课程即代码:STEM教育中教学设计的AI辅助架构

Henrique Mohallem Paiva

机构 * Universidade Federal de Sao Paulo (Unifesp)(圣保罗联邦大学) Institute of Technology and Leadership (Inteli)(技术与领导力学院)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 该研究提出基于课程即代码的六阶段AI辅助教学设计架构,结合生成式AI与LaTeX、Python,经验证可降低教师STEM教学材料创作工作量,提升材料质量与可扩展性。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07138 2026-08-10 physics.acc-ph cs.AI 新提交 57%

Autonomous discovery of accelerator commissioning algorithms

加速器调试算法的自主发现

Thorsten Hellert

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出语言模型智能体闭环循环,自主发现加速器调试算法,在ALS-U储存环射频束流捕获任务中取得良好效果,生成多目标非支配算法,推动调试研究模式转变。

Comments 9 pages, 4 figures. Submitted to Physical Review Accelerators and Beams (ZVR1001)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05430 2026-08-07 cs.CR cs.LG 新提交 57%

Robust Context-Aware Detection of Malicious Instructions in Text

文本中恶意指令的鲁棒上下文感知检测

Buzhao Liu, Xinhang Ma, Yevgeniy Vorobeychik

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05234 2026-08-07 cs.LG cs.PL 新提交 57%

PPDL: LLM-Based Flows as Probabilistic Programs

PPDL:基于大语言模型的流作为概率程序

Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出用于编程基于LLM的流的概率语言PPDL,可量化传播流中不确定性,无需额外代码即可尝试推理缩放技术,还通过实验及面向Rocq的定理证明智能体案例验证了其能力。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 57%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-07 cs.CL 版本更新 57%

Same Task, Different Work: Prompt-Induced Waste in Coding Agents

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01518 2026-08-07 cs.SE 版本更新 57%

Probe to Generate: Program Variant-Guided Test Augmentation for Repository-Level Repair Benchmarks

基准测试足够强大吗?基于突变的诊断和回归套件的增强

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出STING框架,通过语义改变的程序变体增强回归测试,提高基准测试的可靠性。实验显示,77%的实例存在至少一个存活变体,测试覆盖率提升,修复率下降,揭示了基准测试的不足。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08652 2026-08-07 cs.AI 版本更新 57%

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05116 2026-08-06 cs.SE cs.HC 新提交 57%

Characterizing Visual Accessibility Issues in AI Developer Tools: An Empirical Study

AI开发者工具中的视觉可访问性问题表征:一项实证研究

Sabrina Haque, Christoph Csallner

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本研究通过分析五个AI开发者工具生态系统的问题报告,表征了其中的视觉可访问性障碍类型及差异,揭示了交互设计与生态系统实践对工具可访问性记录的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04857 2026-08-06 cs.CR cs.SE 新提交 57%

Hidden Ciphers and Where to Find Them: Static Discovery and Assessment of Cryptographic Assets in Software

隐藏的密码及其发现途径:软件中密码资产的静态发现与评估

Christian Näther, Eduard Hirsch

专题命中 软件智能体 :planning(abstract);分类 cs.SE

AI总结 本文提出分类驱动的静态方法,可在不到6分钟处理57610个文件,发现370个密码资产(含6个CVE漏洞、52个后量子迁移候选),F1达0.75,助力密码资产发现与后量子迁移规划

Comments 22 pages, 8 figures, 5 tables, accepted at ICICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05551 2026-08-06 cs.SE 版本更新 57%

Automated Code Review Assignments: An Alternative Perspective of Code Ownership on GitHub

自动化代码审查分配:GitHub上的代码所有权另一种视角

Jai Lal Lulla, Raula Gaikovina Kula, Christoph Treude

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究分析GitHub CODEOWNERS功能的使用情况,发现其能提升代码审查效率和流程稳定性,但应用仍不广泛。

Comments 19 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18048 2026-08-06 cs.SE cs.ET 版本更新 57%

Augmenting software engineering with AI - The ai4se taxonomy and its use

用人工智能增强软件工程:ai4se分类法及其应用

Ina K. Schieferdecker

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文针对MDSE应用受限问题,提出ai4se分类法,展望SE中利用MDSE结构优势与AI可扩展性的大模型愿景,并探讨人机协作的配对建模范式以提升软件质量。

Comments 32 pages, 4 figures, 7 tables, final revision after review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03558 2026-08-05 cs.SE 新提交 57%

EffiHolmes: Differential Profiling-Guided Repository Level Time Inefficiency Fix Localization

EffiHolmes:基于差分分析的仓库级时间低效修复定位

Haowen Yang, Yun Peng, Zishuo Ding

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02642 2026-08-05 physics.chem-ph cs.AI 新提交 57%

MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

MDArena:面向真实分子动力学工作流的编码智能体评估基准

Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro, Eden James Gage, Jonathan David Colburn, Linda Xi Phan, Minjoon Seo, Kevin Guan, Philip C. Biggin

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。

Comments 17 pages including appendices, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00450 2026-08-05 cs.HC cs.SE 版本更新 57%

Revibing Code from Papers: Reimplementing HCI Artifacts

从论文中重构代码:重新实现人机交互(HCI)人工制品

Eytan Adar, Yoonjoo Lee, Nina Lei, Q. Vera Liao, Weirui Peng

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本研究利用智能体AI技术直接从HCI研究论文重构交互式软件,提出重构性指标,经UIST论文验证可生成强基线代码,有望改变HCI研究人工制品的生产评估方式。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 57%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00808 2026-08-04 cs.SE 新提交 57%

Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents

将交互历史转化为执行状态:面向长程编码智能体的运行时层

Zehao Wang, Yisen Xu, Chenglin Li, Chao Peng, Bram Adams, Ahmed E. Hassan, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究针对长程编码智能体易受过时状态干扰的问题,提出Ledger运行时层,通过显式执行状态提升编码任务性能并降低成本,效果在多个模型和基准上得到验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00122 2026-08-04 cs.AI 新提交 57%

Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment Snapshot

企业编码智能体的共享组织记忆:系统设计与部署快照

Harsh Rao Dhanyamraju, Leonidas Raghav

机构 * SAP SE(思爱普公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文设计部署共享组织记忆系统,将经验捕获融入企业编码工作流,收集并整理任务相关经验,管控风险并供智能体检索,目前其效果仍在评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14061 2026-08-04 cs.SE 版本更新 57%

LLM Agents Can See Code Repositories

LLM智能体能够查看代码仓库

Dongjian Ma, Silin Chen, Yufei Yang, Yuling Shi, Yanfu Yan, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。

Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29637 2026-08-03 cs.CV cs.SE 新提交 57%

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

CodeShrink:面向高效多模态代码理解的自适应视觉压缩

Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28815 2026-08-03 cs.SE 新提交 57%

Preventing Premature Commitment in Coding Agents with an Evidence-Conditioned Execution Layer

通过证据条件执行层防止编码智能体的过早提交

Yisen Xu, Chenglin Li, Zehao Wang, Jinqiu Yang, Tse-Hsun Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 ECLoop是介于编码智能体与仓库间的证据条件执行层,可防止过早提交,在SWE-bench Verified上提升Pass@1指标4.8-11.8个百分点,同时降低平均token消耗。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏