Token Reduction Is Not Cost Reduction
令牌减少并非成本降低
机构 * PointFive
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
令牌减少并非成本降低
机构 * PointFive
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。
当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。
Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track
修复前诊断:将智能体故障转化为选择性自修正
机构 * Ant International(蚂蚁国际)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 本研究提出诊断引导的修复框架DARC,通过先诊断故障类型再进行选择性自修正,在ALFWorld等三个任务场景中提升了智能体平均任务性能并减少资源消耗,为缺乏类编译器反馈的领域构建可靠智能体提供了实用路径。
主特质分析:面向人机协作中“技能”的推导
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。
自演进网络验证器
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 该研究提出一种自动演进的网络验证器,通过编码智能体与可信预言机的反例引导循环,让基于SMT的验证器自主学习新网络功能,解决手动维护模型的难题。
Comments 8 pages, 5 figures
FlexSQL:灵活探索与执行打造更优的文本到SQL智能体
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升
Comments Published at COLM 2026
MEGA:基于智慧图的自进化智能体优化基础设施
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 MEGA是一种自进化智能体优化基础设施,通过三层架构实现智慧积累、组合推理与自进化,可系统性优化异构智能体系统,将优化与知识进化融为一体。
Comments 29 pages, 10 figures. Technical report
一个方案,多种适配:自演化在不同语言和模型中编码了什么
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 该研究固定演化方案,在八种编程语言和三个基础模型上分析自演化适配工具,发现其为语言需求与模型差距共同塑造的补偿层,可提升编码智能体性能并能蒸馏为通用工具。
Comments 20 pages, 12 figures, 9 tables. Includes appendix
SBCO:面向规划智能体的自监督、验证器驱动的工具链优化器
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本研究针对规划任务提出SBCO,一种自监督的验证器驱动工具链优化器,其性能优于或相当的定制基线,且计算成本仅为其1/4至1/5.5。
OpenCodeReview:面向成本效益型智能体代码评审的非确定性转确定性方案
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 OpenCodeReview针对LLM代码评审智能体的非确定性与上下文局部性缺陷,通过在三个流水线节点注入确定性,在AACR-Bench上实现SEM-F1提升且大幅降低令牌消耗,性能优于主流编码智能体。
ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写
机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。
广泛推理,而非深度推理:将推理溢价分摊到提炼技能中
机构 * Microsoft(微软公司)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 该研究提出将推理模式的重复分摊为跨任务提炼的技能,在四个智能体基准上大幅降低代币量的同时恢复多数推理性能,部分场景下优于推理模式。
Comments COLM 2026 Efficient Reasoning Workshop
VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法
机构 * CUHK(香港中文大学) ; USTC(中国科学技术大学) ; SCUT(华南理工大学) ; HKU(香港大学) ; NTU(南洋理工大学) ; PKU(北京大学) ; SJTU(上海交通大学) ; CMU(卡内基梅隆大学) ; THU(清华大学) ; HUST(华中科技大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。
Comments 15 pages, 3 figures, and 3 tables
FlashRT:用于引导智能体部署实时多模态应用的智能体框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; AMD(超威半导体公司) ; University at Buffalo(纽约州立大学水牛城分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.LG
AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。
TokTier:面向智能体大语言模型服务的精确有状态分词方案
机构 * Arizona State University(亚利桑那州立大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL
AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。
Comments 26 pages. Code: https://github.com/asu-idi/toktier
内化身份基元:公有区块链上自主智能体的密码学个体性
专题命中 软件智能体 :software agent(abstract);分类 cs.AI
AI总结 本文提出将公有区块链上自主智能体的身份密钥-权重绑定信任根转移至密码学假设,在Solana开发网部署了首个身份基元为密码学不变量的链上智能体,完成了2.36天链上运行,实例化了密码学个体性。
Comments 52 pages, 3 figures, 11 tables. Cryptographic key-to-weights binding (W = HKDF(sk) inside Groth16) with an on-chain state-commitment chain on Solana devnet; active-query, homeostatic, and economic-metabolism extensions; 166- and 168-cycle continuous runs. Code, threat model, and per-cycle telemetry: https://github.com/ksk-S/internalising-identity-2026 (tag arxiv-v1)
PRWeaver:针对基于大语言模型的代码审计工具对抗长周期恶意拉取请求的评估
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 该研究提出PRWeaver基准,评估基于LLM的代码审计工具对长周期恶意PR的可靠性,发现特定评审策略会降低检测率,为优化代码审计工具提供了依据。
对代理生成的拉取请求中图书馆使用情况的研究
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 研究探讨了代理生成的拉取请求中图书馆使用情况,发现代理频繁导入图书馆但很少引入新依赖项,且在引入时遵循严格的版本控制实践。
Comments 5 pages, 3 tables. Accepted at MSR '26 (Challenge Track)
Journal ref 23rd International Conference on Mining Software Repositories: MSR 2026
跨语言令牌套利:通过本地LLM预处理优化代码智能体上下文窗口
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出一种预处理的边缘端提示重写中间件,利用本地Llama 3.2模型进行跨语言翻译和结构重写,在保持或提升任务准确率的同时减少34-47%的提示令牌和最高18.8%的总令牌消耗。
Comments Updated References
Agent-as-Peer-Debriefer: 一种基于视角精炼的多智能体定性分析框架
机构 * Soochow University(苏州大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 提出一种多智能体框架,通过模拟同行汇报(peer debriefing)并引入理论驱动、数据驱动和应用三种分析视角,提升大语言模型在定性数据分析中的编码质量。
使用智能体AI构建流程建模工具:PM4Py-UCM的经验报告
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 本文通过AI辅助构建开源流程建模工具PM4Py-UCM的深入案例,提出相关工具包与分类法,总结了开发经验教训及验证策略。
Comments 17 pages, 9 figures, 4 tables, submitted to a conference
“回家吧,副驾驶,你喝醉了”:理解开发者对智能体生成的代码审查评论的回应
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 研究开发者对智能体生成的代码审查评论的回应,分析五个智能体在342个Python仓库生成的54791条评论,探讨解决率、开发者经验及影响评论有用性的特征,发现不同智能体解决率有差异,还确定未解决评论原因及影响因素,为改进相关反馈提供见解。
通过工具工程分发安全控制
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 研究商业AI编码代理安全控制分发问题,通过分阶段测试方法,利用SHarD工具在多种代理配置上测试,证明三类安全控制可通过单个命令嵌入分发,效果与直接安装商业代理相同,还提出相关框架特征及后续研究问题。
超越记忆:一种用于异构协作知识工作的带大语言模型代理的模板化基础架构
机构 * University of Notre Dame(圣母大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 研究指出知识工作成果难传承,大语言模型代理无持久记忆。提出llm-wiki-memory-template,它是异构协作知识工作基础架构,沿多人类、多代理、多领域三个轴,通过案例研究展示其能保留失败路径等,解决负面结果丢失问题。
Comments 15 pages, 3 figures, 1 table
PRO-LONG:程序化内存实现长程推理
机构 * Duke University(杜克大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。
AgentCgroup: 理解和控制AI代理的操作系统资源
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; Virginia Tech(弗吉尼亚理工大学) ; UConn(康涅狄格大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI
AI总结 AgentCgroup通过意图驱动的eBPF资源控制器,解决多租户云环境中AI代理资源管理的粒度、响应性和适应性不匹配问题,提升隔离性和减少资源浪费。
超越文本编辑:源代码的代数操作
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 研究提出源代码代数方法,通过逻辑代数操作修改代码库,概述其操作属性。实验表明大语言模型代理用此方法完成代码更改成功率更高、令牌数更少,为代码编辑提供新方向,推动相关研究。
Comments Accepted for publication in the Visions and Emerging Results Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy
用于可信代理商务的以决策为中心的参考架构
专题命中 软件智能体 :software agent(abstract);分类 cs.SE
AI总结 研究针对代理商务问题,提出以决策为中心的与协议无关的架构,含规范信封等多种机制,通过开源实现、多场景和消融评估,支持受保护依赖项检测等多项功能,但未涵盖部分关键特性。
Comments 23 pages, 3 figures. Includes ancillary reproducibility materials
智能拉取请求的测试覆盖分析
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 研究人工智能编码代理生成的拉取请求的测试覆盖情况,分析4882个相关请求,发现代理包含测试更改比例低,现有测试覆盖不足,代理编写测试仅在少数请求中提升覆盖,错误处理结构测试严重不足,为此提出相关改进措施。
Comments 12 pages, to appear 42nd International Conference on Software Maintenance and Evolution
终端中的智能代码审查:行为、成本和人工对齐的轨迹级分析
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 研究终端环境中智能代码审查的行为、成本等,基于审查者轨迹分析,发现智能审查者审查精度高但有探索等开销,成功审查与规划等有关,凸显轨迹感知和成本敏感评估对未来此类系统的好处。