Same Task, Different Work: Prompt-Induced Waste in Coding Agents
提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试
机构 * PointFive
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试
机构 * PointFive
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。
基准测试足够强大吗?基于突变的诊断和回归套件的增强
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出STING框架,通过语义改变的程序变体增强回归测试,提高基准测试的可靠性。实验显示,77%的实例存在至少一个存活变体,测试覆盖率提升,修复率下降,揭示了基准测试的不足。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT
机构 * South China University of Technology(南方科技大学) ; StepFun ; Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 软件智能体 :planning(abstract);分类 cs.AI
AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。
Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026
自动化代码审查分配:GitHub上的代码所有权另一种视角
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究分析GitHub CODEOWNERS功能的使用情况,发现其能提升代码审查效率和流程稳定性,但应用仍不广泛。
Comments 19 pages, 8 figures, 12 tables
用人工智能增强软件工程:ai4se分类法及其应用
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文针对MDSE应用受限问题,提出ai4se分类法,展望SE中利用MDSE结构优势与AI可扩展性的大模型愿景,并探讨人机协作的配对建模范式以提升软件质量。
Comments 32 pages, 4 figures, 7 tables, final revision after review
从论文中重构代码:重新实现人机交互(HCI)人工制品
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本研究利用智能体AI技术直接从HCI研究论文重构交互式软件,提出重构性指标,经UIST论文验证可生成强基线代码,有望改变HCI研究人工制品的生产评估方式。
Comments UIST 2026
LLM智能体能够查看代码仓库
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。
Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo
CodeRescue:用于编码智能体的预算校准恢复路由
机构 * University of Washington(华盛顿大学) ; New York University(纽约大学) ; ByteDance(字节跳动) ; Amazon(亚马逊)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 研究编码智能体失败后的预算部署问题,核心方法是将其制定为异构动作上的恢复路由并训练监督路由器,添加CRC层实现预算变化下的成本控制,主要贡献是校准前沿在多个方面优于基线,节省恢复成本。
Comments Withdrawn at the request of ByteDance because the manuscript was submitted before completing the company's required internal review and approval process
AuEmoChat:用于对话语音合成的真实情感理解与呈现
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 针对对话语音合成中情感表达不真实及多模态令牌干扰问题,提出AuEmoChat框架,通过AuEmoCodec学习情感令牌空间、AuEmoToMe合并冗余令牌,集成到模型并结合情感流匹配渲染语音,实验证明其性能优于现有基线。
Comments Accepted by ACMMM 2026
AGENTS.md 文件中的配置异味:配置编码代理的常见错误
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文首次系统化编码代理配置文件(AGENTS.md/CLAUDE.md)的异味,通过灰文献综述和仓库挖掘识别出六种异味,并在100个开源仓库中验证其普遍性,其中Lint Leakage最常见(62%)。
Journal ref 26th IEEE International Conference on Source Code Analysis and Manipulation (SCAM 2026)
超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?
机构 * ByteDance Inc.(字节跳动公司)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。
Symbolon: 通过学习代码变换进行符号执行
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 提出Symbolon框架,自动学习多样化的代码变换并上下文敏感地应用,以缓解符号执行的路径爆炸和复杂约束问题,在32个真实程序上平均行覆盖率提升3.69倍,内存和求解时间分别降低29.2倍和123倍,并在Linux内核中发现21个新漏洞。
NEMO: 通过自主编码代理实现执行感知的优化建模
机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。
Comments Accepted at ICML 2026
技能问题:湖仓代理的数据中心优化
机构 * University of Maryland(马里兰大学) ; Università Milano Bicocca(米兰Bicocca大学) ; Bauplan Labs(Bauplan实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 针对分支湖仓Bauplan上的编码代理,提出数据中心的优化流程,通过生成任务验证器对、在隔离沙箱中执行候选技能并利用追踪信号和程序化检查评分,将准确率提升31.9%。
Comments Pre-print of paper accepted at ADS @ VLDB 2026, Boston
DPO-F+:使代码修复反馈与开发者偏好对齐
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。
Comments 10 pages, 2 figures
SWE-Manager:编码前选择并合成黄金方案
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。
ToolRosella: 将代码仓库翻译为科学智能体的标准化工具
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 提出ToolRosella框架,通过仓库分析、工具接口构建、执行测试和迭代修复,自动将异构科学代码仓库转化为标准化、可被智能体调用的工具,在122个仓库上达到61.5%的转换成功率,下游任务成功率为84.0%。
Comments 20 pages
BadRobot: 在物理世界中越狱具身LLM智能体
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beihang University(北航) ; Griffith University(格里菲斯大学)
专题命中 软件智能体 :planning(abstract);分类 cs.AI
AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。
Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io
Journal ref International Conference on Learning Representations (ICLR) 2025
可执行世界模型在编码智能体时代的ARC-AGI-3应用
机构 * SingularityNET
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。
Comments 13 pages. Accepted for publication at AGI-2026
RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。
信任但要验证?揭示自主编码代理的安全债务
专题命中 软件智能体 :agent(abstract);agentic(comments)
AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。
Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)
展示chart-plot:弥合学术图表生成的最后一英里
专题命中 软件智能体 :agentic(abstract,comments)
AI总结 提出chart-plot系统,通过风格感知代码生成、部署感知渲染循环和结构化编辑层,解决学术图表从代码到发表的质量差距问题。
Comments 7 pages, 6 figures. Submitted to the VLDB ADS 2026 Workshop: The Joint Workshop on Agentic Data Systems and Data-Centric AI
用于模拟真实城市几何中住宅入室盗窃的有限元框架
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出一种有限元框架,将基于智能体的概率入室盗窃模型转化为PDE模型,采用解耦方案求解,经芝加哥市真实几何测试,鲁棒高效且开源,为多尺度多物理场模型研究奠基。
面向全自动铁路运行的GitOps驱动标注目录
专题命中 软件智能体 :workflow(abstract)
AI总结 针对全自动铁路运行的标注数据管理难题,提出基于GitOps的轻量级元数据管理架构,结合Data-as-Code、CI/CD与SSG,实现以开发者为中心的工作流,保障可追溯性与合规性并自动生成数据集概览。
Journal ref 16th International Conference on Advanced Computer Information Technologies in Zlín, Czech Republic, 2026
独立复杂或维伯犯罪?探索生成AI工具、编码助手和代理在网络犯罪生态系统中的采用与创新
专题命中 软件智能体 :agentic(abstract)
AI总结 本文通过创新理论和演化经济学分析网络犯罪生态系统,提出独立复杂和维伯犯罪概念,发现AI在现有低利润方案中有早期应用,但未造成广泛破坏。
Comments Updated with results on developments in the first half of 2026
SATLOCK:用于低地球轨道星座上抗天气量子密钥分发的切换耦合调度
专题命中 软件智能体 :agent(abstract)
AI总结 研究低地球轨道卫星星座上量子密钥分发路由难题,提出SATLOCK框架,结合综合信道模型、整数线性规划和去中心化深度Q网络,评估不同竞争模式下性能,ILP给出吞吐量上限,DQN智能体学习策略但受跨需求协调限制。
SymFT:基于符号Clifford–Pauli框架和稳定子坐标的通用容错量子电路模拟
专题命中 软件智能体 :planning(abstract)
AI总结 SymFT是一款高吞吐量容错量子电路模拟器,通过符号Clifford–Pauli框架分解和自适应稳定子坐标规划优化采样,在多种量子电路上实现了比Stim、Clifft、SOFT更优的采样性能。
Comments 28 pages, 1 figure, 5 tables; v2: update benchmark results and related work. SymFT is the second-generation successor to SOFT, see GitHub repository: https://github.com/haoliri0/SOFT
MadAgents通过智能代理提升MadGraph的使用效率
专题命中 软件智能体 :agentic(abstract)
AI总结 MadAgents通过智能代理提升MadGraph的使用效率,简化了高能物理模拟流程,并加速了LHC研究。
Comments 59 pages, 3 figures, 1 table. v3: includes a Claude Code implementation with a self-improvement loop
视觉目标姿态估计的不确定性量化
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 软件智能体 :planning(abstract)
AI总结 SLUE通过凸优化方法为视觉目标姿态估计提供高概率的椭球不确定性界,有效缩小平移界限并保持方向精度。
Comments 18 pages, 9 figures. Code available: https://github.com/MIT-SPARK/PoseUncertaintySets. Published in IEEE Transactions on Robotics
一种更精确的有理非交换算法用于使用48次乘法的4x4矩阵乘法
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出一种更精确的4x4矩阵乘法算法,使用48次非交换乘法,改进了误差界指数并提升了实际精度。