SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward
SoK:AI安全代码生成:进展、陷阱与前进之路
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SoK:AI安全代码生成:进展、陷阱与前进之路
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。
多轮LLM对话中NFR评估的准确性与满意度
机构 * University of Maine(缅因大学) ; University of Notre Dame(圣母大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。
Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)
语言模型代理能否成为机械可解释性中有用的电路解释器?
机构 * George Mason University(乔治梅森大学) ; The Ohio State University(俄亥俄州立大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 研究语言模型代理在机械可解释性中自动解释已定位电路的能力,提出HyVE方法,通过迭代观察、假设生成和因果验证生成组件级解释,实验表明代理有潜力但可靠验证仍是关键障碍。
Comments 23 pages, 4 figures, 14 tables
ESAA-Conversational:一种用于异构LLM编码智能体之间连续性、交接和策管的事件溯源记忆层
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 提出ESAA-Conversational架构,通过事件溯源实现跨多个LLM编码智能体的共享会话记忆,解决会话状态漂移问题,支持连续性、交接和策管。
Comments 11 pages, 1 table
Litmus: 零标注、代码驱动的AI系统评估指标规范
机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 提出Litmus系统,通过分析源代码自动生成评估指标,无需人工标注,在三个真实AI流水线上优于基线方法。
Comments 22 pages, 4 figures
Tmax: 终端智能体的简单配方
机构 * Allen Institute for AI(人工智能研究院) ; University of Washington(华盛顿大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 提出Tmax配方,通过新颖分类法生成数据并结合结果奖励的强化学习,在9B参数下达到27%的Terminal-Bench 2.0性能,超越先前更大模型。
Comments preprint
VeriPort: 自动化且经过验证的大规模补丁回溯
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 提出VeriPort系统,自动化将安全补丁回溯到受影响的所有版本,并通过证据链验证补丁有效性和功能保留,在BackportBench上达到95.3%成功率,比现有方案高22.7个百分点。
更进一步:通过跨平台反向工程和函数级语义分析理解PLC二进制
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出PLC-BinX,一种用于跨平台PLC二进制理解的二进制代码分析工作流,通过跨平台反向工程、核心函数提取和函数级语义表示构建,实现了对PLC二进制的深入理解,并在工具链预测和功能预测任务中取得了优异的性能。
使用大语言模型进行Qiskit代码迁移
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 针对量子软件开发套件版本演进导致的代码维护问题,提出结合大语言模型与检索增强生成(RAG)的混合方法,利用自动生成的迁移场景分类体系引导模型,实现Qiskit代码跨版本自动迁移,有效减少幻觉并提升迁移建议质量。
使用编码代理的N版本编程
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文在当代AI编码代理背景下重新审视N版本编程,通过Knight-Leveson实验评估代理系统、模型和实现语言的多样性对故障模式的影响,发现常见模式故障,但多数投票三版本单元显著降低故障数,证明该策略的工程实用性。
提示质量与拉取请求结果:基于阶段的LLM辅助开发实证研究
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 通过分析265个开发者与ChatGPT的交互,研究提示结构(上下文、具体性、验证)对LLM辅助开发中代码生成、采纳和集成深度的影响,发现不同维度在不同阶段有不同作用。
Comments 48 pages, 2 figures
数据智能代理:通过自主编码代理解释、建模和查询企业数据
机构 * C3 AI
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 提出Data Intelligence Agents (DIA)系统,由三个自主编码代理组成,通过执行、验证和修复工件来压缩数据集成工作流,在七个SQL基准测试中达到或超越最佳结果。
Skill-to-LoRA:从使用技能到学习行为以实现令牌高效的LLM智能体
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出Skill-to-LoRA方法,将技能文本转换为LoRA适配器,替代运行时注入技能文档,在SWE-Skills-Bench上提升通过率并降低令牌成本。
Comments Preprint. 10 pages, 4 figures
LLM 编码智能体能否推理时间序列?
机构 * Institute of Formal and Applied Linguistics, Faculty of Mathematics and Physics, Charles University(查尔斯大学数学与物理学院形式与应用语言学研究所)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 研究 LLM 编码智能体在时间序列分析中的能力,发现代码访问可提升性能达 10%,但仍有 22-34% 错误,并分析了推理差距。
Comments 17 pages, 7 figures
MultiMolecule: 一个用于生物分子序列模型工作流的模块化生态系统
机构 * DanLing Team(丹 Ling 团队)
专题命中 软件智能体 :workflow(abstract);分类 cs.LG
AI总结 提出MultiMolecule开源生态系统,通过标准化接口整合RNA、DNA和蛋白质序列模型,提供53个模型族实现、112个检查点和16个数据集资源,支持模型复用、评估和生物预测。
LearnOpt: 通过知识图谱和约束优化恢复标准化考试的潜在认知结构
机构 * Independent Researchers(独立研究者)
专题命中 软件智能体 :planning(abstract);分类 cs.AI
AI总结 提出LearnOpt框架,利用知识图谱和约束优化从历史试题中恢复潜在认知结构,生成个性化学习计划;在NEET和JEE Advanced考试数据上验证了潜在结构的稳定性和可检测的转变。
Comments 26 pages, 2 figures, 6 tables. Code, data, and calibration tooling: https://github.com/joyboseroy/learnopt. Datasets on HuggingFace: joyboseroy/neet-skill-tags-2016-2024, joyboseroy/jee-advanced-skill-tags-2016-2023
内在计算功能主义与模拟意识
机构 * Araya Inc.(Araya公司) ; School of Philosophy, Fudan University(复旦大学哲学学院) ; Sussex Centre for Consciousness Science, University of Sussex(Sussex大学意识科学中心)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文从内在计算功能主义出发,提出机制丰富的规范结构,论证若意识是计算构成的,则任何满足内在因果-计算实现关系的系统(生物、人工或模拟)都实现相同的意识相关属性。
MiniMax 稀疏注意力
机构 * MiniMax ; Peking University(北京大学) ; NVIDIA(英伟达) ; Zhejiang University(浙江大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。
Comments 30 pages, 14 figures
PROJECTMEM:面向AI编码代理的本地优先、事件溯源记忆与判断层
机构 * University of Utah(犹他大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出PROJECTMEM,一种本地优先、事件溯源的记忆与判断层,通过记录事件日志并生成紧凑摘要,帮助AI编码代理避免重复错误,实现记忆即治理。
Comments 12 pages, 5 figures, 1 table. Code: https://github.com/riponcm/projectmem
SentTrack: GitHub问题仓库中情感驱动的瓶颈检测
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 提出SentTrack双管道框架,结合大语言模型摘要与ABCDE交互分类,从约9000个GitHub问题线程中检测社会技术瓶颈,发现49%线程停滞,仅13%解决,并通过加权评分引擎优先处理高摩擦讨论。
AI编码智能体能够复现社会科学研究结果
机构 * University of Oxford(牛津大学) ; University of Zurich(苏黎世大学) ; Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 本研究构建SocSci-Repro-Bench基准测试,评估Claude Code和Codex两个前沿编码智能体在221项社会科学任务中的复现能力,发现它们能复现大部分结果,且Claude Code表现更优,同时提示框架会影响确认性规范搜索。
MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。
Comments preprint
大型语言模型移植海洋模型:FESOM2(Fortran到C再到C++/Kokkos)的经验与教训
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文展示利用LLM将FESOM2海洋模型从Fortran移植到C再到C++/Kokkos,通过两阶段翻译、严格字面转换和逐级验证,在数周内保持物理准确性并实现GPU加速。
前沿编码代理使用元编程适应不熟悉的编程语言
机构 * Lossfunk
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 研究评估LLM编码代理在陌生语言上的表现,发现强代理通过元编程(如用Python生成目标语言代码)适应,禁止此策略性能大幅下降,而弱代理无法从中受益。
Comments 43 pages, 8 figures
EstRTL:功能估计引导的RTL代码生成
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; Defense Innovation Institute, Academy of Military Science (AMS)(军事科学院创新院) ; School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) ; Key Laboratory of Advanced Microprocessor Chips and Systems, Changsha, China, and College of Computer Science and Technology, National University of Defense Technology, Changsha, China(先进微处理器芯片与系统重点实验室,长沙,中国,和国防科技大学计算机科学与技术学院,长沙,中国) ; Defense Innovation Institute, AMS, Beijing, China and Qiyuan Lab, Beijing, China(军事科学院创新院,北京,中国和启元实验室,北京,中国)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出EstRTL框架,通过静态功能评分估计,结合生成、评估和修正三阶段范式,提升LLM生成RTL代码的功能正确性,在通用LLM上正确率提升3.2%-9.0%。
ToolRosella: 将代码仓库翻译为科学智能体的标准化工具
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 提出ToolRosella框架,通过仓库分析、工具接口构建、执行测试和迭代修复,自动将异构科学代码仓库转化为标准化、可被智能体调用的工具,在122个仓库上达到61.5%的转换成功率,下游任务成功率为84.0%。
Comments 20 pages
BadRobot: 在物理世界中越狱具身LLM智能体
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beihang University(北航) ; Griffith University(格里菲斯大学)
专题命中 软件智能体 :planning(abstract);分类 cs.AI
AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。
Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io
Journal ref International Conference on Learning Representations (ICLR) 2025
通过小型语言模型的代码重构实现高效技能落地
机构 * KAIST(韩国科学技术院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。
Comments Accepted to ICML 2026
审查代码,而非故事:代码优先同行评审的愿景与协议
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 提出代码优先同行评审协议,由AI系统构建环境、执行实验并生成标准化审查包,将评审焦点从叙述转向可执行证据。
Comments 17 pages, vision and protocol paper
可执行世界模型在编码智能体时代的ARC-AGI-3应用
机构 * SingularityNET
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。
Comments 13 pages. Accepted for publication at AGI-2026