SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents
SpecBench: 评估软件工程LLM代理的规约级推理能力
专题命中 代码生成 :code generation(abstract)
AI总结 提出SpecBench基准,通过从RFC过程中提取任务,评估LLM代理在无执行反馈下识别初始设计提案中遗漏、歧义、不一致或错误假设的规约级推理能力。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
SpecBench: 评估软件工程LLM代理的规约级推理能力
专题命中 代码生成 :code generation(abstract)
AI总结 提出SpecBench基准,通过从RFC过程中提取任务,评估LLM代理在无执行反馈下识别初始设计提案中遗漏、歧义、不一致或错误假设的规约级推理能力。
FunKit:用于泛函方法的计算机代数工具包
专题命中 代码生成 :code generation(abstract)
AI总结 本文介绍FunKit,一个Mathematica包,用于从任意主方程推导和追踪泛函方程,支持多种场论和主方程,并提供代码生成功能。
Robo-Blocks:社交机器人终端用户设计与编程中的生成式支架
机构 * Department of Computer Sciences\ of Wisconsin--Madison
专题命中 代码生成 :code generation(abstract)
AI总结 通过研究通过设计(RtD)过程,提出基于LLM的积木式编程环境Robo-Blocks,利用生成式支架将高级想法转化为可执行机器人行为,支持新手程序员,并揭示了用户角色与使用模式。
基于LLM多智能体框架的自优化拓扑优化
专题命中 代码生成 :code generation(abstract)
AI总结 提出TopOptAgents多智能体系统,通过LLM协作与迭代自优化循环,自动化拓扑优化的决策与设计过程,尤其对文献覆盖不足的问题类效果显著。
Comments 28 pages, 17 figures
Pramana:自主代理网络中声明验证的协议层处理
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出Pramana协议层,通过定义缺失的线缆格式,为自主代理网络中的声明验证提供结构化方法,结合经典印度认识论中的四种知识类型,确保验证过程的确定性和可追溯性。
Comments 23 pages, 4 figures, 5 tables, 42 references
在可实现性假设下利用超位置的合成完备性
专题命中 代码生成 :program synthesis(abstract)
AI总结 本文研究了在可实现性假设下利用超位置进行程序合成的完备性问题,通过改进超位置演算并证明其正确性和完备性,确保能够找到满足规范的可计算程序。
Comments to be published in IJCAR 2026
uGen:一种用于生成微架构攻击PoC的代理框架
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出uGen框架,利用LLM生成微架构攻击代码,解决现有方法的可移植性问题,通过多代理设计提升攻击代码的准确性与实用性。
将AlphaEvolve适应于优化TPUs上的全同态加密
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出利用AlphaEvolve自动化优化TPUs上的全同态加密内核,通过进化搜索提升TFHE和CKKS方案的执行效率,减少延迟。
Tab,Tab,Bug:AI集成IDE中Next Edit Suggestions的安全隐患
专题命中 代码生成 :code generation(abstract)
AI总结 本文研究了AI集成IDE中的Next Edit Suggestions安全问题,揭示了其复杂的上下文检索机制和潜在攻击向量,通过实验室测试和在线调查发现NES易受上下文污染和交易性编辑影响,需加强安全教育和防护措施。
代理预编码:基于LLM的多智能体系统用于预编码优化
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出AgenticPrecoding框架,通过多智能体系统自动推导端到端预编码,提升未来6G网络中异构场景的适应性。
严格函数纠错码与数据保护的存在性与构造
专题命中 代码生成 :code generation(abstract)
AI总结 本文研究严格函数纠错码与数据保护的存在性和构造,通过三种贡献:基于α-距离图框架建立存在条件,利用Simonis结果开发反向构造,以及从窄感BCH码中独立构造严格函数纠错码。
基于检索增强的核启发式合成(RKHS):利用大语言模型的结构化方法用于硬件设计
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出RKHS方法,结合检索增强生成、紧凑核启发式模板和LLM驱动的反馈循环,用于硬件设计中的启发式优化,实验证明其在降低延迟的列表调度中有效。
Comments Presented at the NSF Workshop on Agents for Chip Design Automation, UCLA
Dr.Sai:BESIII实世界物理分析的代理AI
专题命中 代码生成 :code generation(abstract)
AI总结 Dr.Sai利用大语言模型实现自动物理分析,通过自然语言转化为严谨的物理工作流,在BESIII实验中成功重新测量了十个J/psi衰变分支比,无需手动编程,展示了自主发现的潜力。
Comments 39 pages, 7 figures
QRAFTI:量化金融领域实证研究的代理框架
专题命中 代码生成 :code generation(abstract)
AI总结 QRAFTI框架通过整合面板数据研究工具与MCP服务器,支持对大规模金融面板数据进行因子研究,可复现已有因子、测试新信号并生成标准化报告。
VerilogCL:一种用于鲁棒LLM基于Verilog生成的对比学习框架
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出VerilogCL框架,通过对比学习和主动错误筛查提升Verilog代码生成的鲁棒性,实验表明其在编译成功率和功能正确性上优于现有基线。
云原生与分布式系统用于高效可扩展的大语言模型——研究议程
专题命中 代码生成 :code generation(abstract)
AI总结 本文探讨云平台和分布式系统在支持大语言模型的可扩展性、效率和优化中的作用,分析部署复杂性及新兴趋势,提出未来研究方向。
Comments 45 pages, 5 figures
AgentClick: 一个基于技能的人机协作审查层用于终端AI代理
专题命中 代码生成 :code generation(abstract)
AI总结 AgentClick通过浏览器界面提供结构化交互,降低非专家用户与AI代理协作的门槛,提升效率和质量。
Comments Accepted to ACM CAIS 2026 System Demonstrations. Conference paper
SeQuant框架用于符号和数值张量代数。I. 核心功能
专题命中 代码生成 :code generation(abstract)
AI总结 SeQuant框架结合符号计算与数值计算,通过图论张量网络简化张量表达式,优化Wick定理应用,并支持非协变张量网络及参数依赖张量模式,实现符号与数值计算的无缝集成。
COBALT-TLA:一种用于跨链桥漏洞发现的神经符号验证循环
专题命中 代码生成 :code generation(abstract)
AI总结 COBALT-TLA结合LLM与TLA+模型检查器,通过自动REPL循环发现跨链桥漏洞,首次自主识别Optimistic Relay Attack漏洞类。
Comments 4 pages, 1 table. Submitted to FMBC 2026 (Formal Methods for Blockchains)
CKG-LLM:基于知识图谱的智能合约访问控制漏洞检测框架
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出CKG-LLM框架,利用大语言模型能力将自然语言漏洞模式转化为知识图谱查询,提升智能合约访问控制漏洞检测性能。
Comments 6 pages, 5 figures
向大型语言模型迈进的自动化渗透测试
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出RedShell框架,利用微调的LLM生成针对Windows漏洞的恶意PowerShell代码,实现高效隐私保护的渗透测试自动化。
RedShell:基于生成AI的伦理黑客方法
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出RedShell工具,通过生成恶意PowerShell代码提升渗透测试效率,并构建了用于训练恶意代码生成模型的真实数据集,实验显示其生成的代码语法正确率高,语义一致性良好。
通过追踪提示级轨迹来理解学生在编程教育中使用AI的学习过程
专题命中 代码生成 :code generation(abstract)
AI总结 研究通过分析学生与AI交互的轨迹,揭示其在编程作业中使用AI工具的学习策略与能力差异,发现学生通过迭代改进而非直接复制AI生成代码的方式提升编程能力。
AgenticRS-Architecture:面向代理推荐系统的系统设计
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出AgenticRS架构,通过交互式进化代理实现推荐系统全生命周期自动化,核心模块包括AutoTrain、AutoFeature和AutoPerf,实现模型、特征和资源的自适应演化。
AutoUE:通过多智能体系统自动化生成Unreal引擎中的3D游戏
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出AutoUE系统,通过多智能体协同实现3D游戏的端到端生成,涵盖模型检索、场景生成、代码合成及自动化测试,验证了其有效性。
Comments Accepted as a ACL'26 Findings full paper
自组织:一种面向LLM服务的自演化系统范式,用于运行时动态
专题命中 代码生成 :program synthesis(abstract)
AI总结 本文提出Autopoiesis,一种自演化系统,使LLM服务从静态策略部署转向持续在线策略演化,通过实时动态驱动策略合成,提升服务在运行时动态下的适应性与效率。
Sci-Mind:基于认知的对抗辩论用于自主数学建模
专题命中 代码生成 :code generation(abstract)
AI总结 Sci-Mind通过模仿人类科学发现过程,结合经验记忆回溯和对抗性认知辩证,提升自主数学建模的严谨性和代码可执行性。
通过隐写术可以ary文件保护LLM免受滥用及AI驱动的恶意软件
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出基于隐写术canary文件的框架,用于检测未经授权的LLM处理,通过两种模式实现符号和语言隐写术的结合,有效识别敏感文档。
代理图示学:迈向高能物理中自主符号计算
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出Diagrammatica,通过HEPTAPOD框架扩展实现LLM代理的多步骤理论计算。通过工具约束计算和知识接地方法,实现符号计算的精确性与可验证性,验证了在高能物理中的应用效果。
Comments 54 pages, 6 figures
构建SAIL:利用科学家-人工智能循环以实现严谨的可视化工具
专题命中 代码生成 :code generation(abstract)
AI总结 本文提出SAIL框架,通过分离领域逻辑与代码语法,帮助科学家在保持科学严谨性的同时利用AI快速生成代码,展示两个开源天文工具,证明其在科普、教学和早期研究中的有效性。
Comments 10 pages (+ references), 4 figures. Interactive visualizations available at: https://nicosmo.github.io/lensing_visualization/ and https://nicosmo.github.io/cosmic_web_explorer/