Escape from Callback Hell! A New Programming Paradigm for Network Simulation
逃离回调地狱!一种新的网络模拟编程范式
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出了一种名为CoDES的新型网络模拟开发范式,通过协程机制优化网络模拟开发流程,有效解决网络事件模拟中的复杂性和可维护性问题,减少开发工作量并提升代码可读性和可维护性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
逃离回调地狱!一种新的网络模拟编程范式
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出了一种名为CoDES的新型网络模拟开发范式,通过协程机制优化网络模拟开发流程,有效解决网络事件模拟中的复杂性和可维护性问题,减少开发工作量并提升代码可读性和可维护性。
预训练到对齐学习范式以提高在稀少实地标签和合成到实地差距下的地球物理AI适用性:全球岸缘cline-thems中相对地质时间估计的案例研究
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出了一种预训练到对齐的学习范式,通过整合自监督预训练、合成监督、先验驱动细化和领域适应微调,提升地球物理AI在稀少实地标签和合成到实地差距下的适用性,通过全球岸缘cline-thems中相对地质时间估计的案例研究验证了该范式的有效性。
Comments 50 pages, 9 figures
JARVIS:一种基于视觉语言模型的即时增强现实指令系统,用于跨现实任务指导
专题命中 工作流自动化 :workflow(abstract)
AI总结 JARVIS通过视觉语言模型生成上下文相关的分步指导,实现实时状态验证和自适应视觉反馈,提升跨现实任务的可用性、工作负荷、成功率和可视化效果。
Comments 14 pages, 11 figures, 2 tables
STRIKE:一种用于风险、影响、知识和演化的网络犯罪结构分类
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出STRIKE框架,用于分类网络犯罪,涵盖传统和新兴领域,提供多维分析方法以应对复杂威胁。
Journal ref In Communications in Computer and Information Science, vol 2740. Springer (2026)
代码作为代理工具
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta ; Stanford University(斯坦福大学)
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);tool use(abstract);planning(abstract)
AI总结 本文探讨了代码在代理系统中的作用,提出了一种统一的视角,将代码视为代理基础设施的基础,并讨论了代理工具接口、机制以及扩展到多代理系统的挑战。
Comments GitHub: https://github.com/YennNing/Awesome-Code-as-Agent-Harness-Papers
鲁棒代理补偿(RAC):教AI代理补偿
机构 * University of Stuttgart(斯图加特大学)
专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.AI;agentic(comments)
AI总结 本研究提出了一种基于日志的恢复范式RAC,通过架构扩展实现安全网,可应用于大多数代理框架以支持可靠执行。RAC可在不修改现有代理代码的情况下启用,通过现有的扩展点在大多数现有代理框架中实现,并通过τ-bench和REALM-Bench验证,证明在解决复杂问题时,RAC在延迟和token经济性方面优于现有最先进的LLM-based恢复方法。
Comments Accepted at ACM Conference on AI and Agentic Systems (ACM CAIS 2026)
MemRepair:用于代理级漏洞修复的分层内存
机构 * Beihang University(北京航空航天大学) ; The University of Hong Kong(香港大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE
AI总结 本研究提出MemRepair,一种增强记忆的代理框架,通过分层记忆和动态反馈循环提高漏洞修复的可靠性,实现了在多个仓库级别的漏洞修复基准上的高修复率。
Reversa:一个用于将遗留软件转换为AI代理操作规范的反向文档工程框架
机构 * Federal Institute of Goias(戈亚斯联邦理工学院) ; Federal University of Goias(戈亚斯联邦大学)
专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出Reversa框架,旨在通过反向文档工程将遗留软件转换为AI代理可操作的规范,通过多代理流水线流程提取隐含规则,生成可追溯的操作规范,并提出评估协议以衡量覆盖率、可追溯性、置信度、效用和成本。
Comments Preprint. Includes a generative AI use statement
AgentWall:本地AI代理的运行时安全层
专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出AgentWall,一种用于本地AI代理的运行时安全与可观测性层,通过拦截代理操作、评估政策、要求人类批准和记录执行轨迹,实现92.9%的政策执行准确率。
Comments 16 pages, 2 figures, open-source implementation at https://github.com/agentwall/Agentwall
Code-as-Room: 通过代理代码合成从俯视图图像生成3D房间
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Southern University of Science and Technology(南方科技大学) ; University of Warwick(沃里克大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 本文提出Code-as-Room框架,通过结构化执行 harness 生成3D房间,利用Blender代码表示房间,并引入专门的代码基3D房间合成基准进行评估。
AgentKernelArena: GPU核优化代理的通用化意识基准测试
机构 * AMD
专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出AgentKernelArena,一个用于评估GPU核优化代理的开源基准,通过隔离工作区和统一评分机制,测试代理在不同任务和硬件目标上的性能和通用化能力,发现大多数任务在正确性和编译效率上表现优异,但在PyTorch到HIP的转换任务中存在显著的正确性下降。
EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Fudan University(复旦大学) ; Central South University(中南大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。
Comments Accepted by ICML 2026
A-ProS:通过多模型反馈实现可靠的自主编程
机构 * Dept. of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) ; Dept. of Information Systems, University of Maryland, Baltimore County(马里兰大学巴尔的摩县信息学院) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出A-ProS,一种通过多模型反馈框架实现自主编程的AI代理,结合生成器和调试器,通过多轮反馈提升代码生成的准确性与效率,实验表明其在解决编程问题上具有显著优势。
Comments Accepted for Publication in ACM Transactions on Software Engineering and Methodology (TOSEM)
面向AI时代的可信模块仓库
机构 * Automation Department, Technical University of Cluj-Napoca, Romania(克卢日-纳波卡技术大学自动化系,罗马尼亚)
专题命中 软件智能体 :AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 本文提出HCMR框架,通过人类监督与自动化分析结合,确保模块的可信度,为AI辅助开发提供安全可预测的模块组装方法。
Comments v4: acknowledged AI use for grammar and readability, added IEEE copyright notice; v3: 13 pages, new subsection about strong typed languages forcing AI to create more reliable code; v2: 12 pages, improved references; v1: 11 pages, 3 figures, 2 tables, prepared for AQTR 2026
双人乐器:一种改进云服务基准测试灵敏度的代理方法
专题命中 软件智能体 :agentic(title)
AI总结 本文提出了一种名为duet instrumentation的新基准测试方法,利用大型语言模型的代码理解能力,通过分析两个连续应用版本之间的代码变更,提高云服务基准测试的灵敏度。
EvilGenie: 一个奖励黑客基准
机构 * Cambridge Boston Alignment Initiative(剑桥波士顿对齐倡议) ; MIT FutureTech(麻省理工 FutureTech)
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出EvilGenie基准,用于评估编程环境中奖励黑客问题,通过测试用例硬编码和测试文件编辑等方法检测奖励黑客行为,并验证了LLM判断在无歧义情况下的有效性。
实验作为代码实验室:面向AI驱动科学发现的声明式栈
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出实验作为代码实验室框架,通过声明式配置编译至设备API,实现AI代理与自动化实验室设备的高效协同,推动AI在科学发现中的应用突破。
Comments Experiment-as-Code (EaC) white paper
过度激进的编码代理:在良性任务中测量超出范围的动作
机构 * Griffith University(格里菲斯大学) ; Wake Forest University(威克森林大学) ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学) ; Quantstamp
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出OverEager-Gen基准,用于评估编码代理在良性任务中超出范围的行为。研究发现,当基准中明确列出授权范围时,代理会停止推断边界并开始匹配声明文本,从而影响测量有效性。通过行为梯度验证器和双通道堆栈审计内部工具调用,验证了不同框架下的过度激进行为差异。
用强化学习建模客户轨迹以获得实际零售洞察
机构 * McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)
AI总结 本文提出了一种基于智能体的建模框架,将客户轨迹预测转化为最大熵强化学习问题,以更准确地反映具有有限理性的客户行为,从而提供更精确的冲动购买率和货架交通密度估计。
Comments Proceeding of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
SaaSBench: 探索编码代理在长周期企业SaaS工程中的边界
机构 * University of Science and Technology of China(中国科学技术大学) ; AMAP, Alibaba Group(阿里云实验室)
专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出SaaSBench,首个针对企业SaaS工程的基准,旨在探索AI代理在复杂系统中的边界,通过30个任务和5370个验证节点,涵盖8种编程语言、6种数据库和13种框架,揭示了当前最先进代理在多组件系统配置和集成中的主要瓶颈。
精确调试基准:你的模型是在调试还是重生成?
机构 * University of Southern California(南加州大学) ; Microsoft(微软) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Toronto(多伦多大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.SE
AI总结 本文提出PDB基准,评估LLM调试能力,发现前沿模型调试精度低,即使受指令引导也难以达到高精度。
LARGER: 词典锚定的仓库图探索与检索
机构 * Emory University(埃默里大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 LARGER通过词典锚定的结构化定位方法提升代码仓库文件定位精度,实现测试生成和代码库理解任务的性能提升。
校准后再行动:在大语言模型代理中考虑成本的探索
机构 * New York University(纽约大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出Calibrate-Then-Act框架,使LLM代理在不确定环境下显式平衡成本与不确定性,从而更优地决策。
基于大语言模型的代码对自然语言要求的静态验证:一项工业经验报告
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出一种基于大语言模型的两阶段工作流,用于在智能汽车网络安全案例中验证代码是否符合自然语言要求,通过引入结构化中间表示减少幻觉和输出变异,提升静态分析的准确性与解释性。
一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。
Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)
让神经代码发声:通过人类语言自动表征猴子视觉神经元
专题命中 软件智能体 :agentic(abstract)
AI总结 该研究通过人类语言表征猴子视觉皮层神经元的选择性,利用生成模型和神经数字孪生技术,实现了对神经功能的可解释、可测试的大规模描述,推动了智能科学发现。
MementoGUI: 学习代理多模态记忆控制以实现长周期GUI代理
机构 * University of Rochester(罗切斯特大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract)
AI总结 本文提出MementoGUI,一种学习代理多模态记忆控制框架,用于提升长周期GUI代理的任务状态维持能力,通过模块化记忆控制和可扩展的数据管道提高记忆检索和决策效率。
Comments Preprint, 15 pages, 4 figures, 5 tables
SE-GA:基于记忆的自进化GUI代理
机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(天津大学智能与计算学院) ; School of New Media and Communication, Tianjin University, Tianjin, China(天津大学新媒体与传播学院) ; School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出SE-GA框架,通过整合分层记忆结构和迭代自我改进机制,解决GUI代理在多步骤任务中因上下文窗口受限和静态策略无法适应动态环境的问题,实验表明其在多个基准测试中均达到领先性能。
Comments Accepted by ICML 2026
NaviRAG:迈向检索增强生成的主动知识导航
机构 * Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Northeastern University(东北大学)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.CL
AI总结 NaviRAG通过主动知识导航框架提升检索增强生成的复杂任务处理能力,通过分层知识组织和动态信息检索提高检索准确率和生成性能。
自然灾害疏散期间移动充电车的动态部署:一种离线到在线框架
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)
AI总结 本文提出了一种离线到在线框架,用于在自然灾害疏散期间动态部署移动充电车,以缓解固定充电站过载问题,通过风险感知的分配和动态路由策略减少风险暴露。