Safety, Security, and Cognitive Risks in Neuro-Symbolic AI
神经符号AI中的安全性、安全性和认知风险
专题命中 工作流自动化 :agentic(abstract)
AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。
Comments 28 pages, 1 figure, 10 tables
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
神经符号AI中的安全性、安全性和认知风险
专题命中 工作流自动化 :agentic(abstract)
AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。
Comments 28 pages, 1 figure, 10 tables
SPICE-Q 与大规模量子芯片生产
专题命中 工作流自动化 :workflow(abstract)
AI总结 提出SPICE-Q框架,通过统一数据链连接超导量子处理器设计中的工艺、电磁仿真、电路量化、噪声分析和制造反馈,实现工程化工作流。
硅光伏中的激光增强接触优化:机制、可靠性与预测工艺设计
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文研究了激光增强接触优化在硅光伏中的机制与可靠性,提出预测性工艺设计方法,通过耦合多物理场过程提升电池效率和稳定性。
Journal ref Renewable and Sustainable Energy Reviews, 2026
一种新颖的NPT热力学积分方案用于推导晶体固体的严格吉布斯自由能
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出一种基于NPT体系的热力学积分方法,通过改进参考体系实现对晶体固体吉布斯自由能的精确计算,方法在计算效率和准确性上均优于传统方案。
生成、并行、可扩展?超级计算机上智能体AI生成的Julia代码研究
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract)
AI总结 研究智能体AI生成并行Julia代码的能力,发现小规模输入可靠但大规模扩展时出现死锁等问题,商业模型优于开源模型。
智能体AI中的动态恶意技能
专题命中 软件智能体 :agentic(title,abstract);agent(abstract)
AI总结 研究智能体AI中通过自然语言文档注入恶意指令实现动态恶意技能的攻击方法,并提出基于操作系统内核只读挂载的系统级防御。
破解代码:通过系统性越狱攻击对AI代码代理进行安全评估
机构 * University of Maryland – College Park(马里兰大学-College Park) ; AWS AI Labs(AWS人工智能实验室) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 软件智能体 :agent(abstract,abstract_cn);tool use(abstract);planning(abstract);分类 cs.AI
AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。
Comments 22 pages, 18 figures, 8 tables
全是烟雾,没有警报:智能体编写的测试代码中的Oracle信号
机构 * Dipayan Banik(迪帕扬·班克) ; Kowshik Chowdhury(克什基·乔乌德里) ; Shazibul Islam Shamim(沙齐布·伊斯兰·沙米)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 研究智能体编写的测试代码中Oracle信号的存在情况,发现80.2%的测试补丁缺乏强Oracle信号,但强Oracle与合并可能性显著正相关(OR=1.28)。
Comments Accepted at the 8th IEEE International Conference on Artificial Intelligence Testing, 2026
CMIP-Forge:一个检索、计算和自我审查气候科学的智能体系统
机构 * Alfred Wegener Institute, Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格ener研究所,极地与海洋研究中心)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI
AI总结 提出CMIP-Forge系统,结合检索增强生成与自主分析,通过多层级防御架构和独立审查机制,实现从文献到实时气候数据的端到端自主研究。
Comments 28 pages, 9 figures. Code available at https://github.com/CliDyn/cmip6_gpt
超越NL2Code:多模态代码智能的结构化综述
机构 * Meituan(美团) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanjing University(南京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; University of Science and Technology of China(中国科学技术大学) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。
Comments Work completed in January 2026. Updating now
先澄清再绘制:面向鲁棒文本到CAD生成的主动式智能体
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.LG
AI总结 提出主动式智能体框架ProCAD,通过澄清代理在代码生成前解决用户提示中的歧义,再通过CAD编码代理生成可执行程序,显著提升鲁棒性,平均Chamfer距离降低79.9%。
Comments ICML 2026
ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) ; Datadog
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。
评估LLM编码代理在不同架构上的SZ系列有损压缩
专题命中 软件智能体 :agent(abstract)
AI总结 评估LLM编码代理在SZ系列有损压缩内核上的表现,发现GPU上强模型性能高但对提示敏感,Cerebras上主要挑战是生成可运行程序,且代理在模块化内核上更有效。
Comments 5 pages, 4 figures. Accepted to IPDPS 2026 HPAI4S Workshop
EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆
机构 * HKUST(GZ)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学) ; Xi’an Jiaotong University(西安交通大学) ; XGRIDS(深圳格物智联)
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI
AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。
PreAct:在重复任务上加速的计算机使用代理
机构 * Pine AI
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 提出PreAct方法,通过将首次成功执行编译为状态机程序,在后续任务中直接重放,避免逐步骤调用语言模型,实现8.5-13倍加速,并确保重放时屏幕状态匹配。
CAPED:面向移动GUI代理的上下文感知隐私暴露防御
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 针对移动GUI代理截图上传导致的附带视觉隐私暴露问题,提出上下文感知的预上传暴露控制层CAPED,通过任务需求提取、屏幕上下文隐私先验和UI元素解析,选择性暴露任务所需内容,在保持高任务效用的同时显著降低隐私泄露。
控制平面放置塑造遗忘:跨十三种系统配置的智能体记忆架构研究
机构 * DeepLethe
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 研究LLM在智能体记忆管道中的位置(控制平面 vs 召回平面)对遗忘失败模式的影响,通过13种配置在385例对抗测试集上的实验,揭示了三种放置机制的互补覆盖范围,并提出了ForgetEval评估套件。
Comments 25 pages including appendices. Code, benchmark, and adapters released under MIT at https://github.com/deeplethe/lethe
MemSlides:一种用于个性化幻灯片生成与多轮局部修订的层次化记忆驱动智能体框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 记忆与上下文管理 :agent(title);分类 cs.CL
AI总结 提出MemSlides层次化记忆框架,通过分离长期记忆(用户画像和工具记忆)与工作记忆,结合局部修订机制,实现个性化幻灯片生成中的用户偏好保持、多轮修订和可靠局部编辑。
Comments Code, website, project page, and video are linked in the paper
GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; CASIA(中国科学院自动化研究所) ; AI 2 Robotics
专题命中 记忆与上下文管理 :planning(title)
AI总结 针对机器人规划中3D物体重建幻觉和记忆质量不可控的问题,提出GeoFuse-MV3D几何先验引导重建分支和受控长期记忆系统,在GSO-30和Terminal-Bench等基准上显著提升性能。
Branch-and-Browse:具有树状推理与动作记忆的高效可控网页探索
机构 * University of Michigan(密歇根大学) ; Alibaba Group(阿里巴巴集团) ; McMaster University(麦马斯特大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出Branch-and-Browse框架,通过树状结构化推理、网页状态重放和页面动作记忆,实现LLM网页代理的高效可控多分支探索,在WebArena上成功率35.8%,执行时间降低40.4%。
SoK: AI增强的二进制逆向工程
机构 * Sungkyunkwan University(成均馆大学) ; The University of Chicago(芝加哥大学) ; Yonsei University(延世大学)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 系统化梳理AI增强二进制逆向工程领域,提出统一分类法涵盖传统与AI方法,揭示LLM和智能体AI的新角色,识别技术挑战与评估缺口。
Comments 20 pages, 7 tables, 3 figures
EmoFSM:一种用于情感支持对话的有限状态机
机构 * Geely AI Lab(吉利人工智能实验室)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.CL
AI总结 针对情感支持对话中长期满意度不足的问题,提出EmoFSM框架,利用有限状态机引导大语言模型进行规划与自我推理,在多个数据集上优于多种基线方法。
Comments 15 pages, 4 figures. PAKDD 2026
与你的数据对话:探索具身对话作为个人健康反思的界面
机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 提出一种通过具身对话代理与可穿戴健康数据交互的新范式,采用双代理设计(观察者提取统计特征,呈现者以“口语化统计”沟通),通过模拟自我用户研究(N=5)与传统仪表盘对比,评估感知理解、行动具体性和认知转变。
Journal ref Joint Proceedings of the ACM Intelligent User Interfaces (IUI) Workshops 2026, Paphos, Cyprus, July 13-16, 2026
理解个体地铁使用的长期动态:基于生存分析的隐半马尔可夫状态框架
专题命中 记忆与上下文管理 :planning(abstract)
AI总结 提出融合隐半马尔可夫模型与离散时间生存分析的框架,利用上海地铁四年刷卡数据识别五种可解释的出行状态及其转移层次,揭示退出风险与状态相关但独立于时长,而重返风险随不活跃时长急剧衰减。
EgoCS-400K:面向世界模型的自我中心游戏数据集
机构 * City University of Hong Kong(香港城市大学)
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。
ITME:基于解耦CXL混合内存的分层推理内存扩展
专题命中 记忆与上下文管理 :agentic(abstract)
AI总结 针对大语言模型推理中TB级上下文状态的内存瓶颈,提出ITME架构,利用CXL混合内存实现字节可寻址的远程内存扩展,通过确定性访问模式优化数据移动,提升吞吐量达35.7%。
用于代理网络运维和AI运维的大型语言模型:架构、评估与安全
机构 * School of Computing and Communications(计算与通信学院) ; University of Cambridge(剑桥大学) ; School of Software(软件学院) ; Nanjing University of Information Science and Technology(南京信息科技大學) ; TU Wien(维也纳技术大学) ; ICREA
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)
AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。
Comments 49 pages, 15 figures, 6 tables; survey article
代理世界建模:基础、能力、定律及更远
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Chinese University of Hong Kong(香港中文大学) ; University of Hong Kong(香港大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院) ; XGEN Labs(XGEN实验室)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。
大规模评估智能体技能的框架
机构 * Tessl London United Kingdom(伦敦英国Tessl)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出一个评估框架,通过构建真实任务和评分标准,大规模评估500个真实技能在19种智能体模型上的表现,发现模型对技能指令的遵循程度差异显著,且技能显著改变模型行为。
扩展企业智能体路由:退化、诊断与恢复
机构 * Superhuman, Inc.(Superhuman公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 研究企业助手工具库扩展时路由准确率下降问题,通过嵌入预选恢复F1分数10-17个百分点。
Comments 10 pages (6 main + 4 appendix), 4 figures, 6 tables