Program Semantic Inequivalence Game with Large Language Models
基于大语言模型的程序语义不等价博弈
机构 * University of Edinburgh(爱丁堡大学) ; Cisco Systems(思科系统)
AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。
大厂专区
基于大语言模型的程序语义不等价博弈
机构 * University of Edinburgh(爱丁堡大学) ; Cisco Systems(思科系统)
AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。
重新思考基础智能体的内存机制:第二阶段综述
机构 * UIC(伊利诺伊大学香槟分校) ; IIT(伊利诺伊理工学院) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; UW–Madison(威斯康星大学麦迪逊分校) ; ASU(亚利桑那州立大学) ; Emory(埃默里大学) ; Northwestern(西北大学) ; NTU(国立台湾大学) ; UCF(佛罗里达大学) ; Rutgers(新泽西罗格斯大学) ; Cambridge(剑桥大学) ; Harvard(哈佛大学) ; UTokyo(东京大学) ; UCSD(加州大学圣地亚哥分校) ; UCSC(加州大学圣塔克鲁斯分校) ; TAMU(德克萨斯大学奥斯汀分校) ; UCSB(加州大学圣塔芭芭拉分校) ; MBZUAI(马克斯·普朗克人工智能研究所) ; McGill(麦吉尔大学) ; UCLA(加州大学洛杉矶分校) ; Stanford(斯坦福大学) ; Salesforce ; Google(谷歌) ; Meta ; Roblox ; Cisco(思科) ; Capital One
AI总结 本文综述了基础智能体内存机制,从内存基质、认知机制和主体维度分析内存在不同拓扑结构下的实现,并探讨内存操作的学习策略与评估指标。
Comments Accepted at Transactions on Machine Learning Research (TMLR) with Survey Certification. Project page: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory
用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习
机构 * Iowa State University(爱荷华州立大学) ; Cisco AI Research(思科人工智能研究院)
AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。
基于贝叶斯神经网络的直接贝叶斯自由能最小化
机构 * Cisco Inc.(思科公司)
AI总结 本文提出通过直接最小化贝叶斯自由能来训练贝叶斯神经网络,该方法在树状因子图上精确,可处理混合概率和确定性子图,且在单次梯度传递中实现联合优化,无需交叉验证。
Comments Improved the paper - formalization of routing, add classification experiments, new bib items, free routing in linear model, and many more. Also polished the text
随机元遗忘:连接语言主干与多模态遗忘
机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) ; Cisco Research(思科研究院) ; Michigan State University(密歇根州立大学)
AI总结 研究视觉语言模型的机器遗忘问题,提出随机元遗忘框架,利用VLM级反馈学习初始化,经内、外循环更新语言主干,实验证明该方法在遗忘-保留权衡上表现最佳,能提升准确率且可迁移。
Comments 15 pages
联邦轻量级微调
机构 * Cisco Systems Inc.(思科系统公司)
AI总结 研究联邦微调通信瓶颈问题,提出基于映射网络的方法,通过低秩分解和增量公式等改进,实现低带宽通信,在CIFAR - 网络上大幅减少通信量,准确率与全权重FedAvg相近,在带宽 - 准确率方面表现优异。
Comments 22 pages, 10 figures, 6 tables. Extended preprint with appendix. Under review at ACCV 2026
在极端类别不平衡下基于网络的提示工程对抗有组织的Astroturf活动
机构 * University of Southern California(美国南加州大学) ; Cisco AI Research(思科人工智能研究)
AI总结 本文提出基于大型语言模型的Balanced RAG框架,通过提示工程和平衡检索增强生成技术,在极端类别不平衡下有效识别协调虚假信息活动。
Journal ref WWW '25: Companion Proceedings of the ACM on Web Conference 2025
CLIP 潜在空间的超球面几何:一种语义混合模型
机构 * Tsinghua University(清华大学) ; Cisco Research(思科研究院) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
AI总结 研究 CLIP 潜在空间,提出基于冯·米塞斯-费舍尔分布混合的密度模型,用期望最大化算法学习,实现准确可解释的密度估计,改善长尾和分布外检测,建立几何一致的概率框架。
Comments 23 pages, 8 figures
RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标
机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) ; Cisco Systems(思科系统公司) ; Zaitra s.r.o.(扎伊特拉有限公司) ; NaiveNeuron(天真神经元)
AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。
Comments SemEval-2026 Task 1
现实世界客户端流失情况下的鲁棒联邦学习
机构 * Georgia Tech(佐治亚理工学院) ; Cisco Research(思科研究院)
AI总结 研究现实世界客户端流失情况下的联邦学习,提出FeLiX框架,通过引入流感知可用性层、新鲜效用选择和信息感知延迟鲁棒聚合三个原语,在实时交互流上最小化达到目标准确率的挂钟时间,相比基线减少挂钟时间和通信带宽。
Comments 13 pages
VOTE:基于轨迹集成投票的视觉-语言-动作优化
机构 * Northeastern University(东北大学) ; Cisco(思科) ; EmbodyX
AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。
Comments 12 pages
用于生产中稳定模型更新的全范围二元分类器校准
机构 * Cisco AI Defense(思科人工智能防御)
AI总结 针对对抗环境中检测模型面临的问题,引入基于现有校准原语的方法,使模型输出分数有一致FPR含义,降低FPR误差,且交付工件小,为生产中模型稳定更新提供了有效解决方案。
Sangam:使用AR堆栈高效服务扩散语言模型
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cisco Research(思科研究)
AI总结 研究扩散语言模型服务问题,提出Sangam系统,用赤字令牌预算调度器实现摊还无停顿调度,采用混合服务策略缓解预填充资源不足,揭示服务设计空间受预填充-解码干扰等因素影响。
TallyTrain: 通信高效的联邦蒸馏
机构 * Cisco Systems Inc(思科系统公司)
AI总结 针对联邦学习中模型大小和类别数导致的通信瓶颈,提出TallyTrain方法,通过传输argmax类别索引将每个探针的通信量压缩至⌈log₂C⌉比特,在非独立同分布训练下优于软标签蒸馏,并在标准基准上匹配或超越软标签蒸馏,通信量降低三个数量级。
Comments 27 pages, 7 figures, 12 tables
蒸馏检测:通过弹药筒蒸馏揭露大语言模型中的隐蔽偏见
机构 * Stanford University(斯坦福大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Foundation AI–Cisco Systems Inc.(Foundation AI–思科系统公司)
AI总结 提出Distill to Detect (D2D)方法,通过蒸馏模型与基座之间的分布偏移到KV缓存前缀适配器中,放大隐蔽偏见信号至可检测程度,并基于Fisher加权投影理论解释其有效性。
Comments Accepted to the ICML 2026 Workshops on TAIGR, AI4GOOD, Mechanistic Interpretability, and CoLoRAI
丢弃-再恢复:视觉-语言-动作模型有多冗余?
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Cisco Research(思科研究院)
AI总结 通过提出Drop-Then-Recovery分析协议和GateProbe敏感性指标,发现VLA模型中语言骨干高度冗余,而视觉和动作路径对移除更敏感。
继承的电路,学习的语义:微调如何创建标准评估不可见的规避漏洞
机构 * Cisco Talos(思科 Talos)
AI总结 研究微调如何引入安全分类模型的规避漏洞,通过因果干预定位继承电路,提出预部署监测方法,发现微调扩展了规避面。
是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案
机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) ; Cisco Systems, Inc.(思科系统公司)
AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。
Comments Accepted to ACL 2026 GEM Workshop
ReM-MoA:推理记忆维持混合代理的扩展
机构 * University of Southern California(南加州大学) ; Iowa State University(爱荷华州立大学) ; Cisco AI Research(思科人工智能研究院)
AI总结 提出ReM-MoA框架,通过排名推理记忆和策展多样化记忆路由机制,解决混合代理架构随深度增加性能退化问题,在多个推理基准上持续优于现有方法。
大语言模型微调的双层数据策展:离线选择与在线自优化生成
机构 * Cornell University(康奈尔大学) ; Cisco Research(思科研究)
AI总结 提出双层框架结合离线数据选择与在线自优化生成,提升微调数据质量,理论证明优于直接混合,实验验证效果。
Comments updated the theories and experiments
DynamicMem:真实世界场景下的长时记忆基准测试
机构 * University of Minnesota(明尼苏达大学) ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Cisco(思科) ; Adobe
AI总结 提出DynamicMem基准,通过合成15个月的多应用用户活动数据,评估LLM代理在异构、动态变化且隐含的用户画像记忆能力,发现记忆检索是主要瓶颈。
协议感知分词与架构协同设计用于无线数据包基础模型
机构 * Cisco Systems(思科系统)
AI总结 通过2x2对比实验发现,协议感知分词是无线数据包基础模型性能的主要杠杆,改变分词器可使准确率波动32个百分点,而改变架构仅影响2个百分点。
Comments 10 pages, 5 figures, 3 tables
FAPO:多步骤LLM流水线的全自动提示优化
机构 * Foundation AI–Cisco Systems Inc.(基础AI–思科系统公司) ; Yale University(耶鲁大学)
AI总结 提出FAPO框架,通过自动诊断流水线瓶颈并迭代优化提示或链结构,在18个模型-基准比较中15次优于基线GEPA,平均提升14.1个百分点。
VLA 知道自己的极限:机器人策略的自适应执行视界
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Cisco Research(思科研究)
AI总结 针对流式视觉-语言-动作模型中执行视界影响性能的问题,提出 AutoHorizon 方法,通过分析注意力权重动态估计每块动作的执行视界,提升机器人操作任务性能。
Comments ECCV 2026. Project page at https://hatchetproject.github.io/autohorizon/
学习 PyTorch 到 JAX 翻译中的 Bug 上下文
机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State大学计算机科学系) ; Department of Human Science, Iowa State University, Ames, IA, USA(Iowa State大学人类科学系) ; Cisco AI Research, Outshift, San Jose, CA, USA(Cisco AI研究,Outshift,San Jose,加利福尼亚州,美国)
AI总结 针对 LLM 在 PyTorch 到 JAX 代码翻译中易出错的问题,构建 T2J 基准(含 bug 及修复),通过上下文学习使弱 LLM 翻译质量提升达 20%。
Comments ICML Deep Learning for Code (DL4C) workshop, 2026
面向执行约束的自主AI自动化:一种可复现的AIBOM驱动的CSAF-VEX框架
机构 * University of Oxford(牛津大学) ; Cisco Systems(思科系统) ; The Alan Turing Institute(艾伦·图灵研究所) ; University of Warwick – WMG(沃里克大学 – WMG) ; University of Hull(哈罗德大学)
AI总结 提出一种协议驱动框架,通过绑定SBOM和AIBOM工件与确定性环境捕获及结构化运行时遥测,结合静态与运行时证据生成CSAF VEX公告,经密码签名和确定性重放验证,在合成自主AI工作负载上评估。
Journal ref Execution-bound advisory automation for agentic AI: a reproducible AIBOM-driven CSAF-VEX framework. Front Artif Intell 9, (May 2026), 1826384
数据为中心的LLM漏洞利用生成基准测试:理解微调的影响
机构 * Cisco Systems, Inc.(思科系统公司) ; Michigan State University(密歇根州立大学)
AI总结 采用数据驱动方法,构建高质量数据集并设计评估框架,对17个大语言模型进行零样本漏洞利用生成能力基准测试,发现8B开源模型经微调后性能提升超42.5%,接近部分商业模型。
Comments Technical Report
Cordyceps: 通过数据投毒对LLM的隐蔽控制攻击
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Cisco Systems(思科系统)
AI总结 提出一种数据投毒方法,通过语义关联教LLM隐藏任意恶意指令,实现隐蔽控制攻击,绕过多种防御。
Comments USENIX Security '26
机器遗忘的行为审计具有隐私代价
机构 * University of Pittsburgh(匹兹堡大学) ; Cisco(思科)
AI总结 本文证明,在互不信任的模型所有者和审计者场景下,仅依赖模型行为查询的审计方案无法在不泄露保留集成员信息的情况下识别未充分遗忘的模型,揭示了隐私与审计之间的固有权衡。
Every Eval Ever:AI评估结果的统一模式与社区仓库
机构 * Technical University Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Weizenbaum Institute(魏岑鲍姆研究所) ; Zuse Institute Berlin(柏林祖泽研究所) ; Evidence Prime ; Trustible ; Kitware ; ETH Zurich(苏黎世联邦理工学院) ; StickFlux Labs ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; IBM Research(IBM研究院) ; Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学) ; Cisco(思科) ; University of Notre Dame(圣母大学) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; University of Oxford(牛津大学) ; Ohio University(俄亥俄大学) ; Writer ; TCS Research(塔塔咨询服务研究院) ; Oxford University Press(牛津大学出版社) ; Queen Mary University of London(伦敦玛丽女王大学) ; Technical University Berlin(柏林工业大学) ; University of Delaware(特拉华大学) ; Cinemo ; Johns Hopkins University(约翰霍普金斯大学) ; University of Copenhagen(哥本哈根大学) ; ELLIS(欧洲学习与智能系统实验室) ; Iowa State University(爱荷华州立大学) ; Meta FAIR ; University of Montreal(蒙特利尔大学) ; Mila Quebec AI Institute(Mila魁北克人工智能研究所) ; EleutherAI ; Yale University(耶鲁大学) ; Hugging Face ; University of Edinburgh(爱丁堡大学) ; Harvard University(哈佛大学) ; ETH AI Center(ETH人工智能中心) ; MIT(麻省理工学院) ; MIT-IBM Watson Lab(MIT-IBM沃森实验室)
AI总结 针对AI评估结果格式不统一、难以比较的问题,提出首个共享模式与社区众包仓库,通过标准化表示、自动转换器和社区数据库实现跨评估框架的统一。