ImpactHO: Importance-Aware KV Cache Transfer for Multi-User Edge LLM Handover
ImpactHO:面向多用户边缘大模型切换的重要性感知键值缓存迁移
专题命中 效率与部署 :LLM(title);分类 cs.AI
AI总结 该研究针对多用户边缘大模型切换时回程链路饱和导致缓存无法完整迁移的问题,提出重要性感知KV缓存迁移方案,通过闭式加权注水算法实现高效分配,在500ms窗口内达到接近全缓存的准确率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
ImpactHO:面向多用户边缘大模型切换的重要性感知键值缓存迁移
专题命中 效率与部署 :LLM(title);分类 cs.AI
AI总结 该研究针对多用户边缘大模型切换时回程链路饱和导致缓存无法完整迁移的问题,提出重要性感知KV缓存迁移方案,通过闭式加权注水算法实现高效分配,在500ms窗口内达到接近全缓存的准确率。
解析器已掌握:约束解码中的轻量级偏差校正
专题命中 效率与部署 :language model(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 该研究针对语法约束解码中刚性屏蔽扭曲模型分布的问题,利用增量解析的语法状态提出轻量级离线 logit 校正,在几乎不增加开销的情况下优于基线方法,兼顾了语言模型的概率完整性与语法一致性。
Comments 9 pages, 5 figures
企业MCP认证的网关架构:统一异构认证、身份委托与用户/非用户角色问题
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出一种集中式MCP网关架构,通过双轴认证模型、多SSO授权与令牌供应模式、三类身份流及部署演进方案,解决企业MCP认证碎片化问题,已在数十个MCP服务器场景投入生产。
缓解可靠高效搜索智能体的上下文干扰
机构 * The Chinese University of Hong Kong(香港中文大学) ; University College London(伦敦大学学院) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; The University of Edinburgh(爱丁堡大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文针对多轮搜索智能体的上下文干扰问题,提出基于蒸馏的上下文优化器,将其纳入RL训练后可显著提升搜索智能体的可靠性与效率,开创了AI智能体“先优化上下文再生成”的新范式。
当智能体自动化变得有利可图:通过痕迹经济核保量化和保险自主AI风险
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出痕迹经济核保方法,通过量化客户-任务-痕迹片段级别的风险并转移至保险,使自主AI部署在经济上可接受,实验显示定价误差从$17.7K降至$569,风险降低72%。
Comments 26 pages, 14 figures, 29 tables
Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化
机构 * McGill University(麦吉尔大学) ; Université de Montréal(蒙特利尔大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; Mila – Quebec AI Institute(魁北克AI研究所)
专题命中 效率与部署 :LLM(abstract_cn);post-training(abstract);分类 cs.LG
AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。
大规模行为推断:动机与信念系统之间的根本不对称性
机构 * Department of Computer Science University of Idaho(计算机科学系 俄克拉荷马州立大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 研究通过大规模实验揭示动机与信念系统在行为推断中的根本不对称性,发现动机推断效率远超信念系统,且信念系统推断的瓶颈在于信息理论限制。
Comments Published in Transactions on Machine Learning Research (2026). OpenReview: https://openreview.net/forum?id=aDMDqtw63H
Journal ref Transactions on Machine Learning Research, ISSN 2835-8856 (2026)
AI的核聚变:可持续为数据中心供电的途径
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。
Comments Under review
StrataCL:面向生产级超级节点的 fabric 原生通信库
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 针对分布式 AI 工作负载的通信瓶颈,提出零冗余的 fabric 原生通信库 StrataCL,通过分配时注册等技术优化,在华为 CloudMatrix384 上显著提升了带宽与多类工作负载的性能。
TACTICL:面向表格上下文学习模型的任务感知压缩框架
机构 * TU Dortmund University(多特蒙德工业大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 针对表格基础模型推理成本高、蒸馏后损失上下文适应性的问题,提出TACTICL框架,剪枝Transformer层并替换为轻量适配器,在47个基准数据集上可替换85%层且性能无显著下降,对数据偏移鲁棒。
Comments Accepted for publication at AutoML2026
泄露它:黑盒语言模型训练数据提取的概率方法
机构 * Karolinska Institutet(卡罗林斯卡学院)
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对黑盒语言模型提出概率训练数据提取方法,发现聚合AUC掩盖逐文档泄露风险,发布leakit工具,强调隐私审计需按领域分解逐文档提取结果。
Comments 14 pages, 7 figures. Code: https://github.com/victormaricato/leakit
Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI
AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。
SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片
专题命中 效率与部署 :language model(abstract);分类 cs.AI
AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。
MazzikaAI:一种基于知识的性能到提示编译器,用于结合流式文本到音乐模型的实时阿拉伯maqam伴奏
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI
AI总结 本文提出基于知识的MazzikaAI系统,通过编译实时输入生成文本提示,引导未微调的Google Lyria RealTime实现实时阿拉伯maqam伴奏,可精准控制微分音生成,为文化包容性生成音频提供了可扩展范式。
面向策略内自蒸馏的自适应监督锚定
机构 * Renmin University of China(中国人民大学)
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 针对策略内自蒸馏的 rollout 条件信号退化问题,提出分离监督路径并自适应调整锚定强度的框架,提升了任务获取能力并优化了可塑性-稳定性权衡。
Comments 9 pages, 4 figures, and 3 tables. Meilin Yang and Zixuan Ding contributed equally. Corresponding authors: Li Yu and Zhe Fu
retrosynthesis 中的顺序至关重要:通过反应中心引导的离散流匹配实现结构感知生成
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 效率与部署 :foundation model(abstract);分类 cs.LG
AI总结 本研究提出了一种结构感知的模板自由框架,通过反应中心引导的离散流匹配实现高效的 retrosynthesis 生成。
FastInsight: 图形RAG中通过融合运算实现快速且有洞察力的检索
专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI
AI总结 FastInsight通过融合运算提升图RAG检索效率和洞察力,改进检索准确性和生成质量。
Comments CIKM 2026
当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任
专题命中 效率与部署 :LLM(abstract)
AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。
Comments Accepted to ACM HCOMP 2026
Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)
专题命中 效率与部署 :language model(abstract)
AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。
进化层特定标量函数用于硬件感知的Transformer适应
机构 * Department of Machine Learning and Neural Computing(机器学习与神经计算系) ; Donders Institute for Brain, Cognition, and Behaviour(大脑、认知与行为多纳尔斯研究所)
专题命中 效率与部署 :post-training(abstract)
AI总结 本文提出一种高效硬件感知框架,通过遗传编程进化层特定标量函数,避免重新训练,提升Transformer在边缘设备上的性能。
Comments 8 pages, 7 figures. v2: updated GP method (FLOP-based complexity, knee-point selection) and re-run results
基于N最佳教师轨迹选择的在线策略蒸馏
机构 * Johns Hopkins University(约翰霍普金斯大学) ; TikTok ; University of California, San Diego(加州大学圣地亚哥分校) ; Fudan University(复旦大学)
专题命中 效率与部署 :post-training(abstract)
AI总结 本文提出BRTS框架,通过选择更准确且与学生行为一致的教师轨迹提升在线策略蒸馏效果,在AIME和AMC基准测试中取得显著改进。
Comments 10 pages, 5 figures
LLM智能体工厂:领域特定大语言模型智能体的检索
机构 * Sber AI ; Moscow Institute of Physics and Technology(莫斯科物理技术学院) ; National University of Science and Technology MISIS(莫斯科国立科学技术大学MISIS) ; Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究所) ; Artificial Intelligence Research Institute(人工智能研究所)
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出LLM Agents Factory框架,通过检索2万余个预设智能体配置文件按需构建领域特定智能体,在多基准测试中实现高准确率与低推理成本,为工业应用提供动态智能体生成的替代方案。
Comments 7 pages, 1 figure, SIGIR 2026
GenRec:Netflix 一款基于大语言模型的推荐排序器
专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 Netflix 提出基于 LLM 的推荐排序器 GenRec,通过两阶段后训练实现,在大规模 A/B 测试中,其用更少标注数据即可取得显著指标提升,推动推荐范式转变并总结了部署经验。
Comments 9 pages
基于大语言模型微调的可理解推荐研究
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title);language model(title);post-training(abstract)
AI总结 该研究针对传统推荐的语义协同差距问题,提出CURec框架,通过微调LLM并结合强化学习优化,提升推荐可理解性与性能,在公开基准上表现更优。
Comments 11 pages, 6 figures, to be published on CIKM '26
ELBench:面向教育场景的大语言模型多维基准
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 ELBench是首个评估教育大模型四项核心要求的综合基准,评估发现通用模型综合表现相近但模块优势不同,中国模型在安全性模块领先,教育专用模型未在教育模块占优,高阶培养存在系统性盲点。
Comments 13 pages, 6 figures, 8 tables. Benchmark data: https://huggingface.co/datasets/ZeroLoss-Lab/ELBench
MedUP:唤醒医学视觉-语言模型中的统一理解与感知能力
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学)
专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出MedUP模型,通过UniMedTok分词器在共享token空间统一医学视觉-语言模型的感知与理解,构建相关训练语料库和评估基准,在多医学任务上性能优于现有模型。
Comments 10 pages, 6 figures
BRACIS 十一年:巴西智能系统会议的元科学研究
专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究对2015-2025年BRACIS的1066篇录用论文进行元科学分析,揭示其研究领域变化、作者与机构分布、引用特征及开放实践情况,发现LLM研究占比提升、引用集中、预印本与高引用相关等结论。
思维病毒:多智能体大语言模型系统中的自传播思想
专题命中 领域大模型 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 本研究提出多智能体LLM系统中的思维病毒概念,构建其进化算法模型,发现其传播受宿主模型等因素影响,添加系统警告可免疫,为设计更稳健的多智能体系统提供依据。
Diffract:大语言模型领域自适应的谱视角
专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究提出Diffract工具包,通过分析持续预训练的大语言模型的权重矩阵奇异值谱,发现可选择性回退低重要性注意力头以提升领域适配性能,实现高效的领域自适应。
Comments Accepted at ICML 2026. Code: https://github.com/Risk-AI-Research/diffract
永不停止说话:针对端到端语音语言模型的拒绝服务攻击
专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 本研究针对端到端语音语言模型提出基于扰动的拒绝服务攻击,通过优化声学扰动抑制EOS生成以延长解码,在三类开源模型上验证了其攻击有效性及安全风险。