An interactive enhanced driving dataset for autonomous driving
一种交互增强的自动驾驶数据集
专题命中 评测与基准 :instruction tuning(abstract)
AI总结 本文提出交互增强驾驶数据集,通过生成合成视频实现多模态对齐,用于评估和优化自动驾驶模型的推理能力。
Comments Accepted for publication in Scientific Data
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
一种交互增强的自动驾驶数据集
专题命中 评测与基准 :instruction tuning(abstract)
AI总结 本文提出交互增强驾驶数据集,通过生成合成视频实现多模态对齐,用于评估和优化自动驾驶模型的推理能力。
Comments Accepted for publication in Scientific Data
CRISP:用于高效LVLM推理的预LLM文本驱动视觉令牌剪枝
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) ; School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
专题命中 效率与部署 :LLM(title,title_cn);language model(abstract)
AI总结 针对大型视觉语言模型推理开销大的问题,提出CRISP框架,通过文本驱动在预LLM阶段剪枝视觉令牌,分两阶段工作,实验表明其在激进剪枝率下能保持高性能,降低推理成本和延迟,是高效LVLM推理的实用方案。
Comments Accepted by the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026) as Oral
NIRVANA:为大语言模型压缩重新构想的结构化剪枝
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
AI总结 研究针对大语言模型结构化剪枝中性能下降等问题,提出NIRVANA框架。通过函数空间显著性评估结构重要性,引入全局单元排序等策略,消除随机采样不稳定问题,在多架构上广泛评估,取得新的最优结果,为模型压缩提供实用方法。
Comments Accepted to COLM 2026. Camera-ready
C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用
机构 * Alibaba Group(阿里巴巴集团)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。
Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026
RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) ; Nanyang Technological University(南洋理工大学) ; Chongqing University(重庆大学)
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。
Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ
LMEdge:边缘集群上的QoS感知大语言模型推理编排
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究在边缘集群上进行QoS感知的LLM推理编排问题,提出LMEdge服务。通过BILP优化并结合五个轻量级ML模型预测相关指标,设计轻量级启发式方法。在边缘测试平台评估,结果显示其降低延迟、保持准确性、提高资源利用率及服务比率。
Comments 12 pages, 5 figures, 2 tables, EUROPAR conference paper
通过高效多样响应采样暴露大语言模型中的长尾安全故障
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL
AI总结 本文通过多样响应生成方法系统暴露大语言模型的安全故障,提出PDPS算法在降低计算成本的同时提高攻击成功率,并生成更多多样化的不安全输出。
Comments Accepted by Transactions on Machine Learning Research (TMLR)
NANOZK:用于可验证大语言模型推理的分层零知识证明
机构 * USC Viterbi School of Engineering(USC维特里维学院工程学院)
专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 NANOZK通过分层零知识证明验证大语言模型推理,采用分层证明框架实现常数大小证明,提升可扩展性与并行证明效率,同时保持形式正确性。
Comments Extended version. The first 12 pages correspond to the ICICS 2026 (Springer LNCS) camera-ready paper. This version supersedes the earlier ICLR 2026 VeriFAI Workshop preprint and adds full security proofs, Halo2 circuit details, lookup-table derivations, extended experiments, verifier-cost analysis, GPU scaling, reproducibility instructions, and appendices omitted from the proceedings
SelectInfer:用于设备端语言模型的选择性神经元加载与计算
机构 * Paderborn University(帕德博恩大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型在边缘设备部署的挑战,提出SelectInfer框架,通过离线分析识别特定任务和通用神经元,实施选择性加载和计算两项关键优化,可显著减少内存与计算量,同时保持任务性能,推动LLM在边缘设备的部署。
检测、归因、叙述:用于可解释的洗钱者识别的端到端管道
机构 * OCBC, Singapore(新加坡华侨银行)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对洗钱者账户检测难题,提出端到端管道,含LightGBM分类器、TreeSHAP归因层和LLM模块。经评估,系统收益率提升,警报量增加,LLM叙述减少认知负荷,在实际部署中表现出色,还探讨了在监管金融环境中的应用影响。
用于高效能和低成本的大语言模型服务的异构神经处理单元自动缩放
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究如何利用异构神经处理单元为大语言模型服务实现能源和成本高效。提出NeuScale自动缩放框架,通过新vPod抽象管理资源,基于屋顶线分析分配,支持动态供应。经模拟器验证,可显著提升成本效率和SLO满意度。
Comments Accepted to MICRO'26
在神经处理单元中实现空间细粒度动态电压频率调节以实现高效节能的大语言模型服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对NPU服务LLMs时功耗问题,开发eNPU支持空间细粒度、组件级DVFS,通过重构流水线、引入通信机制、扩展ISA及采用编译器驱动搜索优化,实现能耗降低25.8% - 35.2%且保持SLO保证。
Comments Accepted by MICRO'26
通过小语言模型实现人工智能民主化:面向本地部署的结构化基准测试和参数高效微调
机构 * Binghamton University(宾汉姆顿大学)
专题命中 效率与部署 :language model(title,abstract);small language model(title);分类 cs.AI
AI总结 研究在硬件和治理约束下人工智能民主化问题,通过对九个小语言模型在特定基准测试上控制评估,采用共享参数高效微调管道,得出有序工作流程让部分低于3B的模型可成为结构化小众工作负载本地专家的结论。
KernelBench验证:大语言模型生成的内核真的能超越PyTorch吗?
机构 * Meta ; FAIR at Meta SuperIntelligence Lab(元超智能实验室公平团队) ; Stanford University(斯坦福大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型生成的内核是否真能超越PyTorch,指出前沿模型存在奖励黑客行为。引入KernelBench-Verified扩展评估框架及内存效率指标,实验发现最佳模型加速比低,无模型始终超PyTorch,部分模型增加GPU内存峰值使用,强调持续调整评估协议的必要性。
HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向
机构 * Tufts University(塔夫茨大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。
FlowBlock:用于自校正扩散语言模型的波前并行解码
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI
AI总结 研究针对块级扩散大语言模型块间解码串行问题,提出无需训练的\flowblock{}并行解码框架,基于门控波前解码和异构波前打包机制,相比串行模型提升了每秒令牌数、降低延迟并提高准确率,优于基于训练的基线。
DORA:一种用于语言模型训练的可扩展异步强化学习系统
机构 * Meituan, China(美团(中国))
专题命中 效率与部署 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG
AI总结 DORA通过算法-系统协同设计解决异步训练中长尾轨迹问题,提升训练效率并保持收敛性,实验表明其在开源基准和工业应用中均显著提升强化学习训练速度。
用于边缘大语言模型推理的过渡感知后端调度
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究边缘平台大语言模型推理问题,提出过渡感知后端调度方法,结合算子特征与后端选择,经实验验证该方法能降低延迟、能量及能量延迟积,减少切换,提升边缘变压器工作负载调度效率。
基于大语言模型驱动的量子最优控制跨范式设计
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对量子最优控制实际应用的瓶颈,提出由大语言模型驱动的QOC-Workbench工作流程,可跨范式设计协议,能自主解析文献、积累控制模式,在多场景验证中表现出色,建立了自主量子控制的跨范式方法。
Comments 19 pages, 8 figures
Lil: 在长解码阶段应用后训练稀疏注意力算法时,少即是少
机构 * SCS, Peking University, Beijing, China(北京大学信息科学与技术学院,北京,中国) ; Key Lab of HCST (PKU), MOE, Beijing, China(高等教育出版社HCST重点实验室(PKU),北京,中国) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) ; Tencent, Shenzhen, China(腾讯,深圳,中国) ; Beijing Tongming Lake Information Technology Application Innovation Center, Beijing, China(北京 Tongming Lake 信息技术应用创新中心,北京,中国)
专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在长解码阶段应用稀疏注意力算法时,信息丢失导致序列变长的问题,提出早停算法减少token消耗并降低精度损失。
Mediator:基于较少参数冲突和不确定性路由的内存高效大语言模型合并
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型合并中参数冲突致性能下降等问题,提出基于层参数冲突情况分别处理,结合任务算术稀疏性解耦专家,依输入数据任务不确定性选合并专家,实验表明该方法提升性能且降低系统成本。
Comments work in progress. arXiv admin note: text overlap with arXiv:2405.09673 by other authors
OmniVLM:一种用于高效设备端推理的令牌压缩、参数少于十亿的视觉语言模型
机构 * Nexa AI
专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);preference optimization(abstract)
AI总结 研究提出OmniVLM视觉语言模型,通过令牌压缩机制减少计算开销,经多阶段训练匹配更大模型性能。在多基准测试中优于现有基线,在笔记本电脑上实证显示速度提升,能在边缘设备高效部署,模型权重可在huggingface获取。
Arbor:一种用于关键对话流程可靠导航的框架
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 Arbor通过分解决策树导航为节点级任务,提升了医疗分诊中对话流程的准确性和效率,使小型模型能超越大模型表现。
CoCurve:用于无训练结构化大语言模型剪枝的跨模块协同剪枝曲率
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型结构化剪枝中独立评分单元不合理的问题,提出CoCurve方法,通过二阶泰勒展开得到Fisher矩阵计算协同剪枝曲率边,联合修剪注意力和FFN单元,仅用M次前向传播求解预算二次规划,无需标签、微调等完成剪枝。
上下文探查用于微调语言模型中的成员推断
机构 * Korea University, Seoul, South Korea(韩国大学)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 本文提出ICP-MIA框架,通过上下文探查技术有效检测微调语言模型中的成员身份,提升隐私保护能力。
Journal ref Proceedings of the 33rd Network and Distributed System Security Symposium (NDSS 2026)
D-NOVA:通过具有向量适配的双边界3D NAND优化相似性搜索实现存储内检索加速器
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对RAG密集向量检索性能瓶颈,提出软硬件协同设计的存储内检索加速器D-NOVA。通过深度嵌入搜索功能、采用新距离度量及引入适配器,实现高效检索,相比CPU和现有加速器有显著性能和能效提升,展现全存储向量搜索加速RAG的潜力。
Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026), Athens, Greece. Chang Eun Song and Sumukh Pinge are co-first authors and contributed equally
FAME:面向失败的混合专家模型用于消息级日志异常检测
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出FAME,一种面向失败的混合专家模型,用于消息级日志异常检测。该方法通过少量标注数据训练轻量级路由器和领域专家,实现高效的异常检测,同时在BGL和Thunderbird数据集上取得了高精度和召回率。
Comments 12 pages, 5 figures, Accepted at the 2026 IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)
MXSens:用于高效大语言模型推理的灵敏度感知混合精度量化
机构 * EPFL(洛桑联邦理工学院) ; Tsinghua University(清华大学) ; MangoBoost Inc.(芒果助推公司) ; Korea University(韩国大学) ; Google DeepMind(谷歌DeepMind)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型推理中4位量化因异常值致精度降的问题,提出MXSens方法,基于列和层灵敏度分配混合尾数比特宽度,无需训练,利用MXINT块结构,在多模型任务中优于现有方法,平衡了量化的准确性与资源效率。
突破扩散语言模型的分解障碍
专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 CoDD通过引入轻量级概率推理层,突破扩散语言模型的分解障碍,实现高效且连贯的生成性能。
AnnoRetrieve:面向无结构文档分析的高效结构化检索
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 本文提出AnnoRetrieve,通过结构化注释替代向量嵌入,实现高效精准的语义检索,降低LLM调用频率和成本,提升文档分析的准确性和可扩展性。