RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning
RankGuide: 张量秩引导的路由与引导以实现高效的推理
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Intel Labs(英特尔实验室)
AI总结 RankGuide通过张量秩引导的路由与引导提升小推理模型与大推理模型的协作效率,减少推理延迟并提高准确性。
大厂专区
RankGuide: 张量秩引导的路由与引导以实现高效的推理
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Intel Labs(英特尔实验室)
AI总结 RankGuide通过张量秩引导的路由与引导提升小推理模型与大推理模型的协作效率,减少推理延迟并提高准确性。
检索增强可解释学习:迈向医疗保健领域特定任务的零样本模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; GenBio AI(基因生物人工智能公司) ; Intel(英特尔公司)
AI总结 研究针对医疗保健领域特定任务零样本模型问题推出检索增强可解释学习(RAIL)框架,通过检索相关任务并传递结构生成新预测器,概率公式提供不确定性支持可靠性感知部署,在临床程序预测任务中性能可靠,还提升模型透明度。
Comments A preliminary, non-archival version of this work, titled RAG-IM, was presented at NeurIPS 2024 workshops and the ML4H 2024 Findings track. The work was subsequently renamed Retrieval-Augmented Interpretable Learning (RAIL)
TRACE-ROUTER:用于智能AI的任务一致且自适应的在线路由
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Intel(英特尔公司) ; Texas A&M University(德克萨斯农工大学)
AI总结 研究针对企业AI中现有路由决策与智能应用任务级结果不匹配问题,提出TRACE-Router任务级路由框架,利用上下文博弈、终端奖励更新策略,在多基准测试中改善准确性-延迟权衡,取得较好效果。
面向ReRAM的模型微调:解决I-V非线性和保留误差
机构 * Intel Corporation(英特尔公司)
AI总结 提出一种基于微调的硬件感知训练算法,通过范围收缩的sinh变换缓解I-V非线性,并将保留误差纳入正则化损失,实现ReRAM上DNN的高效部署,在图像分类和问答任务中精度损失极小。
Comments 11 pages, 12 figures, 2 tables, with appendix (5 pages, 9 figures)
用于实时跌倒检测的无监督关键点:在现实世界条件下的比较分析及预测带宽减少
机构 * West Virginia University(西弗吉尼亚大学) ; Intel Corporation(英特尔公司) ; Binghamton University(宾汉姆顿大学)
AI总结 研究老年人跌倒检测问题,提出用基于无监督关键点和预测时间建模的隐私保护框架取代RGB传输,经多方式评估发现表示选择应依视觉条件,无监督关键点在身体可见性受限时有优势。
SurgXBench: 可解释的视觉-语言模型手术基准
机构 * Arizona State University(亚利桑那州立大学) ; Intel Labs(英特尔实验室) ; Duke University(杜克大学) ; University of Miami(迈阿密大学) ; University of California, Merced(加州大学默塞德分校)
AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。
前沿大语言模型是否已为网络安全做好准备?来自双模式漏洞基准测试的垂直基础模型证据
机构 * super-intel.ai(超级智能人工智能公司)
AI总结 通过白盒函数级漏洞检测和黑盒Web应用安全测试双模式基准测试,评估前沿大语言模型在网络安全任务中的表现,发现其存在高误报率、低覆盖率等问题,而领域专用模型通过结构化方法显著提升性能。
评估通用机器学习力场与实验测量的对比
机构 * Department of Civil Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木工程系) ; Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) ; Intel Labs, California, USA(美国加州英特尔实验室) ; Department of Materials Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里材料科学与工程系) ; Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系)
AI总结 提出UniFFBench框架和MinX数据集,系统评估六种通用机器学习力场,发现模型在计算基准上表现优异但在实验复杂性下存在显著“现实差距”,密度预测误差高于实际应用阈值。
Prism: 通过GPU内存气球实现经济高效的多LLM服务
机构 * UCLA(加州大学洛杉矶分校) ; UC Berkeley(伯克利加州大学) ; Harvard University(哈佛大学) ; CMU(卡内基梅隆大学) ; University of Edinburgh(爱丁堡大学) ; Intel(英特尔) ; Stanford University(斯坦福大学) ; LMSYS(灵州市系统实验室) ; ByteDance(字节跳动) ; Alibaba Cloud(阿里云) ; Tsinghua University(清华大学) ; Novita AI ; Rice University(里士满大学)
AI总结 针对多LLM服务中资源效率低下的问题,提出基于内存气球的内存中心化LLM协同服务框架Prism,统一空间与时间共享,已在10K+ GPU生产环境部署。
Comments OSDI'26
CTS-Bench: 面向时钟树综合中GNN的图粗化权衡基准测试
机构 * The University of Southern Mississippi(密苏里州南方大学) ; Intel Corporation(英特尔公司) ; Louisiana Tech University(路易斯安那理工大学)
AI总结 提出CTS-Bench基准套件,系统评估图粗化对GNN在时钟树综合中预测精度与计算效率的权衡,发现粗化虽降低内存和加速训练,但会移除关键结构信息导致零样本评估下R²为负。
Comments Accepted to ML Bench'26 ASPLOS
Hermes: 通过基于感知器的片外负载预测加速长延迟负载请求
机构 * ETH Zürich(苏黎世联邦理工学院) ; Intel Processor Architecture Research Lab(英特尔处理器架构研究实验室) ; LIRMM, Univ. Montpellier, CNRS(蒙彼利埃大学LIRMM实验室,CNRS)
AI总结 提出Hermes技术,利用感知器预测片外负载请求,投机性地直接从主存获取数据,同时并行访问缓存层次,从而消除片外负载关键路径上的片上缓存访问延迟,显著提升处理器性能。
Comments To appear in 55th IEEE/ACM International Symposium on Microarchitecture (MICRO), 2022