arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 135
2606.07586 2026-06-10 cs.LG cs.AI cs.AR cs.MA 版本更新

From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs

从人类引导到自主:面向空间NPU上端到端LLM部署的智能体技能系统

Jiajie Li, Erwei Wang, Zhiru Zhang, Samuel Bayliss

机构 * AMD Research and Advanced Development(AMD研究与高级开发)

AI总结 提出两阶段方法,从人类引导的智能体辅助部署到自主技能系统,在AMD XDNA 2 NPU上实现8种LLM的端到端自动部署,性能超越或持平人工优化基线。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05751 2026-06-08 cs.CL cs.AI 版本更新

Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns

分析LLM生成文本中说服性语言的差异:揭示刻板的性别模式

Amalie Brogaard Pauli, Maria Barrett, Max Müller-Eberstein, Isabelle Augenstein, Ira Assent

机构 * Department of Computer Science, Aarhus University(阿arhus大学计算机科学系) AMD Silo AI University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根IT大学) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

AI总结 提出框架评估LLM生成说服性语言时受接收者性别、发送者意图和输出语言的影响,发现所有模型均存在显著的性别差异,反映性别刻板印象的语言倾向。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04238 2026-06-04 cs.LG cs.AI

Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data

Recover-LoRA 用于激进量化:通过低秩适配与合成数据知识蒸馏恢复2比特语言模型的精度

Devleena Das, Rajeev Patwari, Elliott Delaye, Ashish Sirasao

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 针对2比特激进量化导致的大语言模型精度严重下降问题,提出Recover-LoRA方法,结合选择性混合精度策略(仅MLP的gate和up层量化为2比特)和基于合成数据蒸馏的低秩适配训练,在Qwen3-4B上以1万合成样本在12个基准中恢复9个基准80-95%的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10236 2026-06-04 cs.DC cs.AR cs.LG

Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap

基于DMA的细粒度计算通信重叠的设计空间探索

Shagnik Pal, Shaizeen Aga, Suchita Pati, Mahzabeen Islam, Lizy K. John

机构 * Advanced Micro Devices Inc.(先进微器件公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出细粒度计算通信重叠方法FiCCO,通过深入分片粒度以下、利用DMA引擎卸载通信,实现更广泛网络拓扑下的性能优化,最高获得1.6倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00395 2026-06-03 cs.LG cs.AI

PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

PR2: 基于MoE的大语言模型强化学习中的预测性路由重放

Daize Dong, Junlin Chen, Haolong Jia, Jiang Liu, Jiawei Wu, Huanwei Di, Jialian Wu, Zhengzhong Liu, Zicheng Liu, Emad Barsoum, Dimitris N. Metaxas, Hongyi Wang

机构 * Rutgers University(罗格斯大学) AMD MBZUAI

AI总结 针对MoE大语言模型强化学习中路由器漂移导致的不稳定性问题,提出预测性路由重放方法,通过轻量级演化预测器减少路由不匹配,提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30313 2026-06-03 cs.RO

UniLab: A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms

UniLab: 超越GPU主导范式的机器人强化学习异构架构

Yufei Jia, Zhanxiang Cao, Mingrui Yu, Heng Zhang, Shenyu Chen, Dixuan Jiang, Meng Li, Xiaofan Li, Yiyang Liu, Junzhe Wu, Zheng Li, XiLin Fang, Ting-Yu Tsui, Shengcheng Fu, Haoyang Li, Anqi Wang, Zifan Wang, Dongjie Zhu, Chenyu Cao, Zhenbiao Huang, Ziang Zheng, Jie Lu, Xin Ma, Zhengyang Wei, Xiang Zhao, Tianyue Zhan, Ye He, Yuxiang Chen, Yizhou Jiang, Yue Li, Haizhou Ge, Yuhang Dong, Fan Jia, Ziheng Zhang, Meng Zhang, Xiwa Deng, Zhixing Chen, Hanyang Shao, Chenxin Dong, Yixuan Li, Yizhi Chen, Bokui Chen, Kaifeng Zhang, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Xiang Li, Yue Gao, Guyue Zhou

机构 * THU(清华大学) SJTU(上海交通大学) SII(上海信息所) Motphys HITSZ(哈尔滨工业大学) BIT(北京理工大学) NEU(南京大学) SUSTech(四川大学) TJU(天津大学) DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) Galbot NUS(国立新加坡大学) WTU(武汉理工大学) HBUT(湖南大学) AMD NJU(南京大学) ZJU(浙江大学) Dexmal Sharpa D-Robotics

AI总结 提出UniLab异构CPU-仿真/GPU-学习架构,通过统一运行时解耦CPU并行仿真与GPU策略更新,在相同硬件配置下将端到端训练效率提升3-10倍,并减少对NVIDIA CUDA的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00735 2026-06-02 cs.DC cs.LG

ViBE: Co-Optimizing Workload Skew and Hardware Variability for MoE Serving

ViBE: 针对MoE服务的工作负载偏斜与硬件变异性协同优化

Seokjin Go, Marko Scrbak, Ephrem Wu, Srilatha Manne, Divya Mahajan

机构 * Georgia Institute of Technology(佐治亚理工学院) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 提出ViBE框架,通过感知硬件的专家放置方法,结合GPU性能建模与专家激活分析,最小化分布式MoE推理中的执行时间不平衡,显著提升SLO达标率并降低P90 TTFT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30753 2026-06-01 cs.CL

Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation

通过时空并行解码和置信度外推的高效扩散大语言模型

Zekai Li, Ji Liu, Yiqing Huang, Ziqiong Liu, Dong Li, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

AI总结 提出时空并行解码(TSPD)和置信度外推(CE)两种方法,通过动态控制去噪轨迹减少冗余迭代,加速扩散大语言模型推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22347 2026-05-29 cs.LG cs.AI

Pushing the Limits of Block Rotations in Post-Training Quantization

推动后训练量化中块旋转的极限

Sai Sanjeet, Ian Colbert, Pablo Monteagudo-Lago, Giuseppe Franco, Yaman Umuroglu, Nicholas J. Fraser

机构 * Advanced Micro Devices, Inc. (AMD)(Advanced Micro Devices公司) State University of New York at Buffalo(纽约州立大学布法罗分校) Norwegian University of Science(挪威科学与技术大学)

AI总结 本文提出PeRQ框架,通过置换和旋转重新分布激活值,以克服块旋转在抑制异常值时的几何限制,显著提升后训练量化精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09532 2026-05-27 cs.LG cs.AI cs.CL cs.CV

Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models

Athena: 利用数据高效的过程奖励模型增强多模态推理

Shuai Wang, Zhenhua Liu, Jiaheng Wei, Xuanwu Yin, Dong Li, Emad Barsoum

机构 * Advanced Micro Devices Inc.(先进微器件公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 提出 Athena-PRM,一种多模态过程奖励模型,通过利用弱和强完成者之间的预测一致性高效生成高质量过程标签,在仅5000样本下显著提升复杂推理问题的逐步评估性能。

Comments TMLR 2026, https://openreview.net/forum?id=unWmplHccF

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20507 2026-05-27 cs.AR cs.DC cs.LG

Harmonia: Enhancing Data Placement and Migration in Hybrid Storage Systems via Multi-Agent Reinforcement Learning

Harmonia: 通过多智能体强化学习增强混合存储系统中的数据放置与迁移

Rakesh Nadig, Vamanan Arulchelvan, Rahul Bera, Taha Shahroodi, Gagandeep Singh, Andreas Kakolyris, Ismail Emir Yuksel, Mohammad Sadrosadati, Jisung Park, Onur Mutlu

机构 * ETH Zürich(苏黎世联邦理工学院) AMD Research(AMD研究)

AI总结 针对混合存储系统中数据放置与迁移策略相互依赖导致性能次优的问题,提出基于多智能体强化学习的协同优化方法Harmonia,显著提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24793 2026-05-26 cs.CL

Beyond the Target: From Imitation to Collaboration in Speculative Decoding

超越目标:从模仿到协作的推测解码

Jinze Li, Yixing Xu, Guanchen Li, Jinfeng Xu, Shuo Yang, Yang Zhang, Xuanwu Yin, Dong Li, Edith C. H. Ngai, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微设备公司) The University of Hong Kong(香港大学) University of North Texas(北卡罗来纳州立大学)

AI总结 提出协作推测解码(CoSpec),通过强化学习训练仲裁策略,在推测解码中灵活选择接受草稿或目标模型的令牌,在保持加速的同时超越仅使用目标模型的性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18800 2026-05-20 cs.LG cs.AI

Theory-optimal Quantization Based on Flatness

基于平坦度的理论最优量化

Xiusheng Huang, Zhe Li, Xuanwu Yin, Lu Wang, Yequan Wang, Dong Li, Emad Barsoum, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) AMD Ritzz-AI

AI总结 本文提出了一种基于平坦度的理论最优量化方法,通过分析量化误差与异常值之间的数学关系,引入了平坦度指标来量化异常值分布,并提出了双向对角量化框架BDQ,有效分散异常值模式,提升了大语言模型在低比特精度下的性能。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16819 2026-05-19 cs.CL cs.AI cs.LG

AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents

AgentKernelArena: GPU核优化代理的通用化意识基准测试

Sharareh Younesian, Wenwen Ouyang, Sina Rafati, Mehdi Rezagholizadeh, Sharon Zhou, Ji Liu, Yue Liu, Yuchen Yang, Hao Li, Ziqiong Liu, Dong Li, Vikram Appia, Zhenyu Gu, Emad Barsoum

机构 * AMD

AI总结 本文提出AgentKernelArena,一个用于评估GPU核优化代理的开源基准,通过隔离工作区和统一评分机制,测试代理在不同任务和硬件目标上的性能和通用化能力,发现大多数任务在正确性和编译效率上表现优异,但在PyTorch到HIP的转换任务中存在显著的正确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16439 2026-05-19 cs.CV cs.AI

KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

KVCapsule: 用于视觉-语言模型的高效序列KV缓存压缩方法:不对称冗余

Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

AI总结 本文提出KVCapsule,一种针对视觉语言模型的KV缓存压缩框架,通过轻量压缩和重建组件实现内存节省,提升吞吐量并减少内存占用,同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09296 2026-05-12 cs.CV cs.AI cs.LG

Micro-Defects Expose Macro-Fakes: Detecting AI-Generated Images via Local Distributional Shifts

微缺陷暴露宏观伪造:通过局部分布偏移检测AI生成图像

Boxuan Zhang, Jianing Zhu, Qifan Wang, Jiang Liu, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Meta AI Advanced Micro Devices(先进微器件公司)

AI总结 本文提出MDMF框架,通过放大微小统计异常为宏观分布偏移,利用局部分布偏移检测AI生成图像,实验表明其在多个基准上表现优异。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08632 2026-05-12 cs.CL cs.AI

PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding

PARD-2:面向双模式推测解码的目标对齐并行草稿模型

Zihao An, Taichi Liu, Ziqiong Liu, Dong Li, Ruofeng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学)

AI总结 本文提出PARD-2,一种双模式推测解码框架,通过Confidence-Adaptive Token优化提升LLM推理效率,实验显示其在Llama3.1-8B上实现6.94倍无损加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08575 2026-05-12 cs.LG cs.AI

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

揭示专家内部激活稀疏性以实现高效的混合专家模型执行

Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

机构 * University of California, Berkeley(加州大学伯克利分校) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 本文研究了混合专家模型中专家内部激活稀疏性,通过利用这种未被探索的稀疏性维度,提高了模型执行效率,实现了2.5倍的层执行速度提升和1.2倍的端到端速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08114 2026-05-12 cs.LG cs.IT cs.MS math.IT

Statistical Inference and Quality Measures of KV Cache Quantisations Inspired by TurboQuant

受TurboQuant启发的KV缓存量化统计推断与质量度量

Paolo D'Alberto

机构 * AMD(AMD公司) Anthropic

AI总结 本文分析了三种KV缓存量化方案,在公平的比特预算下,探讨了QJL对内积方差的影响及softmax非线性放大机制,通过实验证明不同方案在KL散度、几何K误差和6D距离上的性能差异。

Comments 23 pages, 7 Figures, multiple tables, the process is highly assisted by AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07230 2026-05-11 cs.CV cs.AI

CASCADE: Context-Aware Relaxation for Speculative Image Decoding

CASCADE:基于上下文的放松方法用于推测图像解码

Selin Yildirim, Subhajit Dutta Chowdhury, Mohammad Mahdi Kamani, Vikram Appia, Deming Chen

机构 * AMD(AMD公司)

AI总结 本文提出CASCADE方法,通过捕捉目标模型隐藏状态中的冗余性,在不额外训练的情况下实现接受放松,提升推测解码效率,实验表明在多模态模型中达到3.6倍加速,保持图像质量和提示一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05732 2026-05-11 cs.LG cs.AI

CRAFT: Forgetting-Aware Intervention-Based Adaptation for Continual Learning

CRAFT:面向持续学习的遗忘感知干预式适应

Md Anwar Hossen, Fatema Siddika, Juan Pablo Munoz, Tanya Roosta, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Maro Systems(Maro系统) University of California, Berkeley(加州大学伯克利分校) AMD

AI总结 CRAFT通过在隐藏表示上学习低秩干预,避免更新模型权重,通过输出分布分歧路由任务、KL散度正则化和合并干预,减少遗忘并提升性能。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02525 2026-05-11 cs.LG

AdaHOP: Fast and Accurate Low-Precision Training via Outlier-Pattern-Aware Rotation

AdaHOP: 通过异常模式感知旋转实现快速且准确的低精度训练

Seonggon Kim, Alireza Khodamoradi, Pranathi Vasireddy, Kristof Denolf, Eunhyeok Park

机构 * Advanced Micro Devices, Inc.(先进微器件公司) POSTECH(POSTECH大学)

AI总结 本文提出AdaHOP,通过分析权重、激活和梯度中的三种稳定异常模式,采用自适应Hadamard变换和异常提取策略,在MXFP4精度下实现BF16级质量,提升内存压缩和训练速度。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06351 2026-05-08 cs.CV cs.AI cs.LG

DC-DiT: Adaptive Compute and Elastic Inference for Visual Generation via Dynamic Chunking

DC-DiT:通过动态分块实现视觉生成的自适应计算与弹性推理

Akash Haridas, Utkarsh Saxena, Parsa Ashrafi Fashi, Mehdi Rezagholizadeh, Vikram Appia, Emad Barsoum

机构 * Advanced Micro Devices Inc. (AMD)(先进微器件公司(AMD))

AI总结 DC-DiT通过动态分块机制,自适应地压缩视觉输入,优化计算资源分配,提升生成效率与灵活性,实验显示在ImageNet生成任务中显著降低计算量并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22972 2026-04-30 cs.CL

Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match

无需训练的宽松推测解码:在精确匹配之外接受语义正确的草稿

Jinze Li, Yixing Xu, Guanchen Li, Shuo Yang, Jinfeng Xu, Xuanwu Yin, Dong Li, Edith C. H. Ngai, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系)

AI总结 本文提出无需训练的宽松推测解码方法FLy,通过利用目标模型的自我纠正行为来判断草稿-目标不匹配是否仍具有语义有效性,从而在保持高精度的同时提升解码效率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24715 2026-04-28 cs.CL cs.LG

Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling

长上下文意识的升级:混合大语言模型扩展的新前沿

Parsa Ashrafi Fashi, Utkarsh Saxena, Mehdi Rezagholizadeh, Aref Jafari, Akash Haridas, Mingyu Yang, Vansh Bhatia, Guihong Li, Vikram Appia, Emad Barsoum

机构 * AMD

AI总结 本文提出HyLo方法,通过架构适应与高效Transformer块结合,提升长上下文能力,实现上下文长度扩展32倍,内存消耗降低90%,在混合架构中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24003 2026-04-28 cs.CL cs.LG

Stabilizing Efficient Reasoning with Step-Level Advantage Selection

通过步骤级优势选择稳定高效推理

Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 本文提出SAS方法,在步骤层面选择优势,提升推理稳定性与效率,实验显示在多个基准上准确率提升0.86点,推理长度减少16.3%。

Comments Findings of ACL 2026, Code: https://github.com/HanNight/SAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11931 2026-04-27 cs.CL cs.AI

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

AdaptEvolve: 通过自适应模型选择提高进化AI代理的效率

Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * IIT Kharagpur(印度理工学院Kharagpur分校) Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

AI总结 本文提出AdaptEvolve方法,通过自适应选择大语言模型提升进化代理效率,实验证明在保持准确性的同时降低推理成本37.9%。

Comments 9 pages, 2 Figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21280 2026-04-24 cs.CV

ImageHD: Energy-Efficient On-Device Continual Learning of Visual Representations via Hyperdimensional Computing

ImageHD: 通过超维度计算实现高效的设备端视觉表示持续学习

Jebacyril Arockiaraj, Dhruv Parikh, Viktor Prasanna

机构 * AMD Zynq ZCU104 FPGA

AI总结 ImageHD基于超维度计算实现设备端视觉持续学习,通过硬件感知的持续学习方法和量化CNN前端,在严格时延和芯片内存限制下提升效率与能效。

Comments FCCM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18117 2026-04-21 cs.LG

LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

LoRaQ:面向4位量化优化的低秩近似

Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen, Kristof Denolf, Mathieu Salzmann

机构 * Computer Vision Laboratory, Ecole Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(瑞士洛桑联邦理工学院计算机视觉实验室) Research and Advancement Development Team, Advanced Micro Devices, Inc, USA(美国高级微器件公司研发与进步发展团队)

AI总结 LoRaQ通过简化校准方法,实现了无需高精度分支的4位量化优化,首次提出全子16位流水线,提升Pixart-$Σ$和SANA模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏